Gemini, 에이전트형 비디오 이해 도입: 토큰 최대 88%, 비용 최대 66% 절감
Google DeepMind가 Gemini 3.7 Flash, 3.6 Flash, 3.5 Flash-Lite용 에이전트형 비디오 이해를 출시했습니다. 고정 프레임 속도로 영상을 읽는 대신, 모델이 프레임, 오디오, 대본에서 필요한 구간을 검색하고 정밀하게 살펴봅니다. 표준 벤치마크에서 토큰은 최대 88%, 비용은 최대 66% 줄고 정확도는 최대 7% 오른다고 합니다. Google AI Studio나 Gemini Enterprise Agent Platform에서 API 설정을 agentic으로 바꾸면 사용할 수 있습니다.
Google DeepMind가 Gemini용 에이전트형 비디오 이해(agentic video understanding)를 출시했습니다. 대상 모델은 Gemini 3.7 Flash, Gemini 3.6 Flash, Gemini 3.5 Flash-Lite 세 가지입니다. 글은 수석 프로덕트 매니저 Rohan Doshi와 리서치 디렉터 Mario Lučić가 작성했습니다. 공식 발표의 핵심 수치는 세 가지입니다. 표준 비디오 분석 벤치마크에서 토큰 소비를 최대 88%, 분석 비용을 최대 66% 줄이고, 정확도를 최대 7% 높인다는 것입니다. 모두 최댓값이지 평균이 아닙니다. 실제 결과는 영상 길이와 작업 유형에 따라 달라집니다. 의미를 이해하려면 기존 방식을 봐야 합니다. 이른바 정적 처리에서는 모델이 고정된 프레임 속도로 영상 전체를 입력받습니다. 기본값은 초당 1프레임(1 FPS)이며 API로 조정할 수 있습니다. 단순하지만 비용 문제가 두 가지 있습니다. 첫째, 영상이 길어질수록 토큰 소비가 늘어납니다. 90분짜리 강의나 몇 시간짜리 녹화본은 부담이 큽니다. 둘째, 개발자는 높은 토큰 비용을 감수하거나, 프레임 솎아내기, 자르기, 요약 같은 지름길을 택해야 합니다. 후자는 중요한 세부 정보를 잃을 수 있습니다. Google은 10분짜리 사용법 영상부터 90분 강의, 수 시간짜리 녹화까지 긴 영상에서 이 딜레마가 가장 크다고 설명합니다. 새 기능의 효과가 가장 큰 곳도 여기입니다.
작동 방식의 핵심은 모델의 역할 변화입니다. Gemini는 모든 프레임을 수동적으로 받는 대신, 핵심 추론 능력과 네이티브 비디오 도구를 결합합니다. 화면 프레임, 오디오, 대본이라는 세 종류의 신호에 걸쳐 목표 구간을 검색하고, 훑어보고, 정밀하게 살펴볼 수 있습니다. 무엇을 볼지, 어떤 속도로 볼지, 어떤 모달리티로 볼지는 모델이 정합니다. 필요한 순간과 신호만 가져옵니다. Google은 이를 에이전트 루프라고 부릅니다. Gemini가 내부 도구를 호출해 영상 파일의 관련 부분을 불러오고, 결과를 확인한 뒤 다음 행동을 결정합니다. 이전에도 개발자가 직접 구간 분할, 전사, 검색 코드를 만들면 비슷한 일을 할 수 있었습니다. 이제는 이 루프가 모델 안에서 돌아가므로 개발 부담이 줄어듭니다.
이 아이디어는 앞서 나온 에이전트형 비전(agentic vision)의 연장선에 있습니다. 에이전트형 비전은 코드 실행과 Gemini의 네이티브 이미지 이해를 결합한 기능입니다. 새 기능은 같은 패턴을 영상에 적용했습니다. Google이 꼽은 새 능력은 1초 미만 단위의 장면 검색, 더 정확한 이상 징후 탐지, 정밀한 개수 세기 등입니다. 이런 작업에는 공통점이 있습니다. 답이 아주 짧은 몇 순간에만 있는 경우가 많고, 1 FPS 균등 샘플링은 이를 놓치기 쉽습니다. 되돌아가서 속도를 늦추고 다시 볼 수 있는 모델이 더 유리합니다. 성능에 대해 Google은 세 모델 모두에서 개선이 있다고 말합니다. 그중 에이전트형 이해를 켠 Gemini 3.7 Flash가 전체 품질이 가장 높고, 품질과 비용의 조합도 가장 좋다고 강조합니다. Google의 차트에서 이 모델은 테스트한 모델 가운데 정확도 대비 비용의 파레토 프런티어에 놓입니다. 쉽게 말해, 테스트 범위 안에서는 더 낮은 비용으로 더 높은 정확도를 내는 다른 구성이 없었다는 뜻입니다. 단서가 있습니다. 이 결과는 Google이 고른 표준 벤치마크에서 나왔습니다. 우리가 확인한 원문 발췌에는 각 벤치마크의 이름이나 개별 표가 없습니다. 따라서 발표 수치를 믿기 전에 자사 영상으로 직접 시험해야 합니다.
사용 방법은 간단합니다. 업로드한 영상과 YouTube 영상을 지원하며, Google AI Studio와 Gemini Enterprise Agent Platform의 Gemini API로 쓸 수 있습니다. Google의 요약에 따르면 API 설정을 agentic으로 바꾸면 켜집니다. 전환 비용이 작아서 기존 영상 분석 파이프라인을 다시 쓸 필요는 크지 않을 것입니다. 개발자와 기업에 미치는 영향은 세 가지입니다. 첫째는 비용 구조입니다. 긴 영상 분석은 토큰 비용 때문에 확장하기 어려운 경우가 많았습니다. 보안 영상 검토, 회의와 강좌 요약, 미디어 자산 검색, 규정 준수 표본 점검이 그 예입니다. 최대 66%의 비용 절감은 이 중 일부를 현실적으로 만들 수 있습니다. 둘째는 엔지니어링 부담입니다. 팀이 직접 만들던 프레임 선택, 구간 분할, 대본 정렬, 검색 로직을 모델 내부의 도구 루프에 맡길 수 있습니다. 셋째는 품질과 비용이 더는 반드시 맞바꿔야 하는 관계가 아니라는 점입니다. 정확도는 오르고 비용은 내려가므로 실서비스에 매력적입니다.
남은 질문도 있습니다. 에이전트 루프는 요청 하나에 여러 모델 단계를 수반합니다. 원문 발췌에는 지연 시간 데이터가 없으므로, 응답 시간과 실행마다의 일관성은 직접 측정해야 합니다. 또 어디를 볼지 모델이 정하기 때문에, 드물게 핵심 구간을 건너뛸 수 있습니다. 안전 감시나 의료 영상처럼 위험이 큰 용도에서는 사람의 검토와 표본 점검이 계속 필요합니다. 더 많은 모델이나 입력 소스를 지원할지도 Google은 밝히지 않았습니다. 앞으로의 전망을 보면, 이번 발표는 멀티모달 경쟁의 방향을 보여 줍니다. 쟁점은 모델이 얼마나 긴 영상을 담을 수 있는가에서, 얼마나 똑똑하게 보는가로 옮겨 가고 있습니다. 컨텍스트 창이 커져도 모든 프레임을 넣는 방식이 저렴해지지는 않습니다. 먼저 훑고, 위치를 찾고, 가까이서 살펴보는 흐름은 사람이 영상을 다루는 방식에 더 가깝습니다. 다른 모델 업체도 비슷한 능동 검색 기능을 내놓을 것으로 보입니다. 개발자의 관심은 전처리 파이프라인에서 평가와 비용 모니터링으로 옮겨 갈 것입니다.
실무 조언은 이렇습니다. 대표적인 영상을 골라 짧은 클립과 긴 클립으로 나누고, 정적 설정과 에이전트 설정으로 각각 실행하세요. 작업별로 토큰, 총비용, 정확도를 기록합니다. Google은 긴 영상에서 효과가 크다고 하므로 짧은 클립에서는 차이가 작을 수 있습니다. 이 비교를 마친 뒤에 전환을 결정하세요.