Google은 9월 1일 Gemini에 에이전트형 비디오 이해 기능을 도입했다고 밝히며, 최대 66%까지 분석 비용을 줄이고 최대 88%까지 토큰 소비를 낮추면서 정확도를 최대 7%까지 높인다고 말했다. 이는 API 설정에서 처리를 agentic으로 지정하면 활성화되며, 추가 기능 요금 없이 표준 Gemini API 토큰 가격이 적용된다.
통상적인 설명이 놓치는 점
토큰을 88% 줄인다는 말은 모델 내부에서 압축이 이뤄진 것처럼 들린다. 그러나 그렇지 않다. 에이전트 모드에서는 Gemini가 어떤 순간을 가져올지, 어떤 프레임 속도로 가져올지, 그리고 프레임·오디오·전사문 중 무엇을 사용할지를 기존의 고정 속도 프레임 샘플링 대신 스스로 고른다. 모델이 영상의 일부를 덜 본다는 뜻이다. 이는 분명 실용적이고 유용한 기능이지만, 무엇을 건너뛸 수 있는지에 대한 모델 자체의 판단에 좌우된다. 관련 근거가 전체 재생 시간에 걸쳐 넓게 흩어져 있는 과제에서는 건너뛸 것이 없기 때문에 절감 효과는 사라진다.
두 수치 사이의 간극
비용 절감률(66%)이 토큰 절감률(88%)보다 훨씬 작다는 점에 주목할 필요가 있다. 그 차이는 에이전트 루프 자체에서 발생한다. 무엇을 살펴볼지 결정하는 데도 토큰이 쓰이기 때문이다. 세 수치 모두 “최대” 기준이어서 기대치가 아니라 상한선이다.
실제 적용 범위
두 번째 설명 오류는 배포 범위다. 이번 기능은 Flash 라인에만 적용됐으며 — Gemini 3.7 Flash, 3.6 Flash, 3.5 Flash-Lite — Gemini API를 통한 Google AI Studio와 Gemini Enterprise Agent Platform에서만 제공된다. Gemini 앱에는 “곧” 적용되며, YouTube의 “Ask YouTube”에는 “향후 몇 달” 내 적용된다. 다수의 보도는 소비자용 앱을 예로 들었지만, 해당 앱에는 이 기능이 없다.
가격 정책이 의미하는 것
Google은 Gemini 3.7 Flash가 테스트된 모델 가운데 “정확도-비용 파레토 프런티어를 달성한다”고 주장하며, 이 모드에 대해 추가 요금을 받지 않는다고 밝혔다. 비디오는 고정 프레임 속도 때문에 비용이 정보량이 아니라 재생 시간에 따라 늘어나는 형식이어서, 장문 컨텍스트의 의미가 사라지던 영역이었다. 그 연결고리를 끊고도 별도 과금을 하지 않겠다는 선택은, 긴 영상 분석을 전문 작업이 아니라 기본 작업으로 만들려는 시도로 읽힌다.
