Gemini agentic video understanding, 긴 영상 분석 비용을 비교하는 방법
Gemini Flash 모델이 필요한 영상 구간을 스스로 찾아 다시 보는 기능을 지원합니다.
Google 자체 측정에서는 토큰과 비용 감소, 정확도 향상을 함께 제시했습니다.
긴 영상 분석 개발자는 agentic 처리를 샘플 한 건에서 먼저 비교할 만합니다.
긴 영상을 AI로 분석할 때는 얼마나 촘촘히 읽힐지가 비용과 품질의 타협점이 됩니다. 프레임을 적게 뽑으면 장면을 놓치고, 많이 넣으면 토큰 사용량이 커집니다. 새 기능은 이 선택을 모델의 탐색으로 옮깁니다.
고정 간격 대신 필요한 순간을 찾습니다
기존의 정적 처리는 일정한 초당 프레임 수로 영상을 읽습니다. 새 방식은 Gemini가 필요한 구간을 찾아 다른 속도로 다시 살핍니다. 화면과 음성, 자막 가운데 필요한 신호만 불러옵니다. 빠른 상태 변화나 긴 강의 속 특정 내용을 찾는 작업에 맞습니다.
지원 모델은 Gemini 3.7 Flash, 3.6 Flash, 3.5 Flash-Lite입니다. Google AI Studio와 Gemini API에서 영상 입력의 processing 값을 agentic으로 지정해 사용할 수 있습니다. 표준 토큰 가격이 적용되고 별도 기능 요금은 없습니다.
최대 수치는 그대로 예산표에 넣지 마세요
Google 자체 벤치마크는 토큰을 최대 88%, 비용을 최대 66% 줄이고 정확도를 최대 7% 높였다고 설명합니다. 최대치가 한 작업에서 동시에 보장된다는 뜻은 아닙니다. 영상 길이와 질문 유형, 찾으려는 장면의 밀도에 따라 결과가 달라질 수 있습니다.
짧은 영상이나 거의 모든 장면을 읽는 작업에서는 이점이 작을 수 있습니다. 반대로 긴 회의나 강의에서 특정 장면을 찾는다면 확인할 이유가 생깁니다.
개발자는 같은 영상과 질문을 두 경로에 넣어야 합니다. 정적 처리와 agentic 처리의 비용·정확도를 비교하세요. 정답 여부뿐 아니라 놓친 구간, 처리 시간, 실제 청구 토큰을 함께 기록하면 전환 판단이 쉬워집니다. 일반 직장인이 Gemini 앱에서 지금 바꿀 설정은 아니며, 현재 행동 주체는 API로 영상 분석 기능을 만드는 개발자입니다.
긴 영상 분석 개발자는 agentic 처리를 샘플 한 건에서 먼저 비교할 만합니다. 한 번의 최대 절감보다 반복 작업에서 비용과 품질이 안정적으로 유지되는지가 중요합니다.
출처
- Google DeepMind 공식 발표: https://deepmind.google/blog/introducing-agentic-video-in-gemini/
이 글은 자체 리서치 파이프라인의 자료 조사를 바탕으로 작성했습니다.