AI 모델

Google, Gemini 모델에 에이전트형 동영상 이해 기능 도입

Google은 Gemini 3.7 Flash, 3.6 Flash, 3.5 Flash-Lite에 에이전트형 동영상 이해를 도입해 토큰과 비용을 줄이고 분석 품질을 높인다고 밝혔다.

게시일 업데이트
Google DeepMindGemini동영상 AI

Google은 9월 1일 Gemini에 에이전트형 동영상 이해 기능을 출시하고 Gemini 3.7 Flash, Gemini 3.6 Flash, Gemini 3.5 Flash-Lite에 새로운 영상 분석 모드를 추가했다. 회사는 이 기능이 표준 동영상 분석 벤치마크에서 토큰 소비를 최대 88%, 비용을 최대 66% 줄이고 품질을 최대 7% 높일 수 있다고 밝혔다. 이 기능은 Google AI Studio와 Gemini Enterprise Agent Platform의 Gemini API를 통해 동영상 업로드와 YouTube 영상에 사용할 수 있다.

이 기능은 모델이 동영상을 처리하는 방식을 바꾼다. 기존 정적 처리는 보통 고정 프레임률로 영상을 읽으며 기본값은 초당 1프레임인 경우가 많다. 개발자는 API로 이 값을 조정할 수 있지만, 긴 영상이나 중요한 정보가 잠깐만 등장하는 작업에서는 비효율적일 수 있다. 에이전트형 동영상 이해는 Gemini가 더 목표 지향적으로 움직이게 한다. 모델은 시각 프레임, 오디오, 전사 텍스트를 가로질러 관련 구간을 동적으로 검색하고 스캔하며 사용자의 요청에 필요한 순간과 신호만 가져온다.

Google은 이를 Gemini의 네이티브 이미지 이해와 코드 실행을 결합한 에이전트형 비전과 비슷한 아이디어라고 설명한다. 동영상에서는 같은 에이전트 루프가 모델에게 무엇을 볼지, 어떤 속도로 볼지, 프레임과 오디오와 전사 중 어떤 모달리티를 사용할지 결정하게 한다. 90분 강의에서 특정 순간을 찾아야 한다면 모델은 모든 초를 같은 깊이로 처리할 필요가 없다. 전사로 시간 범위를 좁히고, 관련 구간의 프레임을 살피고, 필요하면 오디오를 듣고, 선택된 근거에 기반해 답할 수 있다.

효율성 주장은 긴 영상에서 특히 중요하다. 교육 도구, 미디어 아카이브, 보안 분석, 회의 리뷰 제품을 만드는 개발자들은 정확도와 비용 사이에서 자주 선택해야 한다. 높은 프레임 샘플링은 더 많은 세부 정보를 잡아내지만 토큰과 비용을 빠르게 늘린다. 낮은 샘플링은 비용을 줄이지만 빠른 동작, 미묘한 이상, 정확한 장면 경계를 놓칠 수 있다. Google은 에이전트형 동영상 이해가 필요한 순간에만 중요한 시간 창을 높은 프레임률로 다시 샘플링하고 관련 없는 장면을 무차별 처리하지 않아 이 균형을 개선한다고 설명했다.

Google이 제시한 사용 사례는 이 기능이 단순한 비용 최적화가 아니라는 점을 보여준다. 1초보다 짧은 순간 검색은 빠른 컷이나 상태 변화를 찾아 자동 편집과 스포츠 분석에 유용하다. 긴 영상 속 바늘 찾기식 검색은 수백만 토큰을 소비하지 않고도 여러 시간짜리 녹화에서 복잡한 질문에 답하게 한다. 이상 감지는 흥미로운 시간 구간에 집중해 움직임과 시각적 흔적을 더 자세히 살핀다. 행동과 물체 계수 역시 모델이 짧은 구간을 서로 다른 프레임률로 다시 볼 수 있을 때 개선될 수 있다.

이번 출시는 멀티모달 AI 제품의 방향도 보여준다. 초기 동영상 이해는 압축된 영상 표현을 모델에 넘기고 중요한 정보가 남아 있기를 기대하는 방식에 가까웠다. 에이전트형 동영상은 모델을 더 능동적으로 만들어 다음에 어디를 볼지 결정하는 분석가에 가깝게 만든다. 이는 품질과 효율을 동시에 높일 수 있지만, 결과가 모델의 검색 전략에 의존하기 때문에 평가도 더 복잡해진다. 동영상 AI를 만드는 팀에게 Google의 새 기능은 정적 입력을 줄이고 모델 주도 검사를 시험할 수 있는 새로운 선택지다.