Google은 8월 27일 16:00 UTC에 개발자들에게 Gemini Omni 1.1 Flash를 공개하며 장면 확장, 첫·마지막 프레임 보간, 저비용 드래프트 모드, 비디오 참조 조건부 생성 기능을 추가했다. 문서에서는 gemini-omni-1.1-flash를 "고속 비디오 생성, 편집, 영화적 제어를 위해 설계된 고성능 멀티모달 모델"이라고 설명한다. 이 모델은 Google AI Studio, Gemini API, Gemini Enterprise Agent Platform, Google Flow에서 제공되며, 장면 확장은 전 세계 Gemini 앱의 AI Plus, Pro, Ultra 구독자에게 제공된다.

실제로 새로워진 점

장면 확장은 턴당 최대 10초를 덧붙이며, 총 길이는 최대 40초로 제시된다. 비디오 참조는 캐릭터나 환경의 일관성을 유지하기 위해 최대 3초의 기존 영상을 받아들인다. 화면 비율은 기본적으로 16:9이며 9:16도 지원한다. SynthID 워터마킹은 내장돼 있다. Adobe Firefly, Figma Weave, Runway가 제작 사용자로 언급되며, Figma Weave의 크리에이티브 디렉터는 이 모델이 "팀이 단순히 영상을 생성하는 수준을 넘어 진정으로 연출하도록 이끈다"고 말한다.

통상적 해석이 놓치는 부분

Google의 자체 페이지와 배치되는 주장 세 가지가 퍼지고 있다. 첫째, "4K 비디오 생성"은 후처리다. 모델 카드에는 4K와 1080p가 모두 업스케일 결과로 표시돼 있으며, 네이티브 생성은 720p에서 멈춘다. 드래프트 모드에서는 360p다. 둘째, "40초 비디오"는 상한과 생성 결과를 혼동한 표현이다. 40초는 클립 끝에 10초씩 누적해야만 도달할 수 있으며, 모델은 한 번에 40초를 생성할 수 없고 중간에 삽입할 수도 없다. 셋째, "60% 더 빠르고 비용은 3분의 1"이라는 수치는 360p 드래프트 경로에만 해당한다. 이는 효율성 개선이 아니라 해상도 할인으로 읽어야 한다.

한 곳에서는 정식 출시, 다른 곳에서는 프리뷰

블로그 글은 이번 공개를 정식 출시로 설명한다. 그러나 엔터프라이즈 버전에 대한 Google Cloud 문서 페이지 제목은 "Gemini Omni 1.1 Flash Preview"다. 제공 범위와 출시 단계는 Google의 세 가지 배포 채널에서 동일하지 않으며, 보도는 이를 하나로 평면화해왔다.

누락된 지역 제한

업로드한 비디오를 대사 추가와 함께 확장하는 기능은 EEA, 스위스, 영국에서는 사용할 수 없다. 음성 편집은 어느 곳에서도 지원되지 않는다. 대부분의 보도에는 이 두 제한이 언급되지 않았다.