Gemini Omni Turns AI Video Into a Conversation

Google I/O 2026에서 공개된 Gemini Omni를 통해 AI 영상 제작이 단순 생성에서 대화형 편집과 멀티모달 제작 흐름으로 이동하고 있음을 분석합니다.

Date: 2026-05-20 Topic: AI Primary source: Google

구글이 Google I/O 2026에서 Gemini Omni를 공개했다. 한 줄로 말하면, 이제 생성형 AI 영상은 "문장을 넣으면 영상이 나오는 도구"에서 "가지고 있는 이미지, 영상, 소리, 텍스트를 섞어 대화하듯 고치는 도구"로 이동하고 있다.

이 변화가 중요한 이유는 단순히 더 그럴듯한 영상을 만들 수 있어서가 아니다. 영상 제작의 출발점이 프롬프트 하나가 아니라 사용자가 이미 가진 자료 전체로 넓어지고, 수정 과정도 편집 프로그램의 메뉴가 아니라 자연어 대화에 가까워지고 있기 때문이다.

Core Lens
This is less about prettier AI video and more about turning media creation into an iterative conversation.

What Actually Changed

Google이 발표한 첫 모델은 Gemini Omni Flash다. 구글 설명에 따르면 이 모델은 텍스트, 이미지, 영상, 오디오를 입력으로 받아 하나의 영상 결과물을 만들 수 있다. 지금은 영상 생성에서 시작하지만, 앞으로는 이미지나 오디오 같은 다른 출력 방식도 지원하겠다는 방향을 밝혔다.

기존 AI 영상 도구가 보통 "텍스트를 영상으로 바꾸는 기능"처럼 보였다면, Gemini Omni의 핵심은 입력 재료가 훨씬 넓다는 점이다. 예를 들어 사용자는 짧은 촬영본, 참고 이미지, 배경음, 원하는 분위기 설명을 함께 넣고 하나의 장면을 만들 수 있다. 이후에는 "배경을 바꿔줘", "카메라 각도를 뒤쪽으로 돌려줘", "이 스타일은 유지하고 움직임만 바꿔줘"처럼 대화로 이어서 고칠 수 있다.

구글은 Omni가 장면의 앞뒤 맥락을 기억하고, 인물이나 물리적 움직임의 일관성을 유지하는 방향으로 설계됐다고 설명한다. 실제 품질은 사용자가 얼마나 복잡한 작업을 시도하느냐에 따라 달라지겠지만, 제품 방향은 분명하다. AI 영상이 한 번에 완성본을 뽑는 기계가 아니라, 초안과 수정이 반복되는 편집 공간으로 바뀌고 있다.

Why It Matters

영상 제작에서 가장 어려운 부분은 늘 "좋은 아이디어"만이 아니었다. 촬영 장비, 편집 툴, 모션 그래픽 지식, 사운드 작업, 여러 파일을 맞춰보는 시간이 필요했다. Gemini Omni 같은 도구는 이 중 일부를 대화형 조작으로 낮춘다.

그렇다고 전문 제작자가 필요 없어졌다는 뜻은 아니다. 오히려 달라지는 것은 역할이다.

  • 일반 사용자는 여행 영상, 짧은 발표 자료, 소셜 영상의 초안을 훨씬 쉽게 만들 수 있다.
  • 크리에이터는 촬영한 원본을 다양한 스타일과 포맷으로 빠르게 실험할 수 있다.
  • 기업은 광고 시안이나 제품 설명 영상을 만들 때 초기 제작 비용과 시간을 줄일 수 있다.
  • 개발자와 스타트업은 API가 열리면 영상 편집 기능을 자기 서비스 안에 붙이는 방식을 고민하게 된다.

중요한 점은 "누가 영상을 만들 수 있는가"보다 "얼마나 많은 영상이 실험 단계에서 만들어질 수 있는가"다. 제작 비용이 낮아지면 결과물의 양은 늘어난다. 그러면 좋은 콘텐츠를 고르는 기준, 저작권을 다루는 방식, AI 생성물 표시 기준도 함께 중요해진다.

The Trust Problem Comes With It

Google은 Omni로 만든 영상에 SynthID 디지털 워터마크를 넣고, Gemini 앱과 Chrome, Google Search에서 생성 여부를 확인할 수 있게 하겠다고 밝혔다. 이 대목은 부가 기능처럼 보이지만 사실 핵심에 가깝다.

영상은 텍스트보다 훨씬 강한 설득력을 가진다. 누군가의 얼굴과 목소리가 들어간 영상이 손쉽게 만들어지고 편집된다면, 이용자는 "이 영상이 실제 촬영물인지, AI로 만든 것인지, 일부만 편집된 것인지"를 더 자주 확인해야 한다. Google이 개인 아바타 기능을 제공하면서도 음성·발화 변경 같은 더 민감한 기능은 추가 테스트가 필요하다고 선을 그은 것도 이 때문이다.

다만 워터마크가 모든 문제를 해결하지는 못한다. 워터마크를 쓰지 않는 도구도 있고, 플랫폼마다 검증 기능을 받아들이는 속도도 다르다. 그래서 앞으로 중요한 것은 하나의 기술보다 다음 세 가지가 함께 작동하는지다.

Lens What to Watch
Product 사용자가 생성·편집 여부를 쉽게 확인할 수 있는가
Platform YouTube, Search, Chrome 같은 유통 경로에서 표시가 이어지는가
Policy 기업과 크리에이터가 AI 생성물 표기를 실제로 지키는가

What This Changes for Creators

Gemini Omni의 가장 큰 의미는 영상 제작이 "최종본을 만드는 일"보다 "가능성을 빠르게 탐색하는 일"에 가까워진다는 점이다. 짧은 제품 소개 영상, 교육용 설명 장면, 음악에 맞춘 소셜 클립, 브랜드 무드 영상처럼 반복 실험이 많은 작업에서 먼저 쓰일 가능성이 크다.

반대로 긴 서사 영상이나 섬세한 연기, 법적 권리 확인이 중요한 상업 캠페인은 여전히 사람이 강하게 통제해야 한다. AI가 초안을 빨리 만들수록, 사람의 판단은 더 뒤로 밀리는 것이 아니라 더 앞에 와야 한다. 어떤 장면을 만들 것인지, 어떤 사람의 얼굴과 목소리를 쓸 수 있는지, 결과물이 오해를 만들지 않는지 판단하는 일은 도구가 대신하기 어렵다.

한국의 콘텐츠 제작자와 기업 입장에서도 이 흐름은 가볍지 않다. 짧은 영상 중심의 마케팅과 커머스 콘텐츠는 이미 빠른 제작 속도를 요구한다. 여기에 AI 영상 편집이 붙으면, 앞으로는 "촬영 능력"뿐 아니라 "AI가 이해할 수 있게 장면을 지시하고, 결과물을 검수하는 능력"이 제작 역량의 일부가 될 수 있다.

Questions Worth Asking

이번 발표에서 봐야 할 질문은 "AI 영상이 얼마나 현실적으로 보이는가"만이 아니다. 더 중요한 질문은 제작 과정과 유통 과정이 어떻게 바뀌는가다.

우리가 지켜볼 부분은 네 가지다.

  • Gemini Omni가 실제 사용자 환경에서 복잡한 장면의 일관성을 얼마나 유지하는가.
  • YouTube Shorts와 Flow에서 생성형 영상이 어떤 속도로 퍼지는가.
  • API 공개 이후 광고, 교육, 커머스 서비스가 이 기능을 어떻게 붙이는가.
  • SynthID 같은 표시 장치가 이용자의 신뢰를 높일 만큼 눈에 띄고 지속적으로 작동하는가.

내가 보기에 Gemini Omni는 "영상 생성 AI 경쟁의 새 모델"이면서 동시에 "편집 인터페이스의 변화"다. 앞으로의 제작 도구는 타임라인과 레이어만 보여주는 프로그램이 아니라, 사용자가 가진 자료를 이해하고 다음 수정을 제안하는 대화형 작업대에 가까워질 것이다. 이 변화가 창작을 넓힐지, 검증 부담을 더 크게 만들지는 기술 성능만이 아니라 표시와 책임의 설계에 달려 있다.

Sources