Gemini Omni 1.1 Flash: Cơ chế tạo và biên tập video qua Interactions API

hecigo8 min read
Gemini APIGenerative VideoInteractions APIAI

Google vừa phát hành bản cập nhật Gemini Omni 1.1 Flash cho các nhà phát triển thông qua Google AI Studio và Gemini Enterprise Agent Platform. Khác với các mô hình tạo video chuyên biệt trước đây vốn chỉ nhận prompt rồi render lại toàn bộ cảnh từ đầu, Omni 1.1 Flash là mô hình đa phương thức dạng world model, cho phép chỉnh sửa video theo từng lượt hội thoại có lưu trạng thái (stateful editing), mở rộng phân cảnh và kiểm soát chuyển động giữa các khung hình mẫu.

Kiến trúc đa phương thức và vòng lặp Interactions API

Phần lớn các công cụ tạo video AI thế hệ trước xử lý dữ liệu theo đường ống tách rời: sinh hình ảnh độc lập, đưa qua mô hình chuyển động, sau đó gắn thêm một track âm thanh riêng. Cách tiếp cận này khiến video dễ mất tính nhất quán khi người dùng muốn thay đổi một chi tiết nhỏ trong khung hình.

Theo tài liệu chính thức của Google AI for Developers, Gemini Omni Flash tiếp nhận đồng thời văn bản, hình ảnh, âm thanh và video đầu vào trong cùng một luồng suy luận. Cửa sổ ngữ cảnh của mô hình hỗ trợ lên đến 1.048.576 token, cho phép phân tích mối quan hệ vật lý và ngữ cảnh không gian giữa các đối tượng trong video.

Điểm khác biệt lớn nhất nằm ở Interactions API. Thay vì gửi một request độc lập mỗi lần sinh video, nhà phát triển có thể truyền tham số previous_interaction_id. Khi nhận được ID này, mô hình giữ nguyên bố cục khung hình cũ và chỉ can thiệp vào đúng thuộc tính được chỉ định trong câu lệnh tiếp theo (ví dụ: đổi chất liệu bề mặt, thay đổi ánh sáng, làm ẩn một vật thể).

📖

Kiểm tra độ thân thiện của website với AI Agent: Cơ chế hoạt động của Vercel Is Agentic

Tìm hiểu cách AI agent tương tác trực tiếp với hạ tầng web và dữ liệu thông qua cơ chế content negotiation.

4 nâng cấp kỹ thuật trong phiên bản Omni 1.1 Flash

Trong công bố về Gemini Omni 1.1 Flash trên blog Google, Google DeepMind bổ sung thêm 4 tính năng điều khiển cho luồng làm việc tự động:

1. Kéo dài phân cảnh (Scene Extension) lên 40 giây

Trước đây, các mô hình video thường chỉ tham chiếu được 1 giây cuối cùng của clip, dẫn đến hiện tượng khung hình sau bị biến dạng hoặc trượt góc nhìn. Omni 1.1 Flash phân tích ngữ cảnh của 10 giây video liền trước. Người phát triển có thể mở rộng video theo từng bước 10 giây, đạt tổng thời lượng tối đa 40 giây cho mỗi cảnh quay liền mạch.

2. Nội suy giữa khung hình đầu và cuối (Keyframe Interpolation)

Cho phép lập trình viên chỉ định cụ thể frame bắt đầu và frame kết thúc. Mô hình tính toán và sinh ra toàn bộ chuyển động ở giữa, hỗ trợ các thao tác quay phức tạp như whip-pan, chuyển góc 360 độ hoặc tạo các đoạn video loop mượt mà không bị giật khựng.

3. Bản dựng nháp 360p tiết kiệm chi phí

Trong quá trình thử nghiệm câu lệnh (prompting), việc render trực tiếp độ phân giải cao gây tốn chi phí và tăng độ trễ. Chế độ render 360p cho tốc độ tạo nhanh hơn tới 60% với chi phí tính toán chỉ bằng 1/3 so với độ phân giải 720p tiêu chuẩn.

4. Nâng cấp độ phân giải 4K và video tham chiếu

Sau khi kiểm tra bản dựng nháp đạt yêu cầu, luồng xử lý có thể yêu cầu mô hình upscale trực tiếp lên 1080p hoặc 4K. Ngoài ra, mô hình cho phép nạp tối đa 3 giây video tham chiếu trong payload đa phương thức để học chuyển động của nhân vật thật.

Triển khai code thực tế: Tạo và chỉnh sửa video

Dưới đây là quy trình hai bước bằng TypeScript sử dụng @google/genai SDK: tạo video gốc từ văn bản và sau đó chỉnh sửa video đó bằng cách trích xuất ID tương tác.

import { GoogleGenAI } from '@google/genai';
import * as fs from 'fs';
 
const ai = new GoogleGenAI({
  apiKey: process.env.GEMINI_API_KEY,
});
 
async function generateAndEditVideo() {
  // Buoc 1: Tao video ban dau voi ty le khung hinh 16:9
  const initialResponse = await ai.interactions.create({
    model: 'gemini-omni-1.1-flash',
    input: 'A red sports car driving on a coastal road at sunset, continuous shot.',
    response_format: {
      type: 'video',
      aspect_ratio: '16:9',
    },
  });
 
  const interactionId = initialResponse.id;
  console.log(`Interaction ID: ${interactionId}`);
 
  if (initialResponse.output_video?.data) {
    fs.writeFileSync(
      'step1_initial.mp4',
      Buffer.from(initialResponse.output_video.data, 'base64')
    );
  }
 
  // Buoc 2: Chinh sua video dua tren ID cu ma khong can upload lai file
  const editedResponse = await ai.interactions.create({
    model: 'gemini-omni-1.1-flash',
    previous_interaction_id: interactionId,
    input: 'Change the weather to heavy rain with wet road reflections, keep the same car motion.',
  });
 
  if (editedResponse.output_video?.data) {
    fs.writeFileSync(
      'step2_edited.mp4',
      Buffer.from(editedResponse.output_video.data, 'base64')
    );
  }
}
 
generateAndEditVideo().catch(console.error);

Theo hướng dẫn phát triển trên Google AI Docs, khi thao tác trực tiếp qua REST API thay vì SDK, dữ liệu video Base64 không nằm trong trường tiện ích output_video mà nằm trong mảng steps của payload phản hồi JSON (steps[i].content[j].data).

Xử lý hạ tầng middleware: Đồng bộ file và quản lý ID

Khi đưa Gemini Omni Flash vào dây chuyền sản xuất media tự động, rào cản kỹ thuật thường không nằm ở câu lệnh prompt mà nằm ở lớp middleware trung gian điều phối dữ liệu:

Hạng mục kỹ thuậtVấn đề phát sinhGiải pháp kiến trúcCấu hình tham số
Thời gian renderHTTP timeout khi chờ sinh video (thuờng mất 20 - 90 giây)Chuyển sang kiến trúc bất đồng bộ (Async Queue) với worker xử lýTimeout gateway tối thiểu 180s
Dung lượng file Base64Video 10 giây chuẩn nén nhẹ vẫn chiếm vài chục MB chuỗi stringTránh lưu string trong RAM; pipe trực tiếp stream Base64 xuống S3/GCSBuffer streaming chunk 64KB
Quản lý trạng tháiprevious_interaction_id hết hạn hoặc thất lạc giữa các workerLưu ID phiên làm việc vào Redis kèm timestamp và metadata sceneTTL Redis đặt 24 giờ
Định dạng đầu vàoVideo tải lên cần đồng bộ frame rate và codecSử dụng Files API để upload trước khi gọi lệnh suy luậnKiểm tra trạng thái file = ACTIVE

Đối với các video người dùng tự tải lên để biên tập, lập trình viên cần đẩy file qua Files API trước, chờ tiến trình xử lý trên máy chủ của Google hoàn tất (state === 'ACTIVE'), sau đó mới truyền uri vào Interactions API.

Watermark SynthID và xác thực nguồn gốc C2PA

Mọi video xuất ra từ Omni 1.1 Flash đều được nhúng watermark kỹ thuật số vô hình bằng công nghệ SynthID của Google DeepMind, đồng thời kèm theo metadata chuẩn C2PA. Hệ thống này cho phép các công cụ tìm kiếm và trình duyệt nhận diện được nguồn gốc tạo bởi AI mà không làm suy giảm chất lượng hiển thị của từng khung hình.

Trong các quy trình xuất bản nội dung tự động ra các nền tảng mạng xã hội hoặc hệ thống quản lý nội dung (CMS), lớp middleware cần đảm bảo giữ nguyên dải metadata C2PA này khi thực hiện các tác vụ phụ như cắt tỉa định dạng (transcoding) hay nén tệp.

🚀

Thấy hữu ích? Theo dõi hecigo trên Zalo OA để nhận bài viết kỹ thuật mới sớm nhất - không spam, chỉ nội dung thực tế. Hoặc liên hệ trực tiếp nếu bạn cần hỗ trợ triển khai.

📖

Đọc tiếp: Nối text-to-speech vào workflow: phần khó không nằm ở API

Kinh nghiệm xử lý độ trễ và bất đồng bộ khi tích hợp các mô hình sinh dữ liệu thời gian thực.

Nguồn tham khảo

Related Articles