
Gemini Omni 1.1 Flash là gì? Tính năng, giá và cách dùng
Gemini Omni 1.1 Flash có thể kéo dài cảnh đến 40 giây, nối keyframe, tạo bản nháp 360p và xuất 4K. Đây là cách dùng và tính giá.
Video AI thường có một trò khá khó chịu: khung đầu nhìn ổn, vài giây sau nhân vật đổi mặt, áo đổi màu, còn chiếc ghế phía sau tự dưng mọc thêm chân. Gemini Omni 1.1 Flash được Google đưa ra để xử lý đúng nhóm vấn đề đó. Đây là mô hình tạo và chỉnh sửa video qua Gemini API, tập trung vào việc giữ cảnh liền mạch và cho người làm nội dung kiểm soát chuyển động rõ hơn.
Bản 1.1 có thể đọc lại tối đa 10 giây trước khi tạo phần tiếp theo, kéo dài video theo từng đoạn 10 giây đến tổng cộng 40 giây, nối khung hình đầu với khung hình cuối và nâng video lên 1080p hoặc 4K. Nó cũng có chế độ nháp 360p để thử ý tưởng nhanh, đỡ phải trả tiền 4K chỉ để phát hiện nhân vật đi xuyên qua cái bàn.
- Kéo dài cảnh: đọc tối đa 10 giây ngữ cảnh cũ và tạo tiếp từng đoạn 10 giây.
- Nối keyframe: tạo chuyển động giữa khung đầu và khung cuối.
- Bản nháp 360p: thử bố cục, chuyển động và prompt nhanh hơn.
- Nâng độ phân giải: xuất 1080p hoặc 4K sau khi đã chốt cảnh.
Gemini Omni 1.1 Flash là gì?
Gemini Omni 1.1 Flash là mô hình tạo và chỉnh sửa video đa phương thức của Google. “Đa phương thức” ở đây có nghĩa là mô hình có thể nhận nhiều loại dữ liệu, gồm văn bản, hình ảnh, âm thanh và video, thay vì chỉ đọc một câu lệnh rồi tự đoán mọi thứ.
Google mô tả bản 1.1 là bản đã sẵn sàng cho môi trường sản phẩm và cung cấp nó cho nhà phát triển trả phí qua Gemini API. Tên model dùng trong API là gemini-omni-1.1-flash. Người dùng phổ thông có thể gặp các tính năng liên quan trong Google Flow; tính năng kéo dài cảnh cũng được Google đưa vào ứng dụng Gemini cho các gói đủ điều kiện.
Đừng nhầm Omni với Gemini 3.7 Flash. Gemini 3.7 Flash là mô hình đa dụng cho lập trình, suy luận và quy trình agent. Omni 1.1 Flash nhắm thẳng vào tạo video và chỉnh sửa video theo hội thoại. Cũng đừng gộp nó với Veo 3.1. Tài liệu Google vẫn liệt kê cả Omni Flash lẫn Veo cho tác vụ video, nhưng hai dòng model có cách dùng và API khác nhau.
Nếu bạn mới làm quen với hệ sinh thái này, bài cách dùng Google AI Studio và Gemini API sẽ giúp bạn hiểu API key, giao diện thử model và quy trình đưa mã mẫu vào ứng dụng.
Năm thay đổi đáng để ý ở bản 1.1
Kéo dài cảnh mà không quên sạch đoạn trước
Các mô hình video đời đầu thường chỉ nhìn phần cuối của clip để đoán cảnh kế tiếp. Cách này nhanh, nhưng rất dễ làm nhân vật, ánh sáng hoặc hướng chuyển động bị lệch. Theo bài công bố của Google, Omni 1.1 có thể phân tích tối đa 10 giây video trước đó. Bản cũ chỉ tham chiếu giây cuối.
Người dùng có thể kéo dài video theo từng đoạn 10 giây, đến tổng thời lượng 40 giây. Con số 40 giây chưa biến nó thành xưởng phim trong một cú nhấp chuột. Giá trị nằm ở chỗ bạn có đủ khoảng thời gian để dựng một cảnh ngắn có mở đầu, chuyển động và kết thúc, thay vì ghép hàng loạt clip rời rồi cầu mong nhân vật vẫn là cùng một người.
Đặt khung đầu và khung cuối
Keyframe là khung hình mốc. Bạn đưa cho model một ảnh ở đầu và một ảnh ở cuối, sau đó yêu cầu nó tạo phần chuyển động ở giữa. Cách làm này hữu ích khi cần máy quay tiến gần chủ thể, xoay quanh một sản phẩm, chuyển từ toàn cảnh sang cận cảnh hoặc tạo clip lặp liền mạch.
Đây là loại kiểm soát thực dụng hơn câu lệnh kiểu “hãy làm video điện ảnh”. Từ “điện ảnh” có thể khiến model nghĩ ra đủ thứ. Hai khung mốc nói rõ vị trí xuất phát và điểm đến. Phần khó còn lại là mô tả đường đi: máy quay lia trái hay phải, chủ thể có chuyển động không, ánh sáng thay đổi thế nào và có được phép cắt cảnh hay không.
Dùng video mẫu để giữ chuyển động
Omni 1.1 nhận tối đa ba giây video tham chiếu trong đầu vào đa phương thức. Đoạn mẫu có thể cung cấp nhịp chuyển động, động tác hoặc ngữ cảnh hình ảnh mà câu chữ khó mô tả chính xác. Chẳng hạn, “nhân vật bước lùi hai nhịp rồi xoay” vẫn có thể bị hiểu theo nhiều cách. Một đoạn video mẫu ngắn giúp giảm phần đoán mò.
Video tham chiếu không phải nút sao chép hoàn hảo. Kết quả vẫn cần được kiểm tra từng khung, nhất là bàn tay, chữ trên vật thể, chi tiết khuôn mặt và các vật ở mép hình. Nếu nội dung có người thật, thương hiệu hoặc tài sản của khách hàng, bạn còn phải kiểm tra quyền sử dụng trước khi tải lên. Model giỏi đến đâu cũng không kiêm luôn luật sư bản quyền.
Tạo bản nháp ở 360p
Google cho biết chế độ 360p có thể tạo nhanh hơn tối đa 60% so với 720p, dựa trên thông lượng hệ thống, và chi phí bằng khoảng một phần ba. Đây là thay đổi đáng tiền nhất nếu công việc cần thử nhiều phiên bản.
Video tạo sinh hiếm khi đúng ngay lần đầu. Thường phải sửa góc máy, nhịp chuyển động, vật thể thừa hoặc đoạn thoại. Xuất mọi lần thử ở 4K vừa chậm vừa tốn. Quy trình hợp lý là tạo ba hoặc bốn bản 360p, mỗi lần chỉ thay một yếu tố. Khi chuyển động và bố cục đã ổn, hãy tạo bản 720p để kiểm tra kỹ rồi mới nâng lên 1080p hoặc 4K.
Nâng video lên 1080p hoặc 4K
Omni 1.1 hỗ trợ đầu ra 1080p và 4K. Độ phân giải cao giúp hình ảnh sắc hơn khi chiếu trên màn hình lớn hoặc đưa vào phần mềm dựng. Nó không sửa được một cảnh sai logic. Nếu chiếc cốc đổi vị trí giữa clip, bản 4K chỉ cho bạn thấy lỗi đó rõ hơn.
Hãy xem bước nâng độ phân giải là khâu xuất bản, không phải khâu thử nghiệm. Trước khi nâng, kiểm tra chuyển động, tính liên tục, mép vật thể, khuôn mặt, chữ, âm thanh và tỷ lệ khung hình. Một phút xem lại có thể tiết kiệm nhiều lượt render.
Giá Gemini Omni 1.1 Flash được tính ra sao?
Trang giá Gemini API ghi Omni 1.1 Flash chỉ có ở gói trả phí dành cho nhà phát triển. Giá đầu vào là 1,50 USD cho một triệu token đối với văn bản, ảnh, video hoặc âm thanh. Đầu ra video là 17,50 USD cho một triệu token. Google quy đổi video 720p ở mức 5.792 token mỗi giây, tương đương khoảng 0,10 USD cho một giây video theo bảng giá tiêu chuẩn.
Như vậy, một clip 10 giây ở 720p có chi phí đầu ra xấp xỉ 1 USD, chưa tính phần đầu vào và các lần thử bỏ đi. Đây chỉ là phép ước lượng từ tỷ lệ do Google công bố. Hóa đơn thực tế phụ thuộc độ phân giải, thời lượng, số lần tạo lại và cách nền tảng trung gian tính phí.
Google nói bản nháp 360p có giá bằng khoảng một phần ba 720p. Nguồn độc lập The Decoder ghi mức hiệu dụng là 0,03 USD mỗi giây cho 360p, 0,10 USD cho 720p, 0,15 USD cho 1080p và 0,30 USD cho 4K tại thời điểm công bố. Giá dịch vụ AI đổi khá nhanh, vì vậy hãy xem trang giá Gemini API trước khi chạy một lô lớn. Đừng lấy bài viết này làm bảng giá đóng đinh lên tường.
Cách dùng Gemini Omni 1.1 Flash cho đỡ tốn công
Nhà phát triển có thể thử model trong Google AI Studio hoặc gọi qua API. Google dùng Interactions API cho quy trình chỉnh sửa nhiều lượt. Đoạn mã rút gọn dưới đây minh họa việc tiếp tục một video đã tạo:
Google minh họa quy trình bằng thư viện google-genai: tạo một client, gọi client.interactions.create() với model gemini-omni-1.1-flash, truyền mã của lần tạo video trước và đặt độ phân giải phản hồi là 360p. Cách gọi cụ thể có thể thay đổi theo phiên bản SDK, vì vậy nên lấy mã mẫu mới nhất từ tài liệu chính thức thay vì chép một đoạn cũ rồi ngồi ngắm lỗi.
Lần chỉnh tiếp phải tham chiếu đúng mã của lần tạo video trước. Bạn cũng cần cài Google Gen AI SDK, cấu hình API key và bật thanh toán cho dự án. Nếu chỉ muốn xem model hoạt động, giao diện AI Studio dễ bắt đầu hơn việc lao ngay vào Python rồi tranh luận với lỗi xác thực lúc nửa đêm.
Viết prompt theo từng lớp
Một prompt video dễ kiểm soát nên nói rõ chủ thể, hành động, máy quay, bối cảnh, ánh sáng và âm thanh. Không cần nhét tất cả tính từ trong từ điển. Câu lệnh càng mơ hồ, model càng phải tự quyết nhiều thứ.
Ví dụ: “Một kỹ thuật viên đặt chiếc router màu đen lên bàn. Máy quay tiến chậm từ toàn cảnh đến cận cảnh cổng mạng, một cú máy liên tục, không cắt cảnh. Ánh sáng văn phòng trung tính. Giữ nguyên màu và hình dáng router.” Cấu trúc này cho biết cái gì xuất hiện, nó làm gì, máy quay đi đâu và chi tiết nào không được thay đổi.
Khi cần sửa, chỉ đổi một yếu tố mỗi lần. Nếu cùng lúc thay góc máy, nhân vật, bối cảnh và ánh sáng, bạn sẽ không biết thay đổi nào gây lỗi. Cách thử từng biến nghe hơi chậm, nhưng thường nhanh hơn trò đập cả prompt đi viết lại.
Đặt giới hạn cho nội dung tạo sinh
Video dùng trong quảng cáo, đào tạo hoặc tin tức cần một vòng kiểm tra riêng. Hãy xem từng cảnh ở tốc độ thường và tua chậm. Kiểm tra nhân vật, logo, chữ, số liệu, sản phẩm và lời thoại. Nếu video mô tả một sự kiện có thật, cần đối chiếu với nguồn gốc; hình ảnh trông thuyết phục không có nghĩa là nó đúng.
Với dữ liệu nội bộ, đừng tải tài liệu, khuôn mặt khách hàng hay video chưa công bố lên tài khoản cá nhân chỉ vì tiện. Trang giá của Google nói dữ liệu ở gói trả phí không được dùng để cải thiện sản phẩm, nhưng doanh nghiệp vẫn cần đọc điều khoản, chính sách lưu giữ và yêu cầu tuân thủ của chính mình.
Omni 1.1 Flash hợp với ai?
Model này hợp với đội đang xây công cụ dựng video, ứng dụng marketing, hệ thống tạo nội dung theo mẫu hoặc quy trình cần chỉnh sửa video qua API. Khả năng nhận nhiều loại đầu vào và chỉnh qua nhiều lượt giúp nó phù hợp với sản phẩm có giao diện, nơi người dùng muốn nói “giữ cảnh này, đổi góc máy, kéo dài thêm 10 giây” thay vì tạo lại từ đầu.
Người làm nội dung đơn lẻ cũng có thể dùng Omni qua Google Flow nếu đang ở gói Google AI Plus, Pro hoặc Ultra. Tuy nhiên, mua gói chỉ để thử một clip chưa chắc kinh tế. Hãy xác định bạn cần tạo bao nhiêu video, có phải xuất 4K không và liệu một công cụ dựng truyền thống có giải quyết nhanh hơn. Có những lúc kéo timeline bằng chuột vẫn là công nghệ đỉnh cao nhất trong phòng.
Omni 1.1 chưa thay thế phần mềm dựng video. Nó tạo cảnh và hỗ trợ chỉnh nội dung, còn cắt ghép chính xác, trộn âm thanh, làm phụ đề, quản lý màu và xuất nhiều định dạng vẫn cần công cụ dựng. Cách dùng khôn ngoan là giao cho model phần tạo biến thể và chuyển động khó quay, sau đó hoàn thiện bằng phần mềm quen thuộc.
Có nên dùng ngay không?
Nếu bạn cần API tạo video có khả năng nối cảnh, nhận video tham chiếu và kiểm soát khung hình đầu cuối, Gemini Omni 1.1 Flash đáng để thử bằng một dự án nhỏ. Hãy bắt đầu ở 360p với một cảnh 10 giây. Đo tỷ lệ bản dùng được, thời gian chờ và chi phí sau vài chục lượt, rồi mới quyết định có đưa vào sản phẩm hay không.
Nếu nhu cầu chỉ là tạo vài clip mạng xã hội mỗi tháng, Google Flow có thể dễ chịu hơn API. Còn nếu bạn cần phim dài, tính liên tục tuyệt đối hoặc hình ảnh phải đúng từng chi tiết sản phẩm, hãy chuẩn bị quy trình kiểm duyệt và dựng hậu kỳ. Mốc 40 giây là hữu ích, nhưng vẫn là một cảnh ngắn chứ chưa phải tập phim.
Thứ đáng giá ở bản 1.1 không phải chữ 4K. Đó là khả năng thử rẻ ở 360p, chỉ định điểm đầu và điểm cuối, rồi kéo dài cảnh với nhiều ngữ cảnh hơn. Ba việc này giúp quy trình bớt may rủi. Video AI vẫn có lúc cư xử như đạo diễn uống quá nhiều cà phê, nhưng ít nhất giờ bạn có thêm vài nút để bảo đạo diễn đứng đúng chỗ.
Nguồn tham khảo
- Google: Gemini Omni 1.1 Flash lets you build with more control
- Google AI for Developers: danh sách model Gemini API
- Google AI for Developers: bảng giá Gemini API
- The Decoder: tổng hợp thay đổi và giá theo độ phân giải
Bạn muốn dùng khả năng nối keyframe cho loại video nào: giới thiệu sản phẩm, bài giảng hay một cú máy mà ngoài đời quay mãi vẫn rung? Chia sẻ tình huống ở phần bình luận, càng cụ thể càng dễ bàn cách làm.

