Google vừa công bố bộ công cụ tạo video AI mạnh nhất từ trước đến nay — Veo 3 và phiên bản nâng cấp Veo 3.1. Điểm nổi bật không chỉ là video 4K mà còn là khả năng tạo âm thanh đồng bộ ngay trong quá trình sinh video, từ đối thoại tự nhiên đến hiệu ứng môi trường. Veo 3.1 đạt điểm cao nhất về đồng bộ âm thanh trên 527 prompt trong benchmark MovieGenBench của Google DeepMind, vượt qua cả Runway Gen-4 và Kling AI. Với gói Google AI Pro chỉ từ 7.99 USD/tháng, bất kỳ ai cũng có thể tiếp cận công nghệ này.

Độ phân giải tối đa: 4K · Tỷ lệ khung hình: 16:9 và 9:16 · Tính năng âm thanh: Đối thoại, hiệu ứng môi trường, âm nền · Phiên bản mới: Veo 3.1 Ultra · Nền tảng chính: Google AI Studio, Gemini, DeepMind

Tổng quan nhanh

1Điểm xác nhận
  • Veo 3 hỗ trợ độ phân giải 4K cho người dùng trả phí (Imagine.art)
  • Veo 3.1 tạo âm thanh stereo 48kHz, mã hóa AAC 192kbps (MindStudio)
  • Google AI Pro giá 7.99 USD/tháng (MindStudio)
2Điểm chưa rõ
  • Ngày phát hành chính xác ISO của Veo 3 Pro
  • Giá chính thức gói Ultra tại thị trường Việt Nam
  • Hiệu suất thực tế trên thiết bị di động tại Việt Nam
3So sánh đối thủ
  • Runway Gen-4 đạt 1,247 điểm Elo, vượt Veo về chuyển động (MindStudio)
  • Kling AI hỗ trợ 4K cho phiên bản pro (Imagine.art)
  • Sora đạt 1080p, không hỗ trợ hình người thực tế trên VBench (Google DeepMind)
4Hướng đi tiếp
  • Veo 3.1 tích hợp vào Artlist cho nhà sáng tạo nội dung (Artlist)
  • Hỗ trợ video dọc 9:16 gốc cho TikTok, YouTube Shorts (MindStudio)
  • Tính năng Ingredients to Video hỗ trợ 3 hình ảnh tham chiếu (Google Blog)
Thông số Giá trị
Nhà phát triển Google DeepMind
Độ phân giải 4K (trả phí) / 720p (miễn phí)
Âm thanh Hiệu ứng, đối thoại tự tạo, 48kHz stereo
Truy cập chính aistudio.google.com
Phiên bản mới Veo 3.1 hỗ trợ ứng dụng thực tế
Chi phí Google AI Pro: 7.99 USD/tháng

Google Veo 3 là gì?

Veo 3 là mô hình trí tuệ nhân tạo tạo video từ văn bản tiên tiến nhất của Google DeepMind, ra mắt gần đây với khả năng tạo video độ phân giải lên 4K kèm âm thanh đồng bộ ngay trong quá trình sinh video. Không giống các công cụ chỉ tạo hình ảnh chuyển động, Veo 3 tích hợp kiểm soát góc quay điện ảnh và nhất quán nhân vật xuyên suốt các cảnh. Mô hình này mô phỏng vật lý thực tế tốt, tránh hành vi vật lý bất khả thi mà nhiều đối thủ gặp phải. Điểm khác biệt cốt lõi là Veo 3 có thể tạo đối thoại tự nhiên, hiệu ứng âm thanh môi trường và âm nền đồng bộ với hình ảnh — không phải ghép thêm sau.

Tính năng chính của Veo 3

  • Độ phân giải 4K cho người dùng trả phí, 720p miễn phí (Imagine.art)
  • Tạo video từ văn bản với âm thanh đồng bộ (Điện Máy Xanh)
  • Kiểm soát góc quay điện ảnh và nhất quán nhân vật (Điện Máy Xanh)
  • Chế độ Fast/Turbo tiết kiệm 80% chi phí nhưng chất lượng thấp hơn (Imagine.art)

Ứng dụng thực tế

Veo 3 đáp ứng nhu cầu của nhà sáng tạo nội dung cần video chất lượng cao mà không có thiết bị quay chuyên dụng. So với Sora, Veo 3 vượt trội ở chất lượng 4K và âm thanh gốc, bám sát prompt tốt hơn nhờ mô phỏng vật lý chính xác. Tuy nhiên, Veo 3.1 ưu tiên nội dung high-motion VFX hơn nội dung thực tế như tài liệu — điểm cần lưu ý khi chọn công cụ phù hợp.

Điều cần nhớ

Veo 3 miễn phí ở 720p, nhưng muốn xuất 4K thật sự bạn cần đăng ký Google AI Pro trở lên. Chế độ Fast/Turbo giúp tiết kiệm credit nhưng chất lượng giảm đáng kể.

Google Veo 3.1 Ultra có gì mới?

Veo 3.1 Ultra là phiên bản nâng cấp đáng chú ý nhất của Google DeepMind, ra mắt gần đây với nhiều cải tiến quan trọng so với Veo 3 tiêu chuẩn. Điểm nhấn là tính năng tạo âm thanh đồng bộ bao gồm đối thoại, hiệu ứng môi trường và âm nền ngay trong quá trình tạo video — không cần ghép thêm. Veo 3.1 cũng hỗ trợ video dọc 9:16 gốc cho TikTok, Instagram Reels và YouTube Shorts, thay vì cắt xén từ video ngang như nhiều công cụ khác.

So sánh với Veo 3 tiêu chuẩn

Hai phiên bản cách nhau khoảng 8-12% về tốc độ xử lý khi không bật âm thanh, nhưng khi bật âm thanh, Veo 3.1 chậm hơn 25-30%. Mỗi lần tạo tối đa 8 giây video, cần chain nhiều lần cho video dài hơn. Veo 3.1 cải thiện tính nhất quán khung hình 40-60% cho clip 8 giây, giảm hiện tượng biến dạng vật thể và thay đổi ánh sáng. Độ chính xác dự đoán chuyển động tăng 35% dựa trên benchmark mô phỏng vật lý.

  • Âm thanh 48kHz stereo, mã hóa AAC 192kbps, độ trễ đồng bộ chỉ ~10ms (MindStudio)
  • Ingredients to Video hỗ trợ 3 hình ảnh tham chiếu để duy trì nhận diện nhân vật (MindStudio)
  • Tạo ở 720p rồi upscaling AI lên 1080p và 4K, không phải nhân pixel đơn giản (MindStudio)
  • Veo 3.1 vượt trội trên MovieGenBench về tuân thủ prompt và đồng bộ âm thanh (Google DeepMind)

Hỗ trợ landscape và portrait

Veo 3.1 được ưu tiên trên VBench I2V benchmark cho chất lượng hình ảnh và ý định prompt từ 355 cặp hình ảnh-văn bản. Tính năng Ingredients to Video cải tiến cho video biểu cảm hơn từ hình ảnh, hỗ trợ cả video dọc và upscaling 4K. Veo 3.1 có sẵn trên Gemini app, YouTube Shorts, Flow, Gemini API, Vertex AI và Google Vids.

Điểm cần lưu ý

Veo 3.1 ưu tiên nội dung high-motion VFX hơn nội dung thực tế như tài liệu. Nếu bạn cần tạo video tài liệu thực tế, Veo 3 tiêu chuẩn có thể phù hợp hơn.

Cách dùng Google Veo 3 miễn phí?

Để truy cập Veo 3 miễn phí, bạn cần đăng nhập tài khoản Google vào aistudio.google.com, chọn model Veo-3 trong danh sách và bắt đầu tạo video với giới hạn 720p. Gói miễn phí cho phép thử nghiệm nhưng giới hạn về số lượng video và độ phân giải. Google AI Pro giá 7.99 USD/tháng truy cập Veo 3.1 với credit giới hạn, trong khi Google AI Ultra 250 USD/tháng có giới hạn cao hơn đáng kể.

Truy cập qua Google AI Studio

  • Đăng nhập aistudio.google.com bằng tài khoản Google
  • Chọn models/veo-3 trong menu bên trái
  • Nhập prompt văn bản mô tả nội dung video mong muốn
  • Chọn độ phân giải 720p (miễn phí) hoặc 4K (cần Pro)
  • Đợi 90-120 giây cho video 8 giây không âm thanh

Gemini video generator

Cách khác là đăng nhập gemini.google.com với tài khoản Google AI Pro để truy cập tính năng tạo video tích hợp. Gemini cho phép điều khiển Veo 3 thông qua giao diện trò chuyện quen thuộc, phù hợp với người dùng đã quen với ChatGPT hay Claude. Tốc độ xử lý phụ thuộc vào độ phức tạp của prompt và lượng người dùng đồng thời trên hệ thống.

Mẹo tiết kiệm

Dùng chế độ Fast/Turbo giúp tiết kiệm 80% credit (20 thay vì 150) nhưng chất lượng video sẽ thấp hơn đáng kể. Phù hợp khi bạn chỉ cần xem trước ý tưởng trước khi xuất bản.

Labs Google Veo 3 ở đâu?

Veo 3 và Veo 3.1 được phát triển bởi Google DeepMind và tích hợp sâu vào hệ sinh thái Google. Labs chính thức nằm tại deepmind.google/models/veo/ — nơi cung cấp thông tin benchmark và tài liệu kỹ thuật đầy đủ nhất. Ngoài ra, Google Blog tại blog.google cũng công bố các cập nhật chính thức về tính năng mới và hướng dẫn sử dụng.

DeepMind Veo

Trang DeepMind là nguồn thông tin đáng tin cậy nhất về Veo series, cung cấp dữ liệu benchmark MovieGenBench (527 prompt) và VBench I2V (355 cặp hình ảnh-văn bản). Tại đây, bạn tìm thấy đánh giá chính thức cho thấy Veo 3.1 vượt trội về tuân thủ prompt và đồng bộ âm thanh so với các mô hình khác. Điểm đáng chú ý: không thể so sánh Veo 3.1 với Sora 2 Pro trên VBench vì Sora không hỗ trợ hình người thực tế.

Blog Google cập nhật

  • Thông báo chính thức Veo 3.1 Ingredients to Video (Google Blog)
  • Hướng dẫn tích hợp trên Gemini app, YouTube Shorts, Flow
  • Công bố tích hợp Artlist cho nhà sáng tạo nội dung chuyên nghiệp
Lưu ý

Veo 3.1 là mô hình video AI tiên tiến nhất của Google DeepMind và đã được tích hợp vào Artlist, cho phép nhà sáng tạo nội dung sử dụng trong dự án thương mại.

Flow Google Veo 3 hoạt động như thế nào?

Flow là giao diện tạo video tích hợp trong hệ sinh thái Google, cho phép người dùng điều khiển Veo 3 qua câu lệnh văn bản hoặc hình ảnh tham chiếu. Quy trình bắt đầu bằng việc nhập mô tả chi tiết về nội dung, phong cách và chuyển động mong muốn. Veo 3 sau đó phân tích prompt, tạo khung hình đầu tiên, rồi dự đoán chuyển động tiếp theo dựa trên mô phỏng vật lý thực tế. Khi bật âm thanh, hệ thống đồng thời tạo đối thoại, hiệu ứng môi trường phù hợp với từng cảnh.

Quy trình tạo video từ text

  • Nhập prompt văn bản mô tả chi tiết nội dung video
  • Hệ thống phân tích và tạo khung hình dựa trên prompt
  • Mô phỏng vật lý dự đoán chuyển động tự nhiên
  • Tạo âm thanh đồng bộ với hình ảnh (Veo 3.1)
  • Upscaling AI nâng cấp lên 1080p hoặc 4K

Tích hợp âm thanh

Veo 3.1 tạo âm thanh ở tần số mẫu 48kHz với đầu ra stereo và mã hóa AAC 192kbps. Độ trễ đồng bộ âm thanh-hình ảnh chỉ khoảng 10ms, đảm bảo đối thoại khớp hoàn toàn với chuyển động miệng nhân vật. Tính năng Ingredients to Video hỗ trợ up to 3 hình ảnh tham chiếu để duy trì nhận diện nhân vật, vật thể qua các cảnh khác nhau.

Điểm cần biết

Thời gian xử lý Veo 3.1 chậm hơn Veo 3 khoảng 8-12% khi không bật âm thanh, nhưng tăng 25-30% khi bật âm thanh. Video 8 giây không âm mất 90-120 giây để tạo.

So sánh chi tiết Veo 3 với các đối thủ

Ba mô hình tạo video AI hàng đầu hiện nay là Veo 3.1, Runway Gen-4 và Kling AI, mỗi mô hình có điểm mạnh riêng biệt. Runway Gen-4 đạt 1,247 điểm Elo trên benchmark video AI, vượt cả Veo 3 và 3.1 về chất lượng chuyển động. Tuy nhiên, Veo 3.1 dẫn đầu về đồng bộ âm thanh và tuân thủ prompt theo đánh giá của Google DeepMind.

Tiêu chí Veo 3.1 Runway Gen-4 Kling AI
Độ phân giải 4K (upscaling AI) Upscaled 4K từ 720p 4K (pro), 1080p (khác)
Âm thanh Có (48kHz stereo) Không Không
Video dọc 9:16 Có (gốc) Hạn chế
Điểm benchmark Cao nhất âm thanh 1,247 Elo 1080p tiêu chuẩn
Chi phí 7.99 USD/tháng 12-35 USD/tháng 15-100 USD/tháng

The implication: Veo 3.1 là lựa chọn mạnh nhất nếu dự án cần âm thanh gốc và video dọc, còn Runway Gen-4 thích hợp cho nội dung VFX đòi hỏi chuyển động phức tạp mà không cần đối thoại.

Lưu ý quan trọng

Veo 3.1 ưu tiên nội dung high-motion VFX hơn nội dung thực tế như tài liệu. Runway Gen-4 vượt trội về chuyển động nhưng không hỗ trợ âm thanh gốc. Chọn công cụ phù hợp với nhu cầu cụ thể của bạn.

Thông số kỹ thuật chi tiết

Bảng so sánh dưới đây tổng hợp các thông số kỹ thuật cốt lõi giữa Veo 3 và Veo 3.1, giúp bạn nhanh chóng xác định phiên bản nào phù hợp với quy trình làm việc của mình.

Thông số Veo 3 Veo 3.1
Độ phân giải tối đa 4K (trả phí) 4K (upscaling AI)
Độ phân giải miễn phí 720p 720p
Thời lượng clip tối đa 8 giây 8 giây
Tần số mẫu âm thanh 48kHz 48kHz
Mã hóa âm thanh Stereo AAC 192kbps Stereo AAC 192kbps
Tỷ lệ khung hình 16:9, 9:16 16:9, 9:16
Cải thiện khung hình Tiêu chuẩn 40-60% tốt hơn
Dự đoán chuyển động Tốt Tăng 35%
Hình ảnh tham chiếu 1-2 hình 3 hình
Xử lý không âm Nhanh hơn 8-12% Chuẩn
Xử lý có âm Không hỗ trợ Chậm hơn 25-30%

What this means: Nhà sáng tạo nội dung cần âm thanh đồng bộ sẽ phải chấp nhận thời gian xử lý tăng 25-30% với Veo 3.1, nhưng đổi lại chất lượng nhất quán khung hình và độ chính xác chuyển động vượt trội so với Veo 3 tiêu chuẩn.

Tóm lại: Veo 3.1 là công cụ tạo video AI 4K có âm thanh đồng bộ tốt nhất hiện nay theo đánh giá của Google DeepMind. Nhà sáng tạo nội dung: đăng ký Google AI Pro 7.99 USD/tháng để tiếp cận đầy đủ tính năng. Nhà phát triển: sử dụng Gemini API hoặc Vertex AI để tích hợp vào ứng dụng.

Câu hỏi thường gặp

Google Veo 3.1 Ultra khác Veo 3 thường như thế nào?

Veo 3.1 Ultra có thêm tính năng tạo âm thanh đồng bộ (đối thoại, hiệu ứng môi trường), hỗ trợ video dọc 9:16 gốc, và cải thiện nhất quán khung hình 40-60% tốt hơn. Phiên bản Ultra cũng có tính năng Ingredients to Video nâng cấp với 3 hình ảnh tham chiếu thay vì 1-2 như Veo 3 tiêu chuẩn.

Google Veo 3 Pro có miễn phí không?

Veo 3 có gói miễn phí giới hạn ở 720p. Muốn xuất 4K hoặc dùng đầy đủ tính năng của Veo 3.1, bạn cần đăng ký Google AI Pro (7.99 USD/tháng) hoặc Google AI Ultra (250 USD/tháng) với credit cao hơn.

Veo 3 hỗ trợ tạo video portrait chưa?

Veo 3.1 hỗ trợ tạo video dọc 9:16 gốc cho TikTok, Instagram Reels và YouTube Shorts, không phải cắt xén từ video ngang. Tính năng này có sẵn trên cả Gemini app và Google AI Studio.

Cách tích hợp Veo 3 vào ứng dụng developer?

Nhà phát triển có thể tích hợp Veo 3 qua Gemini API hoặc Vertex AI trên Google Cloud. Hai nền tảng này cung cấp quyền truy cập API với giới hạn usage tùy theo gói subscription.

Google Veo 2 có còn dùng được không?

Veo 2 vẫn hoạt động nhưng lỗi thời so với Veo 3 và 3.1. Google đã tập trung phát triển trên phiên bản mới hơn với chất lượng 4K và âm thanh đồng bộ vượt trội.

Veo 3.1 là phiên bản nào?

Veo 3.1 là phiên bản nâng cấp của Veo 3, được Google DeepMind phát hành gần đây với tính năng tạo âm thanh đồng bộ, video dọc gốc và upscaling 4K. Đây là mô hình video AI tiên tiến nhất của Google tính đến thời điểm hiện tại.

DeepMind Labs Veo 3 yêu cầu tài khoản gì?

Bạn cần tài khoản Google và đăng ký gói Google AI Pro hoặc Ultra để truy cập đầy đủ tính năng Veo 3.1. Gói miễn phí cho phép dùng thử ở 720p nhưng giới hạn số lượng video và không hỗ trợ 4K.

Trích dẫn chuyên gia

Veo 3.1 lets you create more expressive videos from images, directly on your phone.

— Google Blog (Thông báo chính thức)

Veo 3 là mô hình trí tuệ nhân tạo (AI) tạo video từ văn bản tiên tiến nhất của Google.

— Điện Máy Xanh (Đánh giá công nghệ)

Generate videos 1080p and 4K with state-of-the-art upscaling.

— Google Blog (Tài liệu kỹ thuật)

Runway Gen-4 achieved a 1,247 Elo score on AI video benchmarks, outperforming both Veo 3 and 3.1.

— MindStudio (Phân tích so sánh)

Veo 3.1 đang định hình lại tiêu chuẩn của ngành tạo video AI, nhưng Runway Gen-4 vẫn dẫn đầu về chất lượng chuyển động với 1,247 điểm Elo. Điều này cho thấy không có mô hình nào hoàn hảo cho mọi nhu cầu — Veo 3.1 phù hợp với dự án cần âm thanh đồng bộ và video dọc, còn Runway Gen-4 thích hợp cho nội dung VFX đòi hỏi chuyển động phức tạp. Với Google AI Pro chỉ 7.99 USD/tháng, chi phí tiếp cận công nghệ này đã trong tầm tay của hầu hết nhà sáng tạo nội dung Việt Nam.