Google DeepMind vừa ra mắt agentic video understanding , tính năng phân tích video chủ động cho các model Gemini 3.7 Flash, 3.6 Flash và 3.5 Flash-Lite. Theo công bố ngày 1/9, tính năng này giúp giảm tới 88% lượng token tiêu thụ, cắt 66% chi phí phân tích và tăng độ chính xác tới 7% so với cách xử lý tĩnh hiện tại.
Vấn đề với cách làm cũ
Phân tích video tĩnh hoạt động theo kiểu nạp toàn bộ nội dung với tốc độ khung hình cố định (mặc định 1 FPS, có thể chỉnh qua API). Với video ngắn thì ổn, nhưng với nội dung dài (video hướng dẫn 10 phút đến bài giảng 90 phút hoặc bản ghi nhiều giờ), developer buộc phải chọn giữa chi phí token cao hoặc kỹ thuật rút gọn làm mất chi tiết quan trọng.
Cách mới khác thế nào?
Agentic Video Understanding cho phép Gemini đóng vai trò chủ động, hướng tới mục tiêu khi quyết định xem gì, xem với tốc độ nào và xem qua kênh nào (khung hình, âm thanh hay transcript). Model chỉ tải về những phân đoạn và tín hiệu cần thiết thay vì nuốt toàn bộ luồng video.

Trước đây developer phải tự viết logic này bằng tay, giờ đây Gemini đã có thể tự thực hiện qua một vòng lặp agentic, gọi công cụ nội bộ để tải phần video liên quan, giúp giảm đáng kể công sức phát triển.
Các khả năng Agentic Video Understanding:
-
Truy xuất khoảnh khắc dưới giây: xác định chính xác thay đổi trạng thái chớp nhoáng và ranh giới cắt cảnh dễ bị bỏ lỡ ở tốc độ 1 FPS, mở đường cho tự động hóa biên tập video chính xác.
-
Tìm kim đáy bể trên video dài: trả lời câu hỏi phức tạp trên video nhiều giờ mà không đốt hàng triệu token.
-
Phát hiện bất thường: lấy mẫu lại các cửa sổ thời gian quan trọng ở FPS cao hơn để xem chuyển động nhanh và các chi tiết hình ảnh tinh tế.
-
Đếm hành động và vật thể: theo dõi chính xác các chuyển động lặp lại và vật thể riêng biệt theo thời gian.
Trong số ba model được hỗ trợ, Gemini 3.7 Flash với agentic understanding cho chất lượng tổng thể tốt nhất và sự kết hợp tối ưu giữa chất lượng và chi phí — nằm trên đường cong pareto về độ chính xác trên mỗi chi phí trong số các model được kiểm tra cho phân tích video.
Cách bật và chi phí
Tính năng đã có sẵn hôm nay cho video upload và video YouTube qua Gemini API trong Google AI Studio và Gemini Enterprise Agent Platform. Chỉ cần đặt cấu hình xử lý thành “agentic” trong API. Chi phí sẽ tính theo dúng mức giá token chuẩn của Gemini API và không có thêm phí tính năng.
Google cũng cho biết sẽ đưa tính năng này tới toàn bộ người dùng Gemini app trên các model Flash và Flash-Lite trong thời gian tới, và trong vài tháng tới sẽ nâng cấp tính năng Ask YouTube của YouTube để trả lời dựa trên hình ảnh video tốt hơn. Các đối tác thử nghiệm sớm gồm Ponder, Revyl, Mosaic và Resemble.AI đều ghi nhận hiệu quả rõ rệt.