Google ra mắt Gemini 3.8 Live: Đột phá đàm thoại AI thời gian thực không ngắt quãng
Bộ đôi mô hình âm thanh Gemini 3.8 Live và Live Extended Thinking của Google cho phép AI vừa suy luận ngầm vừa trò chuyện tự nhiên, hỗ trợ hơn 97 ngôn ngữ và xử lý hình ảnh trực tiếp.

Bước tiến mới trong giao tiếp âm thanh giữa người và máy
Google vừa chính thức giới thiệu hai mô hình âm thanh mới mang tên Gemini 3.8 Live và Live Extended Thinking. Điểm nhấn lớn nhất của lần nâng cấp này là giúp các doanh nghiệp triển khai trợ lý ảo thông minh (voice agent) có khả năng tương tác siêu tốc, suy luận chuyên sâu và duy trì mạch đàm thoại liên tục mà không phụ thuộc vào cấu trúc "hỏi – đáp" (prompt – response) cứng nhắc truyền thống.
Đợt phát hành này diễn ra chỉ hai tuần sau khi hãng công nghệ Mỹ tung ra các mô hình nền tảng Gemini 3.8 Flash và 3.8 Cyber.
Khả năng suy luận ngầm và xóa bỏ độ trễ tương tác
Cả hai mô hình mới đều sở hữu những năng lực xử lý mạnh mẽ:
- Tương tác đa nhiệm liên tục: Mô hình có thể thực hiện lệnh gọi API và công cụ (tool call) ngay trong khi vẫn đang phát âm thanh phản hồi cho người dùng.
- Tiếp nhận hình ảnh trực tiếp (live visual inputs): Giúp trợ lý AI hiểu cả những gì người dùng đang nói lẫn khung cảnh họ đang nhìn thấy trong thời gian thực.
- Đa ngôn ngữ: Hệ thống hỗ trợ tương tác trên 97 ngôn ngữ khác nhau.
- Tính năng suy luận tùy biến (Configurable Thinking): Riêng phiên bản Gemini 3.8 Live Extended Thinking cho phép nhà phát triển linh hoạt bật hoặc tắt cơ chế suy luận nội bộ của mô hình tùy theo tác vụ.
Phân tích sâu hơn về mặt kỹ thuật, ông Sid Nag, nhà sáng lập Tekonyx, cho biết kiến trúc mới đã tách rời thành công "độ trễ tương tác" (thời gian phản hồi tín hiệu từ người dùng) và "độ trễ suy luận" (thời gian mô hình xử lý thông tin). Trước đây, AI thường phải ngưng đọng để suy nghĩ rồi mới trả lời. Với Gemini 3.8 Live, mô hình thực hiện suy luận ở chế độ nền mà không làm gián đoạn cuộc trò chuyện, loại bỏ tình trạng phải đánh đổi giữa phản hồi nhanh và câu trả lời sâu sắc.
Đồng thời, nhà phân tích Bradley Shimmin từ Futurum Group nhận định người dùng giờ đây có thể ngắt lời hoặc bổ sung ngữ cảnh mới vào cuộc trò chuyện bất kỳ lúc nào mà không làm sụp đổ tiến trình xử lý của AI.
Cạnh tranh trực diện và mở rộng ứng dụng doanh nghiệp
Theo ông Bradley Shimmin, mặc dù các đối thủ như Apple đã trang bị tính năng chuyển giọng nói thành văn bản theo thời gian thực trên các ứng dụng ghi chú, công nghệ của Google đã đưa trải nghiệm lên một tầm cao mới khi biến tương tác với AI thành một cuộc trò chuyện hai chiều thực thụ.
Với khả năng kết hợp đa phương thức giữa văn bản, âm thanh và video trực tiếp, các chuyên gia đánh giá Gemini 3.8 Live sẽ nhanh chóng được ứng dụng vào nhiều kịch bản thương mại thực tế, bao gồm tổng đài chăm sóc khách hàng tự động, quy trình tư vấn bán hàng thông minh và các hệ sinh thái agent tự hành thế hệ mới.
