Google ra mắt Gemini 3.5 Transcribe – phiên âm AI tự động loại bỏ “um” và “uh”
Gemini 3.5 Transcribe của Google hỗ trợ hơn 85 ngôn ngữ, tự động xóa từ ngữ đệm, nhận dạng thuật ngữ chuyên ngành và gán lời nói cho tới ba người nói.

Google tung Gemini 3.5 Transcribe, nâng tầm phiên âm AI
Vào ngày 26 tháng 8 năm 2026, Google công bố bản cập nhật mới nhất cho dòng sản phẩm Gemini Audio – Gemini 3.5 Transcribe. Đây là phiên bản thứ ba trong họ Gemini 3.5, sau Gemini 3.5 Live Translate, và được giới thiệu trong khi công ty vẫn chưa ra mắt phiên bản cao cấp Gemini 3.5 Pro mà đã hứa sẽ có vào tháng 6. Phiên bản mới hứa hẹn “đại diện cho một bước tiến lớn so với mô hình phiên âm trước đây, Chirp 3”, đặc biệt về hiệu năng đa ngôn ngữ và tỉ lệ lỗi từ ngữ.
Tính năng chi tiết và số liệu hỗ trợ
- Hỗ trợ đa ngôn ngữ: Gemini 3.5 Transcribe có khả năng nhận diện và phiên âm tự động hơn 85 ngôn ngữ, bao gồm tiếng Anh, tiếng Việt, tiếng Tây Ban Nha, tiếng Ả Rập và các ngôn ngữ ít được hỗ trợ trước đây. Google khẳng định mô hình mới “có độ chính xác cao hơn đáng kể” so với Chirp 3 trong các ngôn ngữ không phải tiếng Anh.
- Xóa từ ngữ đệm: Khi người dùng nói, các âm tiết “um”, “uh”, “ah” thường xuất hiện và làm giảm tính chuyên nghiệp của bản ghi. Gemini 3.5 Transcribe tự động loại bỏ những từ này mà không cần can thiệp thủ công, giúp văn bản sạch sẽ và dễ đọc.
- Nhận diện thuật ngữ chuyên ngành: Người dùng có thể tải lên một “vocabulary” tùy chỉnh. Khi được cung cấp, mô hình sẽ tự động áp dụng các quy tắc chính tả và thuật ngữ đặc thù (ví dụ: “nanoparticle”, “GAN”, “định luật Ohm”) để tránh việc sửa sai tự động làm mất nghĩa.
- Gán lời nói cho nhiều người: Đối với các file âm thanh đã ghi âm sẵn, Gemini 3.5 Transcribe có thể xác định và gán lời nói cho tới ba người nói khác nhau, đồng thời cung cấp timestamp cấp từ, giúp người dùng dễ dàng tìm kiếm và chỉnh sửa nội dung.
- Khả năng tích hợp: Tính năng hiện đã được triển khai cho người dùng macOS thông qua ứng dụng Gemini, và cho tính năng “Rambler dictation” trên Android tại một số quốc gia và ngôn ngữ được chọn. Đối với các nhà phát triển, Google mở ra public preview qua Gemini API trong AI Studio và Antigravity, cho phép tích hợp trực tiếp vào các ứng dụng hoặc dịch vụ khác. Hỗ trợ trên trình duyệt Chrome dự kiến sẽ ra mắt trong thời gian tới.
- Câu nói của Google: “Bạn có thể chỉnh sửa một cách tự nhiên chỉ bằng giọng nói của mình,” Google nhấn mạnh, đồng thời “phiên âm sẽ tự động định dạng văn bản và loại bỏ các từ ngữ đệm như ‘um’ và ‘uh’.”
- Sửa đổi thông tin trước đó: Trong một bản tin trước khi công bố, Google đã đề cập tới hai mô hình Gemini 3.5 Live và 3.5 Experimental. Tuy nhiên, theo cập nhật mới nhất, chỉ có Gemini 3.5 Transcribe được công bố hôm nay.
Bối cảnh ngành và so sánh với đối thủ
Sự ra mắt Gemini 3.5 Transcribe xuất hiện trong bối cảnh cạnh tranh gay gắt giữa các ông lớn AI trong lĩnh vực phiên âm và dịch thuật. Microsoft đã tích hợp Whisper vào Azure Speech, trong khi OpenAI cung cấp Whisper API cho các nhà phát triển. Cả hai đều hỗ trợ đa ngôn ngữ, nhưng chưa có tính năng tự động xóa từ ngữ đệm và tùy chỉnh từ vựng chuyên ngành như Gemini 3.5 Transcribe.
Việc Google nhấn mạnh “cải thiện đáng kể” so với Chirp 3 cho thấy họ đang cố gắng khắc phục những hạn chế của phiên bản trước, nhất là trong việc giảm lỗi dịch và nâng cao độ chính xác cho các ngôn ngữ không phải tiếng Anh. Đối với doanh nghiệp và nhà sáng tạo nội dung ở Việt Nam, khả năng tự động loại bỏ “um” và “uh” đồng thời hỗ trợ tiếng Việt có thể giảm thời gian hậu kỳ đáng kể.
Mặc dù Gemini 3.5 Pro vẫn chưa ra mắt, nhưng Gemini 3.5 Transcribe đã tạo tiền đề cho những cải tiến tiếp theo, đồng thời củng cố vị thế của Google trong hệ sinh thái AI đa ngôn ngữ. Khi Chrome sắp hỗ trợ tính năng này, người dùng trên mọi nền tảng sẽ có thêm một công cụ mạnh mẽ để chuyển đổi giọng nói thành văn bản một cách nhanh chóng và chuyên nghiệp.