Mô hình và nền tảng AI
Anthropic Mang đến Opus và Sonnet cho Chế độ Giọng nói Claude

Anthropic đã mở chế độ giọng nói của Claude cho các mô hình mạnh mẽ hơn, cho phép các cuộc trò chuyện bằng giọng nói chạy trên các cấp độ Opus và Sonnet thay vì mô hình Haiku nhẹ mà đã cung cấp tính năng này từ khi ra mắt vào năm 2025. Công ty đã xác nhận sự thay đổi này vào thứ Năm, ngày 23 tháng 7 năm 2026, và coi đây là một cách để làm cho việc trò chuyện với Claude trở nên hữu ích cho công việc thực sự chứ không chỉ là tìm kiếm nhanh.
Theo tài liệu về chế độ giọng nói của Anthropic, tính năng này hiện bắt đầu với mô hình mà người dùng đã chọn lần cuối trong trò chuyện văn bản và chạy phiên bản nhanh nhất của nó theo mặc định, vì vậy một phiên sẽ kế thừa trí tuệ của mô hình đằng sau nó. Người dùng cũng có thể chuyển đổi giữa Haiku, Sonnet và Opus trong quá trình trò chuyện thông qua trình chọn mô hình. Trong thực tế, điều đó mở ra các công việc mà thiết lập Haiku chỉ xử lý kém: lý luận dài hơn, phản hồi về cách bạn diễn đạt một bản trình bày khách hàng, hoặc các yêu cầu nặng về công cụ như soạn thảo email và cập nhật một khe thời gian bằng giọng nói.
Chế độ giọng nói cũng có thể tiếp cận các ứng dụng kết nối, bao gồm Gmail, Google Calendar, Google Docs và Slack, vì vậy một yêu cầu bằng giọng nói có thể kéo context từ tài khoản của người dùng hoặc thực hiện một hành động như rescheduling một cuộc họp. Sự tích hợp ứng dụng này là điểm tách biệt rõ ràng nhất với OpenAI, mà chế độ giọng nói vừa được cập nhật đã thay đổi cách ChatGPT nói nhưng vẫn không thể sử dụng các công cụ bên ngoài để hoàn thành công việc.
Quyết định sản phẩm, không phải mô hình giọng nói mới
Đối với bất kỳ ai theo dõi những gì các phòng thí nghiệm tiền phong thực sự vận chuyển, phần đáng chú ý của bản phát hành này là những gì Anthropic không xây dựng. Không có mô hình giọng nói bản địa mới ở đây. Anthropic đã nói với Engadget rằng bản cập nhật “được tập trung vào trí tuệ và truy cập công cụ,” và rằng nó “đang tiếp tục đầu tư vào giọng nói” với “nhiều hơn để chia sẻ sau này trong năm.” Đường ống cơ bản vẫn theo lượt: Claude lắng nghe, pause để suy nghĩ, sau đó nói, và nó được cho là dựa trên một nhà cung cấp văn bản-sang-nói bên ngoài như ElevenLabs cho đầu ra bằng giọng nói.
Định tuyến một mô hình suy luận vào giọng nói ít hơn là một nâng cấp âm thanh hơn là một khả năng. Một yêu cầu bằng giọng nói hiện có thể được xử lý bởi một mô hình có thể lập kế hoạch và làm việc thông qua một vấn đề, nơi Haiku được điều chỉnh để trả lại một câu trả lời nhanh hơn là một câu trả lời được xem xét. Sự thay đổi về những gì giọng nói có thể làm đến hoàn toàn từ mô hình đằng sau nó.
Đó là một đặt cược khác với cái mà OpenAI đang thực hiện. OpenAI đã đổ nguồn lực vào một hệ thống bản địa, song hướng, GPT-Live, xử lý những gì bạn nói và tạo ra một câu trả lời cùng một lúc, gần hơn với nhịp điệu của một cuộc gọi điện thoại. Anthropic thay vào đó định tuyến các mô hình suy luận mạnh nhất của mình vào một ngăn xếp giọng nói thông thường và chấp nhận các hạn chế đối thoại đi kèm với nó. Vì mô hình giọng nói bản thân không thay đổi, người dùng không thể nhận thấy việc xử lý gián đoạn mượt mà hơn hoặc một cuộc trò chuyện trở lại thuận tiện hơn. Những gì thay đổi là làm thế nào Claude có thể suy luận về những gì nó được hỏi, không phải về cách nó nghe khi làm điều đó.
Sự đánh đổi này tương ứng với một câu hỏi mà người dùng Claude đã phải đối mặt trong văn bản: mô hình mạnh nhất không phải lúc nào cũng là lựa chọn phù hợp cho nhiệm vụ. Chọn một mô hình nặng hơn mua độ sâu với chi phí của tốc độ, và các cuộc trò chuyện bằng giọng nói đặc biệt nhạy cảm với độ trễ. Đặt lựa chọn trong tay người dùng, thay vì mặc định mọi người vào lựa chọn nhanh nhất, là thực chất của bản cập nhật.
Điều gì có sẵn, và điều gì còn thiếu
Chế độ giọng nói nâng cấp đang được tung ra dưới dạng beta cho tất cả người dùng trên các ứng dụng di động, máy tính để bàn và web của Anthropic. Vì nó là một vấn đề về định tuyến các mô hình hiện có chứ không phải cơ sở hạ tầng mới, việc tung ra không chờ đợi Anthropic vận chuyển các hệ thống âm thanh mới. Tài khoản miễn phí bị giới hạn ở mô hình Haiku và một ứng dụng kết nối, với Sonnet và Opus dành cho người đăng ký trả phí. Đầu vào đa ngôn ngữ, được thêm vào đầu năm nay, được bao gồm, mặc dù Claude vẫn không thể tự động phát hiện chuyển đổi ngôn ngữ; người dùng phải đặt tên ngôn ngữ họ sẽ nói, bằng lời hoặc trong cài đặt giọng nói.
Trình chọn mô hình hiển thị Opus, Sonnet và Haiku, nhưng không phải Claude Fable 5, mô hình mạnh nhất và rộng rãi nhất của Anthropic, vẫn còn ngoài giọng nói. Sự thiếu sót này phù hợp với logic của bản phát hành. Điều này là về việc khớp giọng nói với các mô hình suy luận mà hầu hết mọi người đã sử dụng hàng ngày, không phải về việc đẩy ranh giới của những gì một trợ lý bằng giọng nói có thể làm.
Kết quả đọc ít hơn như một đột phá về giọng nói hơn là một tuyên bố về chiến lược. Anthropic đang đặt cược rằng giá trị của một trợ lý bằng giọng nói đến từ mô hình suy luận và các công cụ nó có thể tiếp cận, không phải từ một kiến trúc âm thanh được thiết kế riêng. Những bản cập nhật được hứa hẹn sau này trong năm sẽ cho thấy bao lâu vị trí đó sẽ được giữ khi OpenAI và Google tiếp tục đẩy các hệ thống bản địa về giọng nói của riêng họ.












