Mô hình và nền tảng AI
GPT‑Live‑1 của OpenAI có mặt trong API với mức $0.05 mỗi phút

OpenAI ra mắt GPT‑Live‑1 trong API vào ngày 10 tháng 9 năm 2026, cung cấp mô hình giọng nói toàn song công cho các nhà phát triển với mức $0.05 mỗi phút cho lớp giọng nói phía trước. Bản phát hành mở rộng hệ thống hội thoại phía sau ChatGPT Voice sang các ứng dụng bên thứ ba và quy trình công việc doanh nghiệp.
GPT‑Live‑1 có thể nghe và nói đồng thời, và OpenAI cho biết nó giao các suy luận và hành động sâu hơn cho các mô hình và công cụ mà nó kết hợp, như đã được minh họa với Codex và ChatGPT Work. Đối với bản phát hành API, công ty cho biết đã tập trung vào các khả năng cho phép các nhà phát triển điều khiển và tùy chỉnh trải nghiệm giọng nói dựa trên người dùng, quy trình công việc và mục tiêu của họ.
Một Mô Hình Đơn cho Việc Nghe và Nói
Các trợ lý giọng nói truyền thống kết hợp chuỗi chuyển đổi giọng nói thành văn bản, một mô hình suy luận và chuyển văn bản thành giọng nói, và mỗi bước chuyển giao làm tăng độ trễ và tạo ra nhiều cơ hội mất thời gian, ngữ cảnh hoặc nhịp điệu tự nhiên của cuộc hội thoại. GPT‑Live‑1 xử lý việc nghe và nói trong một mô hình duy nhất, suy luận đồng thời trên âm thanh vào và ra, phản hồi các sự gián đoạn và xác nhận ngay khi chúng xảy ra trong khi giao các suy luận sâu hơn cho phần hậu trường, vì vậy cuộc hội thoại có thể tiếp tục trong khi công việc diễn ra ở nền.
Các nhà phát triển lựa chọn các mô hình, công cụ và khung trợ lý đứng sau cuộc hội thoại. OpenAI đưa ra ví dụ về việc kết hợp GPT‑Live‑1 với một mô hình như Luna cho các nhiệm vụ khối lượng lớn như lên lịch hoặc cập nhật đơn hàng, và một mô hình như Astra cho các vấn đề khách hàng phức tạp đòi hỏi suy luận; phần hậu trường cũng có thể là một mô hình của bên thứ ba. Các nhà phát triển có thể định hình tông giọng, tốc độ và phong cách hội thoại của trợ lý thông qua lời nhắc hệ thống.
OpenAI liệt kê thêm các ưu điểm cho bản phát hành API: quản lý ngữ cảnh im lặng và xử lý tiếng ồn nền mà không phải thuyết minh từng bước bằng lời, duy trì ngữ cảnh qua các phiên kéo dài, và hỗ trợ điện thoại cho các trợ lý điện thoại toàn song công trong các cuộc gọi từ đặt chỗ nhà hàng đến hỗ trợ khách hàng. GPT‑Live‑1 cung cấp sẵn bản ghi ASR và văn bản phản hồi, hỗ trợ ưu tiên từ khóa và hiểu biết về ký tự chữ và số, và mặc dù không phải là mô hình dựa trên lượt, nó hỗ trợ phát hiện lượt một cách tự nhiên để các nhà phát triển có thể tiếp tục xây dựng dựa trên ranh giới lượt rõ ràng. Một đoạn mã được công bố cùng thông báo cho thấy một ứng dụng truyền ngữ cảnh hội thoại tới Codex và trả lại câu trả lời của Codex cho GPT‑Live‑1 trong một phiên.
Kết Quả Đánh Giá Được Báo Cáo
OpenAI báo cáo rằng GPT‑Live‑1 cải thiện hiệu năng Full Duplex Bench lên 30 điểm phần trăm so với GPT‑Realtime‑2.1, với mức tăng lớn về độ trễ trong việc luân chuyển lượt và hành vi tương tác, và nó đứng đầu trên Tau3, một chuẩn đo lường trí thông minh của trợ lý giọng nói tiên tiến trên các nhiệm vụ đầu cuối, khi kết hợp với GPT‑6 Astra với mức nỗ lực suy luận trung bình.
Trong Tau3 (Voice) Intelligence, đo lường các nhiệm vụ dịch vụ khách hàng bằng giọng nói trong các lĩnh vực hàng không, bán lẻ và viễn thông, các điểm Pass@1 thành công của OpenAI được báo cáo là 86,2% cho GPT‑Live‑1, so với 45,7% cho GPT‑Realtime‑2.1 và 42,4% cho GPT‑Realtime‑2. Trong Tau Banking (Voice) Knowledge, đo lường tỷ lệ hoàn thành thành công của 97 nhiệm vụ kiến thức ngân hàng, các con số được báo cáo là 32,0% so với 12,4% và 10,3%.
Công ty cũng báo cáo điểm trung bình Artificial Analysis Conversational Dynamics là 97,3% cho GPT‑Live‑1, so với 95,7% cho GPT‑Realtime‑2.1 và 95,3% cho GPT‑Realtime‑2, trong một đánh giá bao gồm xử lý tạm dừng, luân chuyển lượt hội thoại, gián đoạn và phản hồi ngược. Trong Full Duplex Bench v1.5 Interactivity, kiểm tra phản ứng với tiếng nói nền, nói với người khác, phản hồi ngược của người nghe và gián đoạn, các điểm được báo cáo là 80,10% so với 45,4% và 47,8%. Độ trễ luân chuyển lượt trong Full Duplex Bench v1, đo thời gian trợ lý bắt đầu trả lời sau khi người dùng hoàn thành một lượt, là 0,798 giây so với 1,41 giây và 1,63 giây. Trong Full Duplex Bench v3, chạy với nền tảng Terra với mức nỗ lực suy luận thấp, OpenAI báo cáo Pass@1 gọi công cụ là 87,0% so với 60,0% và 58,0%, và chất lượng phản hồi là 90,0% so với 88,0% và 81,0%.
Từ ChatGPT Voice Đến API
OpenAI giới thiệu GPT‑Live vào ngày 8 tháng 7 năm 2026 như một thế hệ mới của các mô hình giọng nói toàn song công hỗ trợ ChatGPT Voice, ra mắt GPT‑Live‑1 và GPT‑Live‑1 mini cho người dùng ChatGPT trên toàn cầu vào ngày hôm đó và cho biết dự định đưa các mô hình này vào API. OpenAI cho biết GPT‑Live‑1 sẽ trở thành mô hình mặc định hỗ trợ ChatGPT Voice cho người dùng Go, Plus và Pro, trong khi GPT‑Live‑1 mini sẽ là mặc định cho người dùng Free. Bản cập nhật ngày 31 tháng 7 năm 2026 đã thêm dấu watermark SynthID cho âm thanh được hỗ trợ tạo bằng GPT‑Live qua ChatGPT Voice và API của OpenAI, cùng với quyền truy cập API vào công cụ xác minh công khai của OpenAI.
Thông báo cũng giới thiệu doanh nghiệp tới OpenAI Presence, mà OpenAI cho biết sử dụng GPT‑Live‑1 để cung cấp các tương tác giọng nói thời gian thực cho các trợ lý trả lời câu hỏi, giải quyết vấn đề, sử dụng hệ thống công ty, thực hiện các hành động đã được phê duyệt, và chuyển giao cho con người khi cần. OpenAI giới thiệu Presence vào ngày 22 tháng 7 năm 2026 như một sản phẩm doanh nghiệp được triển khai cho các quy trình công việc giọng nói và trò chuyện, có sẵn cho khách hàng đủ điều kiện thông qua chương trình khả dụng chung có giới hạn do các Kỹ sư Triển khai Trước của OpenAI và một số nhà tích hợp hệ thống toàn cầu dẫn dắt, thay vì là sản phẩm tự phục vụ.
Khách Hàng Sớm và Giọng Nói Mới
Giám đốc công nghệ của Yelp, Alex Levy, cho biết việc thêm GPT‑Live‑1 vào Yelp Host và Hatch đã cải thiện việc luân chuyển lượt và độ chính xác so với kiến trúc giọng nói truyền thống của công ty, và Yelp đang thấy cải thiện đáng kể trong tỷ lệ xử lý cuộc gọi khi Yelp Host trả lời các cuộc gọi như đặt chỗ và đặt món ăn. “Người gọi cũng nói các câu đầy đủ, tự nhiên hơn, điều này cho chúng tôi thấy trải nghiệm ở đầu kia của điện thoại thực sự khác biệt,” Levy nói. Một bản demo được công bố cùng thông báo cho thấy Yelp Host xác nhận một đặt chỗ trong khi GPT‑Live‑1 xử lý tiếng ồn nền, các cuộc trò chuyện phụ và gián đoạn.
Đồng sáng lập và giám đốc công nghệ của Speak, Andrew Hsu, cho biết các đánh giá ban đầu phát hiện GPT‑Live‑1 giảm gián đoạn trong khoảng dừng suy nghĩ của người học gần 80% so với các hệ thống dựa trên lượt trước đây trong các Bài học Live Tutor của Speak. Giám đốc vận hành của Fin, Jordan Neil, cho biết mô hình này chuyển hỗ trợ giọng nói AI từ nhịp điệu dừng‑bắt đầu sang luồng tự nhiên của một cuộc gọi điện thoại, cho phép khách hàng tạm dừng, gián đoạn và thay đổi hướng trong khi Fin kết hợp cuộc hội thoại với hệ thống hỗ trợ độc quyền của mình để giải quyết vấn đề. Đồng sáng lập và giám đốc sản phẩm của Cognition, Walden Yan, mô tả việc sử dụng GPT‑Live‑1 cùng với Devin, kỹ sư AI của Cognition, để thảo luận một ý tưởng, kiểm tra áp lực một phương pháp, hoặc chuyển giao công việc khi không ngồi trước bàn phím.
OpenAI cho biết họ đang mở rộng từ một bộ nhỏ các giọng nói thời gian thực sang một lựa chọn rộng hơn bao gồm các giọng điệu, phương ngữ và ngôn ngữ, mang lại cho các nhà phát triển nhiều lựa chọn hơn về cách trợ lý của họ nghe. Các nhà phát triển muốn truy cập giọng nói tùy chỉnh phải liên hệ bộ phận bán hàng của OpenAI để tìm hiểu về tiêu chuẩn đủ điều kiện và quy trình yêu cầu. Công ty cho biết sẽ tiếp tục mở rộng các tùy chọn giọng nói và khả năng hỗ trợ ngôn ngữ trong những tháng tới.












