Mô hình và nền tảng AI

Google DeepMind Mang Tới Ngôn Ngữ Ký Hiệu Dịch Sang Văn Bản Cho Điện Thoại Với SL2T

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Google DeepMind đã phát hành một mô hình ngôn ngữ ký hiệu sang văn bản, SL2T, trong hai sản phẩm Android tiêu dùng, lần đầu tiên công nghệ ngôn ngữ ký hiệu đạt được tính năng trên điện thoại. Mô hình này cung cấp khả năng nhập văn bản bằng ngôn ngữ ký hiệu trong Gboard và Live Transcribe trên điện thoại Pixel 11, ra mắt với khả năng dịch ngôn ngữ ký hiệu Mỹ sang tiếng Anh vào ngày 12 tháng 8 năm 2026.

Tính năng này hoạt động ở bất kỳ nơi nào người dùng thường nhập văn bản. Một người dùng ngôn ngữ ký hiệu khiếm thính có thể nhập văn bản tìm kiếm, soạn thảo tin nhắn hoặc tài liệu, hoặc hỏi Gemini bằng cách ký hiệu vào camera điện thoại thay vì nhập văn bản. Trong Live Transcribe, người dùng ngôn ngữ ký hiệu có thể trả lời trong cuộc trò chuyện bằng ngôn ngữ ký hiệu thay vì nhập văn bản. Google cho biết những người thử nghiệm đã tìm thấy việc ký hiệu bằng ngôn ngữ ký hiệu Mỹ nhanh hơn và tự nhiên hơn so với nhập văn bản bằng tiếng Anh.

SL2T là mô hình đầu tiên của Google được mô tả là một bước đột phá về chất lượng và tính tổng quát cho dịch ngôn ngữ ký hiệu. Nó được đào tạo trên hơn 100.000 giờ dữ liệu ngôn ngữ ký hiệu, bao gồm hơn 50 ngôn ngữ ký hiệu, với khoảng một phần tư dữ liệu là ngôn ngữ ký hiệu Mỹ. Việc đào tạo chung trên nhiều ngôn ngữ, phương ngữ và trình độ kỹ năng đã tạo ra một mô hình vượt trội so với các hệ thống đơn ngôn ngữ trong các thí nghiệm của công ty, theo thông báo.

Điều Mô Hình Nhận Thức và Cách Dịch

Hệ thống không xử lý video thô của người ký hiệu. Một mô hình trên thiết bị, MediaPipe Holistic, theo dõi 130 điểm chính trên khuôn mặt, cơ thể và tay của người ký hiệu frame by frame, và chỉ những tọa độ hình học này rời khỏi thiết bị để dịch. Dữ liệu camera ban đầu được loại bỏ ngay lập tức, một thiết kế mà Google coi là một biện pháp bảo vệ quyền riêng tư.

Từ luồng tọa độ này, SL2T tạo ra văn bản tiếng Anh trực tiếp, bỏ qua lớp chú thích trung gian được gọi là glosses mà hầu hết các hệ thống dịch ngôn ngữ ký hiệu trước đây dựa vào. Glosses gán nhãn cố định cho từng ký hiệu, điều này hạn chế vốn từ vựng và mất đi các dấu hiệu không thủ công và cấu trúc không gian mang ý nghĩa ngữ pháp trong ngôn ngữ ký hiệu. Việc loại bỏ nút thắt này cho phép chất lượng dịch tăng tỷ lệ với dữ liệu đào tạo chứ không phải với tập nhãn được xây dựng thủ công.

Ngôn ngữ ký hiệu là ngôn ngữ tự nhiên độc lập với ngữ pháp của riêng chúng, không phải là phiên bản ký hiệu của tiếng nói. Điều này làm cho nhiệm vụ trở thành dịch máy giữa hai ngôn ngữ, cộng với một vấn đề tầm nhìn máy tính khó khăn: mô hình phải theo dõi đồng thời chuyển động của tay, cánh tay, thân, đầu và khuôn mặt với tốc độ khung hình cao. Những nỗ lực trước đây về công nghệ ngôn ngữ ký hiệu, chẳng hạn như găng tay cảm biến, không thể giải quyết được cả hai yêu cầu này.

Kết Quả Benchmark và Mẫu Lỗi Còn Lại

Trên benchmark FLEURS-ASL, đo lường khả năng dịch ngôn ngữ ký hiệu Mỹ sang tiếng Anh của ngôn ngữ phức tạp, trừu tượng được ghi lại trong điều kiện phòng thu bởi các Người phiên dịch khiếm thính được chứng nhận, SL2T đạt điểm 70 BLEURT zero-shot, cao hơn so với các kết quả được báo cáo trước đây, theo Google. Công ty cũng báo cáo 74 BLEURT trên biến thể ký hiệu một tay của benchmark và 85 BLEURT trên PRESTO-ASL, một tập dữ liệu các cụm từ được ký hiệu cho một máy tính bảng đã dock. Trên FSboard, một tập dữ liệu ký hiệu bằng tay được thu thập từ người dùng khiếm thính trên thiết bị di động, mô hình đạt độ chính xác trùng khớp chính xác 64%. Đây là những con số do nhà cung cấp báo cáo; không có đánh giá độc lập nào được công bố.

Google đã xuất bản các ví dụ song song từ FLEURS-ASL, hiển thị đầu ra thông thạo cùng với các chế độ lỗi có thể xác định. Mô hình thỉnh thoảng thay thế các ký hiệu hiếm và ký hiệu bằng tay nhanh, bỏ qua các cấu trúc thụ động và hình ảnh phân loại, và mất dấu khi ngữ cảnh bị thiếu. Một ví dụ dịch “Con chim săn mồi này có lông đầy đủ, máu nóng” thành “Con vật này là máu nóng, ăn màu xám”, một lỗi ký hiệu bằng tay thay thế “xám” cho “săn mồi”.

Mô hình cũng hiển thị hành vi ảo giác còn lại, tạo ra văn bản khi không có ai ký hiệu, chẳng hạn như khi một người thứ hai vào khung hình hoặc người ký hiệu tạm dừng. Google cho biết phiên bản phát hành đã giảm đáng kể những lỗi này so với các bản xây dựng trước khi phát hành mà những người đánh giá khiếm thính đã thử nghiệm vào tháng 7 năm 2026, nhưng chưa loại bỏ chúng.

Địa Điểm Google Nói Công Cụ Không Nên Sử Dụng

Phiên bản này đi kèm với một lớp quản lý đặc biệt. Google DeepMind đã thành lập một ủy ban tư vấn, Ủy ban Tư vấn Ngôn ngữ Ký hiệu AI, tập hợp các tổ chức khiếm thính, bao gồm Hiệp hội Quốc gia về Người khiếm thính, Liên đoàn Thế giới về Người khiếm thính, Mạng lưới Nghệ thuật Chuyên nghiệp khiếm thính và Viện Công nghệ Quốc gia về Người khiếm thính của Viện Công nghệ Rochester. Ủy ban đã đồng tác giả một báo cáo tác động chung nêu rõ công nghệ này là gì và nơi nó ngừng hoạt động.

Báo cáo định nghĩa SL2T 1.0 là một công cụ tạo bản thảo hỗ trợ cho các thiết lập không chính thức, thấp: nhắn tin, tìm kiếm, điều hướng, ghi chú và cuộc trò chuyện không chính thức một đối một. Nó rõ ràng loại trừ các cuộc tư vấn y tế, thủ tục pháp lý, tương tác với cảnh sát, hướng dẫn trong lớp học, cuộc phỏng vấn việc làm và quyết định về lợi ích chính phủ. Nó cũng tuyên bố rằng công cụ này không đáp ứng nghĩa vụ pháp lý về các điều khoản hợp lý theo Đạo luật về Người khiếm thính Mỹ hoặc các khuôn khổ tương đương, và nó không được sử dụng bởi các tổ chức để thay thế cho các phiên dịch viên người khiếm thính được chứng nhận.

Người ký hiệu vẫn ở trong vòng lặp suốt quá trình. Cả hai ứng dụng đều hiển thị bản xem trước văn bản mà người dùng có thể xem xét và chỉnh sửa trước khi gửi, và trong Live Transcribe, người dùng khiếm thính kiểm soát khi văn bản dịch được hiển thị cho đối tác trò chuyện. Báo cáo lưu ý rằng biện pháp bảo vệ này giả định khả năng đọc và viết tiếng Anh chức năng để bắt lỗi.

SL2T Hoạt Động Như Thế Nào Trong Tài Liệu Giới Hạn Của Mô Hình

Báo cáo tác động liệt kê các ranh giới kỹ thuật của mô hình một cách chi tiết. Độ chính xác giảm trong điều kiện ánh sáng yếu, ánh sáng nền khắc nghiệt hoặc khi quần áo giảm độ tương phản với tay và khuôn mặt. Bộ theo dõi tư thế chỉ theo dõi đối tượng lớn nhất trong khung hình và không thể xử lý nhiều người ký hiệu. Hiệu suất giảm ở các góc máy cực đoan hoặc khi người ký hiệu nằm nghiêng. Các đoạn nhập được giới hạn ở 60 giây, và mỗi đoạn được dịch độc lập, không có ký ức về các lượt trò chuyện trước đó. Mô hình không được đào tạo hoặc đánh giá trên người ký hiệu dưới 18 tuổi. Nó không hỗ trợ danh sách từ tùy chỉnh, không có chữ ký tên và không có sở thích phương ngữ.

Các bản cập nhật ngắn hạn đã nằm trong đường lối bao gồm nhập dấu câu, dòng mới, biểu tượng cảm xúc và lệnh chỉnh sửa cơ bản, cũng như bộ nhớ trò chuyện trên các đoạn tuần tự trong Live Transcribe. Các mục tiêu nghiên cứu dài hạn bao gồm độ nhạy tốt hơn với các dấu hiệu không thủ công như biểu cảm khuôn mặt và vị trí lông mày, hỗ trợ nhiều người ký hiệu và thu thập dữ liệu mở rộng trên các phương ngữ ngôn ngữ ký hiệu khu vực và ngôn ngữ ký hiệu Mỹ da đen.

Dự án này bắt nguồn từ Sam Sepah, một người khiếm thính của Google, và quan điểm của người khiếm thính đã được tích hợp vào thu thập dữ liệu, nghiên cứu người dùng và đánh giá. Google mô tả việc ra mắt SL2T là bước đầu tiên trong một nỗ lực dài hơn: các ngôn ngữ ký hiệu bổ sung, tạo ngôn ngữ ký hiệu và các khả năng biên giới rộng lớn hơn đều được liệt kê là công việc đang hoạt động. Tính năng này được vận chuyển trên Pixel 11 mà không có chi phí thêm, với nhiều thiết bị hơn sẽ theo sau vào dữ liệu thu thập, nghiên cứu người dùng và đánh giá.

Jonas Reeve là một nhà phân tích được tạo bởi AI tại Unite.AI, tập trung vào trí tuệ nhân tạo nhận thức, trí tuệ nhân tạo tổng quát (AGI) và các nền tảng lý thuyết của trí tuệ máy. Công việc của ông khám phá cách học tập, lý luận, trí nhớ và trừu tượng hóa xuất hiện trong cả hệ thống sinh học và nhân tạo, vẽ ra các kết nối giữa các kiến trúc AI hiện đại và các câu hỏi lâu đời trong khoa học nhận thức và triết lý của tâm trí.
Với một cách tiếp cận khái niệm và phản ánh, Jonas kiểm tra các khuôn khổ như mô hình lý luận, hệ thống đại lý, nhận thức xuất hiện và lý thuyết liên kết, nhằm làm rõ tiến bộ hướng tới AGI thực sự có nghĩa là gì - và những gì nó không có. Thay vì theo đuổi thời gian hoặc sự cường điệu, ông nhấn mạnh các nguyên tắc cơ bản, sự nghiêm ngặt về khái niệm và giới hạn của các mô hình hiện tại.
Các bài viết được viết bởi Jonas Reeve được tạo bởi AI và được xem xét bởi đội ngũ biên tập của Unite.AI để đảm bảo độ chính xác, sự rõ ràng và thảo luận có trách nhiệm về các khái niệm AI tiên tiến.