Mô hình và nền tảng AI
Lý do tại sao NVIDIA Alpamayo có thể giải quyết vấn đề ‘trường hợp biên’ của xe tự lái?

Xe tự lái đã đạt được những tiến bộ đáng kể trong thập kỷ qua, tích lũy hàng triệu dặm và hoạt động tốt trên đường cao tốc, trong các khu vực thử nghiệm được kiểm soát và trong các khu vực đô thị được chọn. Tuy nhiên, ngay cả vào năm 2026, việc lái xe trong thế giới thực vẫn tiếp tục暴 lộ những hạn chế quan trọng. Ví dụ, việc rẽ trái không được bảo vệ trong thời tiết mưa lớn, các khu vực xây dựng với vạch làn đường mờ hoặc thiếu, và các điểm giao nhau nơi nhân viên cấp cứu sử dụng tín hiệu tay tạm thời vẫn có thể thách thức các hệ thống tự lái tiên tiến.
Các tình huống này không phải là những bất thường hiếm gặp mà chỉ có thể giải quyết bằng cách thu thập thêm dữ liệu. Thay vào đó, chúng突 xuất một vấn đề sâu sắc hơn trong công nghệ xe tự lái hiện đại. Các hệ thống hiện đại có khả năng phát hiện vật thể và lập bản đồ môi trường, nhưng chúng gặp khó khăn trong việc suy luận về các sự kiện trong tương lai, giải thích ý định của các người dùng đường khác và đưa ra quyết định nhạy cảm với ngữ cảnh. Do đó, việc nhận thức alone là không đủ để đảm bảo an toàn trong các tình huống phức tạp và khó đoán trước.
Để giải quyết thách thức này, NVIDIA (NVDA ) đã giới thiệu Alpamayo tại CES 2026. Đây là một họ các mô hình Vision-Language-Action mở, kết hợp một lớp suy luận rõ ràng trên lớp nhận thức. Bằng cách kết hợp nhận thức với suy luận, Alpamayo cho phép xe tự lái điều hướng các tình huống lái xe hiếm và phức tạp một cách an toàn hơn, đồng thời cung cấp các giải thích có thể giải thích được cho từng quyết định. Do đó, nó đại diện cho một bước tiến quan trọng hướng tới các hệ thống tự động có thể suy nghĩ, giải thích và thích nghi thay vì chỉ quan sát.
Hiểu về vấn đề ‘trường hợp biên’ trong lái xe tự động
Các trường hợp biên là một trong những vấn đề phức tạp nhất trong xe tự lái. Đây là những tình huống hiếm gặp mà hành động an toàn nhất phụ thuộc vào ngữ cảnh tinh tế, quy tắc xã hội không thành văn và tương tác thời gian thực với các người dùng đường khác. Ví dụ, một người đi bộ có thể vẫy tay cho xe qua ngã tư ngay cả khi họ có quyền ưu tiên. Hoặc một khu vực xây dựng có thể có vạch làn đường mờ hoặc thiếu, mâu thuẫn với các hình nón tạm thời. Những tình huống này không xảy ra thường xuyên, có thể chỉ một lần trong vài nghìn dặm, nhưng chúng gây ra một tỷ lệ lớn các sự cố an toàn và lỗi hệ thống.
Báo cáo ngắt kết nối của California năm 2024 rõ ràng cho thấy điều này. Trong 31 công ty xe tự lái được cấp phép, hơn 2.800 xe thử nghiệm đã lái hàng trăm nghìn dặm. Tuy nhiên, nhiều thất bại xảy ra trong các bố cục đường phức tạp, kiểm soát giao thông tạm thời hoặc khi hành vi con người không thể đoán trước. Đây chính xác là những tình huống hiếm gặp mà các mô hình tự lái truyền thống gặp khó khăn trong việc xử lý. Con người, mặt khác, có thể điều hướng chúng bằng cách sử dụng kinh nghiệm, suy nghĩ nhanh và phán đoán trong thời điểm đó. Các hệ thống tự động thường thất bại khi thế giới thực khác với những gì họ đã thấy trong quá trình đào tạo.
Công nghệ tự lái hiện đại rất tốt trong việc nhận thức. Các hệ thống có thể phát hiện xe, xe đạp, người đi bộ và biển báo giao thông với độ chính xác cao bằng cách sử dụng camera, lidar và radar. Ngoài ra, các mô hình từ đầu đến cuối chuyển đổi dữ liệu cảm biến trực tiếp thành lệnh lái và ga. Trên các con đường quen thuộc, điều này cho phép xe tự lái một cách mượt mà và an toàn.
Tuy nhiên, nhận thức alone không thể xử lý tất cả các tình huống. Nó không thể trả lời các câu hỏi quan trọng phát sinh trong các tình huống phức tạp hoặc khó đoán trước. Ví dụ, một người đi bộ sẽ bước vào đường hay không? Liệu có an toàn hơn khi nhường đường trong thời điểm này hay chấp nhận một rủi ro nhỏ? Tại sao một động tác nào đó an toàn hơn động tác khác? Các mô hình hộp đen làm cho những câu hỏi này trở nên khó khăn hơn vì chúng không thể giải thích quyết định của mình. Do đó, các nhóm an toàn và các nhà quản lý có thể gặp khó khăn trong việc tin tưởng vào những hệ thống này.
Các lập trình viên dựa trên quy tắc cũng có những hạn chế. Mặc dù chúng cung cấp hướng dẫn rõ ràng, nhưng việc lập trình quy tắc cho mọi tình huống hiếm gặp nhanh chóng trở nên không thể. Do đó, việc dựa hoàn toàn vào nhận thức hoặc quy tắc cố định sẽ để lại những khoảng trống trong an toàn và quyết định.
Những thách thức này cho thấy tại sao một lớp suy luận là cần thiết cho xe tự lái. Một hệ thống như vậy có thể hiểu tình huống, dự đoán những gì có thể xảy ra tiếp theo và đưa ra quyết định mà con người và các nhà quản lý có thể tin tưởng. Ngoài ra, các mô hình suy luận có thể tạo ra các giải thích có thể được xem xét, tăng cường niềm tin vào hành động của xe.
NVIDIA Alpamayo và sự chuyển dịch hướng tới tự động hóa dựa trên suy luận
NVIDIA giới thiệu Alpamayo, một nền tảng tập trung vào suy luận được thiết kế để giải quyết các trường hợp biên vẫn tiếp tục làm chậm tiến bộ hướng tới lái xe tự động cấp 4. Tuy nhiên, thay vì hoạt động như một hệ thống tự lái hoàn toàn trong xe, Alpamayo hoạt động như một môi trường nghiên cứu và phát triển mở. Nó kết hợp ba thành phần紧密 liên kết: các mô hình Vision-Language-Action, khuôn khổ mô phỏng AlpaSim và các tập dữ liệu lái xe Physical AI lớn. Những yếu tố này cùng nhau hỗ trợ việc nghiên cứu, thử nghiệm và tinh chỉnh các chính sách lái xe phải hoạt động trong điều kiện không chắc chắn và phức tạp xã hội trong khi vẫn dễ hiểu đối với các nhà xem xét con người.
Trung tâm của nền tảng này là Alpamayo 1. Trong mô hình này, khoảng 10 tỷ tham số kết hợp một nền tảng ngôn ngữ và tầm nhìn rộng lớn với một mô-đun dự đoán hành động và quỹ đạo chuyên dụng. Do đó, hệ thống có thể xử lý đầu vào từ nhiều góc nhìn camera, dự đoán chuyển động xe tương lai và tạo ra các giải thích ngôn ngữ tự nhiên rõ ràng cho từng quyết định. Những giải thích này theo một trình tự cấu trúc. Đầu tiên, hệ thống xác định các người dùng đường gần đó. Tiếp theo, nó ước tính ý định có thể của họ. Sau đó, nó đánh giá các giới hạn về tầm nhìn và rủi ro an toàn. Cuối cùng, nó chọn một động tác phù hợp. Ví dụ, khi một xe giao hàng chặn một phần của làn đường, mô hình có thể xem xét khả năng một người đi bộ xuất hiện từ phía sau nó. Sau đó, nó kiểm tra giao thông trong các làn đường lân cận. Do đó, nó có thể chọn một điều chỉnh đường nhỏ thay vì thay đổi làn đường hoàn toàn. Quá trình suy luận này phản ánh chặt chẽ cách một tài xế con người cẩn thận suy nghĩ qua tình huống tương tự.
Phương pháp đào tạo củng cố thêm sự tập trung này vào suy luận. Ban đầu, Alpamayo phát triển một sự hiểu biết nguyên nhân chung từ các tập dữ liệu đa phương tiện lớn. Sau đó, nó được tinh chỉnh bằng cách sử dụng dữ liệu cụ thể từ cả bản ghi thực tế và mô phỏng. Ngoài ra, mô phỏng dựa trên vật lý áp đặt các ràng buộc an toàn như duy trì khoảng cách dừng đủ và tránh giả định trách nhiệm không an toàn. Đồng thời, hệ thống đánh giá các kết quả tương lai thay thế thay vì dựa vào một dự đoán duy nhất. Do đó, bằng cách xem xét những gì có thể xảy ra tiếp theo và ưa thích các phản ứng thận trọng, mô hình giảm thiểu rủi ro thất bại trong điều kiện không quen thuộc.
Ngược lại, các hệ thống dựa trên nhận thức thường hoạt động tốt trong các tình huống thường xuyên nhưng gặp khó khăn khi bố cục đường, thời tiết hoặc hành vi con người khác với kinh nghiệm trước đó. Bằng cách tạo ra các giải thích có thể được xem xét, Alpamayo cung cấp cho các kỹ sư cái nhìn sâu sắc hơn vào nguyên nhân của thất bại. Hơn nữa, nó cung cấp cho các nhà quản lý một cơ sở minh bạch hơn để đánh giá an toàn, hỗ trợ tiến bộ vượt ra ngoài các chương trình thử nghiệm hạn chế.
Alpamayo áp dụng suy luận chuỗi tư duy vào các trường hợp biên
Alpamayo giải quyết các tình huống lái xe khó khăn thông qua suy luận thực tế, rõ ràng, thích nghi với hành vi đường thực tế. Thay vì phản ứng với các cảnh như một整 thể, hệ thống chia mỗi tình huống thành một chuỗi các bước logic. Do đó, quyết định không được tạo ra như một đầu ra duy nhất, mà là kết quả của phân tích cấu trúc. Cách tiếp cận này phản ánh suy luận con người và giảm thiểu hành vi không mong muốn trong điều kiện không quen thuộc.
Đầu tiên, mô hình xác định tất cả các tác nhân liên quan trong cảnh, bao gồm xe, người đi bộ, xe đạp và các vật thể tạm thời. Tiếp theo, nó suy luận ý định có thể bằng cách kiểm tra các mẫu chuyển động, ngữ cảnh và tín hiệu xã hội. Sau đó, nó đánh giá các giới hạn về tầm nhìn, che khuất và các nguy cơ tiềm ẩn. Ngoài ra, nó xem xét các kết quả phản thực như những gì có thể xảy ra nếu một người đi bộ bước ra đường đột ngột. Chỉ sau đó nó so sánh nhiều quỹ đạo có thể với các ràng buộc an toàn trước khi chọn một hành động cuối cùng. Đồng thời, hệ thống tạo ra một dấu vết suy luận ngôn ngữ tự nhiên rõ ràng, giải thích từng bước theo thứ tự.
Quá trình này trở nên quan trọng trong các môi trường mơ hồ. Ví dụ, khi một xe giao hàng chặn một phần của làn đường hẹp đô thị, Alpamayo không dựa hoàn toàn vào một mẫu đã học. Thay vào đó, nó suy luận qua tình huống từng bước. Nó xác định khu vực che khuất phía sau xe. Sau đó, nó dự đoán khả năng một người đi bộ hoặc xe đạp xuất hiện. Sau đó, nó kiểm tra giao thông trong các làn đường lân cận trong một khoảng thời gian ngắn. Do đó, nó có thể chọn một điều chỉnh đường nhỏ để giữ khoảng cách an toàn thay vì thay đổi làn đường hoàn toàn. Quyết định này được hỗ trợ bởi suy luận chứ không chỉ là điểm tự tin.
Hơn nữa, suy luận chuỗi tư duy cải thiện tính minh bạch trong quá trình thử nghiệm và phân tích thất bại. Các kỹ sư có thể kiểm tra chính xác nơi một đường quyết định thất bại, chẳng hạn như suy luận ý định không chính xác hoặc đánh giá rủi ro quá lạc quan. Do đó, các lỗi trở nên dễ dàng chẩn đoán và sửa chữa hơn. Điều này khác với các mô hình hộp đen, nơi hành vi có thể được quan sát nhưng không thể giải thích một cách có ý nghĩa.
Mô phỏng củng cố thêm quá trình suy luận này. Thông qua khuôn khổ AlpaSim, Alpamayo hoạt động trong các môi trường đóng vòng, nơi mỗi hành động ảnh hưởng đến các trạng thái tương lai. Các nhà phát triển có thể tiêm các trường hợp biên hiếm gặp nhưng thực tế, bao gồm cả việc đi bộ đột ngột dưới ánh chói, sự hợp nhất hung hăng của các xe lớn hoặc các điểm giao nhau nơi các tài xế dựa vào cử chỉ thay vì tín hiệu. Vì nhận thức, suy luận và hành động hoạt động cùng nhau, hệ thống phải suy luận dưới áp lực thay vì phát lại các kịch bản tĩnh.
Cuối cùng, khả năng mở rộng được đạt được thông qua một cấu trúc giáo viên-học sinh. Các mô hình Alpamayo lớn thực hiện suy luận chuỗi tư duy trong các trung tâm dữ liệu và tạo ra các quỹ đạo cùng với dấu vết suy luận trên cả dữ liệu thực và mô phỏng. Các mô hình nhỏ hơn sau đó học từ những đầu ra này và mang cấu trúc suy luận cùng vào triển khai trên phần cứng xe. Do đó, logic nguyên nhân được bảo tồn ngay cả khi có các hạn chế tính toán. Đồng thời, các dấu vết suy luận tiêu chuẩn hỗ trợ kiểm tra và xem xét quy định nhất quán. Cùng nhau, những cơ chế này tăng cường độ tin cậy và đưa các hệ thống tự động gần hơn với hoạt động an toàn trong các trường hợp biên thực tế.
Đóng khoảng trống dữ liệu dài thông qua suy luận và mô phỏng
Các hệ thống dựa trên suy luận như Alpamayo không giải quyết vấn đề trường hợp biên bằng cách thu thập thêm dữ liệu lái xe. Thay vào đó, chúng thay đổi cách dữ liệu hiện có được giải thích, mở rộng và thử nghiệm. Do đó, tiến bộ phụ thuộc vào việc sử dụng dữ liệu hiệu quả hơn chứ không chỉ tăng dặm. NVIDIA giải quyết thách thức này thông qua tích hợp chặt chẽ các tập dữ liệu lái xe Physical AI với môi trường mô phỏng AlpaSim, cả hai đều được thiết kế để hỗ trợ phát triển dựa trên suy luận.
Các tập dữ liệu Physical AI của NVIDIA bao gồm hơn 1.700 giờ dữ liệu lái xe đồng bộ hóa được thu thập trên 25 quốc gia và hàng nghìn thành phố. Dữ liệu kết hợp đầu vào từ camera, lidar và radar để thu thập một loạt các hành vi đường thực tế. Điều quan trọng là những bản ghi này mở rộng vượt ra ngoài một khu vực hoặc văn hóa lái xe duy nhất. Do đó, chúng phản ánh các chuẩn mực giao thông khác nhau, mẫu thời tiết, thiết kế đường và các thực tiễn lái xe không chính thức. Sự đa dạng này暴 lộ các mô hình với các ví dụ thực tế về các tình huống hiếm gặp và phức tạp, chẳng hạn như các điểm giao nhau không rõ ràng, vạch làn đường bị hư hỏng hoặc các con đường nơi đàm phán thay thế việc tuân theo quy tắc nghiêm ngặt. Do đó, các mô hình suy luận được đào tạo trên các điều kiện phản ánh sự phức tạp của thế giới thực.
Tuy nhiên, dữ liệu thực alone không thể đại diện cho mọi kịch bản hiếm gặp. Vì lý do này, mô phỏng đóng một vai trò trung tâm trong việc đóng khoảng trống dài. Thông qua AlpaSim, các nhà phát triển có thể tạo ra một số lượng lớn các kịch bản được kiểm soát nhưng thực tế, phản ánh các tình huống khó khăn và không thường xuyên. Những tình huống này có thể bao gồm sự suy giảm cảm biến một phần, chuyển động người đi bộ không thể đoán trước hoặc các nguy cơ môi trường không quen thuộc. Vì mô phỏng hoạt động trong một vòng tròn đóng, mỗi quyết định lái xe ảnh hưởng đến những gì xảy ra tiếp theo. Do đó, hệ thống phải suy luận qua các điều kiện phát triển thay vì phản ứng với các đầu vào tĩnh.
Xác thực cũng trở nên có cấu trúc hơn trong môi trường này. Ngoài việc đo lường độ chính xác của quỹ đạo, các nhà phát triển có thể kiểm tra xem các dấu vết suy luận có nhất quán và đáng tin cậy dưới áp lực hay không. Điều này cho phép đánh giá không chỉ liệu xe có hành xử an toàn hay không, mà còn liệu quá trình ra quyết định của nó có hợp lý hay không – do đó, việc đánh giá an toàn chuyển từ thử nghiệm và sai lầm sang suy luận có hệ thống. Bằng cách kết hợp dữ liệu thế giới thực đa dạng với mô phỏng dựa trên suy luận, Alpamayo giúp giảm khoảng trống dài trong một cách có thể đo lường và xem xét được, hỗ trợ tiến bộ an toàn hơn hướng tới lái xe tự động tiên tiến.
Tác động ngành và thách thức đang diễn ra
Alpamayo phù hợp với chiến lược lái xe tự động rộng lớn hơn của NVIDIA bằng cách tích hợp đào tạo quy mô lớn, mô phỏng và triển khai xe. Đào tạo và đánh giá diễn ra trên các hệ thống GPU hiệu suất cao trong các trung tâm dữ liệu. Trong khi đó, các mô hình nhỏ hơn được dẫn xuất từ công việc này chạy trên phần cứng ô tô, chẳng hạn như nền tảng DRIVE Thor, cho phép ra quyết định thời gian thực trong xe. Tương tự, các hệ thống liên quan mở rộng sang lĩnh vực robot thông qua các nền tảng dựa trên Jetson. Do đó, Alpamayo cho phép cả xe đường và các hệ thống vật lý khác chia sẻ một khuôn khổ phát triển chung.
Sự quan tâm của ngành phản ánh cách tiếp cận này. Một số nhà sản xuất và nhóm nghiên cứu đang thử nghiệm Alpamayo như một lớp suy luận trên các hệ thống nhận thức hiện có. Ví dụ, Mercedes-Benz dự định khám phá tích hợp trong các xe tương lai, trong khi Jaguar Land Rover nghiên cứu việc sử dụng nó để đánh giá các tình huống lái xe phức tạp. Đồng thời, các tổ chức như Lucid, Uber và Berkeley DeepDrive áp dụng Alpamayo cho thử nghiệm chính sách và xác thực an toàn. Do đó, nền tảng này được coi là một công cụ để cải thiện logic an toàn và hỗ trợ các mục tiêu cấp 4, chứ không phải là một sự thay thế cho các ngăn xếp tự động.
Mặc dù có những tiến bộ này, một số thách thức quan trọng vẫn còn và chúng đòi hỏi sự chú ý cẩn thận. Đặc biệt, suy luận chuỗi tư duy có thể mô tả quyết định sau khi sự kiện thay vì phản ánh quá trình nội bộ thực sự, làm phức tạp việc điều tra tai nạn. Ngoài ra, việc chuyển hành vi thận trọng từ các mô hình lớn sang các mô hình nhỏ hơn trong xe có thể làm suy yếu các khoảng cách an toàn nếu xác thực không đủ. Do đó, thử nghiệm nghiêm ngặt là cần thiết để duy trì hành vi nhất quán dưới các hạn chế tính toán chặt chẽ.
Sự khác biệt về phân phối tạo ra những rủi ro đang diễn ra. Suy luận được đào tạo trong các môi trường đô thị có cấu trúc có thể không chuyển đổi mượt mà sang các khu vực có giao thông không chính thức, các điểm giao nhau dày đặc ở châu Á hoặc các con đường nông thôn không trải nhựa. Do đó, xác thực và thích nghi địa phương cẩn thận là cần thiết để duy trì an toàn trên các điều kiện khác nhau. Ngoài ra, sự tin tưởng của công chúng và phê duyệt của các nhà quản lý phụ thuộc vào việc chứng minh rằng các đầu ra suy luận dẫn đến những cải thiện thực sự về an toàn, chẳng hạn như giảm thiểu việc ngắt kết nối, va chạm gần và vi phạm quy tắc.
Mặc dù Alpamayo có cách tiếp cận phát triển mở khuyến khích hợp tác, việc tích hợp với hệ sinh thái của NVIDIA làm dấy lên những câu hỏi về sự phụ thuộc vào NVIDIA trong dài hạn. Tuy nhiên, sự chuyển dịch tổng thể hướng tới tự động hóa dựa trên suy luận là rõ ràng, và bằng cách nhấn mạnh tính minh bạch, trách nhiệm và kết quả an toàn có thể đo lường được, cách tiếp cận này đưa các hệ thống tự lái gần hơn với việc triển khai an toàn ngoài các chương trình thử nghiệm được kiểm soát.
Kết luận
Lái xe tự động đã đạt đến một điểm mà nhận thức alone không còn đủ. Mặc dù xe có thể nhìn thấy đường với độ chính xác cao, nhưng các tình huống khó khăn vẫn đòi hỏi sự hiểu biết, phán đoán và giải thích. Do đó, các hệ thống dựa trên suy luận như Alpamayo đánh dấu một sự chuyển dịch quan trọng trong cách giải quyết những thách thức này. Bằng cách kết hợp suy luận cấu trúc, mô phỏng thực tế và đánh giá minh bạch, cách tiếp cận này nhắm vào các trường hợp biên quan trọng nhất đối với an toàn.
Hơn nữa, nó cung cấp các công cụ mà các kỹ sư và các nhà quản lý có thể kiểm tra và đặt câu hỏi, điều này là cần thiết cho sự tin tưởng. Tuy nhiên, suy luận không loại bỏ tất cả rủi ro. Xác thực cẩn thận, thử nghiệm địa phương và giám sát của các nhà quản lý vẫn còn cần thiết. Dù vậy, bằng cách tập trung vào lý do tại sao các quyết định được đưa ra thay vì chỉ hành động được thực hiện, tự động hóa dựa trên suy luận đưa công nghệ tự lái gần hơn với việc triển khai an toàn và có trách nhiệm trên các con đường thực tế.












