Lãnh đạo tư tưởng

AI Chưa Sẵn Sàng cho Công Việc Thực Tế: Vì Sao Các Mô Hình Thất Bại trong Nhiệm Vụ Phức Tạp

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Các nhà đầu tư trong bong bóng AI cầu xin các chuyên gia văn phòng giao giao những vấn đề khó nhất của họ và hứa với người lao động rằng họ sẽ lấy lại buổi chiều của mình nếu họ chỉ nhượng bỏ thêm một chút dữ liệu. Phân tích phức tạp, các quyết định dựa trên phán đoán, và quy trình làm việc mất năm tháng để phát triển được một mô hình hấp thụ, được cho là sẽ giải phóng con người cho những việc tốt hơn. Đây là câu chuyện thống trị trong doanh nghiệp Mỹ hiện nay, và nó là một cái bẫy. 

Huyền Thoại Khả Năng: Vì Sao Các Mô Hình Thất Bại trong Nhiệm Vụ Phức Tạp

Một nghiên cứu mới nghiên cứu của UC Berkeley đã thử nghiệm các tác nhân AI hàng đầu trên các nhiệm vụ chuyên nghiệp thực tế trong 55 ngành, từ y tế đến tài chính đến pháp luật. Tổng thể hiệu suất dưới 25 phần trăm. Sau đó các nhà nghiên cứu đã tách ra nhiệm vụ khó nhất trong mỗi lĩnh vực – loại công việc phân biệt chuyên gia cấp cao với người mới vào – và mọi mô hình đều thất bại. Điểm số không chỉ thấp; chúng bằng không. 

Bạn có thể nghĩ rằng một kết quả như vậy sẽ tự thay đổi câu chuyện, nhưng thực tế không phải. Trên các ngành, các nhà đầu tư AI có quá nhiều lợi ích khi thuyết phục các chuyên gia rằng hầu hết các mô hình AI hiện tại đã tiến xa hơn thực tế. Nhưng câu hỏi thú vị nhất không phải là liệu AI có thể thực hiện các phần khó nhất của một công việc ngày hôm nay hay không, vì chúng ta, và mọi người bán AI, đã biết câu trả lời. 

Vì vậy, điều này dẫn đến một câu hỏi khác. Điều gì sẽ xảy ra với phán đoán của một chuyên gia trẻ khi họ chấp nhận trao đổi dữ liệu này, trước khi khả năng suy luận của họ được hình thành đầy đủ? 

Phát Hiện Từ Minnesota: Cách AI Làm Bằng Kỹ Năng Về Trung Tâm

Một nghiên cứu thực nghiệm mới nghiên cứu của Trường Luật Đại học Minnesota cung cấp một câu trả lời thực tế, sử dụng luật làm trường hợp thử nghiệm. Các nhà nghiên cứu đã đưa khoảng một trăm sinh viên luật cấp trên qua một chuỗi các nhiệm vụ thực tế: tổng hợp luật từ tài liệu nguồn thô, trả lời các câu hỏi không mở sách để kiểm tra những gì họ đã tiếp thu, áp dụng luật vào một mô hình thực tế, và sau đó chỉnh sửa công việc của mình. Một nhóm chỉ có quyền truy cập AI ở bước đầu tiên và bước cuối cùng. Nhóm còn lại không có AI cho đến cuối cùng.

Sinh viên sử dụng AI để xây dựng bản thảo đầu tiên đã tạo ra công việc mạnh mẽ hơn và nhanh hơn, điều này không hoàn toàn đáng chú ý. Tuy nhiên, điều đáng chú ý là những gì xảy ra sau đó. Các nhà nghiên cứu dự đoán việc sử dụng AI sớm sẽ để lại khoảng trống hiểu biết xuất hiện khi công cụ bị tước bỏ. Nhưng điều này không xảy ra. Những sinh viên đã dùng AI để tổng hợp luật thực sự hiểu luật tốt hơn so với những sinh viên làm mà không có AI, khi được kiểm tra trong môi trường lạnh. Lý luận độc lập không bị suy giảm. Nó vẫn tồn tại, và trong một số trường hợp còn được cải thiện.

Bước ngoặt xuất hiện ở giai đoạn cuối, khi mọi sinh viên đều có AI để chỉnh sửa công việc của mình. Những sinh viên bắt đầu với bản ghi nhớ yếu hơn đã sử dụng công cụ này để thực sự cải thiện nó. Những sinh viên bắt đầu với bản ghi nhớ mạnh hơn lại trở nên kém hơn. Khi được để một mình với một công cụ mạnh mẽ mà không có cấu trúc hướng dẫn cách sử dụng, kỹ năng không được tích lũy mà lại bằng phẳng về phía trung tâm.

Hai nghiên cứu này cùng nhau đưa ra một sự thật nghiêm khắc: AI không phải là sự thay thế cho phán đoán chuyên môn, và các con số của Berkeley nên chấm dứt cuộc trò chuyện này mãi mãi. Nhưng AI cũng không phải là một lực lượng ăn mòn làm suy giảm lý luận khi tiếp xúc. Tác động của nó hoàn toàn phụ thuộc vào vị trí xuất hiện trong quy trình.

Sắp Xếp Thứ Tự Thay Vì Thay Thế: Giữ Phán Đoán ở Trung Tâm

Điều này áp dụng ngoài lĩnh vực pháp luật. Mỗi ngành nghề tri thức hiện đang thực hiện phiên bản thí nghiệm riêng của mình: bác sĩ quyết định có để mô hình soạn một chẩn đoán phân biệt hay không, nhà phân tích quyết định có để mô hình xây dựng bản thảo đầu tiên của một mô hình hay không, và cộng sự quyết định có để mô hình cấu trúc một lập luận trước khi họ tự mình hoàn thiện hay không. Kết quả từ Minnesota cho thấy câu trả lời không phải là một đồng ý hay từ chối chung cho mọi dạng AI. Đó là vấn đề về thứ tự. AI nên nằm ở phần đầu của công việc vất vả và các phần của công việc tạo ra ma sát, nhưng không phải là phán đoán. Nó không nên nằm ở trung tâm của nhiệm vụ mà khách hàng thực sự trả tiền, và hiện tại nó không thể đạt được điều đó ngay cả khi cố gắng.

Các công ty vẫn hứa hẹn ngược lại đang bán một phiên bản AI mà dữ liệu cho biết không tồn tại. Những công ty xây dựng sản phẩm và mối quan hệ khách hàng dựa trên ranh giới mà nghiên cứu thực sự vẽ ra sẽ là những người mà các chuyên gia vẫn tin tưởng trong năm năm tới. Những công ty còn lại sẽ phải dành thời gian giải thích một sự hiểu lầm rất tốn kém.

Austin Worrell là một nhà sáng lập công nghệ sáu lần và là thành viên của Hiệp hội Luật sư California. Ông giữ vị trí CEO và Đồng sáng lập Dialogica, một nền tảng trí tuệ tăng cường an toàn được xây dựng để giúp các công ty luật loại bỏ sự lộn xộn trong công việc hàng ngày đồng thời bảo tồn phán quyết pháp lý, niềm tin của khách hàng và tính bảo mật định hình nghề nghiệp.

Trước khi đồng sáng lập Dialogica, ông đã làm việc tại Gunderson Dettmer, nơi ông tư vấn cho các công ty vốn mạo hiểm và công nghệ trong các vòng tài trợ, thành lập công ty và hơn 1,2 tỷ USD giao dịch M&A, cùng với kinh nghiệm trước đó trong lĩnh vực tranh tụng doanh nghiệp và dân sự. Các dự án của ông bao gồm: KINO, một nền tảng streaming sử dụng AI được hỗ trợ bởi Quỹ ARK Venture của Cathie Wood, Slow Ventures, Sequoia và các đối tác khác; và EG Global, một công ty blockchain có tác động xã hội đã phát triển lên vốn thị trường 500 triệu USD và quyên góp hơn 4 triệu USD cho các hoạt động toàn cầu. Austin đã thi đấu ở cấp độ cao nhất của các cuộc thi mô phỏng xét xử và tòa án mô phỏng trong hơn một thập kỷ, bao gồm việc đánh bại Yale để giành danh hiệu Nhà vô địch Quốc gia.