Mô hình và nền tảng AI

Từ Bạc đến Vàng: Cách DeepMind AI Chinh Phục Kỳ Thi Toán Học Olympia

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Trí tuệ nhân tạo của DeepMind đã đạt được tiến bộ đáng kể trong lĩnh vực lý luận toán học trong vòng một năm. Sau khi giành huy chương bạc tại Kỳ thi Toán học Olympia Quốc tế (IMO) năm 2024, hệ thống AI của họ đã giành huy chương vàng vào năm 2025. Sự tiến bộ nhanh chóng này nhấn mạnh khả năng ngày càng tăng của trí tuệ nhân tạo trong việc giải quyết các vấn đề phức tạp, trừu tượng đòi hỏi sự sáng tạo và trực giác của con người. Bài viết này sẽ trình bày cách DeepMind đạt được sự chuyển đổi này, các lựa chọn kỹ thuật và chiến lược đằng sau nó, và những ý nghĩa rộng lớn hơn của những tiến bộ này.

Ý Nghĩa Của IMO

Kỳ thi Toán học Olympia Quốc tế, được thành lập vào năm 1959, được công nhận trên toàn cầu là cuộc thi toán học hàng đầu cho học sinh trung học. Mỗi năm, các học sinh giỏi nhất từ khắp nơi trên thế giới đối mặt với sáu vấn đề khó khăn trong các lĩnh vực đại số, hình học, lý thuyết số và tổ hợp. Việc giải quyết những vấn đề này đòi hỏi nhiều hơn là tính toán; các thí sinh phải thể hiện sự sáng tạo toán học thực sự, tư duy logic nghiêm ngặt và khả năng xây dựng các chứng minh tinh tế.

Đối với trí tuệ nhân tạo, IMO đưa ra một thách thức độc đáo. Trong khi AI đã thành thạo trong việc nhận dạng mẫu, phân tích dữ liệu và thậm chí các trò chơi phức tạp như cờ vua và cờ tướng, toán học Olympia đòi hỏi sự lý luận trừu tượng, sáng tạo và tổng hợp ý tưởng mới, những kỹ năng truyền thống được coi là đặc trưng của trí tuệ con người. Do đó, IMO đã trở thành một môi trường thử nghiệm tự nhiên để đánh giá mức độ gần gũi của AI với việc đạt được lý luận giống như con người.

Phá Vỡ Huy Chương Bạc Của Năm 2024

Năm 2024, DeepMind đã giới thiệu hai hệ thống AI để giải quyết các vấn đề cấp độ IMO: AlphaProof và AlphaGeometry 2. Cả hai hệ thống đều là ví dụ về “trí tuệ nhân tạo biểu tượng thần kinh“, kết hợp điểm mạnh của các mô hình ngôn ngữ lớn (LLM) với sự nghiêm ngặt của logic biểu tượng.

AlphaProof được thiết kế để chứng minh các tuyên bố toán học bằng cách sử dụng Lean, một ngôn ngữ toán học chính thức. Nó kết hợp Gemini, mô hình ngôn ngữ lớn của DeepMind, với AlphaZero, một động cơ học tăng cường được biết đến với thành công trong các trò chơi trên bàn cờ. Trong môi trường này, vai trò của Gemini là dịch các vấn đề ngôn ngữ tự nhiên thành Lean và cố gắng chứng minh bằng cách tạo ra các bước logic. AlphaProof được đào tạo trên hàng triệu vấn đề mẫu thuộc các lĩnh vực toán học và độ khó khác nhau. Hệ thống này tự cải thiện bằng cách cố gắng chứng minh các tuyên bố ngày càng phức tạp, tương tự như cách AlphaZero học bằng cách chơi trò chơi chống lại chính nó.

AlphaGeometry 2 được thiết kế để giải quyết các vấn đề hình học. Ở đây, sự hiểu biết ngôn ngữ của Gemini cho phép AI dự đoán các cấu trúc phụ trợ hữu ích, trong khi một động cơ lý luận biểu tượng quản lý các suy luận logic. Cách tiếp cận lai này cho phép AlphaGeometry giải quyết các vấn đề hình học vượt quá phạm vi của lý luận máy tính truyền thống.

Cùng nhau, những hệ thống này đã giải quyết bốn trong số sáu vấn đề của IMO: hai trong đại số, một trong lý thuyết số và một trong hình học, đạt được điểm số 28 trên 42. Thành tích này là một cột mốc quan trọng, vì đây là lần đầu tiên một AI đạt mức huy chương bạc tại IMO. Tuy nhiên, thành công này phụ thuộc rất nhiều vào các chuyên gia con người để dịch các vấn đề thành ngôn ngữ toán học chính thức. Họ cũng yêu cầu tài nguyên tính toán khổng lồ, đòi hỏi nhiều ngày xử lý cho mỗi vấn đề.

Các Đổi Mới Kỹ Thuật Đằng Sau Huy Chương Vàng

Sự chuyển đổi của DeepMind từ huy chương bạc sang huy chương vàng được thúc đẩy bởi một số cải tiến kỹ thuật quan trọng.

1. Ngôn Ngữ Tự Nhiên Là Phương Tiện Cho Chứng Minh

Thay đổi quan trọng nhất là chuyển từ các hệ thống yêu cầu dịch chuyên gia thành ngôn ngữ chính thức sang việc sử dụng ngôn ngữ tự nhiên làm phương tiện cho chứng minh. Sự thay đổi này được thực hiện thông qua một phiên bản nâng cao của Gemini được trang bị khả năng Deep Think. Thay vì chuyển đổi vấn đề thành Lean, mô hình này xử lý văn bản trực tiếp, tạo ra các bản phác thảo không chính thức, nội bộ chính thức hóa các bước quan trọng và tạo ra một chứng minh tiếng Anh tinh gọn. Học tăng cường từ phản hồi của con người (RLHF) được sử dụng để thưởng cho các giải pháp logic nhất quán, ngắn gọn và trình bày.

Gemini Deep Think khác với phiên bản công khai của Gemini ở hai điểm chính. Đầu tiên, nó phân bổ các cửa sổ ngữ cảnh dài hơn và nhiều token tính toán hơn cho mỗi truy vấn, cho phép mô hình duy trì các chuỗi suy nghĩ nhiều trang. Thứ hai, nó sử dụng lý luận song song, nơi hàng trăm luồng suy nghĩ推測 được tạo ra cho các giải pháp tiềm năng khác nhau. Một giám sát viên nhẹ sau đó xếp hạng và thúc đẩy các đường dẫn hứa hẹn nhất, vay mượn các khái niệm từ tìm kiếm cây Monte Carlo nhưng áp dụng cho văn bản. Cách tiếp cận này mô phỏng cách các nhóm con người suy nghĩ, loại bỏ các ý tưởng không sản xuất và hội tụ vào các giải pháp tinh tế.

2. Đào Tạo và Học Tăng Cường

Đào tạo Gemini Deep Think liên quan đến việc tinh chỉnh mô hình để dự đoán các bước tiếp theo thay vì câu trả lời cuối cùng. Để mục đích này, một tập hợp dữ liệu 100.000 giải pháp chất lượng cao cho các cuộc thi toán học và đại học đã được biên soạn. Tập hợp dữ liệu này chủ yếu được thu thập từ các diễn đàn toán học công khai, các bản thảo arXiv và các bộ vấn đề của trường đại học. Các cố vấn con người đã xem xét các ví dụ đào tạo để lọc ra các chứng minh không logic hoặc không đầy đủ. Học tăng cường giúp tinh chỉnh mô hình, hướng dẫn Gemini sản xuất các chứng minh ngắn gọn và chính xác. Các phiên bản đầu tiên tạo ra các chứng minh quá dài dòng, nhưng các hình phạt về các cụm từ thừa giúp cắt giảm đầu ra.

Không giống như việc tinh chỉnh thông thường, thường gặp khó khăn với phần thưởng thưa thớt nơi phản hồi là nhị phân, chứng minh đúng hay không. DeepMind đã thực hiện một hệ thống phần thưởng từng bước, nơi mỗi tiểu đề được xác minh đóng góp vào điểm số tổng thể. Cơ chế phần thưởng này hướng dẫn Gemini ngay cả khi chứng minh hoàn chỉnh là không thường xuyên. Quá trình đào tạo kéo dài ba tháng và sử dụng khoảng 25 triệu giờ TPU.

3. Song Song Hóa Khổng Lồ

Song song hóa cũng đóng vai trò quan trọng trong sự tiến bộ của DeepMind từ bạc sang vàng. Mỗi vấn đề tạo ra nhiều nhánh lý luận song song, với tài nguyên động thay đổi sang các đường dẫn hứa hẹn hơn khi các đường dẫn khác bị tắc. Lập lịch động này đặc biệt có lợi cho các vấn đề tổ hợp, có không gian giải pháp lớn. Cách tiếp cận này giống như cách con người kiểm tra các bất đẳng thức phụ trước khi cam kết một quy nạp đầy đủ. Mặc dù kỹ thuật này tốn kém về tính toán, nhưng nó có thể quản lý được bằng cách sử dụng các cụm TPU v5 của DeepMind.

DeepMind Tại IMO 2025

Để duy trì tính toàn vẹn của cuộc thi, DeepMind đã đóng băng trọng số của mô hình ba tuần trước khi IMO để ngăn chặn việc rò rỉ các vấn đề chính thức vào tập dữ liệu đào tạo. Họ cũng lọc ra dữ liệu chứa các giải pháp cho các câu hỏi Olympia chưa được công bố.

Trong cuộc thi, Gemini Deep Think được cung cấp sáu vấn đề chính thức dưới dạng văn bản thuần túy, mà không có quyền truy cập vào internet. Hệ thống hoạt động trên một cụm được cấu hình để mô phỏng sức mạnh tính toán của một máy tính xách tay tiêu chuẩn cho mỗi quá trình. Toàn bộ quá trình giải quyết vấn đề được hoàn thành trong ít hơn ba giờ, nằm trong giới hạn thời gian. Các chứng minh được tạo ra đã được gửi đến các điều phối viên của IMO mà không có sự thay đổi.

Gemini Deep Think đã đạt được điểm số hoàn hảo cho năm vấn đề đầu tiên. Vấn đề cuối cùng, là một câu đố tổ hợp đầy thách thức, tuy nhiên, đã khiến cả AI và 94% thí sinh con người bối rối. Mặc dù vậy, AI đã kết thúc với điểm số tổng thể là 35/42 để giành huy chương vàng. Điểm số này cao hơn bảy điểm so với thành tích bạc của năm trước. Các quan sát viên sau đó đã mô tả các chứng minh của AI là ‘cẩn thận’ và ‘hoàn chỉnh’, lưu ý rằng chúng tuân theo các chứng minh nghiêm ngặt như mong đợi từ các thí sinh con người.

Ý Nghĩa Đối Với AI và Toán Học

Thành tựu của DeepMind là một cột mốc quan trọng cho cả AI và toán học. Đối với AI, việc làm chủ IMO là một bước tiến tới trí tuệ nhân tạo tổng quát (AGI), nơi các hệ thống có thể thực hiện bất kỳ nhiệm vụ trí tuệ nào mà con người có thể. Việc giải quyết các vấn đề toán học phức tạp đòi hỏi lý luận và hiểu biết, những thành phần cơ bản của trí tuệ tổng quát. Thành công này cho thấy AI đang tiến gần hơn đến các khả năng nhận thức giống như con người.

Đối với toán học, các hệ thống AI như Gemini Deep Think có thể trở thành những công cụ vô giá cho các nhà toán học. Chúng có thể hỗ trợ trong việc khám phá các lĩnh vực mới, xác minh các giả thuyết và thậm chí phát hiện các định lý mới. Bằng cách tự động hóa các khía cạnh nhàm chán hơn của việc xây dựng chứng minh, AI giải phóng các nhà toán học con người tập trung vào công việc khái niệm cấp cao. Ngoài ra, các kỹ thuật được phát triển cho các hệ thống AI này có thể truyền cảm hứng cho các phương pháp mới trong nghiên cứu toán học mà có thể không thể thực hiện được thông qua nỗ lực của con người một mình.

Tuy nhiên, sự tiến bộ của AI trong toán học cũng đặt ra câu hỏi về vai trò của AI trong các môi trường giáo dục và cạnh tranh. Khi khả năng của AI tiếp tục phát triển, sẽ có những cuộc tranh luận về cách tham gia của AI có thể thay đổi bản chất của giáo dục toán học và cạnh tranh.

Nhìn Về Tương Lai

Chiến thắng IMO vàng là một cột mốc quan trọng, nhưng vẫn còn nhiều thách thức toán học nằm ngoài tầm với của các hệ thống AI hiện tại. Tuy nhiên, sự tiến bộ nhanh chóng từ bạc sang vàng trong vòng một năm nhấn mạnh tốc độ tăng tốc của các đổi mới và phát triển AI. Nếu tốc độ này tiếp tục, các hệ thống AI có thể sớm giải quyết một số vấn đề toán học chưa được giải quyết nổi tiếng nhất. Trong khi câu hỏi về việc AI sẽ thay thế hay nâng cao sự sáng tạo của con người vẫn chưa được giải quyết, IMO 2025 là một chỉ dẫn rõ ràng rằng trí tuệ nhân tạo đã đạt được những bước tiến đáng kể trong lý luận logic.

Tiến sĩ Tehseen Zia là Giáo sư Liên kết có thời hạn tại Đại học COMSATS Islamabad, nắm giữ bằng Tiến sĩ về Trí tuệ Nhân tạo từ Đại học Công nghệ Vienna, Áo. Chuyên về Trí tuệ Nhân tạo, Học máy, Khoa học Dữ liệu và Thị giác Máy tính, ông đã có những đóng góp đáng kể với các ấn phẩm trên các tạp chí khoa học uy tín. Tiến sĩ Tehseen cũng đã dẫn dắt các dự án công nghiệp khác nhau với tư cách là Điều tra viên Chính và từng là Tư vấn viên Trí tuệ Nhân tạo.