Đánh giá sách
Đánh giá sách: The Infinity Machine: Demis Hassabis, DeepMind và cuộc tìm kiếm siêu trí tuệ của Sebastian Mallaby

Đã từng đọc The Power Law, mà tôi coi là cuốn sách hay nhất về vốn đầu tư mạo hiểm, tôi đã tiếp cận cuốn sách mới nhất của Sebastian Mallaby với kỳ vọng cao hơn bình thường. The Infinity Machine: Demis Hassabis, DeepMind và cuộc tìm kiếm siêu trí tuệ không làm tôi thất vọng.
Giống như The Power Law, cuốn sách thành công vì Mallaby hiểu rằng các công ty chuyển đổi không thể được giải thích chỉ thông qua công nghệ hoặc kết quả tài chính. Chúng phải được hiểu thông qua tham vọng, tính cách, sự cạnh tranh và niềm tin sâu sắc của những người xây dựng chúng.
The Infinity Machine là một phần câu chuyện về một doanh nhân tạo ra một trong những công ty trí tuệ nhân tạo quan trọng nhất trong lịch sử. Tuy nhiên, quan trọng hơn, đó là câu chuyện về một nhà khoa học tình cờ sử dụng doanh nghiệp như một phương tiện để theo đuổi các câu hỏi khoa học.
Demis Hassabis không được coi là người đã thành lập DeepMind chủ yếu để trở nên giàu có, nổi tiếng hoặc được ca ngợi như một người sáng lập công nghệ. Anh ta được coi là người đã xác định trí thông minh là vấn đề có hậu quả nhất mà anh ta có thể làm việc và sau đó xây dựng cuộc sống của mình xung quanh việc giải quyết nó.
Đó là sự khác biệt làm cho cuốn sách trở nên hấp dẫn.
Một nhà khoa học trước và một doanh nhân thứ hai
Mallaby theo dõi con đường của Hassabis từ khi còn là một thần đồng cờ vua và nhà thiết kế trò chơi điện tử đến một nhà khoa học thần kinh, nhà nghiên cứu trí tuệ nhân tạo và cuối cùng là đồng sáng lập của DeepMind. Cuốn sách dựa trên hơn 30 giờ cuộc trò chuyện với Hassabis, cùng với hơn 100 cuộc phỏng vấn với đồng nghiệp, đối thủ, nhà phê bình và các cộng tác viên trước đây.
Truy cập này cho phép Mallaby trình bày Hassabis không chỉ là gương mặt công khai của Google DeepMind, mà là một người có lợi ích đã vẫn còn nhất quán đáng chú ý.
Cờ vua đã dạy anh ta cách suy nghĩ vài bước trước. Thiết kế trò chơi mô phỏng đã dạy anh ta cách các thế giới phức tạp có thể xuất hiện từ các quy tắc tương đối đơn giản. Khoa học thần kinh đã khuyến khích anh ta đặt câu hỏi về cách bộ nhớ, tưởng tượng, lập kế hoạch và trí thông minh hoạt động trong não bộ con người.
Các hoạt động này không phải là các giai đoạn không liên quan của sự nghiệp. Chúng là các cách tiếp cận khác nhau để cùng một câu hỏi cơ bản: Liệu trí thông minh có thể được hiểu đủ tốt để được tái tạo?
Điều nổi bật trong suốt cuốn sách là Hassabis có xu hướng giảm các vấn đề xuống nền tảng của chúng. Thay vì bắt đầu với những gì công nghệ hiện có có thể đạt được, anh ta lặp lại bắt đầu với kết quả mà anh ta tin nên có thể và làm việc ngược lại.
Cách tiếp cận từ nguyên tắc đầu tiên này cũng giải thích tầm nhìn thời gian dài không bình thường của anh ta. Hassabis sẵn sàng giữ một vấn đề trong tâm trí trong nhiều năm – hoặc thậm chí hàng thập kỷ – cho đến khi khoa học và tính toán đã tiến bộ đủ để anh ta có thể giải quyết nó một cách chính xác.
Ví dụ rõ ràng nhất là dự đoán cấu trúc protein.
Cuộc trò chuyện đã gieo hạt giống cho vấn đề gấp protein
Trong khi học khoa học máy tính tại Cambridge vào những năm 1990, Hassabis đã trở thành bạn bè với các sinh viên sinh học. Một trong số họ đặc biệt quan tâm đến vấn đề gấp protein và giải thích rằng việc giải quyết nó có thể biến đổi sinh học.
Hassabis ngay lập tức nhận ra đó là loại vấn đề tìm kiếm khổng lồ có thể được giải quyết bằng trí tuệ nhân tạo. Anh ta được cho là đã giữ ghi chú về các vấn đề khoa học có thể trở nên phù hợp với các thuật toán mà anh ta hy vọng sẽ xây dựng. Dự đoán cấu trúc protein vẫn còn trong số đó trong gần hai thập kỷ.
Đây là một trong những phần hấp dẫn nhất của cuốn sách.
Một cuộc trò chuyện dường như bình thường đã giới thiệu Hassabis đến một vấn đề sẽ vẫn còn trong tâm trí anh ta trong suốt thời gian học đại học, nghiên cứu khoa học thần kinh, doanh nghiệp và sự phát triển của các hệ thống học tập.
Để hiểu tầm quan trọng của những gì tiếp theo, cần phải đánh giá quy mô của thách thức.
Protein bắt đầu như chuỗi axit amin. Những chuỗi này gấp lại thành cấu trúc không gian ba chiều phức tạp, và hình dạng kết quả chủ yếu quyết định protein có thể làm gì trong một sinh vật sống. Do đó, hiểu cấu trúc là điều cần thiết để nghiên cứu bệnh tật, thiết kế thuốc và hiểu nhiều cơ chế mà cuộc sống phụ thuộc vào.
Khó khăn là ngay cả một protein tương đối nhỏ cũng có thể giả định một số lượng cấu hình có thể là thiên văn. Việc xác định cấu trúc bằng các phương pháp như nhiễu xạ tia X hoặc kính hiển vi điện tử cryogenic có thể yêu cầu thời gian đáng kể, chuyên môn và chi phí.
Trong khoảng 50 năm, các nhà khoa học đã đấu tranh để dự đoán đáng tin cậy cấu trúc không gian ba chiều của một protein từ chuỗi axit amin một chiều. Thách thức đã trở thành một trong những vấn đề chưa được giải quyết vĩ đại trong sinh học tính toán.
Nó thường được nói rằng AlphaFold “đã giải quyết vấn đề gấp protein”. Về mặt kỹ thuật, mô tả đó quá rộng. AlphaFold đã biến đổi dự đoán cấu trúc protein; nó không giải thích mọi giai đoạn của quá trình gấp vật lý, chuyển động protein, gấp sai hoặc tương tác phân tử.
Điều đó không làm giảm thành tựu. Dự đoán cấu trúc với độ chính xác gần như thực nghiệm đã là một đột phá đã thay đổi toàn bộ lĩnh vực khoa học.
Trò chơi là nơi huấn luyện, không phải điểm đến
DeepMind không bắt đầu bằng sinh học. Những đột phá ban đầu của nó đến từ trò chơi.
Trò chơi cung cấp một điều gì đó vô giá cho một phòng thí nghiệm trí tuệ nhân tạo: môi trường được kiểm soát với quy tắc rõ ràng, kết quả có thể đo lường và số lượng quyết định khổng lồ. Một tác nhân có thể thử nghiệm, thất bại, nhận phản hồi và cải thiện mà không có sự模糊 và rủi ro vật lý của việc hoạt động trong thế giới thực.
Mạng Q sâu của DeepMind đã chứng minh rằng một hệ thống học tập duy nhất có thể thành thạo nhiều trò chơi Atari khác nhau từ các pixel màn hình và tín hiệu phần thưởng thay vì các hướng dẫn cụ thể cho từng trò chơi. Công việc đã giúp thiết lập học tăng cường sâu như một trong những cách tiếp cận đầy hứa hẹn nhất trong trí tuệ nhân tạo hiện đại.
Bài kiểm tra lớn tiếp theo là cờ vây.
Cờ vây đã chống lại các cách tiếp cận tính toán truyền thống vì số lượng vị trí bàn cờ có thể đã làm cho tìm kiếm tuyệt đối không thể. Thành công đòi hỏi phải nhận dạng mẫu, lập kế hoạch chiến lược và khả năng xác định các động thái hứa hẹn mà không cần tính toán mọi kết quả có thể.
Vào tháng 3 năm 2016, AlphaGo đã đánh bại người chơi cờ vây huyền thoại Lee Sedol bốn trận đấu một. Hơn 200 triệu người đã xem một cỗ máy hiển thị các động thái mà thậm chí các cầu thủ hàng đầu ban đầu cũng khó hiểu.
AlphaGo Zero sau đó đã loại bỏ sự phụ thuộc vào hồ sơ trò chơi của con người. Bắt đầu chỉ với các quy tắc, nó đã học bằng cách chơi chống lại chính mình và cuối cùng đã vượt qua phiên bản AlphaGo trước đó. AlphaZero đã tổng quát hóa cách tiếp cận hơn nữa, thành thạo cờ vua, shogi và cờ vây thông qua tự chơi mà không dựa vào chiến lược được tạo thủ công hoặc ví dụ của con người.
Các hệ thống này không phải là các nguyên mẫu trực tiếp của AlphaFold. Kết nối là nhiều hơn về mặt triết lý và tổ chức hơn là kiến trúc.
Trò chơi đã dạy DeepMind cách xây dựng các hệ thống có thể điều hướng các không gian khả năng khổng lồ. Chúng đã chứng minh rằng mạng nơ-ron, học tăng cường, tìm kiếm và số lượng tính toán khổng lồ có thể khám phá ra các giải pháp mà con người không lập trình rõ ràng.
Điều quan trọng hơn, chúng đã mang lại cho Hassabis sự tự tin rằng trí tuệ nhân tạo có thể vượt ra ngoài phân loại và nhận dạng mẫu để tạo ra những hiểu biết thực sự hữu ích.
AlphaGo là một thành tựu lịch sử, nhưng nó không bao giờ là điểm đến cuối cùng. Trò chơi là phòng thí nghiệm trong đó DeepMind có thể phát triển các ý tưởng, con người, cơ sở hạ tầng và sự tự tin cần thiết để đối mặt với các vấn đề khoa học thực sự.
Dự đoán cấu trúc protein là nơi nhiệm vụ ban đầu cuối cùng sẽ được kiểm tra.
AlphaFold và sự khác biệt giữa chiến thắng và giải quyết
DeepMind chính thức bắt đầu làm việc về dự đoán cấu trúc protein vào năm 2016. Hệ thống AlphaFold đầu tiên của nó đã tham gia cuộc thi dự đoán cấu trúc protein CASP13 vào năm 2018 và đạt được độ chính xác cao nhất trong số các thí sinh.
Đối với nhiều tổ chức, việc giành chiến thắng trong cuộc thi sẽ đủ. Nó sẽ tạo ra các tiêu đề, công nhận học thuật và bằng chứng rằng dự án đã thành công.
Hassabis muốn nhiều hơn.
Một hệ thống đứng đầu bảng xếp hạng nhưng vẫn không đủ tin cậy cho công việc khoa học hàng ngày thì chưa thực sự giải quyết vấn đề. DeepMind đã mở rộng đội ngũ, đặt John Jumper vào vai trò nghiên cứu trung tâm và thiết kế lại đáng kể hệ thống thay vì chỉ tinh chỉnh cách tiếp cận ban đầu.
Kết quả là AlphaFold2.
Tại CASP14 vào năm 2020, AlphaFold2 đã đạt được độ chính xác mà các nhà tổ chức và nhà nghiên cứu coi là tương đương với các phương pháp thực nghiệm trên nhiều mục tiêu protein. Nghiên cứu liên quan đã chứng minh rằng dự đoán tính toán có thể thường đạt được độ chính xác nguyên tử, bao gồm cả trong các trường hợp không có cấu trúc đã biết liên quan gần gũi.
DeepMind và Viện Tin sinh học châu Âu sau đó đã phát hành các dự đoán bao gồm hơn 200 triệu cấu trúc protein – gần như mọi protein được khoa học phân loại. Cơ sở dữ liệu đã được hơn ba triệu nhà nghiên cứu trên 190 quốc gia truy cập.
Vào năm 2024, Hassabis và Jumper đã chia sẻ một nửa giải Nobel Hóa học cho dự đoán cấu trúc protein, với nửa còn lại được trao cho David Baker vì thiết kế protein tính toán.
Trình tự các sự kiện này thể hiện điều mà tôi thấy ấn tượng nhất về Hassabis.
Anh ta dường như không hài lòng với việc giành chiến thắng trong phép đo được chấp nhận của một vấn đề. Anh ta liên tục đặt câu hỏi liệu vấn đề cơ bản có thực sự được giải quyết.
Đó là tư duy từ nguyên tắc đầu tiên trong hình thức thuần túy nhất. Một điểm chuẩn chỉ là một đại diện. Mục tiêu không phải là đứng đầu. Mục tiêu là tạo ra một cái gì đó thay đổi những gì các nhà khoa học có thể làm.
Điểm mù LLM đã giúp OpenAI dẫn đầu
Cuốn sách cũng làm rõ một trong những tập phim混乱 nhất trong lịch sử trí tuệ nhân tạo gần đây.
Những nhà nghiên cứu của Google đã giới thiệu kiến trúc transformer trong bài báo nổi tiếng năm 2017 Attention Is All You Need. Các transformer đã trở thành nền tảng trên đó các mô hình ngôn ngữ lớn hiện đại được xây dựng.
Tuy nhiên, Google không chuyển lợi thế đó thành sản phẩm định nghĩa kỷ nguyên trí tuệ nhân tạo tạo sinh. OpenAI đã phát hành ChatGPT và thiết lập giao diện mà hàng trăm triệu người sẽ lần đầu tiên tiếp xúc với trí tuệ nhân tạo tiên tiến. Anthropic sau đó xuất hiện như một nhà lãnh đạo khác, đặc biệt là trong số các nhà phát triển và người dùng doanh nghiệp.
Phiên bản phổ biến của câu chuyện này là Google đã phát minh ra transformer và sau đó đơn giản không xây dựng các mô hình ngôn ngữ. Đó không hoàn toàn chính xác. Google và DeepMind đã xuất bản các nghiên cứu ngôn ngữ đáng kể, bao gồm mô hình Gopher 280 tỷ tham số của DeepMind vào năm 2021.
Sự thất bại không phải là sự vắng mặt của nghiên cứu. Đó là sự thất bại của sự tự tin chiến lược và thực hiện sản phẩm.
Ban đầu, Hassabis nghi ngờ rằng ngôn ngữ đơn thuần có thể tạo ra trí tuệ thực sự. Anh ta tin rằng một hệ thống thông minh cần được gắn với thế giới thông qua nhận thức, hành động, robot hoặc môi trường mô phỏng.
Lo lắng của anh ta là hợp lý. Một máy có thể lưu trữ định nghĩa của trọng lượng, nhưng liệu nó thực sự hiểu trọng lượng nếu không bao giờ nâng nó lên? Nó có thể xử lý các mô tả về trọng lực, nhưng liệu nó hiểu rằng một chiếc kính sẽ vỡ khi rơi?
Do đó, chương trình nghiên cứu của DeepMind đã nhấn mạnh vào các tác nhân hoạt động trong các trò chơi và thế giới được mô phỏng. Các nhà nghiên cứu của nó thậm chí đã xây dựng các hệ thống cụ thể nhằm kết nối ngôn ngữ với nhận thức và hành động trong các môi trường ba chiều.
Điều mà Hassabis đánh giá thấp là lượng thông tin về thế giới vật lý và xã hội đã được mã hóa trong ngôn ngữ của con người. Các mô hình lớn cũng có thể kế thừa một hình thức nền tảng thông qua phản hồi từ những người đã trực tiếp trải nghiệm thế giới.
Hassabis đã thừa nhận rằng đó là điều anh ta đã đánh giá thấp, mô tả các mô hình ngôn ngữ như “hiệu quả không hợp lý”.
Đây là một trong những phần quý giá nhất của cuốn sách vì nó làm cho hành vi của Google trở nên dễ hiểu hơn.
Từ bên ngoài, dường như không thể giải thích được rằng tổ chức chịu trách nhiệm cho transformer lại cho phép OpenAI định nghĩa kỷ nguyên LLM. Từ khuôn khổ trí tuệ của Hassabis, nó có ý nghĩa hơn. Anh ta đang tìm kiếm một hình thức trí tuệ sâu sắc hơn và ban đầu coi dự đoán ngôn ngữ là một con đường không đầy đủ để đạt được nó.
Đánh giá đó cuối cùng có thể được chứng minh là đúng ở cấp độ AGI. Các mô hình ngôn ngữ alone có thể không đủ. Nhưng như một quyết định sản phẩm và nền tảng, nó đã đưa cho các đối thủ một cơ hội phi thường.
Trong quan sát của tôi về thị trường, Gemini đã trở thành một hệ thống đáng gờm và có thể vượt trội so với các mô hình cạnh tranh trong các đánh giá cá nhân. Tuy nhiên, nó vẫn cảm giác như Google đang cố gắng định nghĩa lại một loại mà kỳ vọng đã được OpenAI và Anthropic thiết lập.
Cuốn sách giúp giải thích làm thế nào một trong những tổ chức có nồng độ tài năng và cơ sở hạ tầng trí tuệ nhân tạo lớn nhất lại tìm thấy mình trong vị trí đó.
Tại sao việc bán DeepMind cho Google là phù hợp với nhiệm vụ
Tập khác thay đổi hiểu biết của tôi về Hassabis là bán DeepMind cho Google.
Huyền thoại người sáng lập thường ca ngợi tính độc lập. Doanh nhân lý tưởng được cho là giữ quyền kiểm soát, chống lại việc mua lại, xây dựng một đế chế và nhận được công nhận cá nhân cho việc tạo ra một công ty thống trị.
Hassabis dường như đã đánh giá quyết định khác.
Trong cuộc cạnh tranh để mua DeepMind vào năm 2013, Larry Page đã đưa ra một lập luận trực tiếp đến các ưu tiên của Hassabis. Nếu mục tiêu thực sự của anh ta là tạo ra AGI, tại sao lại dành nhiều năm để xây dựng lại cơ sở hạ tầng, huy động vốn và xây dựng một công ty tương đương với Google khi tài nguyên của Google đã tồn tại?
Các cuộc trò chuyện diễn ra trong một loạt các cuộc họp gần như siêu thực liên quan đến Page, Mark Zuckerberg, Elon Musk và các nhân vật công nghệ khác, bao gồm cả một cuộc họp tại một lâu đài cho thuê ở New York để kỷ niệm sinh nhật của Musk.
Google có thể cung cấp cơ sở hạ tầng tính toán, vốn, tài năng nghiên cứu và sự kiên nhẫn trên quy mô mà một DeepMind độc lập sẽ khó tái tạo. Nó cũng sẵn sàng chấp nhận các điều kiện đạo đức mà DeepMind coi là quan trọng. Hassabis cuối cùng đã chọn Google mặc dù được cho là đã nhận được một đề nghị lớn hơn từ Facebook.
Nhìn qua ống kính doanh nhân truyền thống, việc bán DeepMind sớm có thể xuất hiện như một sự từ bỏ độc lập.
Nhìn qua ống kính của Hassabis, việc vẫn độc lập có thể là sự phân tâm lớn hơn.
Mục tiêu của anh ta không phải là trở thành người sáng lập công ty tiếp theo của Google. Đó là sử dụng con đường nhanh nhất và đáng tin cậy nhất để xây dựng AGI và áp dụng trí tuệ tiên tiến cho khoa học. Google đã rút ngắn con đường đó.
Việc mua lại sau đó đã tạo ra những căng thẳng thực sự về tính độc lập, quản trị, thương mại hóa và các giới hạn đạo đức của trí tuệ nhân tạo. Cuốn sách không gợi ý rằng việc đặt DeepMind bên trong một trong những tập đoàn lớn nhất thế giới đã giải quyết những câu hỏi này. Trong một số cách, nó đã khiến chúng trở nên khó khăn hơn.
Tuy nhiên, quyết định này tiết lộ điều gì đó quan trọng về Hassabis. Anh ta dường như ít gắn bó với trạng thái truyền thống của doanh nhân hơn là với nhiệm vụ khoa học mà doanh nhân đã làm cho nó có thể.
Một trong những người tốt – Nhưng không phải là không thể sai
Hassabis cuối cùng được coi là một trong những người tốt trong cuộc đua trí tuệ nhân tạo.
Điều đó không có nghĩa là mọi quyết định đều đúng. Sự do dự của anh ta về các mô hình ngôn ngữ là có hậu quả. Mối quan hệ của DeepMind với Google đã liên quan đến sự thỏa hiệp. Sự tập trung của các hệ thống trí tuệ nhân tạo mạnh mẽ vào một số tập đoàn tạo ra các câu hỏi mà ngay cả những ý định tốt cũng không thể trả lời.
Tuy nhiên, động lực của anh ta dường như vẫn nhất quán.
Anh ta muốn hiểu trí thông minh. Anh ta tin rằng trí tuệ nhân tạo tiên tiến có thể tăng tốc khám phá khoa học. Anh ta đã nhấn mạnh một cách nhất quán về sự an toàn và sự cần thiết phải xem xét các hậu quả lâu dài của các hệ thống ngày càng mạnh mẽ. Điều quan trọng nhất, AlphaFold cung cấp bằng chứng cụ thể rằng tầm nhìn của anh ta về trí tuệ nhân tạo như một công cụ cho khoa học là hơn một điểm nói chuyện đầy tham vọng.
Có sự khác biệt giữa việc hứa rằng trí tuệ nhân tạo sẽ mang lại lợi ích cho nhân loại và việc phát hành một công cụ được hàng triệu nhà nghiên cứu sử dụng để hiểu tốt hơn về máy móc của sự sống.
AlphaFold mang lại cho Hassabis sự tín nhiệm mà ít nhà lãnh đạo nào trong cuộc đua AGI sở hữu.
Suy nghĩ cuối cùng
The Infinity Machine thành công như một tiểu sử, một lịch sử của DeepMind và một tài khoản dễ tiếp cận về một số đột phá quan trọng nhất trong trí tuệ nhân tạo hiện đại. Nó cũng làm cho các sự kiện chúng ta chứng kiến trong thời gian thực – từ AlphaGo và AlphaFold đến phản ứng chậm của Google với ChatGPT – cảm thấy hợp lý hơn nhiều.
Bài học mạnh mẽ nhất không chỉ là Hassabis cực kỳ thông minh, mặc dù rõ ràng anh ta là vậy. Đó là anh ta đã rất có chủ ý về việc quyết định những vấn đề nào xứng đáng với trí thông minh đó.
Một cuộc trò chuyện với các sinh viên sinh học đã giới thiệu anh ta đến vấn đề gấp protein hàng thập kỷ trước khi trí tuệ nhân tạo có thể giải quyết nó. Anh ta đã giữ vấn đề trong tâm trí, xây dựng tổ chức và hệ thống cần thiết để đối mặt với nó và quay lại nó một khi công nghệ đã tiến bộ đủ.
Đa số các doanh nhân bắt đầu với một công nghệ có sẵn và tìm kiếm một thị trường. Hassabis bắt đầu với những câu hỏi anh ta tin có thể thay đổi nhân loại và làm việc để tạo ra công nghệ đủ mạnh để trả lời chúng.
Đó là điều làm cho The Infinity Machine trở thành một cuốn sách đáng nhớ và Demis Hassabis trở thành một nhân vật không bình thường trong lịch sử trí tuệ nhân tạo.












