Đánh giá sách
Đánh giá sách: Large Language Models của Stephan Raaijmakers

Với tư cách là người sở hữu hơn mười lăm cuốn sách thuộc loạt sách Essential Knowledge của MIT Press, tôi luôn tiếp cận mỗi cuốn sách mới với sự quan tâm và thận trọng: loạt sách này thường cung cấp cái nhìn tổng quan sâu sắc và dễ tiếp cận – nhưng không phải lúc nào cũng đáp ứng được kỳ vọng của tôi về phong cách và độ sâu.
Trong trường hợp của cuốn sách Large Language Models của Stephan Raaijmakers, tuy nhiên, tác giả đã đạt được điều gì đó hiếm có: một cuốn sách rõ ràng, giàu thông tin và cân bằng về mặt phê bình, xứng đáng được xếp vào danh sách những cuốn sách về trí tuệ nhân tạo mà tôi khuyên đọc.
Một trong những điểm mạnh nổi bật của Large Language Models là cách nó định nghĩa lại “ngôn ngữ”. Thay vì chỉ tập trung vào quan điểm triết học hoặc văn học, cuốn sách này xem ngôn ngữ như một hiện tượng tính toán – một hệ thống cấu trúc, mẫu thống kê và tiềm năng tạo ra mà các kiến trúc thần kinh hiện đại có thể khai thác. Việc định nghĩa lại này không phải là không cần thiết: Raaijmakers hướng dẫn người đọc cách các mạng thần kinh lớn mã hóa, phân tích và tạo ra văn bản dựa trên các quy luật thống kê trong các tập dữ liệu văn bản lớn – một sự thay đổi tinh tế nhưng mạnh mẽ trong cách người đọc hiểu các hệ thống này. Cuốn sách giúp người đọc dễ dàng nhận ra rằng ngôn ngữ, khi được xem qua lăng kính tính toán, trở thành thứ mà máy móc có thể mô hình hóa chứ không phải là thứ huyền bí hoặc không rõ ràng.
Sự định nghĩa lại này làm giảm bớt sự huyền bí xung quanh LLMs. Thay vì mô tả chúng như những “người hiểu” có ý thức về ý nghĩa, Raaijmakers chỉ ra cách chúng xấp xỉ ngôn ngữ: dự đoán token tiếp theo, mô hình hóa cú pháp và ngữ nghĩa thống kê, và tạo ra đầu ra ngôn ngữ hợp lý dựa trên phân phối đã học. Nói cách khác – chúng không “nghĩ” theo cách con người; chúng tính toán, thống kê. Đối với nhiều người đọc – đặc biệt là những người không có nền tảng toán học hoặc khoa học nhận thức sâu sắc – đây là một quan điểm rõ ràng và lành mạnh. Cuốn sách biến sự huyền bí xung quanh LLMs thành thứ gì đó có căn cứ, dễ hiểu hơn.
Từ dữ liệu đến hành vi: cách LLMs học — và cách chúng được căn chỉnh
Sau khi thiết lập ngôn ngữ là gì (tính toán), cuốn sách chuyển sang cách các mô hình học. Raaijmakers giải thích một cách dễ hiểu cách các LLM hiện đại được xây dựng (mạng thần kinh sâu, cơ chế chú ý, kiến trúc transformer) và cách chúng tiến hóa từ các máy chỉ 匹配 mẫu thành các công cụ được căn chỉnh và sử dụng hơn.
Một phần quan trọng của sự tiến hóa này là sử dụng phản hồi của con người bằng cách sử dụng học tăng cường từ phản hồi của con người (RLHF) – một kỹ thuật mà đầu ra của LLM được đánh giá hoặc xếp hạng bởi con người, và mô hình được tinh chỉnh để ưa thích đầu ra được coi là hữu ích, an toàn hoặc căn chỉnh với giá trị con người. Cuốn sách vẽ ra sự khác biệt (ngầm và rõ ràng) giữa giai đoạn cơ bản – trước khi đào tạo trên lượng văn bản lớn để học các quy luật thống kê – và giai đoạn căn chỉnh, nơi phán quyết của con người định hình hành vi của mô hình. Sự khác biệt này rất quan trọng: giai đoạn trước khi đào tạo cung cấp cho LLM sự thông thạo và kiến thức chung; RLHF (hoặc tinh chỉnh dựa trên phản hồi) hướng dẫn nó đến các hành vi mong muốn.
Bằng cách không che giấu sự phức tạp hoặc rủi ro, Raaijmakers thừa nhận rằng phản hồi của con người và căn chỉnh dựa trên phần thưởng là không hoàn hảo:偏见 trong phản hồi, phán quyết không đồng đều của con người, quá trình fitteing quá mức đến mô hình phần thưởng, và hành vi không thể đoán trước trong các ngữ cảnh mới – tất cả đều là những hạn chế hợp lệ. Bằng cách từ chối lý tưởng hóa RLHF, cuốn sách duy trì tính hợp lệ.
LLMs có thể và không thể làm gì
Raaijmakers xuất sắc trong việc trình bày cả điểm mạnh và điểm yếu của LLMs. Về mặt tích cực: các LLM hiện đại rất đa năng. Chúng có thể dịch ngôn ngữ, tóm tắt văn bản, tạo mã, sản xuất viết lách sáng tạo, soạn thảo bài viết, trả lời câu hỏi và hỗ trợ trong nhiều lĩnh vực – cơ bản là bất kỳ nhiệm vụ nào có thể được giảm xuống thành “đầu vào văn bản → đầu ra văn bản”. Với quy mô và dữ liệu đủ lớn, sự thông thạo tạo ra của chúng thường ấn tượng, đôi khi không thể tin được.
Đồng thời, cuốn sách không che giấu những hạn chế cơ bản của chúng. LLMs vẫn là những trình tạo mẫu thống kê, không phải những “người nghĩ” thực sự: chúng có thể tạo ra thông tin sai, tự tin xuất ra thông tin có thể nhưng sai, sao chép các偏见 và định kiến hiện diện trong dữ liệu đào tạo, và thất bại trong các ngữ cảnh yêu cầu hiểu biết thế giới thực,推理 thông thường hoặc tính nhất quán lâu dài. Cách tiếp cận của Raaijmakers đối với những thất bại này là tỉnh táo – không báo động, nhưng thực tế — củng cố rằng trong khi LLMs mạnh mẽ, chúng không phải là ma thuật.
Cách tiếp cận cân bằng này rất quý giá – nó tránh được hai cái bẫy của sự cường điệu và bi quan. Người đọc rời đi với một cái nhìn rõ ràng về những gì LLMs tốt và những gì chúng không thể được tin cậy để làm.
Cơ hội và trách nhiệm: lời hứa xã hội và nguy cơ
Ở nơi nhiều sách hướng dẫn kỹ thuật dừng lại ở kiến trúc hoặc trường hợp sử dụng, Large Language Models đi xa hơn – vào các hệ quả xã hội, chính trị và đạo đức của công nghệ này. Trong các chương như “Cơ hội thực tế” và “Rủi ro và lo ngại xã hội”, Raaijmakers mời người đọc xem xét cách LLMs có thể thay đổi sáng tạo, năng suất, giao tiếp con người, truyền thông và tổ chức.
Về mặt cơ hội: tiềm năng là rất lớn. LLMs có thể dân chủ hóa việc viết, dịch, lập trình. Chúng có thể tăng tốc nghiên cứu, giáo dục và biểu đạt sáng tạo. Chúng có thể hỗ trợ những người gặp khó khăn với ngôn ngữ hoặc viết. Chúng có thể thay đổi cách truyền thông được sản xuất và tiêu thụ. Trong một thế giới đang phải đối mặt với tình trạng quá tải thông tin đáng kể, LLMs có thể giúp bắc cầu các khoảng trống – nếu được sử dụng một cách suy nghĩ.
Tuy nhiên, Raaijmakers không tránh né mặt tối. Ông đưa ra những cảnh báo: về thông tin sai lệch và “sự thật bị ảo hóa”, về các偏见 đã ăn sâu, về sự xói mòn phán quyết con người, về sự phụ thuộc quá mức vào các mô hình không hoàn hảo – tất cả đều là những rủi ro đã được ghi nhận trong lĩnh vực đạo đức AI rộng lớn hơn.
Điều quan trọng là, lăng kính xã hội này làm cho cuốn sách có giá trị không chỉ cho các kỹ sư và nhà nghiên cứu mà còn cho các nhà hoạch định chính sách, giáo viên và bất kỳ công dân suy nghĩ nào. Nó đặt LLMs vào các ngữ cảnh thế giới thực, không phải là sự cường điệu trừu tượng.
Cái gì tiếp theo — và một lời kêu gọi cảnh giác
Chương cuối cùng, “Cái gì tiếp theo?”, không giả装 rằng các LLM hiện tại là lời cuối cùng. Thay vào đó, Raaijmakers khuyến khích một quan điểm hướng tới tương lai: làm thế nào LLMs có thể tiến hóa? Chúng ta có thể cải thiện căn chỉnh, minh bạch, công bằng như thế nào? Những nguyên tắc quản lý, quy định và thiết kế nào sẽ bảo vệ xã hội khi các mô hình này trở nên phổ biến?
Đối với tôi – như một người đầu tư sâu vào danh mục Essential Knowledge, nhận thức được cách một số cuốn sách không đáp ứng được kỳ vọng – cuốn sách này xứng đáng được xếp vào hàng những cuốn sách hay nhất. Sự rõ ràng, cân bằng, nền tảng kỹ thuật và nhận thức xã hội của nó làm cho nó trở thành một tác phẩm nổi bật. Nó đạt được sự cân bằng hiếm có giữa giải thích dễ tiếp cận và phê bình nghiêm túc.
Do đó, tôi khuyên tất cả những người xây dựng, triển khai hoặc tương tác với LLMs – các nhà phát triển, tổ chức, nhà hoạch định chính sách và người dùng hàng ngày – hãy giữ một cái nhìn cảnh giác, nghiêm túc và thông tin. Yêu cầu minh bạch. Đẩy mạnh cho dữ liệu đào tạo đa dạng và đại diện. Insist trên đánh giá nghiêm ngặt. Question đầu ra. Đừng đối xử với LLMs như những lời sấm truyền, mà như những công cụ mạnh mẽ – những công cụ mà sức mạnh phải được cân bằng với sự quan tâm, trách nhiệm và phán quyết con người.
Phán quyết cuối cùng
Large Language Models không chỉ là một cuốn sách hướng dẫn kỹ thuật khác – nó là một cuốn sách hướng dẫn kịp thời, sắc sảo và sâu sắc về một trong những công nghệ có ảnh hưởng nhất của thời đại chúng ta. Nó kết hợp giải thích dễ tiếp cận với sự phản ánh nghiêm túc; chi tiết kỹ thuật rõ ràng với nhận thức xã hội rộng lớn; sự ngưỡng mộ tiềm năng với sự thận trọng thực tế về rủi ro.
Đối với bất kỳ ai – kỹ sư, nhà nghiên cứu, sinh viên, nhà hoạch định chính sách, công dân tò mò – muốn hiểu LLMs là gì, chúng có thể và không thể làm gì, và chúng có thể có ý nghĩa gì cho tương lai của chúng ta – cuốn sách Large Language Models của Stephan Raaijmakers là một cuốn sách đọc thiết yếu.












