Mô hình và nền tảng AI

Định luật Moore là gì và nó ảnh hưởng như thế nào đến AI?

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Định luật Moore là quan sát lịch sử cho thấy các mạch tích hợp có giá trị kinh tế thường tăng số lượng thành phần theo tốc độ tăng cấp số nhân. Đây không phải là một định luật vật lý và không khẳng định rằng máy tính sẽ tự động trở nên nhanh gấp đôi theo một lịch trình cố định.

Đối với AI, mật độ transistor quan trọng vì nó cho phép có nhiều đơn vị tính toán, bộ nhớ và liên kết hơn. Tuy nhiên, tiến bộ thực tế còn phụ thuộc vào kiến trúc, độ chính xác số học, đóng gói, băng thông bộ nhớ, thuật toán, phần mềm, năng lượng, năng suất sản xuất và lượng dữ liệu hữu ích.

Những điểm chính

  • Bài viết gốc năm 1965 của Moore mô tả một xu hướng kinh tế và kỹ thuật, không phải một đảm bảo vật lý.
  • Tốc độ đồng hồ tăng chậm lại; các cải tiến hiện đại ngày càng đến từ song song và các bộ tăng tốc chuyên dụng.
  • Hiệu năng AI thường bị giới hạn bởi việc di chuyển bộ nhớ và năng lượng, không chỉ bởi tính toán.
  • So sánh các hệ thống dựa trên độ trễ, thông lượng, chất lượng, công suất và tổng chi phí ở mức tải công việc — không phải số lượng transistor.
What Is Moore’s Law, and How Does It Affect AI? workflow diagram
Tiến bộ AI tích lũy qua phần cứng, thuật toán, dữ liệu và hệ thống — không chỉ mật độ transistor.

Những gì Moore thực sự quan sát được

Gordon Moore đã vẽ biểu đồ số lượng thành phần trong các mạch tích hợp hàng đầu và dự đoán sự tăng trưởng nhanh chóng liên tục với chi phí tối thiểu cho mỗi thành phần. Nhịp độ này sau này thường được tóm tắt là gấp đôi khoảng mỗi hai năm, nhưng các công thức và các đại lượng đo lường đã thay đổi.

Các tính năng nhỏ hơn có thể tăng mật độ và giảm một số chi phí chuyển đổi, tuy nhiên độ phức tạp và kinh tế sản xuất quyết định xu hướng có còn hữu ích hay không. Các tên node là nhãn tiếp thị, vì vậy không nên coi chúng là một so sánh vật lý trực tiếp giữa các nhà sản xuất.

Từ lõi nhanh hơn đến tính toán dị hợp

Việc điều chỉnh điện áp kiểu Dennard từng cho phép tần số đồng hồ cao hơn mà không tăng năng lượng tỷ lệ, nhưng mối quan hệ này đã suy yếu. Các nhà thiết kế đã chuyển sang CPU đa lõi, GPU, đơn vị tensor, chiplet, đóng gói tiên tiến và các bộ tăng tốc chuyên dụng cho từng lĩnh vực.

Sự đa dạng này là trung tâm của deep learning. Các phép toán ma trận dày đặc có thể chạy hiệu quả trên phần cứng song song, trong khi CPU điều phối logic không đều và việc di chuyển dữ liệu. Thành phần nhanh nhất cũng không có ích nếu đường truyền không thể cung cấp đủ dữ liệu cho nó.

Bộ nhớ, độ chính xác và thuật toán

Quá trình huấn luyện và suy luận liên tục di chuyển trọng số, kích hoạt và dữ liệu bộ nhớ đệm qua một hệ thống phân cấp bộ nhớ trên chip và ngoài chip. Băng thông, dung lượng, tính cục bộ và giao tiếp có thể chi phối chi phí. Độ chính xác số học thấp hơn và việc lượng tử hoá giảm bớt việc di chuyển khi chất lượng vẫn chấp nhận được.

Các cải tiến thuật toán có thể giảm lượng tính toán cần thiết để đạt được kết quả mục tiêu. Các mô hình thưa, các phương pháp tăng hiệu suất transformer, bộ tối ưu hoá tốt hơn và dữ liệu chất lượng cao hơn đều ảnh hưởng đến tiến bộ thực tế mà người dùng trải nghiệm.

Cách so sánh phần cứng AI

Các phép tính đỉnh mỗi giây chỉ là lý thuyết. Hãy sử dụng một mô hình đại diện, kích thước batch, độ dài chuỗi, độ chính xác, ngăn xếp phần mềm và ngưỡng chất lượng. Báo cáo độ trễ, thông lượng, năng lượng, dung lượng bộ nhớ, mức sử dụng và chi phí từ đầu đến cuối.

Hệ thống biên có thể ưu tiên tính riêng tư và tiêu thụ năng lượng thấp hơn so với thông lượng tối đa; các trung tâm dữ liệu có thể ưu tiên tổng số token hoặc mẫu trên mỗi watt. Edge AI làm rõ lý do một con số tiêu đề không thể mô tả mọi hệ thống hữu ích.

Tại sao việc mở rộng bán dẫn đã thay đổi

Tiến trình mạch tích hợp ban đầu kết hợp các thiết bị nhỏ hơn, quy trình sản xuất tốt hơn, chi phí mỗi thành phần thấp hơn và cải tiến thiết kế. Trong nhiều năm, giảm kích thước transistor cũng hỗ trợ chuyển đổi nhanh hơn và năng lượng tiêu thụ mỗi phép tính thấp hơn. Cuối cùng, rò rỉ, giới hạn điện áp, mật độ nhiệt, độ trễ liên kết và chi phí chế tạo đã làm suy yếu mối quan hệ đơn giản giữa một node quy trình mới và các lõi đa năng nhanh hơn.

Tiến bộ hiện đại vì vậy trở nên đa chiều. Các thiết bị FinFET và gate‑all‑around cải thiện kiểm soát điện tĩnh; công nghệ khắc siêu tia cực tím hỗ trợ các mẫu nhỏ hơn; chiplet cho phép các nhà thiết kế kết hợp các die được sản xuất trên các quy trình khác nhau; đóng gói tiên tiến đặt tính toán và bộ nhớ gần nhau hơn. Năng suất và đóng gói quyết định liệu một thiết kế ấn tượng về mặt kỹ thuật có thể kinh tế ở quy mô lớn hay không.

Sự chậm lại của một cơ chế mở rộng không có nghĩa là phần cứng ngừng cải tiến. Nó có nghĩa là các kiến trúc sư phải sử dụng transistor một cách có chủ đích hơn. Các đơn vị chuyên dụng đổi lại tính linh hoạt để đạt thông lượng hoặc hiệu suất trên các khối lượng công việc được chọn, trong khi các bộ đệm và liên kết lớn hơn cố gắng cung cấp đủ dữ liệu cho các đơn vị đó.

Cách các khối lượng công việc AI gây áp lực lên phần cứng

Quá trình huấn luyện luân phiên giữa tính toán tiến, lan truyền ngược, cập nhật bộ tối ưu hoá và giao tiếp giữa các bộ tăng tốc. Suy luận dao động từ đánh giá batch đến tạo token tương tác. Phép nhân ma trận quan trọng, nhưng các embedding, chuẩn hoá, hàm kích hoạt, attention, routing, truy cập bộ đệm và điều phối máy chủ đều đóng góp vào hiệu năng thực tế.

Cường độ tính toán — lượng tính toán thực hiện trên mỗi byte di chuyển — giúp giải thích liệu một khối lượng công việc bị ràng buộc bởi tính toán hay băng thông. Kích thước batch nhỏ và giải mã tự hồi quy thường để các đơn vị tính toán không được sử dụng hết vì trọng số hoặc dữ liệu bộ đệm phải được lấy lại liên tục. Batch lớn hơn cải thiện mức sử dụng nhưng tăng độ trễ và bộ nhớ.

Định dạng số thay đổi sự đánh đổi. FP32, BF16, FP16, FP8 và các định dạng số nguyên khác nhau về phạm vi, độ chính xác, hỗ trợ phần cứng và lỗi. Huấn luyện hỗn hợp độ chính xác giữ các phép toán nhạy cảm ở độ chính xác cao hơn; suy luận lượng tử hoá cần hiệu chuẩn và kiểm tra chất lượng thay vì hứa rằng mọi mô hình đều chịu được cùng độ rộng bit.

Kinh tế hệ thống và hướng phát triển trong tương lai

Tổng chi phí AI bao gồm mua hoặc thuê bộ tăng tốc, cung cấp điện, làm mát, mạng, lưu trữ, kỹ thuật phần mềm, công suất nhàn rỗi và các thí nghiệm thất bại. Một chip nhanh hơn có thể tốn nhiều hơn tổng thể nếu mức sử dụng kém hoặc nếu mô hình yêu cầu kiến trúc phân tán tốn kém. Đo lường đầu ra hữu ích tại ngưỡng chất lượng đã định.

Việc mở rộng cũng bị giới hạn bởi dữ liệu và thuật toán. Nhiều tính toán không thể sửa chữa dữ liệu bị gán nhãn sai hoặc một tiêu chí đánh giá khuyến khích các lối tắt. Attention hiệu quả, bộ tối ưu hoá tốt hơn, tính thưa, truy xuất, chưng cất và các khám phá thuật toán có thể cải thiện kết quả mà không cần tăng phần cứng tỷ lệ, mặc dù chúng có thể chuyển chi phí sang các yếu tố khác.

Các hệ thống tương lai sẽ kết hợp tiến bộ quy trình với xếp chồng ba chiều, bộ nhớ băng thông cao, liên kết quang học hoặc điện tiên tiến, luồng dữ liệu đặc thù cho từng lĩnh vực và phần mềm đồng thiết kế. Định luật Moore vẫn là bối cảnh lịch sử có giá trị, nhưng việc lập kế hoạch nên dựa trên các đường cong tải công việc đo lường và các ràng buộc thực tế về nguồn cung, năng lượng và triển khai.

Đọc đúng Định luật Moore trong thiết kế hệ thống AI

Một phân tích hữu ích tách biệt mật độ transistor, hiệu năng CPU đa năng, thông lượng bộ tăng tốc, dung lượng bộ nhớ, băng thông bộ nhớ, liên kết, năng lượng, năng suất sản xuất và chi phí. Những yếu tố này không cải thiện cùng tốc độ. Một khối lượng công việc AI chi phối việc di chuyển trọng số mô hình có thể thu được ít lợi ích từ nhiều đơn vị tính toán hơn, trong khi một mô hình nhỏ trên chip có thể hưởng lợi đáng kể từ phần cứng độ chính xác thấp chuyên dụng. Hãy trích dẫn chỉ số, độ chính xác, khối lượng công việc và phạm vi công suất chính xác thay vì xem node quy trình như là hiệu năng.

Mở rộng một mô hình AI cũng thay đổi yêu cầu phần mềm và hệ thống. Các lần huấn luyện lớn hơn cần thuật toán song song, checkpoint đáng tin cậy, mạng tốc độ cao, đường ống lưu trữ và đủ dữ liệu để sử dụng sức chứa tăng thêm. Khi suy luận, độ trễ phụ thuộc vào độ dài prompt, token sinh ra, batch, bộ nhớ đệm và mục tiêu mức dịch vụ. Các cải tiến thuật toán, tính thưa, lượng tử hoá, truy xuất và dữ liệu tốt hơn có thể mang lại lợi nhuận độc lập với xu hướng transistor và đôi khi vượt qua một thế hệ phần cứng.

Để lập kế hoạch, hãy benchmark các mô hình đại diện trên các hệ thống tiềm năng và mô hình tổng chi phí trong suốt vòng đời triển khai: chi phí mua hoặc đám mây, năng lượng, làm mát, mức sử dụng, kỹ thuật, di chuyển, và rủi ro nguồn cung. Sử dụng các kịch bản thay vì một dự báo tăng cấp số nhân duy nhất. Định luật Moore vẫn là một quan sát lịch sử có giá trị về kinh tế tích hợp, nhưng nó không đảm bảo AI sẽ nhanh hơn, rẻ hơn, mạnh hơn hoặc bền vững hơn theo tỷ lệ trên một lịch trình cố định.

Danh sách kiểm tra triển khai thực tiễn

Biến khái niệm thành một quy trình có giới hạn, có thể kiểm thử: transistors → parallelism → accelerators → memory → software → workload. …  … … … … … … … … … … … … … … … … … … … … … … … … … … … … … … … … … … … … … … … … … … … … … … … … … … … … … … … … … … … … … … … … … … … … … … … … … … … … … … … … … ……………  …… … … …

Trước khi ra mắt, thực hiện một cuộc đánh giá sẵn sàng được ghi chép với những người xây dựng, vận hành, bảo mật và bị ảnh hưởng bởi hệ thống. Kiểm tra các trường hợp bình thường, điều kiện biên, lỗi phụ thuộc và việc lạm dụng; lưu giữ bằng chứng và các rủi ro chưa giải quyết. Xác định ai có thể phê duyệt phát hành, thay đổi ngưỡng, ghi đè kết quả hoặc dừng hoạt động. Xem lại quyết định khi dữ liệu thực tế xuất hiện, vì một dự án thí điểm thành công về mặt kỹ thuật không đảm bảo hiệu năng đáng tin cậy ở quy mô lớn hơn.

  • DENSITY: khả năng cao hơn trong cùng một diện tích chip.
  • EFFICIENCY: độ chính xác, tính cục bộ và tính chuyên biệt.
  • REAL RESULT: chất lượng trên mỗi đơn vị thời gian, năng lượng và chi phí.

Câu hỏi thường gặp

Định luật Moore đã kết thúc chưa?

Xu hướng lịch sử đơn giản đã chậm lại và thay đổi tính chất, nhưng tiến bộ bán dẫn vẫn tiếp tục thông qua thiết bị, kiến trúc, đóng gói, bộ nhớ và phần mềm. Việc cụm từ này còn phù hợp hay không phụ thuộc vào chỉ số được sử dụng.

Gấp đôi số lượng transistor có nghĩa là gấp đôi hiệu năng AI không?

Không. Hiệu năng phụ thuộc vào cách sử dụng transistor và vào băng thông, độ chính xác, cấu trúc mô hình, hiệu quả phần mềm, công suất và các ràng buộc của khối lượng công việc.

Tài liệu tham khảo chính

Jacob stoner là một nhà văn dựa trên Canada, người viết về các tiến bộ công nghệ trong lĩnh vực in 3D và công nghệ drone. Ông đã sử dụng thành công công nghệ in 3D cho một số ngành công nghiệp, bao gồm dịch vụ khảo sát và kiểm tra drone.