Góc nhìn Anderson
Thiệt hại từ việc tinh chỉnh mô hình AI có thể dễ dàng được phục hồi, nghiên cứu cho thấy

Nghiên cứu mới từ Mỹ chỉ ra rằng việc tinh chỉnh mô hình AI cơ bản trên dữ liệu của riêng bạn không cần phải giảm hoặc làm suy giảm chức năng của mô hình gốc – và rằng một giải pháp tương đối đơn giản có thể không chỉ phục hồi khả năng của mô hình gốc, mà còn cải thiện chất lượng đầu ra mà bạn đang cố gắng để mô hình (đã được đào tạo) sản xuất.

Cải thiện hiệu suất trên các mô hình đa dạng với kỹ thuật hiệu chỉnh sau đào tạo mới của các tác giả. Chi tiết hơn trong bài viết. Nguồn: http://export.arxiv.org/pdf/2409.16223
Ý nghĩa của điều này là rất quan trọng, không chỉ đối với các công ty công nghệ lớn đang tập trung vào lợi ích tài chính của việc cho thuê hệ thống sinh ra ‘dưới dạng dịch vụ’, mà còn đối với số lượng ngày càng tăng của ‘người cắt dây’ (các cá nhân sử dụng công nghệ một cách độc lập) đang tải xuống và tùy chỉnh các mô hình mã nguồn mở, để họ có thể truy cập vào các hệ thống viết và tạo hình ảnh/đideo cá nhân hóa với chi phí thấp hơn – và với ít hạn chế hơn.
Các tác giả của bài báo không ngần ngại thể hiện sự hào hứng của họ với tiềm năng của phương pháp này, phương pháp này dường như đã đạt được những tiến bộ đáng kể so với bài báo năm 2023 Holistic Transfer: Towards Non-Disruptive Fine-Tuning with Partial Target Data (đồng tác giả với nhiều người đóng góp cho bài báo mới).
Họ tuyên bố:
‘Những [phát hiện] này rất khuyến khích và có ý nghĩa sâu sắc! Chúng ngụ ý rằng một kỹ thuật hiệu chỉnh sau đào tạo đơn giản có thể giải quyết vấn đề về độ chính xác thấp của mô hình tinh chỉnh trên các lớp vắng mặt, khôi phục khả năng của mô hình được đào tạo trước và đồng thời tiết lộ chất lượng tính năng được cải thiện trên tất cả các lớp.’
Chúng tôi sẽ xem xét công việc mới này ngay sau đó. Trước tiên, hãy xem vấn đề mà nó đang cố gắng giải quyết là gì.
Tại sao nó quan trọng
Làn sóng đầu tiên của việc tinh chỉnh rộng rãi xảy ra sau khi phát hành mô hình Stable Diffusion từ văn bản sang hình ảnh của Stability.ai vào tháng 8 năm 2002. Các mô hình ban đầu, được đào tạo trên một tập con của tập dữ liệu LAION siêu quy mô, đã được cung cấp cho bất kỳ ai để tải xuống.
Tuy nhiên, người dùng muốn chèn nội dung cụ thể (chẳng hạn như bản dạng của họ, phong cách nghệ thuật hoặc đại diện của người nổi tiếng) vào các tính năng tạo ra phi thường của Stable Diffusion được yêu cầu phải sử dụng các kỹ thuật như DreamBooth – một sự mở rộng của phương pháp tùy chỉnh Google Research, cho phép người dùng đào tạo dữ liệu mới vào mô hình miễn phí thông qua việc tinh chỉnh.

Ví dụ về quá trình người dùng của triển khai DreamBooth chính thức của Google từ năm 2022. Người dùng sẽ thu thập một bộ chọn nhỏ các hình ảnh và chọn một tên duy nhất (một tên mà Stable Diffusion không có trong dữ liệu đào tạo) trong các lời nhắc văn bản từ mô hình tinh chỉnh. Nguồn: https://dreambooth.github.io/
Điều này cho phép người dùng có được một bản sao của mô hình rất tốt trong việc tạo ra một người hoặc một phong cách nghệ thuật tùy chỉnh, nhưng mô hình đó bị ‘hỏng’ đối với việc sử dụng chung.
Điều này có nghĩa là nếu bạn muốn tinh chỉnh Stable Diffusion để nó có thể mô tả chính xác ba người khác nhau, bạn sẽ phải tạo ba mô hình khác nhau, mỗi mô hình khoảng 2-4GB hoặc hơn.
Bất kỳ nỗ lực nào để tinh chỉnh lại những mô hình này một lần nữa sẽ không chỉ làm suy giảm hiệu suất chung của mô hình thậm chí còn hơn, mà còn ảnh hưởng tiêu cực đến đầu ra từ phiên tinh chỉnh trước.
Trong mọi trường hợp, các mô hình DreamBooth của người nổi tiếng sẽ sớm lan truyền trên internet, chủ yếu tập trung tại tên miền civit.ai. Cuối cùng, các phương pháp ít tốn kém hơn như Low-Rank Adaptation (LoRA) đã vượt qua việc tinh chỉnh trong phổ biến (mặc dù liệu đầu ra LoRA có hiệu quả như một tinh chỉnh đầy đủ vẫn còn được tranh luận, và NVIDIA đã mã nguồn mở một phương pháp dường như hiệu quả hơn gọi là DoRA).
Một LoRA thuộc thể loại Parameter-Efficient Fine-Tuning (PEFT), chỉ ảnh hưởng đến một tập con của các tham số đã đào tạo của mô hình.
Một số người dùng muốn thay đổi bản chất cơ bản của các điểm kiểm tra Stable Diffusion mã nguồn mở, bằng cách tinh chỉnh chúng trên hàng nghìn hình ảnh.
Điều này, về cơ bản, tạo ra một mô hình cơ sở thay thế, dành riêng cho lĩnh vực mà người dùng đang cố gắng đào tạo (chẳng hạn như một phong cách nghệ thuật cụ thể). Đối với mục đích này, các phương pháp ‘nhẹ’ như LoRA có thể kém hiệu quả, vì trọng số của mô hình cần một sự thiên vị nghiêm trọng đối với dữ liệu đào tạo mới.
Trò chuyện địa phương
Với sự gia tăng gần đây của sự quan tâm đến Mô hình ngôn ngữ lớn (LLM), người dùng muốn tránh các điểm đến ngày càng tăng (và chi phí liên quan) của các dịch vụ dựa trên API như ChatGPT, đã bắt đầu tải xuống và tinh chỉnh các mô hình mã nguồn mở hiệu quả như Llama 3, trong số nhiều mô hình khác.
Ở đây, các LoRA cũng có thể được sử dụng thay vì tinh chỉnh một điểm kiểm tra đầy đủ. Chúng tôi đã cho rằng tinh chỉnh là một phương pháp vượt trội để sản xuất LLM được thích nghi với nhu cầu cụ thể của người dùng. Mặc dù tinh chỉnh có thể có yêu cầu phần cứng lớn hơn và có thể mất nhiều thời gian hơn, nhưng nó cung cấp một sự khái quát hóa sâu hơn của dữ liệu mới mà người dùng muốn mô hình hấp thụ.
Vấn đề với tinh chỉnh là đó là một quá trình phá hủy mà không thể được đào tạo tăng dần trên dữ liệu bổ sung sau này, như chúng tôi đã lưu ý ở trên.
Các tính năng và thiên vị được tiêm vào mô hình dường như làm xáo trộn sự cân bằng ban đầu của trọng số trong tập dữ liệu, có nghĩa là mô hình có thể phản ánh quá mức dữ liệu do người dùng đóng góp, hoặc ít nhất sẽ hoạt động kém hơn tổng thể so với mô hình cơ sở ban đầu (trên các nhiệm vụ không liên quan đến dữ liệu mới).
Một người có thể khắc phục điều này, đến một mức độ nhất định, bằng cách đông lạnh một số phần của mô hình trong quá trình đào tạo; nhưng điều này có thể dẫn đến giảm chức năng tổng thể, vì phần đông lạnh của kiến trúc có thể không khái quát hóa tốt với dữ liệu tinh chỉnh mới trong không gian tiềm ẩn của mô hình.
Nó sẽ, do đó, rất tuyệt nếu có một cách dễ dàng hơn để bảo tồn các khả năng ban đầu của một mô hình tinh chỉnh, đồng thời giữ lại khả năng của mô hình để tạo ra đầu ra dựa trên dữ liệu tinh chỉnh.
Một sự phát triển như vậy sẽ có lợi trên toàn bộ phạm vi người dùng tiềm năng, từ những người đam mê và người dùng sớm sử dụng LLM và các loại mô hình tạo ra khác, lên đến cấp độ FAANG (trong đó một mô hình AI rất tốn kém có thể được cải thiện một cách lặp lại và không phá hủy, mà không có chi phí hàng triệu đô la để bắt đầu đào tạo lại với dữ liệu bổ sung).
Hiệu chỉnh sau đào tạo
Điều này đưa chúng ta trở lại bài báo mới, được gọi là Tinh chỉnh là ổn, nếu được hiệu chỉnh, và đến từ 11 nhà nghiên cứu trên khắp Ohio State University, University of Wisconsin Madison và Rensselar Polytechnic Institute.
Các nhà nghiên cứu đang cố gắng tìm ra chính xác những gì bị hư hỏng trong một mô hình cơ sở khi nó được tinh chỉnh. Họ đã kết luận rằng sự khác biệt chính giữa mô hình ‘trước và sau’ là sự chênh lệch lớn về thang độ logit trên các lớp tinh chỉnh và các lớp ban đầu trong mô hình.
Các liên kết logit dự đoán xác suất thành công trong một quá trình hồi quy logic, chuyển đổi các giá trị ước tính (có thể rất chính xác) thành một hoặc một.
Các tác giả không chỉ phát hiện ra rằng sự thiếu hụt này gần như có thể đảo ngược một cách dễ dàng bằng một kỹ thuật hiệu chỉnh, mà còn rằng sự sửa chữa sau sự kiện này thực sự cải thiện chất lượng đầu ra cho dữ liệu tinh chỉnh. Do đó, với kỹ thuật này, bạn không chỉ nhận được khả năng của mô hình cơ sở, mà còn nhận được sự tích hợp tốt hơn của dữ liệu tinh chỉnh của riêng bạn.
(Mặc dù bài báo không kiểm tra triển vọng, kỹ thuật này ngụ ý rằng một mô hình có thể được tinh chỉnh nhiều lần và vẫn hiệu quả)
Thảo luận về các phát hiện của họ khi điều tra thiệt hại của mô hình sau khi tinh chỉnh, các tác giả tuyên bố:
‘Để ngạc nhiên của chúng tôi, chúng tôi phát hiện ra rằng mô hình tinh chỉnh không quên mối quan hệ giữa các lớp khác nhau, cũng không làm suy giảm các tính năng để nhận ra các lớp này.
‘Thay vào đó, mô hình tinh chỉnh thường tạo ra các tính năng phân biệt hơn cho các lớp khác này, ngay cả khi chúng vắng mặt trong quá trình tinh chỉnh!
‘[Cái] thực sự làm hỏng độ chính xác là sự chênh lệch thang độ logit giữa các lớp tinh chỉnh và các lớp khác [các lớp], ngụ ý rằng một kỹ thuật hiệu chỉnh sau đào tạo đơn giản sẽ khôi phục khả năng của mô hình được đào tạo trước và đồng thời tiết lộ sự cải thiện tính năng trên tất cả các lớp.’
Các tác giả đã làm cho kết quả của các thử nghiệm của họ có thể tái tạo trong một kho lưu trữ GitHub.
Họ phát hiện ra rằng khi điều tra, phần duy nhất của kiến trúc mô hình cơ sở bị hư hỏng trong quá trình tinh chỉnh là phân loại nhị phân, phân loại sai các lớp vắng mặt trong mô hình ban đầu là các lớp tinh chỉnh.
Bài báo tuyên bố*:
‘[Bằng] thêm một yếu tố thiên vị hiệu chỉnh vào tất cả các lớp vắng mặt [4, 40 ], mô hình tinh chỉnh có thể thành công trong việc giành lại độ chính xác của lớp vắng mặt và đạt được sự cải thiện tổng thể đáng kể trong lĩnh vực hạ lưu [lĩnh vực].
‘Hiệu suất kết quả thậm chí vượt qua đường cơ sở mạnh [Holistic Transfer – bài báo mà bài báo này xây dựng ] trong nhiều điểm chuẩn, bao gồm ImageNet và các biến thể của nó [ImageNet, ImageNet-R(endition), ImageNet-S(ketch) ], Office-Home, và VTAB, không cần đào tạo và thiết lập siêu tham số phức tạp.’

Kết quả từ bài báo: một mô hình tinh chỉnh đã có hiệu chỉnh sau đào tạo thực hiện trên nó có thể, theo các tác giả, vượt qua phương pháp hiện tại cho vấn đề.
Các tác giả phân loại hiệu suất cải thiện của một mô hình tinh chỉnh đã được hiệu chỉnh sau đào tạo là ‘hành vi tốt’, và quan sát thấy rằng khi một bộ tối ưu hóa Stochastic Gradient Descent (SGD) cơ bản được sử dụng, kết quả tốt hơn được đạt được so với các bộ tối ưu hóa phổ biến hiện nay, chẳng hạn như Adam.
‘Vẫn,’ họ lưu ý ‘với tốc độ học và suy giảm trọng số đủ nhỏ, các hành vi tốt hiển thị và giữ lại.’
Sửa chữa nhỏ
Để sửa chữa sự chênh lệch thang độ logit kết quả từ việc tinh chỉnh, các tác giả đã mượn một kỹ thuật từ học không có shot, thêm một yếu tố không đổi vào thang độ logit của tất cả các lớp vắng mặt. Điều này dẫn đến một quy tắc phân loại mới.
Các tác giả lưu ý rằng quá trình này ‘khuyến khích’ các lớp vắng mặt bị bỏ qua đến cùng chất lượng dự đoán của các lớp tinh chỉnh, khôi phục hiệu suất ban đầu và cải thiện hiệu suất của ‘dữ liệu được thêm’ tại thời điểm suy luận.

Trong các thử nghiệm, kỹ thuật hiệu chỉnh sau đào tạo đã khôi phục hiệu suất cho nhiều mô hình tinh chỉnh đa dạng. ‘Oracle’ được chỉ định trong bảng đề cập đến một phân loại tinh chỉnh cũng xem xét dữ liệu lớp vắng mặt.
Họ quan sát thêm rằng hiệu chỉnh sau đào tạo ‘có thể áp dụng cho bất kỳ mô hình nào’, và các phương pháp nhằm duy trì tính toàn vẹn của mô hình cơ sở thông qua việc đông lạnh các lớp (chẳng hạn như phân loại và bộ phận chính) đạt điểm thấp so với phương pháp được đề xuất của họ.
Kết luận
Các phát hiện từ sự hợp tác này dường như rất quan trọng. Việc đào tạo một mô hình AI trên một tập dữ liệu siêu quy mô là một cam kết khổng lồ, tương tự như việc cất cánh của một chiếc máy bay chở khách. Mặc dù việc đào tạo có thể bị gián đoạn, và bất kỳ thiệt hại nào cũng có thể được giảm thiểu bằng cách lưu trữ trọng số hiện tại định kỳ (với chi phí lưu trữ đáng kể), để cho phép gián đoạn đào tạo, có rất ít điều mà bạn có thể làm để thay đổi kết quả sau khi cất cánh.
Cái gì ấn tượng về công việc là các nhà nghiên cứu dường như đã khám phá ra một nguyên tắc cơ bản trong đào tạo mô hình AI chung, và giải pháp của họ rất đơn giản.
Ý nghĩa kinh tế của việc có thể giữ lại độ chính xác của mô hình cơ sở sau khi tinh chỉnh cũng rất quan trọng. Cho đến nay, phương pháp phổ biến nhất để giải quyết các hạn chế của các mô hình hàng triệu đô la là lọc đầu ra tại thời điểm suy luận, hoặc kiểm soát suy luận để tránh bất kỳ điểm yếu nào rõ ràng trong mô hình.
Thêm vào đó, một kỹ thuật như vậy có thể mang lại những cải thiện đáng kể về khả năng của các mô hình sinh ra tinh chỉnh ở cấp độ người tiêu dùng, với lợi thế của việc tăng chất lượng đầu ra.
* Tôi đã chuyển đổi các trích dẫn nội tuyến của các tác giả thành siêu liên kết.
Được xuất bản lần đầu vào thứ ba, ngày 1 tháng 10 năm 2024












