Nền tảng AI
Gradient Descent là gì?
Gradient descent là một phương pháp tối ưu hoá điều chỉnh các tham số mô hình để giảm một hàm mục tiêu. Trong việc huấn luyện mạng nơ-ron, hàm mục tiêu thường là mất mát được tính trên các ví dụ. Gradient chỉ hướng về phía tăng nhanh nhất cục bộ, vì vậy gradient descent thực hiện một bước theo hướng ngược lại.
Gradient mô tả độ nhạy cục bộ; độ lớn của nó không phải là thước đo trực tiếp về tốc độ “học” của mô hình. Tiến độ thực tế còn phụ thuộc vào tốc độ học, độ cong, nhiễu, cách tham số hoá, trạng thái bộ tối ưu hoá và dữ liệu.
Những điểm chính
- Backpropagation tính toán gradient, trong khi gradient descent sử dụng chúng để cập nhật các tham số.
- Tối ưu hoá mini-batch là phương pháp thực tiễn tiêu chuẩn cho deep learning.
- Tốc độ học kiểm soát quy mô cập nhật và có thể theo một lịch trình thay vì giảm dần sau mỗi bước.
- Momentum, AdamW, clipping và normalization giải quyết các vấn đề tối ưu hoá khác nhau.

Quy tắc cập nhật cơ bản
Với vector tham số θ, tốc độ học η, và hàm mất mát L:
θ ← θ - η∇L(θ)
Gradient ∇L(θ) chứa một đạo hàm riêng cho mỗi tham số. Trừ nó sẽ di chuyển xuống dốc cục bộ. Một điểm tĩnh có gradient bằng không, nhưng có thể là điểm cực tiểu, cực đại, điểm yên ngựa, hoặc vùng phẳng. Các bề mặt mất mát trong deep learning là phi lồi, do đó việc huấn luyện không được đảm bảo sẽ tìm được một cực tiểu toàn cục duy nhất hoặc mất mát bằng không.
Các phương pháp batch, stochastic và mini-batch
Batch gradient descent
Batch gradient descent tính gradient bằng cách sử dụng toàn bộ tập huấn luyện cho mỗi lần cập nhật. Ước lượng này ổn định nhưng có thể tốn thời gian và bộ nhớ, và một lần cập nhật có thể không tận dụng hết các bộ tăng tốc hiện đại.
Stochastic gradient descent
Stochastic gradient descent thuần túy sử dụng một ví dụ được chọn ngẫu nhiên cho mỗi lần cập nhật. Các gradient của nó có nhiễu, điều này có thể giúp khám phá bề mặt mất mát, nhưng các thao tác dựa trên một ví dụ có thể không hiệu quả trên phần cứng song song.
Mini-batch gradient descent
Huấn luyện mini-batch ước tính gradient từ một tập con các ví dụ. Nó cân bằng giữa nhiễu thống kê và các phép toán ma trận hiệu quả và là cách tiếp cận thông thường trong deep learning. Kích thước batch ảnh hưởng đến bộ nhớ, thông lượng, nhiễu gradient, chuẩn hoá và đôi khi cả khả năng tổng quát hoá.
Lựa chọn tốc độ học
Một tốc độ quá lớn có thể vượt qua các vùng hữu ích hoặc gây lệch. Một tốc độ quá nhỏ có thể làm cho việc huấn luyện chậm không thực tế hoặc bị dừng lại ở các vùng phẳng. Quy mô tốt nhất phụ thuộc vào bộ tối ưu hoá, kích thước batch, mô hình, cách khởi tạo và mục tiêu.
Các lịch trình có thể khởi động dần dần, giảm ở các mốc quan trọng, theo đường cong cosine, hoặc phản hồi dựa trên tiến trình validation. Tốc độ không nhất thiết phải giảm đơn điệu sau mỗi lần cập nhật. Warm restart và lịch trình tuần hoàn cố ý tăng tốc độ trong một số giai đoạn của quá trình huấn luyện.
Momentum
Momentum duy trì một trung bình di động hàm mũ của các gradient trong quá khứ. Nó có thể tăng tốc độ tiến bộ theo các hướng nhất quán và giảm dao động trên các hướng dốc, hẹp. Momentum kiểu Nesterov đánh giá hoặc xấp xỉ gradient sau khi nhìn trước theo hướng momentum.
Bộ tối ưu thích nghi
RMSProp điều chỉnh các cập nhật bằng cách sử dụng trung bình di động của các gradient bình phương. Adam kết hợp các moment thứ nhất giống như momentum với việc điều chỉnh theo moment thứ hai. AdamW tách weight decay khỏi cập nhật gradient thích nghi và được sử dụng rộng rãi cho các transformer.
Các bộ tối ưu thích nghi thường làm cho giai đoạn huấn luyện đầu tiên dễ dàng hơn, nhưng chúng không tự động vượt trội cho mọi mô hình hoặc mục tiêu tổng quát hoá cuối cùng. So sánh các bộ tối ưu đòi hỏi lịch trình phù hợp và việc tinh chỉnh cẩn thận.
Gradient clipping và accumulation
Gradient clipping giới hạn chuẩn hoặc giá trị của gradient để giảm tác động của gradient bùng nổ, đặc biệt trong huấn luyện hồi tiếp hoặc không ổn định. Gradient accumulation cộng các gradient qua nhiều batch nhỏ trước khi cập nhật, xấp xỉ một batch hiệu quả lớn hơn khi bộ nhớ hạn chế.
Giám sát tối ưu hoá
Theo dõi mất mát huấn luyện và validation, các chỉ số nhiệm vụ, tốc độ học, chuẩn gradient, chuẩn tham số và các lỗi số. Mất mát huấn luyện giảm trong khi hiệu suất validation xấu đi cho thấy overfitting, không phải là thành công tối ưu hoá mà nên tiếp tục tự động.
Tối ưu hoá giảm thiểu mục tiêu được cung cấp. Một giá trị mất mát thấp không chứng minh rằng dữ liệu, chỉ số hoặc hành vi thực tế là phù hợp. Rò rỉ, nhãn kém và mục tiêu không phù hợp có thể tạo ra một mô hình được tối ưu tốt nhưng gây hại.
Hình học tối ưu hoá và quy tắc cập nhật
Gradient descent cập nhật các tham số ngược lại với gradient của hàm mất mát. Full-batch descent sử dụng mọi ví dụ huấn luyện cho mỗi bước; stochastic descent sử dụng một ví dụ; các phương pháp mini-batch ước tính gradient từ một tập con và chiếm ưu thế trong deep learning. Tốc độ học xác định quy mô bước. Quá nhỏ lãng phí tính toán hoặc dừng; quá lớn gây dao động hoặc lệch. Momentum tích lũy một hướng di động, trong khi các phương pháp thích nghi như Adam điều chỉnh các tọa độ bằng các moment của gradient. Các thiên vị ngầm khác nhau của chúng có thể tạo ra các mô hình có mất mát huấn luyện tương tự nhưng khả năng tổng quát hoá khác nhau.
Các bề mặt mất mát trong mạng nơ‑ron chứa các vùng phẳng và sắc nét, điểm yên ngựa, tính đối xứng và các hướng có điều kiện kém. Việc chuẩn hoá đặc trưng, chuẩn hoá, khởi tạo, kết nối dư và tiền xử lý thay đổi hình học mà bộ tối ưu hoá nhìn thấy. Các lịch trình có thể khởi động, giảm, vòng hoặc phản hồi với các vùng bằng phẳng. Weight decay khác biệt so với việc chỉ thêm một hình phạt L2 trong một số bộ tối ưu thích nghi. Kích thước batch ảnh hưởng đến nhiễu, bộ nhớ, song song hoá và chế độ tốc độ học, do đó so sánh các bộ tối ưu đòi hỏi ngân sách huấn luyện phù hợp và việc tinh chỉnh cẩn thận.
Chẩn đoán, tái tạo và dừng
Theo dõi mất mát huấn luyện và validation, các chỉ số nhiệm vụ, chuẩn gradient và tham số, tốc độ học, thông lượng và các cảnh báo số. Sự lệch có thể xuất phát từ batch hỏng, nhãn không hợp lệ, độ chính xác hỗn hợp không ổn định, hoặc giảm loss không đúng. Các vùng bằng phẳng có thể chỉ ra khả năng dưới mức, kích hoạt bão hòa, đặc trưng kém, regularization quá mức, hoặc vấn đề lịch trình. Overfitting cần dữ liệu, tăng cường, regularization hoặc dừng sớm — không phải là khẳng định bộ tối ưu hoá đã thất bại. Kiểm tra các lỗi đại diện và so sánh với một baseline đơn giản trước khi tăng độ phức tạp của huấn luyện.
Tái tạo yêu cầu các seed, thứ tự dữ liệu, mã nguồn, cấu hình, phần cứng và phiên bản thư viện, mặc dù một số kernel tăng tốc vẫn không xác định được. Lưu checkpoint kèm trạng thái optimizer và scheduler để việc huấn luyện có thể tiếp tục một cách nhất quán. Chọn một checkpoint dựa trên tiêu chí validation đã được xác định trước và giữ lại một tập test chưa bị chạm tới. Trong huấn luyện phân tán, xác nhận kích thước batch hiệu quả, trung bình gradient và xử lý các worker thất bại. Tối ưu hoá giảm thiểu mục tiêu đã chọn trên dữ liệu có sẵn; nó không đảm bảo các xác suất đã được hiệu chỉnh, lý luận nhân quả, công bằng, an toàn, hoặc tính hữu dụng trong thực tế.
Ví dụ thực tế: tinh chỉnh bộ tối ưu hoá cho mô hình ngôn ngữ
Một nhóm cố định tokenizer, thứ tự dữ liệu, mô hình, batch hiệu quả và ngân sách token huấn luyện, sau đó so sánh SGD với momentum và AdamW trên các lịch trình tốc độ học có thể biện minh. Warm‑up, decay, weight decay, clipping và độ chính xác được ghi lại. Mỗi ứng cử viên chạy nhiều seed, và validation sử dụng một đoạn thời gian giữ lại cộng với các đánh giá nhiệm vụ. Thông lượng và năng lượng được báo cáo cùng với loss để một bộ tối ưu hoá hơi tốt hơn không bị chọn với chi phí không cân xứng.
Chẩn đoán cho thấy sự bất ổn xuất phát từ một shard dữ liệu, bước quá lớn, underflow, hoặc kiến trúc mô hình. Checkpoint bảo tồn trạng thái optimizer và scheduler và được tiếp tục trong một bài kiểm tra. Lựa chọn cuối cùng dựa trên chất lượng và độ bền vững của validation, không phải loss huấn luyện thấp nhất. Một tập test kín được chạy một lần sau khi lựa chọn. Việc suy luận trong môi trường sản xuất được hiệu chỉnh và giám sát riêng vì thành công của optimizer trong giai đoạn tiền huấn luyện không đảm bảo hành vi an toàn hoặc trung thực.
Bằng chứng triển khai và sẵn sàng vận hành
Một quyết định triển khai cần nhiều hơn một buổi trình diễn thành công. Xác định người dùng mục tiêu, môi trường vận hành, đầu vào, đầu ra, các phụ thuộc, người sở hữu và hậu quả của mỗi lỗi quan trọng. Thiết lập một baseline có thể tái tạo và một bộ đánh giá có phiên bản trước khi tinh chỉnh. Kiểm tra các trường hợp thông thường, điều kiện biên, đầu vào sai dạng hoặc thiếu, sự dịch chuyển phân phối, mất kết nối phụ thuộc, lạm dụng, và các nhóm hoặc môi trường có khả năng bị thiếu phục vụ. Đo lường chất lượng nhiệm vụ cùng với hiệu chuẩn hoặc độ không chắc, độ trễ, thông lượng, chi phí tài nguyên, khả năng tiếp cận, quyền riêng tư và bảo mật. Ghi lại mọi biến đổi và ngưỡng để một người đánh giá độc lập có thể tái tạo kết quả và phân biệt bằng chứng với một nguyên mẫu hấp dẫn.
Trước khi ra mắt, chỉ định quyền trách nhiệm cho việc phát hành, ngoại lệ, thay đổi, rollback và ngừng sử dụng. Sử dụng rollout theo giai đoạn, duy trì một fallback an toàn, và xác minh việc giám sát bằng các lỗi được đưa vào cố ý. Telemetry vận hành nên tiết lộ chất lượng đầu vào, hành vi đầu ra, phiên bản mô hình hoặc quy tắc, trạng thái phụ thuộc, can thiệp của con người và kết quả đã xác nhận mà không thu thập dữ liệu nhạy cảm không cần thiết. Xác định ngưỡng cảnh báo và người chịu trách nhiệm phản hồi, sau đó xem xét bằng chứng thực tế sau khi triển khai thay vì giả định hiệu năng offline sẽ kéo dài. Đánh giá lại mỗi khi nguồn dữ liệu, người dùng, mô hình, nhà cung cấp, chính sách, phần cứng hoặc mục tiêu thay đổi. Một hệ thống được duy trì cũng cần có tài liệu phục hồi, học từ sự cố, quy trình xóa và lưu trữ, và một điểm rõ ràng khi nó nên bị vô hiệu hoá hoặc thay thế.
Câu hỏi thường gặp
Gradient descent luôn đạt được cực tiểu toàn cục không?
Không. Đối với các mục tiêu lồi, các điều kiện thích hợp cung cấp bảo đảm mạnh. Các mục tiêu của mạng sâu là phi lồi, và các bộ tối ưu thực tế thường tìm kiếm một giải pháp hữu ích thay vì chứng minh họ đã tìm được cực tiểu toàn cục duy nhất.
Tại sao gradient bằng không có thể gây hiểu lầm?
Gradient bằng không hoặc rất nhỏ có thể chỉ ra một cực tiểu, cực đại, điểm yên ngựa, bão hòa, hoặc một vùng phẳng. Các chẩn đoán huấn luyện phải xem xét lịch sử loss, độ cong, quy mô tham số và hiệu suất validation.












