Góc nhìn Anderson
Một cái nhìn cá nhân về xu hướng văn học tầm nhìn máy tính năm 2025

Thông báo đạo đức và Gaussian Splatting đang suy giảm, trong khi khối lượng khổng lồ của các bài báo được gửi đại diện cho một vấn đề mới mà AI phải giải quyết vào năm 2026.
Ý kiến Tôi đã theo dõi nghiên cứu về tầm nhìn máy tính và tổng hợp hình ảnh trên arXiv và các địa điểm liên quan trong khoảng bảy năm, trên các kênh khác nhau – đủ lâu để phân biệt các mẫu lặp đi lặp lại và sự thay đổi trong xu hướng. Nhưng những quan sát này là giai thoại. Tôi thực sự ước tôi có thời gian để khai thác các tập dữ liệu khổng lồ đang phát triển của dòng xuất bản Arxiv, điều chắc chắn giàu những hiểu biết ẩn, bằng cách sử dụng phân tích học máy. Nhưng hiện tại, tôi chỉ có thể báo cáo một cách không chính thức những gì đã thu hút sự chú ý của tôi từ khi tôi xem xét vấn đề này lần cuối.
Khối lượng ở mức 11
Nhiều xu hướng trong việc gửi bài nghiên cứu AI mà tôi quan sát được vào năm 2024 đã thiết lập mình như những yếu tố cố định vào năm 2025; không kém phần quan trọng là sự gia tăng không ngừng và liên tục về khối lượng của các bài báo liên quan đến AI, được thúc đẩy bởi AI, đến mức một cuộc khủng hoảng được nhận thức:

Số lượng bài nộp khoa học máy tính Arxiv hàng tháng, từ tháng 10 năm 2023 đến tháng 11 năm 2025, với trung bình lũy kế 3 tháng chồng lên. Nguồn
Tốc độ tăng trưởng này được đặc trưng là sự tăng gấp đôi theo cấp số nhân về khối lượng của các bài nộp nghiên cứu AI, vài năm trước, và nó đã chỉ chiếm lĩnh sâu sắc hơn khi sự ra đời gần đây của cuộc sốt đầu tư AI đã nâng cao các ставки, cũng như số tiền tài trợ có sẵn cho nghiên cứu liên quan đến AI.
Thống kê đầy đủ cho năm 2025 chưa có sẵn, và thống kê tổng hợp được hiển thị ở trên đại diện cho số lượng tăng trên tất cả các danh mục. Dưới đây chúng ta có thể thấy rằng khoa học máy tính tiếp tục theo xu hướng thống trị, đáng kể cao hơn so với các đồng nghiệp của nó:

Tăng trưởng số lượng bài nộp khoa học máy tính từ năm 2022 đến năm 2025. Nguồn
Sắp xếp lúa mì
Vào tháng 10, bắt đầu mùa hội nghị thu, luôn mang lại một lượng lớn nghiên cứu mới, đã mang lại thay vào đó một lượng bài nộp với mức độ DOS, tạo thêm động lực và sự cấp thiết cho sợi nghiên cứu phân tích xu hướng nghiên cứu trước đây chưa được đăng ký; nói cách khác, các bài báo và kho lưu trữ đang xuất hiện ngày càng nhiều, tự bản thân chúng nhằm mục đích cắt giảm tỷ lệ tín hiệu trên nhiễu trong cảnh quan nghiên cứu.
Mới nhất chỉ vào tuần trước, dưới dạng NoveltyRank, một bài báo và kho lưu trữ GitHub điều chỉnh các LLM như Qwen3-4B-Instruct-2507 và SciBERT để chúng có thể thực hiện phân loại nhị phân của các bài báo được gửi (dự đoán ‘tính mới’ từ các bài nộp trước), hoặc so sánh tính mới từng cặp (so sánh các bài nộp hiện tại về ‘tính mới’):

Hệ thống NoveltyRank so sánh tiêu đề và tóm tắt của một bài nộp với các bài nộp trước tương tự, tóm tắt sự khác biệt bằng cách sử dụng LLM và chuyển nó đến mô hình Qwen3-4B được điều chỉnh tinh vi để quyết định xem công việc có được coi là ‘mới về mặt khái niệm’. Nguồn
Vấn đề với những cách tiếp cận ‘rây’ như vậy là thách thức của định nghĩa các biến có ý nghĩa. Cách tiếp cận NoveltyRank sử dụng việc chấp nhận của một bài báo vào hội nghị như một chỉ số của tính mới, và – có lẽ khá khinh thường – sử dụng việc xuất bản Arxiv như một chỉ số cơ bản của tiêu cực tính mới.
Giả định này dựa trên hai tiền đề sai lầm: trước hết, rằng tất cả các bài nộp được chấp nhận vào hội nghị đều mới hoặc có ý nghĩa; và thứ hai, rằng tính mới bản thân nó có giá trị không điều kiện. Bất kỳ ai đã lãng phí nửa giờ trên một số bài báo sai lầm, thậm chí là hài hước, được gửi – có thể chỉ để duy trì ‘quota xuất bản hoặc bị sa thải’, sẽ biết rằng tính mới thường là thứ yếu, và công việc tăng dần thường rất quan trọng.
Hiểu được giá trị của một bài báo mới liên quan đến một lĩnh vực mà AI hiện tại rất yếu – ngữ cảnh dài hạn. Vì cách các bài báo thường được viết một cách không trung thực, các bài báo dường như phá vỡ ranh giới có thể thường được tiết lộ là những bước tiến nhỏ trên công việc hiện có; tuy nhiên, các hệ thống tự động sẽ phải phát triển một ‘trực giác’ cho những trường hợp như vậy, mà không cờ bạc nhiều tín hiệu giả, và không dựa vào sự trung thực của các tác giả gửi.
Đầu tư đạo đức
Như tôi đã quan sát trước đó, các cổng thông tin như Arxiv khá kháng với việc cào dữ liệu laissez faire, và các dump dữ liệu mà chúng cung cấp thường thiếu chi tiết hạt nhân.
Do đó, ngay cả khi tôi có tài nguyên và thời gian để tải xuống và trích xuất các tính năng từ một phần đại diện đủ của các bài báo khoa học máy tính, nhiều xu hướng tinh tế hơn sẽ không được nhắm mục tiêu hoặc phân tích.
Một trong những xu hướng này là sự hiện diện hoặc vắng mặt của codicils tuyên bố đạo đức; lâu là một bản включ bắt buộc cho các khoa học sinh học liên quan đến thí nghiệm trên động vật, năm 2024 đã chứng kiến cực điểm của xu hướng hướng tới đặc điểm đạo đức của một công việc được đề xuất, vào cuối các bài báo được gửi trong danh mục Khoa học máy tính.
Theo cách nói chuyện, tôi nói rằng thực tiễn này đã giảm mạnh trong suốt năm 2025. Dự đoán của tôi là rằng những nỗ lực phi điều tiết mạnh mẽ của chính phủ hiện tại, liên quan đến sự phát triển của AI, đã mang lại cho cộng đồng nghiên cứu cả ở Hoa Kỳ và nước ngoài, một sự cấp phép và bảo vệ ngầm từ sự phơi nhiễm pháp lý.
Mặc dù hỗ trợ của nó cho quy định chống lại deepfake, chính quyền hiện tại của Hoa Kỳ đã thực sự khôi phục lại nhiều quan điểm ‘phương tây hoang dã’ đã đặc trưng cho giai đoạn 2021-23 – mặc dù bối cảnh nghiên cứu thuần túy đã định nghĩa nó đã tiến hóa thành mức đầu tư lịch sử.
Bài báo video tạo sinh như ‘bùn AI’
Với việc ra mắt Hunyuan Video và WAN loạt video tạo sinh vào mùa đông trước, video AI đã được hoàn toàn chuyển đổi vào năm 2025. Các chướng ngại vật cũ như khó khăn trong việc tạo ra các đại diện toàn thân, hoặc đạt được các góc nhìn đáng tin cậy của một người, dường như đã bị quét sạch chỉ trong một đêm.
Các bản phát hành bao gồm trọng lượng từ loại này từ Trung Quốc đã, có thể lập luận, đặt tốc độ cho các bản phát hành video tạo sinh này năm, và là một áp lực phản công đối với xu hướng của các kiến trúc video AI phương Tây để được kiểm duyệt, thương mại hóa trước và quy định nhiều hơn.
Sự vắng mặt của một hào trong cảnh này dân chủ CCCP dẫn đầu đã dẫn đến hàng trăm, nếu không phải hàng nghìn công ty tìm cách khai thác thị trường mới cho suy luận bằng cách cung cấp các cổng thông tin thân thiện với người dùng, với các diễn viên đa dạng như civit.ai và RunPod lợi nhuận từ các thủ tục và công nghệ mà trong nhiều trường hợp có thể được chạy trên máy tính gia đình.
Nói chung, những sáng kiến này là những vụ cướp ngắn hạn mong đợi bị chiếm đoạt bởi sự hợp nhất thị trường cuối cùng (mặc dù, không nghi ngờ, những người sáng lập của họ sẽ không phản đối việc vô tình va vào một cổ phần thị trường thống trị, nếu điều đó xảy ra).
Cùng một sự tầm thường và sao chép đã tấn công dòng video tạo sinh trong các bài nộp Arxiv vào năm 2025. Như tôi quan sát tuần trước, tỷ lệ tín hiệu trên nhiễu cho danh mục này đã đạt đến đỉnh cao gây tê liệt, khi các nhà nghiên cứu cạnh tranh công khai cho số lượng lớn tiềm năng mà những đột phá năm nay chắc chắn đã phát hành.
Được nói, hầu hết các bài nộp thuộc loại này chỉ là những bước tiến nhỏ. Các vấn đề cốt lõi còn lại trong AI tạo sinh đã không xuất hiện nhiều trong năm nay: nhu cầu duy trì bản sắc, theo kiểu LoRA, trong suốt một đại diện nhân vật; nhu cầu về thời gian chạy dài hơn cho video đầu ra, với sự nhất quán tổng thể (tức là môi trường và chủ đề, v.v., không chỉ ID) được duy trì; và để cải thiện tạo sinh âm thanh và xử lý trong các kiến trúc video tạo sinh và chỉnh sửa video; trong số những người khác.
Cơn sốt lưới giảm dần
Tôi quan sát thấy năm ngoái rằng cảnh quan đang trải qua một sự gia tăng đáng chú ý trong các bài báo quảng bá các hệ thống tận dụng CGI truyền thống (tức là các đại diện dựa trên lưới như những gì quay trở lại những năm 1970), hoặc tích hợp nó vào các khung neural. Tôi đã quan sát thấy một sự suy giảm đáng kể về động lực hướng tới các giải pháp dựa trên lưới, đặc biệt là trong nửa cuối năm, trong năm 2025.
Nhiều giải pháp CGI tích hợp trong làn sóng giấy trước đó, đặc biệt là những giải pháp liên quan đến các mô hình ‘kiểm soát’ con người tham số như mô hình biến dạng 3D, có thể đã được thay thế bằng các khả năng mới của các khung tạo sinh dựa trên khuếch tán như Veo, Kling, Hunyuan và WAN, trong số nhiều người khác.
Đồng thời, các bài báo liên quan đến các phương pháp Gaussian Splat cũng dường như đã bị ảnh hưởng bởi sự đình trệ phát triển hoặc bị lu mờ bởi các hệ thống AI tạo sinh dựa trên khuếch tán của năm 2025; hoặc cả hai.
Một năm trước, tôi lưu ý rằng sự phấn khích ban đầu của GSplat, đã tạo ra một ấn tượng đáng chú ý vào cuối năm 2023, đã giảm xuống thành các dòng nghiên cứu hẹp hơn. Năm nay, tôi thấy một dòng các bài báo nhằm giải quyết các yêu cầu tài nguyên đáng kể của cách tiếp cận này, cùng với các vấn đề khác.
Mặc dù tôi sẽ mô tả Gaussian Splatting là ‘hiện đang bị đình trệ’, chúng ta nên nhớ rằng công nghệ này có từ đầu những năm 1990 và là một công nghệ tái sinh.
Một ngoại lệ đối với sự rút lui chung khỏi các phương pháp dựa trên lưới là một sự quan tâm rõ ràng đến việc tích hợp AI vào các khung hướng tới in 3D.
Giảm thiểu trong các bài nộp về bảo mật AI
Quan sát cuối cùng của tôi cho năm 2025 là danh mục ‘Bảo mật’ trong phần Khoa học máy tính tại Arxiv đã cho thấy một sự suy giảm đáng kể về tần suất và chất lượng vào năm 2025, và không dễ để đoán tại sao.
Trang Cryptography and Security có thể được cho là luôn là một nơi thứ yếu để đăng bài, vì dòng nghiên cứu này không thể đoán trước được bởi khu vực tư nhân sở hữu trí tuệ – rất ít trong số đó xuất hiện trong các tạp chí học thuật, và gần như không có gì được nhìn thấy trong các nền tảng miễn phí như Arxiv.
Ngoài ra, các bài nộp cho danh mục này tại Arxiv có số lượng ‘cạm bẫy’ cao hơn trung bình – những lời thừa nhận không được nhấn mạnh, thường được chôn trong những nơi không ngờ, làm giảm hoặc phủ nhận giá trị và tính mới của bài báo. Một ví dụ sẽ là một phương pháp xâm phạm bảo mật nhạy cảm có vẻ nhạy cảm, nhưng thực sự dựa trên một số khía cạnh ‘hộp trắng’ – tức là, quyền truy cập đặc biệt vào dữ liệu hoặc thủ tục, như một kẻ tấn công không thể có được.
Điều gì xảy ra vào năm 2026
Mặc dù truyền thông đang riff liên tục về cơn sốt AI như một sự lặp lại của sự sụp đổ dot.com vào đầu những năm 2000 (với một số không đồng ý), điều này thực sự dường như đại diện cho một loại an ninh giả. Về mặt cơ sở hạ tầng, đầu tư, văn hóa và nghiên cứu, không có thời điểm nào như thế này trong lịch sử loài người.
Vì vậy, thật khó để thấy xu hướng nghiên cứu sẽ đi theo hướng nào vào năm 2026, ngoại trừ việc – như thường lệ – một số nỗ lực dài hạn sẽ kết thúc giữa bây giờ và tháng 4, với một ‘dấu ấn’ của những ám ảnh và xu hướng của năm 2025 sẽ phân biệt chúng.
Một sự phát triển có thể giúp cuộc khủng hoảng về khối lượng bài nộp tại Arxiv và các cổng thông tin khác là một lệnh cấm hoặc kiểm tra các bài báo được tạo hoặc hỗ trợ bởi AI, như Arxiv gần đây đã thực hiện cho các bài đánh giá – tuy nhiên, mức độ tham gia của AI vào bất kỳ bài báo nào có thể chứng minh là khó lượng hóa, vì AI đã xâm nhập văn hóa nghiên cứu (và đánh giá đồng nghiệp) nhiều như nó đã xâm nhập vào các lĩnh vực khác – như một giọt ‘mực’ ảnh hưởng đến toàn bộ (curent) ly nước, chứ không phải thay đổi hoàn toàn môi trường.
Được xuất bản lần đầu vào thứ hai, ngày 22 tháng 12 năm 2025












