Góc nhìn Anderson
Cài đặt Gói Python như một Chỉ số của Việc Áp dụng Trí tuệ Nhân tạo Địa phương

Sự gia tăng khó lượng hóa của việc tải xuống gói Python kể câu chuyện về sự lan tỏa của trí tuệ nhân tạo, nếu bạn biết nơi để tìm.
Ý kiến Bất kỳ ai đã khám phá tiềm năng của trí tuệ nhân tạo địa phương sẽ mất một lượng không gian đĩa đáng sợ không chỉ vì các mô hình khổng lồ liên quan, mà còn vì các hệ thống Python và tương tự khác điều khiển suy luận, đào tạo và hàng trăm ứng dụng tiềm năng khác – không ít nhất, trong việc tạo ra các hệ thống tự động hóa địa phương.
Trường hợp sử dụng cuối cùng này là phổ biến nhất trên các máy khác nhau trong mạng LAN của tôi, nơi tôi đã sử dụng trí tuệ nhân tạo để thiết lập các quy trình tự động hóa dựa trên Python, chẳng hạn như sao lưu, kiểm tra định kỳ, quản lý trang web của tôi và hàng chục ứng dụng khác.
Practically mọi thứ tôi muốn đạt được trong các phiên mã này dường như yêu cầu một thư viện Python mới, đến mức PIP (trình cài đặt gói Python) là một trong những phần mềm chiếm nhiều không gian nhất trên các máy LAN của tôi:
Sự hiện diện khiêm tốn của PIP trong CLI và GUI không phản ánh tác động của nó đến hệ thống tệp của bạn. Bộ nhớ đệm có thể đạt đến kích thước tệp cao, thậm chí là hệ thống.
Thử nghiệm với trí tuệ nhân tạo địa phương đảo ngược sự dư thừa đáng kể của máy tính địa phương trước đây, trước khi có sự khan hiếm RAM trong kỷ nguyên hiện tại. Nếu bạn có một khoản RAM hào phóng, nó sẽ bị chiếm dụng trong GPU offloading; một terabyte không gian đĩa cứng, tương tự, sẽ nhanh chóng bị lấp đầy với các mô hình có khối lượng lớn, quantized hoặc không; và ngay cả khi, như tôi đã làm, bạn đã trang bị cho mình 24GB VRAM (một mức tối thiểu mới..?), hệ thống vẫn sẽ cần một loạt các捷径 và thủ thuật để chạy suy luận trong khoảng thời gian hợp lý.
Các gói PyPi đã cài đặt không hiển thị trong các chương trình cài đặt tiêu chuẩn trong GUI của hệ điều hành chính thống và cần phải được yêu cầu rõ ràng, thông qua Python, ví dụ như lệnh PowerShell pip freeze --all.
Danh sách có thể khá dài:
| Gói | Phiên bản | Gói | Phiên bản | Gói | Phiên bản |
|---|---|---|---|---|---|
| absl-py | 2.3.0 | Jinja2 | 3.1.4 | pip | 25.1.1 |
| attrs | 25.3.0 | jsonpatch | 1.33 | platformdirs | 4.3.8 |
| beets | 2.5.1 | jsonpointer | 3.0.0 | protobuf | 4.25.8 |
| certifi | 2025.11.12 | kiwisolver | 1.4.8 | psutil | 7.2.1 |
| cffi | 1.17.1 | lap | 0.5.12 | pybrisque | 1.0 |
| charset-normalizer | 3.4.4 | lazy_loader | 0.4 | pycparser | 2.22 |
| click | 8.2.1 | libsvm | 3.23.0.4 | pyparsing | 3.2.3 |
| colorama | 0.4.6 | Markdown | 3.8.2 | python-dateutil | 2.9.0.post0 |
| confuse | 2.1.0 | MarkupSafe | 2.1.5 | PyYAML | 6.0.2 |
| contourpy | 1.3.2 | matplotlib | 3.10.3 | pyyaml_env_tag | 1.1 |
| cycler | 0.12.1 | mediafile | 0.13.0 | requests | 2.32.5 |
| dlib | 20.0.0 | mediapipe | 0.10.21 | scikit-image | 0.25.2 |
| face-recognition | 1.3.0 | mergedeep | 1.3.4 | scipy | 1.16.0 |
| face_recognition_models | 0.3.0 | mkdocs | 1.6.1 | sentencepiece | 0.2.0 |
| filelock | 3.13.1 | mkdocs-get-deps | 0.2.0 | setuptools | 65.5.0 |
| filetype | 1.2.0 | ml_dtypes | 0.5.1 | six | 1.17.0 |
| flatbuffers | 25.2.10 | mpmath | 1.3.0 | sounddevice | 0.5.2 |
| fonttools | 4.58.4 | musicbrainzngs | 0.7.1 | sympy | 1.13.1 |
| fsspec | 2024.6.1 | mutagen | 1.47.0 | tifffile | 2025.6.11 |
| ghp-import | 2.1.0 | networkx | 3.3 | torch | 2.5.1+cu118 |
| idna | 3.11 | numpy | 2.1.2 | torchvision | 0.20.1+cu118 |
| image-quality | 1.2.7 | opencv-contrib-python | 4.11.0.86 | tqdm | 4.67.1 |
| imageio | 2.37.0 | opencv-python | 4.11.0.86 | typing_extensions | 4.12.2 |
| internetarchive | 5.7.1 | opt_einsum | 3.4.0 | Unidecode | 1.4.0 |
| jax | 0.6.2 | packaging | 25.0 | urllib3 | 2.6.2 |
| jaxlib | 0.6.2 | pathspec | 0.12.1 | watchdog | 6.0.0 |
| jellyfish | 1.2.1 | pillow | 11.0.0 |
Một bản dump của các cài đặt PyPi trên một trong những máy bận rộn của tôi. Một số từ nhỏ này ẩn chứa hàng gigabyte không gian đĩa – đặc biệt là bất cứ thứ gì liên quan đến Torch/PyTorch.
Tóm lại, trí tuệ nhân tạo địa phương có thể đưa trải nghiệm máy tính của bạn trở lại những năm 1990, chỉ hơi quá thời kỳ mà một chương trình như Word phải được tải vào vài KB RAM, một đĩa mềm lớn tại một thời điểm; nhưng trước khi phân bổ đĩa cứng cho bạn không gian để thở.
Tìm kiếm Dòng chảy ngầm
Tôi tò mò về việc liệu sự gia tăng cài đặt PyPi trong những năm qua có thể phục vụ như một chỉ số cho việc áp dụng trí tuệ nhân tạo địa phương, điều này nói chung là khá khó để theo dõi, ngoại trừ trực giác khi tham gia vào các cộng đồng trí tuệ nhân tạo và lưu ý đến các nền tảng và gói nào đang nhận được sự chú ý.
Một cái nhìn thoáng qua trang web PyPi stats cho thấy một phạm vi ngày tháng khá hẹp, tất cả đều chỉ ra sự tăng trưởng liên tục trong tải xuống:
Sự gia tăng tải xuống trên tất cả các gói Python kể từ đầu năm 2026 – mặc dù phạm vi ngày tháng có sẵn rất hẹp. Nguồn
Nó sẽ rất tuyệt nếu có thể mở rộng phạm vi ngày tháng này đến năm 2020 và xem liệu sự gia tăng vẫn còn không, hoặc (như một người có thể nghi ngờ), tăng mạnh hơn vào năm 2024-26 – nếu chỉ vì các hành động không được giám sát của các hệ thống trí tuệ nhân tạo.
Thật không may, các nguồn chính thức của PyPi cho biết rằng thống kê tải xuống PyPi không được cung cấp, vì các lý do bao gồm chi phí bộ nhớ đệm CDN, số lượng tải xuống không chính xác do bộ nhớ đệm, gương, lạm phát tải xuống không chính thức và vấn đề chất lượng dữ liệu lịch sử – và theo trang web Python, sự hữu ích hạn chế của chúng như một thước đo chất lượng của một gói.
Không quá nhanh
Tuy nhiên, PyPi cung cấp các thành phần cần thiết cho người khác để phân tích xu hướng tải xuống; do đó, có nhiều trang web cho phép phạm vi ngày tháng lớn hơn, chẳng hạn như PepySite – nhưng hầu hết đều yêu cầu đăng ký và bạn phải trả tiền để xem các xu hướng và thống kê dài hạn (lên đến $490 USD mỗi tháng trong một trường hợp, cho gói ‘VC’).
Liệu có điều gì mà chúng ta có thể suy ra, thì, về Python như một chỉ số của sự tăng tốc trí tuệ nhân tạo, cách xa các API tốn kém mà trình bày các xu hướng này cho những người có điều kiện?
Mặc dù PyPiStats là một nguồn FOSS, nhưng vì một lý do nào đó, nó chỉ cung cấp thống kê của tháng trước, và phạm vi này không thể được mở rộng ngay cả khi bạn trả tiền.
May mắn thay, một trang web khác khá hào phóng – tại ClickPy, bạn có thể ít nhất tìm kiếm lịch sử áp dụng của các gói riêng lẻ, ngay cả khi tổng của chúng không được sắp xếp thành một cái nhìn tổng quan dễ dàng cho các xu hướng phối hợp.
Ví dụ, đây là quá trình của thư viện Transformers kể từ năm 2016 (mặc dù chỉ hợp lệ kể từ khi ra mắt vào năm 2019):
Sự gia tăng của transformers. Nguồn
Về Torch, được phát hành lần đầu tiên vào năm 2002, nhưng không được định sẵn để làm phiền những người đam mê trí tuệ nhân tạo cho đến khi nó được phát triển thành PyTorch, và sự gia tăng của các mô hình VLM và trí tuệ nhân tạo tạo ra dựa trên hình ảnh và video..?
Torch tải xuống kể từ năm 2017, với một sự tăng mạnh lên trong 2-3 năm qua.
PyTorch trong cùng kỳ, đạt đỉnh và sau đó tăng vọt đôi khi trên một cơ sở ổn định.
Đầu ra thú vị hơn, ví dụ, trong trường hợp của PyTorch (xem hình ảnh trực tiếp trên), là cái nhìn tổng quan về việc áp dụng trên các phiên bản Python khác nhau kể từ năm 2017:

Tải xuống PyTorch theo thời gian kể từ năm 2017, theo phiên bản Python, cung cấp một chiều kích thước bổ sung về sự hấp thụ kể từ thời kỳ "nóng" của cuộc cách mạng trí tuệ nhân tạo thứ ba.
Nếu các thống kê trên cho thấy sự gia tăng trong việc tiêu thụ gói, điều này trở nên rõ ràng hơn khi xem xét theo hệ thống:

Áp dụng PyTorch kể từ năm 2017, được giải thích bởi hệ điều hành.
Nó là một câu chuyện tương tự cho gói accelerate – một trong những thư viện được yêu cầu nhiều nhất cho người dùng trí tuệ nhân tạo bị hạn chế VRAM, những người đang tìm cách tận dụng tối đa hạn chế của hệ thống:

Sự gia tăng của accelerate, theo hệ điều hành.
Vậy nó đi cho bất kỳ số lượng gói hoặc thư viện nào bạn nghiên cứu tại ClickPy, và nó chắc chắn sẽ rất thú vị khi tạo ra một cái nhìn tổng quan thay vì tìm kiếm từng mảnh một.
Một điều trở nên rõ ràng từ các biểu đồ "theo hệ điều hành" là sự gia tăng việc áp dụng Linux. Trong khi việc áp dụng Linux trên máy tính để bàn đang tăng dần, trong sự đối mặt với các chiến lược Windows không phổ biến, việc sử dụng môi trường Linux rõ ràng đang trong một sự tăng trưởng đáng kể.
Ví dụ, tôi chạy Ubuntu ảo hóa trên WSL2 trong Windows cho các container Docker khác nhau, trong đó Docker có thể tận dụng một hệ thống Linux thực sự trên cùng một điều khoản như các nhà phát triển (được cho là) Linux bản địa đã hình dung. Đó là hai hệ thống Linux hoạt động trong một mạng LAN hoàn toàn của Windows (từ góc độ của phần cứng trần), với một máy tính xách tay Linux bản địa đang chờ trong cánh để dành cho những thời gian悠閒 hơn.
Kết luận
Về việc tải xuống gói dựa trên CLI, thật thú vị khi lưu ý về mức độ phổ biến và theo đuổi của không gian này đã trở nên như thế nào trong sự thức dậy của trí tuệ nhân tạo.
Sự gia tăng tiêu thụ gói đang bắt đầu trở thành một mối nguy hiểm về bảo mật, với sự ra đời của slopsquatting. Vì các mô hình ngôn ngữ lớn dễ bị ảo giác, chúng có thể gửi yêu cầu cho các gói không tồn tại. Do sự hội tụ tương tự, các gói giả mạo có thể tái xuất hiện trong các cuộc gọi thư viện khác, đến mức nó đáng để các tác nhân xấu thực sự tạo ra các gói giả cho các lần kéo/cuộc gọi trong tương lai – tất nhiên, với một payload độc hại:
Từ bài báo 'Chúng tôi có một gói cho bạn! Phân tích toàn diện về ảo giác gói bởi các mô hình ngôn ngữ lớn tạo mã' – Sự tạo mã được thúc đẩy bởi AI đang mở rộng bề mặt tấn công của chuỗi cung ứng. Các mô hình ngôn ngữ lớn thường ảo giác các tên gói không tồn tại, tạo ra các lỗ hổng "slopsquatting" mà các tác nhân xấu khai thác khi các đường ống tự động kéo các phụ thuộc không được xác minh. Nguồn
Được xuất bản lần đầu vào thứ Sáu, ngày 24 tháng 7 năm 2026












