Mô hình và nền tảng AI

Công nghệ Tự ghi nhãn tự động mới của Voxel51 hứa hẹn cắt giảm chi phí ghi nhãn lên đến 100.000 lần

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Một nghiên cứu đột phá mới từ công ty khởi nghiệp về tầm nhìn máy tính Voxel51 gợi ý rằng mô hình ghi nhãn dữ liệu truyền thống đang trên đà bị lật đổ. Trong nghiên cứu được công bố hôm nay, công ty báo cáo rằng hệ thống tự ghi nhãn tự động mới của họ đạt được độ chính xác lên đến 95% so với con người trong khi nhanh hơn 5.000 lần và tiết kiệm chi phí lên đến 100.000 lần so với ghi nhãn thủ công.

Nghiên cứu này đã đánh giá các mô hình nền tảng như YOLO-World và Grounding DINO trên các tập dữ liệu nổi tiếng bao gồm COCO, LVIS, BDD100K và VOC. Điều đáng chú ý là trong nhiều kịch bản thực tế, các mô hình được đào tạo độc quyền trên nhãn tự động có hiệu suất tương đương hoặc thậm chí tốt hơn so với những mô hình được đào tạo trên nhãn con người. Đối với các công ty xây dựng hệ thống tầm nhìn máy tính, những ý nghĩa này là rất lớn: hàng triệu đô la chi phí ghi nhãn có thể được tiết kiệm, và chu kỳ phát triển mô hình có thể được rút ngắn từ vài tuần xuống chỉ vài giờ.

Thời đại mới của Ghi nhãn: Từ lao động thủ công đến đường ống dẫn mô hình

Trong nhiều thập kỷ, việc ghi nhãn dữ liệu đã trở thành một nút thắt đau đớn trong việc phát triển trí tuệ nhân tạo. Từ ImageNet đến các tập dữ liệu xe tự lái, các đội đã dựa vào lực lượng lao động khổng lồ để vẽ các hộp giới hạn và phân đoạn đối tượng – một nỗ lực tốn kém và chậm chạp.

Luận lý thống trị đơn giản: nhiều dữ liệu được ghi nhãn bởi con người = trí tuệ nhân tạo tốt hơn. Nhưng nghiên cứu của Voxel51 đã lật ngược giả định này.

Phương pháp của họ tận dụng các mô hình nền tảng đã được đào tạo trước – một số có khả năng zero-shot – và tích hợp chúng vào một đường ống dẫn tự động hóa việc ghi nhãn thường xuyên trong khi sử dụng học chủ động để đánh dấu các trường hợp không chắc chắn hoặc phức tạp cho xem xét của con người. Phương pháp này giảm đáng kể cả thời gian và chi phí.

Trong một thử nghiệm, việc ghi nhãn 3,4 triệu đối tượng bằng GPU NVIDIA (NVDA ) L40S mất chỉ hơn một giờ và chi phí 1,18 đô la. Làm điều này thủ công với AWS SageMaker sẽ mất gần 7.000 giờ và chi phí hơn 124.000 đô la. Trong các trường hợp đặc biệt khó khăn – như xác định các loại hiếm trong các tập dữ liệu COCO hoặc LVIS – các mô hình tự ghi nhãn đôi khi có hiệu suất tốt hơn so với các mô hình được ghi nhãn bởi con người. Kết quả bất ngờ này có thể xuất phát từ các mẫu ghi nhãn nhất quán của các mô hình nền tảng và việc đào tạo chúng trên dữ liệu internet quy mô lớn.

Inside Voxel51: Đội ngũ định hình lại các quy trình làm việc trí tuệ nhân tạo về tầm nhìn

Được thành lập vào năm 2016 bởi Giáo sư Jason Corso và Brian Moore tại Đại học Michigan, Voxel51 ban đầu bắt đầu như một công ty tư vấn tập trung vào phân tích video. Corso, một chuyên gia về tầm nhìn máy tính và robot, đã xuất bản hơn 150 bài báo học thuật và đóng góp mã nguồn mở rộng cho cộng đồng trí tuệ nhân tạo. Moore, một cựu sinh viên tiến sĩ của Corso, hiện là CEO.

Điểm chuyển đổi đến khi đội nhận ra rằng hầu hết các nút thắt trong trí tuệ nhân tạo không nằm trong thiết kế mô hình – mà trong dữ liệu. Sự hiểu biết này đã truyền cảm hứng cho họ tạo ra FiftyOne, một nền tảng được thiết kế để trao quyền cho các kỹ sư khám phá, thu thập và tối ưu hóa các tập dữ liệu trực quan một cách hiệu quả hơn.

Trong những năm qua, công ty đã huy động được hơn 45 triệu đô la, bao gồm 12,5 triệu đô la trong vòng Series A và 30 triệu đô la trong vòng Series B do Bessemer Venture Partners dẫn đầu. Việc áp dụng trong các doanh nghiệp lớn đã theo sau, với các khách hàng lớn như LG Electronics, Bosch, Berkshire Grey (BGRY ), Precision Planting và RIOS tích hợp các công cụ của Voxel51 vào các quy trình làm việc trí tuệ nhân tạo sản xuất của họ.

Từ Công cụ đến Nền tảng: Vai trò mở rộng của FiftyOne

FiftyOne đã phát triển từ một công cụ trực quan hóa tập dữ liệu đơn giản thành một nền tảng trí tuệ nhân tạo toàn diện, tập trung vào dữ liệu. Nó hỗ trợ nhiều định dạng và lược đồ ghi nhãn – COCO, Pascal VOC, LVIS, BDD100K, Open Images – và tích hợp liền mạch với các framework như TensorFlow và PyTorch.

Ngoài việc là một công cụ trực quan hóa, FiftyOne cho phép các hoạt động nâng cao: tìm kiếm hình ảnh trùng lặp, xác định mẫu bị ghi nhãn sai, hiển thị các điểm ngoại lệ và đo lường các chế độ thất bại của mô hình. Hệ sinh thái plugin của nó hỗ trợ các mô-đun tùy chỉnh cho nhận dạng ký tự quang học, video Q&A và phân tích dựa trên nhúng.

Phiên bản doanh nghiệp, FiftyOne Teams, giới thiệu các tính năng hợp tác như kiểm soát phiên bản, quyền truy cập và tích hợp với lưu trữ đám mây (ví dụ: S3), cũng như các công cụ ghi nhãn như Labelbox và CVAT. Đặc biệt, Voxel51 cũng đã hợp tác với V7 Labs để tối ưu hóa dòng chảy giữa việc thu thập tập dữ liệu và ghi nhãn thủ công.

Tái nghĩ về Ngành công nghiệp Ghi nhãn

Nghiên cứu về tự ghi nhãn của Voxel51 thách thức các giả định dướipin ngành công nghiệp ghi nhãn gần 1 tỷ đô la. Trong các quy trình làm việc truyền thống, mỗi hình ảnh phải được chạm vào bởi con người – một quá trình tốn kém và thường trùng lặp. Voxel51 lập luận rằng hầu hết lao động này có thể bị loại bỏ.

Với hệ thống của họ, đa số hình ảnh được ghi nhãn bởi trí tuệ nhân tạo, trong khi chỉ các trường hợp ngoại lệ được chuyển lên con người. Chiến lược kết hợp này không chỉ cắt giảm chi phí mà còn đảm bảo chất lượng dữ liệu tổng thể cao hơn, vì nỗ lực của con người được dành cho các ghi nhãn khó khăn hoặc có giá trị nhất.

Sự thay đổi này song song với các xu hướng rộng lớn hơn trong lĩnh vực trí tuệ nhân tạo hướng tới trí tuệ nhân tạo tập trung vào dữ liệu – một phương pháp tập trung vào việc tối ưu hóa dữ liệu đào tạo thay vì điều chỉnh liên tục kiến trúc mô hình.

Cảnh quan Cạnh tranh và Tiếp nhận Ngành

Các nhà đầu tư như Bessemer xem Voxel51 như là “lớp điều phối dữ liệu” cho trí tuệ nhân tạo – tương tự như cách các công cụ DevOps đã biến đổi phát triển phần mềm. Công cụ mã nguồn mở của họ đã có hàng triệu lượt tải xuống, và cộng đồng của họ bao gồm hàng nghìn nhà phát triển và đội trí tuệ nhân tạo trên toàn thế giới.

Mặc dù các công ty khởi nghiệp khác như Snorkel AI, Roboflow và Activeloop cũng tập trung vào các quy trình làm việc dữ liệu, Voxel51 nổi bật với phạm vi, tư tưởng mã nguồn mở và cơ sở hạ tầng cấp doanh nghiệp. Thay vì cạnh tranh với các nhà cung cấp ghi nhãn, nền tảng của Voxel51 bổ sung cho họ – làm cho các dịch vụ hiện có trở nên hiệu quả hơn thông qua việc thu thập dữ liệu chọn lọc.

Ý nghĩa Tương lai

Các ý nghĩa lâu dài là sâu sắc. Nếu được áp dụng rộng rãi, phương pháp của Voxel51 có thể giảm đáng kể rào cản gia nhập lĩnh vực tầm nhìn máy tính, dân chủ hóa lĩnh vực này cho các công ty khởi nghiệp và nhà nghiên cứu thiếu ngân sách ghi nhãn lớn.

Beyond tiết kiệm chi phí, cách tiếp cận này cũng đặt nền tảng cho các hệ thống học liên tục, trong đó các mô hình trong sản xuất tự động đánh dấu các thất bại, sau đó được xem xét, ghi nhãn lại và折 lại vào dữ liệu đào tạo – tất cả trong cùng một đường ống dẫn được điều phối.

Tầm nhìn rộng lớn hơn của công ty phù hợp với cách trí tuệ nhân tạo đang phát triển: không chỉ là các mô hình thông minh hơn, mà còn là các quy trình làm việc thông minh hơn. Trong tầm nhìn đó, việc ghi nhãn không phải là đã chết – nhưng nó không còn là lĩnh vực của lao động cưỡng bức. Nó chiến lược, chọn lọc và được thúc đẩy bởi tự động hóa.

Antoine là một nhà lãnh đạo có tầm nhìn và là đối tác sáng lập của Unite.AI, được thúc đẩy bởi niềm đam mê không ngừng nghỉ để định hình và quảng bá tương lai của AI và robot. Là một doanh nhân hàng loạt, ông tin rằng AI sẽ gây ra sự gián đoạn cho xã hội giống như điện, và thường được bắt gặp khi nói về tiềm năng của các công nghệ phá vỡ và AGI.

Là một nhà tương lai học, ông dành để khám phá cách những đổi mới này sẽ định hình thế giới của chúng ta. Ngoài ra, ông là người sáng lập của Securities.io, một nền tảng tập trung vào đầu tư vào các công nghệ tiên tiến đang định nghĩa lại tương lai và thay đổi toàn bộ lĩnh vực.