Mô hình và nền tảng AI

Intel Labs Phát Triển Tầm Nhìn Máy Tính với Hai Mô Hình Trí Tuệ Nhân Tạo Mới

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

VI-Depth 1.0 và MiDaS 3.1 là các mô hình trí tuệ nhân tạo mã nguồn mở cải thiện ước tính độ sâu cho tầm nhìn máy tính.

Ước tính độ sâu là một nhiệm vụ tầm nhìn máy tính đầy thách thức cần thiết để tạo ra nhiều ứng dụng trong lĩnh vực robot, thực tế ảo tăng cường (AR) và thực tế ảo (VR). Các giải pháp hiện có thường gặp khó khăn trong việc ước tính khoảng cách một cách chính xác, điều này là một khía cạnh quan trọng trong việc giúp lập kế hoạch chuyển động và tránh chướng ngại vật khi nói đến điều hướng thị giác. Các nhà nghiên cứu tại Intel (INTC ) Labs đang giải quyết vấn đề này bằng cách phát hành hai mô hình trí tuệ nhân tạo cho ước tính độ sâu đơnocular: một cho ước tính độ sâu thị giác-vận động và một cho ước tính độ sâu tương đối mạnh mẽ (RDE).

Mô hình RDE mới nhất, MiDaS phiên bản 3.1, dự đoán độ sâu tương đối mạnh mẽ chỉ bằng cách sử dụng một hình ảnh duy nhất làm đầu vào. Nhờ được đào tạo trên một tập dữ liệu lớn và đa dạng, nó có thể hoạt động hiệu quả trên nhiều nhiệm vụ và môi trường khác nhau. Phiên bản mới nhất của MiDaS cải thiện độ chính xác của mô hình cho RDE khoảng 30% với tập dữ liệu đào tạo lớn hơn và các backbone mã hóa được cập nhật.

MiDaS đã được tích hợp vào nhiều dự án, đáng chú ý nhất là Stable Diffusion 2.0, nơi nó cho phép tính năng độ sâu-hình ảnh suy luận độ sâu của hình ảnh đầu vào và sau đó tạo ra hình ảnh mới bằng cách sử dụng cả thông tin văn bản và độ sâu. Ví dụ, nhà sáng tạo kỹ thuật số Scottie Fox đã sử dụng sự kết hợp của Stable Diffusion và MiDaS để tạo ra một môi trường thực tế ảo 360 độ. Công nghệ này có thể dẫn đến các ứng dụng ảo mới, bao gồm cả việc tái tạo hiện trường tội phạm cho các vụ án, môi trường trị liệu cho chăm sóc sức khỏe và trải nghiệm chơi game nhập vai.

Mặc dù RDE có tính tổng quát hóa tốt và hữu ích, nhưng sự thiếu hụt quy mô làm giảm tính hữu dụng của nó cho các nhiệm vụ hạ nguồn yêu cầu độ sâu đo lường, chẳng hạn như lập bản đồ, lập kế hoạch, điều hướng, nhận dạng đối tượng, xây dựng 3D và chỉnh sửa hình ảnh. Các nhà nghiên cứu tại Intel Labs đang giải quyết vấn đề này bằng cách phát hành VI-Depth, một mô hình trí tuệ nhân tạo khác cung cấp ước tính độ sâu chính xác.

VI-Depth là một đường ống ước tính độ sâu thị giác-vận động tích hợp ước tính độ sâu đơnocular và định vị vận động thị giác (VIO) để tạo ra ước tính độ sâu dày với quy mô đo lường. Cách tiếp cận này cung cấp ước tính độ sâu chính xác, có thể hỗ trợ trong việc tái tạo cảnh, lập bản đồ và điều khiển đối tượng.

Sự kết hợp dữ liệu quán tính có thể giúp giải quyết sự không rõ ràng về quy mô. Hầu hết các thiết bị di động đều chứa các đơn vị đo lường quán tính (IMU). Sự căn chỉnh toàn cầu xác định quy mô toàn cầu phù hợp, trong khi sự căn chỉnh quy mô dày (SML) hoạt động cục bộ và đẩy hoặc kéo các khu vực đến độ sâu đo lường chính xác. Mạng SML tận dụng MiDaS làm backbone mã hóa. Trong đường ống mô-đun, VI-Depth kết hợp ước tính độ sâu dựa trên dữ liệu với mô hình dự đoán độ sâu tương đối của MiDaS, cùng với đơn vị đo lường cảm biến IMU. Sự kết hợp của các nguồn dữ liệu cho phép VI-Depth tạo ra độ sâu đo lường dày đáng tin cậy cho mỗi pixel trong hình ảnh.

MiDaS 3.1VI-Depth 1.0 có sẵn theo giấy phép MIT mã nguồn mở trên GitHub.

Để biết thêm thông tin, vui lòng tham khảo “Vision Transformers for Dense Prediction” và “Towards Robust Monocular Depth Estimation: Mixing Datasets for Zero-shot Cross-dataset Transfer.”

Daniel là một người ủng hộ lớn về cách AI sẽ cuối cùng phá vỡ mọi thứ. Anh thở công nghệ và sống để thử các thiết bị mới.