Gọi vốn

Công nghệ tự lái của Waymo trở nên thông minh hơn, nhận dạng hàng tỷ đối tượng nhờ Công cụ tìm kiếm nội dung

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Các phương tiện tự lái được phát triển bởi Waymo sử dụng các kỹ thuật tầm nhìn máy tính và trí tuệ nhân tạo để nhận thức môi trường xung quanh và đưa ra quyết định thời gian thực về cách phương tiện nên phản ứng và di chuyển. Khi các đối tượng được nhận thức bởi camera và cảm biến bên trong phương tiện, chúng được so sánh với một cơ sở dữ liệu lớn được biên soạn bởi Alphabet (GOOG ) (GOOGL ) để được nhận dạng.

Các tập dữ liệu lớn có tầm quan trọng đặc biệt đối với việc đào tạo phương tiện tự lái, vì chúng cho phép trí tuệ nhân tạo trong phương tiện trở nên tốt hơn và cải thiện hiệu suất. Tuy nhiên, các kỹ sư cần một cách nào đó để hiệu quả匹配 các mục trong tập dữ liệu với các truy vấn để họ có thể điều tra cách trí tuệ nhân tạo hoạt động trên các loại hình ảnh cụ thể. Để giải quyết vấn đề này, theo VentureBeat báo cáo, Waymo gần đây đã phát triển một công cụ gọi là “Công cụ tìm kiếm nội dung”, hoạt động tương tự như cách Google Tìm kiếm hình ảnh và Google Photos hoạt động. Các hệ thống này匹配 các truy vấn với nội dung ngữ nghĩa trong hình ảnh, tạo ra các biểu diễn của các đối tượng để việc tìm kiếm hình ảnh dựa trên các truy vấn ngôn ngữ tự nhiên trở nên dễ dàng hơn.

Trước khi có Công cụ tìm kiếm nội dung, nếu các nhà nghiên cứu của Waymo muốn lấy lại các mẫu cụ thể từ nhật ký, họ phải mô tả đối tượng bằng cách sử dụng các quy tắc. Các nhật ký của Waymo phải được tìm kiếm bằng các lệnh tìm kiếm đối tượng dựa trên các quy tắc, có nghĩa là chạy tìm kiếm đối tượng “dưới X chiều cao” hoặc đối tượng “di chuyển ở y dặm mỗi giờ”. Kết quả của các tìm kiếm dựa trên quy tắc này thường rất rộng và các nhà nghiên cứu sẽ phải tìm kiếm thủ công các kết quả trả về.

Công cụ tìm kiếm nội dung giải quyết vấn đề này bằng cách tạo ra các danh mục dữ liệu và thực hiện tìm kiếm tương tự trên các danh mục khác nhau để tìm ra các danh mục tương tự nhất khi được trình bày với một đối tượng. Nếu Công cụ tìm kiếm nội dung được trình bày với một xe tải hoặc cây, nó sẽ trả về các xe tải hoặc cây khác mà các phương tiện tự lái của Waymo đã gặp. Khi một phương tiện Waymo di chuyển xung quanh, nó ghi lại hình ảnh của các đối tượng xung quanh, sau đó lưu trữ các đối tượng này dưới dạng các biểu diễn toán học. Điều này có nghĩa là công cụ có thể so sánh giữa các danh mục đối tượng và xếp hạng các phản hồi dựa trên sự tương tự giữa các hình ảnh đối tượng được lưu trữ. Điều này tương tự như cách dịch vụ tìm kiếm tương tự dựa trên biểu diễn hoạt động bởi Google.

Các đối tượng mà các phương tiện của Waymo gặp phải có thể có nhiều hình dạng và kích thước khác nhau, nhưng tất cả chúng đều cần được cô lập thành các thành phần thiết yếu và phân loại để Công cụ tìm kiếm nội dung hoạt động. Để điều này xảy ra, Waymo sử dụng nhiều mô hình trí tuệ nhân tạo được đào tạo trên nhiều loại đối tượng khác nhau. Các mô hình khác nhau học cách nhận dạng nhiều loại đối tượng và chúng được hỗ trợ bởi Công cụ tìm kiếm nội dung, cho phép các mô hình hiểu liệu các mục thuộc một danh mục cụ thể có trong một hình ảnh nhất định hay không. Một mô hình nhận dạng ký tự quang học bổ sung được sử dụng cùng với mô hình chính, cho phép các phương tiện Waymo thêm thông tin nhận dạng bổ sung vào các đối tượng trong hình ảnh, dựa trên bất kỳ văn bản nào được tìm thấy trong hình ảnh. Ví dụ, một xe tải có biển hiệu sẽ có văn bản của biển hiệu được bao gồm trong mô tả Công cụ tìm kiếm nội dung của nó.

Nhờ các mô hình trên hoạt động cùng nhau, các nhà nghiên cứu và kỹ sư của Waymo có thể tìm kiếm các nhật ký dữ liệu hình ảnh cho các đối tượng rất cụ thể như các loài cây và loại xe cụ thể.

Theo Waymo, như được trích dẫn bởi VentureBeat:

“Với Công cụ tìm kiếm nội dung, chúng tôi có thể tự động chú thích … các đối tượng trong lịch sử lái xe của chúng tôi, điều này đã làm tăng tốc độ và chất lượng dữ liệu mà chúng tôi gửi để gắn nhãn. Khả năng tăng tốc gắn nhãn đã góp phần vào nhiều cải tiến trên toàn hệ thống, từ việc phát hiện xe buýt trường học với trẻ em sắp bước xuống vỉa hè hoặc người đi xe scooter điện đến một con mèo hoặc một con chó băng qua đường. Khi Waymo mở rộng sang nhiều thành phố hơn, chúng tôi sẽ tiếp tục gặp phải các đối tượng và tình huống mới.”

Đây không phải là lần đầu tiên Waymo sử dụng nhiều mô hình học máy để tăng cường độ tin cậy và chính xác của các phương tiện của họ. Waymo đã hợp tác với Alphabet/Google trong quá khứ, giúp phát triển một kỹ thuật trí tuệ nhân tạo cùng với DeepMind. Hệ thống trí tuệ nhân tạo này lấy cảm hứng từ sinh học tiến hóa. Ban đầu, nhiều mô hình học máy được tạo ra và sau khi chúng được đào tạo, các mô hình hoạt động kém sẽ bị loại bỏ và thay thế bằng các mô hình con. Kỹ thuật này được cho là đã giảm đáng kể các kết quả dương tính giả và cũng giảm đáng kể các tài nguyên tính toán và thời gian đào tạo cần thiết. https://venturebeat.com/2020/02/06/waymos-ai-content-search-tool-lets-engineers-find-objects-within-its-driving-records/

Blogger và lập trình viên với chuyên môn về Machine Learning Deep Learning topics. Daniel hy vọng giúp đỡ người khác sử dụng sức mạnh của AI cho lợi ích xã hội.