Mô hình và nền tảng AI

YOLOv7: Thuật Toán Phát Hiện Đối Tượng Tiên Tiến Nhất?

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Ngày 6 tháng 7 năm 2022 sẽ được ghi nhớ như một mốc lịch sử trong lĩnh vực trí tuệ nhân tạo vì đây là ngày YOLOv7 được phát hành. Kể từ khi ra mắt, YOLOv7 đã trở thành chủ đề nóng trong cộng đồng phát triển tầm nhìn máy tính, và vì những lý do chính đáng. YOLOv7 đã được coi là một cột mốc trong ngành phát hiện đối tượng.

Ngay sau khi bài báo YOLOv7 được xuất bản, nó đã trở thành mô hình phát hiện đối tượng thời gian thực nhanh nhất và chính xác nhất. Nhưng làm thế nào YOLOv7 vượt qua các phiên bản trước của nó? Điều gì làm cho YOLOv7 hiệu quả trong việc thực hiện các nhiệm vụ tầm nhìn máy tính?

Trong bài viết này, chúng tôi sẽ cố gắng phân tích mô hình YOLOv7 và cố gắng tìm câu trả lời cho lý do tại sao YOLOv7 đang trở thành tiêu chuẩn trong ngành. Nhưng trước khi chúng tôi có thể trả lời câu hỏi đó, chúng tôi cần phải xem xét lịch sử phát hiện đối tượng.

Phát Hiện Đối Tượng Là Gì?

Phát hiện đối tượng là một nhánh trong tầm nhìn máy tính giúp xác định và định vị các đối tượng trong một hình ảnh hoặc tệp video. Phát hiện đối tượng là nền tảng của nhiều ứng dụng bao gồm xe tự lái, giám sát được theo dõi và thậm chí là robot.

Mô hình phát hiện đối tượng có thể được phân loại thành hai loại khác nhau, phát hiện đối tượng một lần và phát hiện đối tượng nhiều lần.

Phát Hiện Đối Tượng Thời Gian Thực

Để hiểu rõ cách YOLOv7 hoạt động, điều quan trọng là phải hiểu mục tiêu chính của YOLOv7, đó là “Phát Hiện Đối Tượng Thời Gian Thực”。 Phát hiện đối tượng thời gian thực là một thành phần chính của tầm nhìn máy tính hiện đại. Các mô hình phát hiện đối tượng thời gian thực cố gắng xác định và định vị các đối tượng quan tâm trong thời gian thực. Các mô hình phát hiện đối tượng thời gian thực giúp các nhà phát triển theo dõi các đối tượng quan tâm trong một khung hình di chuyển như video hoặc đầu vào giám sát trực tiếp.

Các mô hình phát hiện đối tượng thời gian thực về cơ bản là một bước tiến so với các mô hình phát hiện hình ảnh thông thường. Trong khi mô hình trước được sử dụng để theo dõi các đối tượng trong tệp video, mô hình sau định vị và xác định các đối tượng trong một khung hình tĩnh như hình ảnh.

Do đó, các mô hình phát hiện đối tượng thời gian thực rất hiệu quả cho phân tích video, xe tự lái, đếm đối tượng, theo dõi nhiều đối tượng và nhiều hơn nữa.

YOLO Là Gì?

YOLO hay “Chỉ Nhìn Một Lần” là một họ các mô hình phát hiện đối tượng thời gian thực. Khái niệm YOLO được giới thiệu lần đầu tiên vào năm 2016 bởi Joseph Redmon và nó đã trở thành chủ đề nóng gần như ngay lập tức vì nó nhanh hơn và chính xác hơn các thuật toán phát hiện đối tượng hiện có. Không lâu sau đó, thuật toán YOLO đã trở thành tiêu chuẩn trong ngành tầm nhìn máy tính.

Khái niệm cơ bản mà thuật toán YOLO đề xuất là sử dụng một mạng nơ-ron từ đầu đến cuối bằng cách sử dụng các hộp giới hạn và xác suất lớp để đưa ra dự đoán trong thời gian thực. YOLO khác với các mô hình phát hiện đối tượng trước đó ở chỗ nó đề xuất một cách tiếp cận khác để thực hiện phát hiện đối tượng bằng cách tái sử dụng các bộ phân loại.

Thay đổi cách tiếp cận đã hoạt động vì YOLO sớm trở thành tiêu chuẩn trong ngành khi khoảng cách hiệu suất giữa nó và các thuật toán phát hiện đối tượng thời gian thực khác là đáng kể. Nhưng tại sao YOLO lại hiệu quả?

Khi so sánh với YOLO, các thuật toán phát hiện đối tượng trước đó sử dụng Mạng Đề Xuất Vùng để phát hiện các vùng quan tâm có thể. Quá trình nhận dạng sau đó được thực hiện trên mỗi vùng riêng biệt. Kết quả là các mô hình này thường thực hiện nhiều lần lặp trên cùng một hình ảnh và do đó thiếu độ chính xác và thời gian thực hiện cao hơn. Mặt khác, thuật toán YOLO sử dụng một lớp hoàn toàn kết nối để thực hiện dự đoán một lần.

YOLO Hoạt Động Như Thế Nào?

Có ba bước giải thích cách thuật toán YOLO hoạt động.

Định Hình Lại Phát Hiện Đối Tượng Là Một Vấn Đề Hồi Quy Đơn

Thuật toán YOLO cố gắng định hình lại phát hiện đối tượng như một vấn đề hồi quy đơn, bao gồm cả pixel hình ảnh, xác suất lớp và tọa độ hộp giới hạn. Do đó, thuật toán chỉ cần nhìn vào hình ảnh một lần để dự đoán và định vị các đối tượng mục tiêu trong hình ảnh.

Lý Do Hình Ảnh Toàn Cầu

Hơn nữa, khi thuật toán YOLO đưa ra dự đoán, nó lý do hình ảnh toàn cầu. Nó khác với các kỹ thuật dựa trên đề xuất vùng và trượt vì thuật toán YOLO nhìn thấy toàn bộ hình ảnh trong quá trình đào tạo và kiểm tra trên tập dữ liệu và có thể mã hóa thông tin ngữ cảnh về các lớp và cách chúng xuất hiện.

Trước YOLO, Fast R-CNN là một trong những thuật toán phát hiện đối tượng phổ biến nhất không thể nhìn thấy ngữ cảnh lớn hơn trong hình ảnh vì nó sử dụng để nhầm lẫn các bản vá nền trong hình ảnh cho một đối tượng. Khi so sánh với thuật toán Fast R-CNN, YOLO chính xác hơn 50% khi nói đến lỗi nền.

Tổng Quan Hóa Đại Diện Của Đối Tượng

Cuối cùng, thuật toán YOLO cũng nhằm mục đích tổng quan hóa đại diện của các đối tượng trong hình ảnh. Kết quả là khi một thuật toán YOLO được chạy trên một tập dữ liệu với hình ảnh tự nhiên và được kiểm tra cho kết quả, YOLO vượt trội so với các mô hình R-CNN hiện có với một khoảng cách rộng.

YOLOv7: Điều Mới Là Gì?

Bây giờ chúng ta đã có kiến thức cơ bản về các mô hình phát hiện đối tượng thời gian thực và thuật toán YOLO, đã đến lúc thảo luận về thuật toán YOLOv7.

Tối Ưu Hóa Quá Trình Đào Tạo

Thuật toán YOLOv7 không chỉ cố gắng tối ưu hóa kiến trúc mô hình mà còn nhằm mục đích tối ưu hóa quá trình đào tạo. Nó nhằm mục đích sử dụng các mô듈 và phương pháp tối ưu hóa để cải thiện độ chính xác của phát hiện đối tượng, tăng cường chi phí đào tạo trong khi duy trì chi phí can thiệp.

Gán Nhãn Hướng Dẫn Từ Thô Đến Tinh

Thuật toán YOLOv7 dự định sử dụng một gán nhãn hướng dẫn từ thô đến tinh mới thay vì gán nhãn động thông thường.

Định Hình Lại Mô Hình

Định hình lại mô hình là một khái niệm quan trọng trong phát hiện đối tượng và việc sử dụng nó thường đi kèm với một số vấn đề trong quá trình đào tạo.

Kéo Dài Và Tăng Cường Quy Mô

Thuật toán YOLOv7 cũng giới thiệu các phương pháp kéo dài và tăng cường quy mô để tận dụng và sử dụng hiệu quả các tham số và tính toán cho phát hiện đối tượng thời gian thực.

YOLOv7: Các Công Việc Liên Quan

Phát Hiện Đối Tượng Thời Gian Thực

YOLO hiện là tiêu chuẩn trong ngành và hầu hết các bộ phát hiện đối tượng thời gian thực đều triển khai các thuật toán YOLO và FCOS.

  • Kiến trúc mạng mạnh mẽ và nhanh hơn.
  • Phương pháp tích hợp tính năng hiệu quả.
  • Phương pháp phát hiện đối tượng chính xác.
  • Hàm mất mát mạnh mẽ.
  • Phương pháp gán nhãn hiệu quả.
  • Phương pháp đào tạo hiệu quả.

Thuật toán YOLOv7 không sử dụng học tự giám sát và phương pháp chưng cất thường yêu cầu大量 dữ liệu.

Định Hình Lại Mô Hình

Kỹ thuật định hình lại mô hình được coi là một kỹ thuật tổng hợp hợp nhất nhiều mô-đun tính toán trong một giai đoạn can thiệp.

Kéo Dài Mô Hình

Kéo dài mô hình là quá trình kéo dài hoặc thu nhỏ một mô hình hiện có để phù hợp với các thiết bị tính toán khác nhau.

Kiến Trúc YOLOv7

Mô hình YOLOv7 sử dụng các mô hình YOLOv4, YOLO-R và YOLOv4 đã缩放 làm cơ sở.

Mạng Lưới Hiệu Suất Kéo Dài Hoặc E-ELAN

E-ELAN là khối xây dựng cơ bản của mô hình YOLOv7 và nó được dẫn xuất từ các mô hình hiện có về hiệu suất mạng.

Kéo Dài Mô Hình Cho Các Mô Hình Dựa Trên Nối

Kéo dài mô hình giúp điều chỉnh các thuộc tính của mô hình để tạo ra các mô hình theo yêu cầu và quy mô khác nhau để đáp ứng các tốc độ can thiệp khác nhau.

Túi Mở Rộng Có Thể Đào Tạo

Túi mở rộng là một tập hợp các phương pháp hoặc kỹ thuật có thể thay đổi chiến lược đào tạo hoặc chi phí để tăng độ chính xác của mô hình.

Định Hình Lại Lại Lọc Theo Kế Hoạch

Thuật toán YOLOv7 sử dụng các đường dẫn truyền播 gradient để xác định cách kết hợp lý tưởng một mạng với định hình lại lọc.

Thô Cho Trợ Lý Và Tinh Cho Mất Mát

Giám sát sâu là một nhánh trong khoa học máy tính thường tìm thấy ứng dụng của nó trong quá trình đào tạo mạng sâu.

Trợ Lý Đầu Hướng Dẫn Gán Nhãn

Chiến lược này thực hiện các tính toán dựa trên kết quả dự đoán của đầu dẫn và sự thật nền, sau đó sử dụng tối ưu hóa để tạo ra các nhãn mềm.

Thô Đến Tinh Đầu Hướng Dẫn Gán Nhãn

Chiến lược này cũng thực hiện các tính toán dựa trên kết quả dự đoán của đầu dẫn và sự thật nền, sau đó sử dụng tối ưu hóa để tạo ra các nhãn mềm.

Các Túi Mở Rộng Có Thể Đào Tạo Khác

Ngoài những cái đã đề cập ở trên, thuật toán YOLOv7 sử dụng các túi mở rộng có thể đào tạo khác, mặc dù chúng không được đề xuất ban đầu bởi chúng.

  • Chuẩn Hóa Batch Trong Công Nghệ Conv-Bn-Hoạt Hóa: Chiến lược này được sử dụng để kết nối trực tiếp một lớp lọc với lớp chuẩn hóa batch.
  • Tri Thức Ngầm Trong YOLOR: Thuật toán YOLOv7 kết hợp chiến lược này với bản đồ tính năng convolutional.
  • Mô Hình EMA: Mô hình EMA được sử dụng như một mô hình tham chiếu cuối cùng trong YOLOv7, mặc dù việc sử dụng chính của nó là để được sử dụng trong phương pháp giáo viên trung bình.

YOLOv7: Thử Nghiệm

Cài Đặt Thử Nghiệm

Thuật toán YOLOv7 sử dụng tập dữ liệu Microsoft COCO để đào tạo và xác thực mô hình phát hiện đối tượng của nó.

So Sánh Với Các Mô Hình Phát Hiện Đối Tượng Tiên Tiến

Hình ảnh trên cho thấy kết quả khi YOLOv7 được so sánh với các mô hình phát hiện đối tượng tiên tiến cho các GPU di động và chung.

Phân Tích Ablation: Phương Pháp Kéo Dài Hợp Chất Đề Xuất

Hình ảnh trên cho thấy kết quả của việc sử dụng các chiến lược khác nhau để tăng quy mô mô hình.

Mô Hình Định Hình Lại Lại Kế Hoạch Đề Xuất

Để xác minh tính tổng quát của mô hình định hình lại lại được đề xuất, thuật toán YOLOv7 sử dụng nó trên các mô hình dựa trên dư và dựa trên nối để xác minh.

Thất Loss Trợ Lý Cho Đầu Trợ Lý

Đối với thất loss trợ lý cho đầu trợ lý, mô hình YOLOv7 so sánh gán nhãn độc lập cho đầu trợ lý và đầu dẫn.

Kết Quả YOLOv7

Dựa trên các thử nghiệm trên, đây là kết quả của hiệu suất YOLOv7 khi so sánh với các thuật toán phát hiện đối tượng khác.

Hình ảnh trên cho thấy mô hình YOLOv7 so sánh với các thuật toán phát hiện đối tượng khác và có thể quan sát thấy rằng YOLOv7 vượt trội so với các mô hình phát hiện đối tượng khác về Độ Chính Xác Trung Bình (AP) v/s can thiệp batch.

Hơn nữa, hình ảnh dưới đây cho thấy hiệu suất của YOLOv7 so với các thuật toán phát hiện đối tượng thời gian thực khác.

Dưới đây là một số quan sát thêm từ kết quả và hiệu suất của YOLOv7.

  1. YOLOv7-Tiny là mô hình nhỏ nhất trong gia đình YOLO, với hơn 6 triệu tham số. YOLOv7-Tiny có độ chính xác trung bình là 35,2% và nó vượt trội so với mô hình YOLOv4-Tiny với số tham số tương đương.
  2. Mô hình YOLOv7 có hơn 37 triệu tham số và nó vượt trội so với các mô hình có số tham số cao hơn như YOLov4.
  3. Mô hình YOLOv7 có độ chính xác trung bình và tốc độ khung hình cao nhất trong phạm vi từ 5 đến 160 khung hình/giây.

Kết Luận

YOLO hay “Chỉ Nhìn Một Lần” là mô hình phát hiện đối tượng tiên tiến nhất trong tầm nhìn máy tính hiện đại. Thuật toán YOLO được biết đến với độ chính xác cao và hiệu quả, và do đó, nó tìm thấy ứng dụng rộng rãi trong ngành phát hiện đối tượng thời gian thực. Kể từ khi thuật toán YOLO đầu tiên được giới thiệu vào năm 2016, các thử nghiệm đã cho phép các nhà phát triển cải thiện mô hình liên tục.

Mô hình YOLOv7 là phiên bản mới nhất trong gia đình YOLO và nó là thuật toán YOLO mạnh nhất cho đến nay. Trong bài viết này, chúng tôi đã thảo luận về các nguyên tắc cơ bản của YOLOv7 và cố gắng giải thích tại sao YOLOv7 lại hiệu quả.

Kunal Kejriwal là một kỹ sư backend chuyên về Python, PostgreSQL, Redis và hạ tầng đám mây trên GCP và AWS. Với ba năm kinh nghiệm trong việc xây dựng và mở rộng các hệ thống sản xuất, anh viết về cơ sở hạ tầng AI, các hệ thống phân tán và kiến trúc triển khai các khối tải học máy.