Grundlagen der KI
Was ist Computer Vision?
Was ist Computer Vision?
Computer-Vision-Algorithmen sind einer der transformierendsten und leistungsstÃĪrksten KI-Systeme der Welt. Computer-Vision-Systeme werden in autonomen Fahrzeugen, Roboter-Navigation, Gesichtserkennungssystemen und mehr eingesetzt. Was sind Computer-Vision-Algorithmen genau? Wie funktionieren sie? Um diese Fragen zu beantworten, werden wir uns mit der Theorie hinter Computer Vision, Computer-Vision-Algorithmen und Anwendungen fÞr Computer-Vision-Systeme auseinandersetzen.
Wie funktionieren Computer-Vision-Systeme?
Um Computer-Vision-Systeme vollstÃĪndig zu verstehen, sollten wir zunÃĪchst betrachten, wie Menschen Objekte erkennen. Die beste ErklÃĪrung, die die Neuropsychologie fÞr die Erkennung von Objekten bietet, ist ein Modell, das die anfÃĪngliche Phase der Objekterkennung als einen Prozess beschreibt, bei dem die grundlegenden Komponenten von Objekten, wie Form, Farbe und Tiefe, vom Gehirn interpretiert werden. Die Signale vom Auge, die ins Gehirn eintreten, werden analysiert, um die Kanten von Objekten zu erkennen und diese Kanten zu einer komplexeren Darstellung zu verbinden, die die Form des Objekts vervollstÃĪndigt.
Computer-Vision-Systeme funktionieren sehr ÃĪhnlich wie das menschliche Sehsystem, indem sie zunÃĪchst die Kanten von Objekten erkennen und diese Kanten dann zu einer Form verbinden. Der groÃe Unterschied besteht darin, dass Computer Bilder als Zahlen interpretieren, so dass ein Computer-Vision-System eine MÃķglichkeit benÃķtigt, die einzelnen Pixel, die das Bild ausmachen, zu interpretieren. Das Computer-Vision-System ordnet den Pixeln im Bild Werte zu und indem es die Differenz zwischen den Werten von einem Bereich von Pixeln und einem anderen Bereich von Pixeln untersucht, kann der Computer Kanten erkennen. Wenn beispielsweise das Bild in Frage grau ist, reichen die Werte von schwarz (dargestellt durch 0) bis weià (dargestellt durch 255). Eine plÃķtzliche Ãnderung des Wertebereichs von Pixeln in der NÃĪhe von anderen Pixeln zeigt eine Kante an.
Dieses grundlegende Prinzip der Vergleichung von Pixelwerten kann auch mit farbigen Bildern durchgefÞhrt werden, indem der Computer die Unterschiede zwischen den verschiedenen RGB-Farbkarten vergleicht. Jetzt, da wir wissen, wie ein Computer-Vision-System Pixelwerte analysiert, um ein Bild zu interpretieren, sollten wir uns die Architektur eines Computer-Vision-Systems ansehen.
Convolutional Neural Networks (CNNs)
Der primÃĪre Typ von KI, der in Computer-Vision-Aufgaben verwendet wird, basiert auf Convolutional Neural Networks. Was ist eine Konvolution genau?
Konvolutionen sind mathematische Prozesse, die das Netzwerk verwendet, um die Differenz zwischen Pixelwerten zu bestimmen. Wenn man sich ein Gitter von Pixelwerten vorstellt, kann man sich ein kleineres Gitter vorstellen, das Þber das Hauptgitter bewegt wird. Die Werte unter dem zweiten Gitter werden vom Netzwerk analysiert, so dass das Netzwerk nur eine Handvoll Pixel auf einmal untersucht. Dies wird oft als âsliding windowsâ-Technik bezeichnet. Die vom Netzwerk analysierten Werte werden zusammengefasst, was die KomplexitÃĪt des Bildes reduziert und es dem Netzwerk erleichtert, Muster zu erkennen.
Convolutional Neural Networks sind in zwei verschiedene Abschnitte unterteilt, den convolutionalen Abschnitt und den vollstÃĪndig verbundenen Abschnitt. Die convolutionalen Schichten des Netzwerks sind die Feature-Extractor, deren Aufgabe es ist, die Pixel innerhalb des Bildes zu analysieren und Darstellungen von ihnen zu erstellen, die die dicht verbundenen Schichten des neuronalen Netzwerks lernen kÃķnnen. Die convolutionalen Schichten beginnen damit, einfach die Pixel zu untersuchen und die niedrigen Features des Bildes wie Kanten zu extrahieren. SpÃĪtere convolutionale Schichten verbinden die Kanten zu komplexeren Formen. Am Ende sollte das Netzwerk hoffentlich eine Darstellung der Kanten und Details des Bildes haben, die es an die vollstÃĪndig verbundenen Schichten weitergeben kann.
Bildannotierung
Obwohl ein Convolutional Neural Network Muster aus Bildern selbst extrahieren kann, kann die Genauigkeit des Computer-Vision-Systems durch die Annotierung von Bildern erheblich verbessert werden. Bildannotierung ist der Prozess der HinzufÞgung von Metadaten zu einem Bild, die dem Klassifizierer helfen, wichtige Objekte im Bild zu erkennen. Die Verwendung von Bildannotierung ist wichtig, wenn Computer-Vision-Systeme sehr genau sein mÞssen, wie bei der Steuerung von autonomen Fahrzeugen oder Robotern.
Es gibt verschiedene MÃķglichkeiten, Bilder zu annotieren, um die Leistung eines Computer-Vision-Klassifizierers zu verbessern. Bildannotierung wird oft mit Begrenzungsboxen durchgefÞhrt, einer Box, die die Kanten des Zielobjekts umgibt und dem Computer sagt, seine Aufmerksamkeit innerhalb der Box zu fokussieren. Semantische Segmentierung ist eine andere Art von Bildannotierung, die durch die Zuweisung einer Bildklasse zu jedem Pixel in einem Bild funktioniert. Mit anderen Worten, jeder Pixel, der als âGrasâ oder âBÃĪumeâ betrachtet werden kÃķnnte, wird als zu diesen Klassen gehÃķrend markiert. Die Technik bietet pixelgenaue PrÃĪzision, aber die Erstellung von semantischen Segmentierungsannotierungen ist komplexer und zeitaufwÃĪndiger als die Erstellung einfacher Begrenzungsboxen. Es gibt auch andere Annotierungsmethoden wie Linien und Punkte.












