Vordenker

Mit künstlicher Intelligenz-gestütztem Scraping den Zugang zu öffentlichen Web-Daten demokratisieren

mm
Unite.AI zu deinen bevorzugten Quellen auf Google hinzufügen

KI-Tools sind bereits bei Fachleuten für das Scraping von öffentlichen Web-Daten ein wichtiger Bestandteil, da sie Zeit und Ressourcen sparen und die Leistung verbessern. Jetzt ermöglicht eine neue Generation von KI-gestützten Web-Scraping-Tools es immer mehr Nicht-Experten, von der Web-Intelligenz zu profitieren. Spieler unterschiedlicher Größe und Fachgebiete können mit weniger Ressourcen mehr erreichen, da KI den Prozess der Umwandlung öffentlich verfügbarer Informationen in wertvolle Erkenntnisse rationalisiert.

Öffentliche Web-Daten bieten eine Fülle von Chancen

Öffentliche Web-Daten sind eine wertvolle Ressource für Fachleute in einer breiten Palette von Branchen. Forscher können sie verwenden, um ihre Hypothesen zu testen, indem sie große Datensätze zu bestimmten Themen aufbauen. Journalisten können tiefe Untersuchungen zu aktuellen Themen durchführen.

Für Unternehmen hat die Web-Intelligenz eine Vielzahl von möglichen Anwendungen. Dazu gehören das Benchmarking der Wettbewerbsfähigkeit gegenüber dem Markt, das Testen neuer Geschäftsideen, die Bewertung und Optimierung von Produktangeboten sowie das Aufdecken von Cyber-Bedrohungen, um nur einige Beispiele zu nennen. Insbesondere im Zeitalter der generativen KI (Gen KI) können Unternehmen öffentliche Web-Daten für die Schulung von Machine-Learning-(ML)-Algorithmen nutzen, die für eine Vielzahl von analytischen und operativen Aufgaben eingesetzt werden können.

Es ist daher nicht verwunderlich, dass Investitionen in Daten und Analytics für Organisationen eine Priorität darstellen. In einer aktuellen Umfrage von Censuswide gaben 74 % der Fachleute an, dass der Bedarf an Zugang zu öffentlichen Web-Daten in ihren Unternehmen zunimmt.

Das Paradoxon der öffentlichen Daten: gleicher Zugang, ungleiche Chancen

Obwohl öffentliche Web-Daten theoretisch für jeden zugänglich sind, liegen die Vorteile in der Praxis oft jenseits der Reichweite der meisten Solo-Gründer und schlanken Unternehmen. Währenddessen setzen führende Unternehmen in verschiedenen Branchen auf Web-Scraping, einem Markt, der 2025 1,03 Milliarden Dollar wert sein wird. Der Grund für diese Ungleichheit bei gleichem Zugang liegt darin, dass die Sammlung von öffentlichen Web-Daten, insbesondere im großen Maßstab, schwierig ist.

Der Aufbau und die Wartung einer Pipeline für die Sammlung von öffentlichen Daten sind komplexe technische Aufgaben. Die notwendige Infrastruktur umfasst Software-Tools wie Web-Scraping- und Crawling-Tools sowie den Zugang zu einem großen Pool von Proxy-Servern. In Censuswides Umfrage unter Scraping-Experten nannten 61 % der Befragten den Aufbau der Infrastruktur als größte Herausforderung bei der Sammlung von großen Mengen an Web-Daten.

Sogar wenn die Infrastruktur vorhanden ist, ist eine kontinuierliche Wartung erforderlich. Traditionell folgen die Werkzeuge bei der Datenextraktion Anweisungen, die auf der Struktur der Website basieren. Allerdings ändert sich die Struktur einer Website oft, was den Scraping-Prozess zum Zusammenbruch bringen kann, bis die Pipeline entsprechend angepasst wird. Dies manuell durchzuführen ist zeitaufwändig und erfordert bestimmte technische Fähigkeiten.

Angesichts dieser Einschränkungen ist es nicht verwunderlich, dass gut ausgestattete Unternehmen traditionell die Nutznießer der öffentlichen Web-Daten waren. Kleine Unternehmen verfügten nicht über die notwendigen Ressourcen, und Nicht-Entwickler verfügten nicht über die erforderlichen technischen Fähigkeiten, obwohl viele Fachleute von einem einfachen und schnellen Zugang zu Web-Intelligenz profitieren würden.

KI-gestützte Lösungen schaffen Chancengleichheit

Obwohl öffentliche Web-Daten selbst eine öffentliche Ressource sind, die für jeden zugänglich ist, wirken sich Ungleichheiten in privaten Ressourcen und Fähigkeiten auf diejenigen aus, die tatsächlich davon profitieren können. Manchmal entstehen innovative Lösungen, um bestimmte Ungleichheiten zu verringern oder zu beseitigen. Im Web-Scraping ist dies durch KI-Fortschritte geschehen. Mit KI-Unterstützung ist die Extraktion von öffentlichen Daten aus dem Web einfacher, schneller und erschwinglicher für Solopreneure und Unternehmen aller Größen geworden.

Natürliche Sprachprompts verstehen

Tools für die Verarbeitung von natürlicher Sprache ermöglichen es Nicht-Entwicklern, Daten zu extrahieren, indem sie beschreiben, was sie wollen, in alltäglicher Sprache. Anstatt zu lernen, Code zu schreiben und Scraping-Pipelines aufzubauen, muss man jetzt nur noch die Grundlagen des Scraping verstehen, um diesen Tools Anweisungen zu geben.

Beispielsweise können Benutzer jetzt eine URL angeben und einen Prompt wie “alle Produktnamen in Kategorie X abrufen” eingeben, und das KI-Tool wird den Rest erledigen. Natürlich ist es bei komplexeren Aufgaben erforderlich, die richtigen Scraping-Parameter zu setzen und zu iterieren, um das gewünschte Ergebnis zu erzielen. Allerdings befinden wir uns noch in einer relativ frühen Phase, und KIs Fähigkeiten in diesem Bereich entwickeln sich weiter.

Emergierte Selbstheilungsfähigkeiten

KI kann auch die Leistung analysieren und verbessern, was es Fachleuten ermöglicht, weniger Zeit mit der Fehlersuche und der Korrektur von Pipelines zu verbringen. Zusätzlich ist weniger Aufsicht erforderlich für Junior-Entwickler oder Fachleute aus anderen Bereichen, die öffentliche Web-Daten nutzen möchten. Wenn sie auf ein Hindernis stoßen, müssen sie nicht unbedingt menschliche Unterstützung suchen. Das Tool kann versuchen, das Problem selbst zu beheben.

Beispielsweise kann das KI-gestützte Parsing-Tool die Parsing-Anweisungen neu schreiben, wenn die Scraping-Pipeline zusammenbricht, weil sich die Art und Weise, wie Informationen auf der Website angezeigt werden, ändert. Mit anderen Worten: Es kann sich an Änderungen in der Website-Struktur anpassen.

Browser-Agenten

Browser-Agenten sind im Begriff, die Art und Weise zu ändern, wie wir online auf Informationen zugreifen. Unternehmen entwickeln diese Agenten als Einkaufs-Assistenten, Buchungsmöglichkeiten und mehr. Sie können auch die Web-Intelligenz auf der Grundlage von öffentlichen Daten weiter verbreiten.

KI-gestützte Browser-Agenten navigieren auf Websites effektiver als Standard-Bots und zeigen mehr Daten an. Beispielsweise können Sie möglicherweise nur den Endpreis in einem Online-Shop sehen, nachdem er zum Warenkorb hinzugefügt wurde. KI-gestützte Tools können Aktionen wie diese ausführen und erhöhen, was ohne menschliche Aufsicht möglich ist.

Die Bedeutung des öffentlichen Zugangs zum öffentlichen Bereich

Bürger demokratischer Gesellschaften wissen nur allzu gut, dass das gleiche Recht auf öffentliche Ressourcen wichtig, aber nicht ausreichend ist. Wahre Demokratie entsteht aus der fairen Möglichkeit, diese Rechte zu nutzen.

Die Sammlung von öffentlichen Web-Daten mag wie ein Nischenbeispiel erscheinen, aber sie berührt viele Bereiche, die wir als wichtig für eine freie und blühende Gesellschaft erachten. KI-gestützte Tools, die die Kosten für den Zugang zu Web-Intelligenz senken, zeigen, wie viel sich mit besseren Mitteln zur Nutzung öffentlicher Ressourcen ändern kann.

In der Wirtschaft können ambitionierte Unternehmer mit begrenzten Mitteln ihre Ideen testen und Prototypen erstellen, um Investitionen anzuziehen. Damit wird das demokratische Versprechen, dass jeder durch harte Arbeit und Talent die gesellschaftliche Leiter hochklettern kann, ein wenig realer.

Währenddessen nutzen investigative Journalisten den Zugang zu öffentlichen Daten, um die Reichen und Mächtigen zur Rechenschaft zu ziehen. Während Geld und Einfluss mächtige Ressourcen sind, ist auch Information eine mächtige Ressource. Datenjournalisten haben wiederholt gezeigt, wie viel durch die Verfolgung von Spuren in Web-Daten aufgedeckt werden kann. KI-gestützte Tools ermöglichen es auch Reportern ohne technische Fähigkeiten, diesen Spuren zu folgen.

Ein weiterer Pfeiler der Demokratie, die freie und offene Wissenschaft, hängt von dem Zugang zu Ressourcen ab, die aus politischen oder finanziellen Gründen verweigert werden können. KI-Tools, die selbst ein Beweis für das sind, was die freie wissenschaftliche Forschung erreichen kann, helfen Forschern, Erkenntnisse aus dem größten Datensatz der Welt – dem Internet – zu gewinnen.

Weiter voranschreiten

KI-Tools sind natürlich keine Allheilmittel, die den demokratischen Zugang zu Daten vorantreiben, während wir voranschreiten. KI kann auch verwendet werden, um Fehlinformationen zu verbreiten und Fälschungen zu erstellen, die uns sogar an der Wahrheit zweifeln lassen.

Wenn wir diese Gefahren im Auge behalten, sollten wir nicht in einen technoapokalyptischen Pessimismus verfallen. Stattdessen können wir daran arbeiten, KI-Tools und öffentliche Daten noch gleichberechtigter zugänglich zu machen. Es bleibt noch viel zu tun. Das Erlernen der Verwendung der Tools, die wir bereits haben, ist eine Möglichkeit, es effektiver zu tun.

Julius Černiauskas ist Litauens Technologieindustrieführer und CEO von Oxylabs. Seit seinem Eintritt in das Unternehmen im Jahr 2015 hat Julius Černiauskas die nackte Geschäftsidee von Oxylabs erfolgreich in den Tech-Riesen verwandelt, der es heute ist, indem er sein tiefes Wissen über Big-Data- und Informationstechnologietrends eingesetzt hat.