Zurück zum Glossar

Investment Intelligence

ESG-Daten und KI: Beschaffung und Strukturierung für die Anlageanalyse

24.09.2026·4 Min Lesezeit·Fachlich geprüft von Frank Barthélemy

ESG-Daten sind Kennzahlen und Informationen zu Umwelt (Environmental), Sozialem (Social) und Unternehmensführung (Governance) eines Unternehmens. Für die Anlageanalyse müssen sie aus vielen Quellen beschafft und in ein einheitliches Format gebracht werden. KI hilft dabei, unstrukturierte Texte wie Nachhaltigkeitsberichte auszulesen, die Angaben zu normalisieren und mit Kennzeichnungen (Tags) zu versehen, sodass Analysten mit vergleichbaren Datensätzen arbeiten können. Die Bewertung dieser Daten und jede Anlageentscheidung bleiben beim Institut oder Berater.

ESG-Daten sind für die Anlageanalyse schwer zu handhaben, weil sie in unterschiedlichen Formaten vorliegen: als Fließtext in Geschäftsberichten, als Tabellen in Datenbanken, als Meldungen in Nachrichten oder Social Media. KI-gestützte Verfahren, vor allem aus dem Bereich der Sprachverarbeitung (Natural Language Processing, kurz NLP), setzen genau hier an. Dieser Artikel erklärt, wie Beschaffung und Strukturierung funktionieren und welche Grenzen dabei zu beachten sind.

Warum ESG-Daten schwer zu beschaffen sind

Ein großer Teil relevanter ESG-Angaben steht in unstrukturierten Dokumenten. Nachhaltigkeitsberichte und Geschäftsberichte sind oft sehr lang: Die Rohdaten solcher XHTML-Dokumente umfassen teils mehrere Millionen Zeichen Quelle. Für Sprachmodelle ist das ein Problem, weil ihr Eingabefenster nur eine begrenzte Menge Text (Token) auf einmal verarbeitet. Deshalb muss vorab herausgefiltert werden, welche Textstellen überhaupt relevant sind.

Hinzu kommt, dass es keinen einheitlichen Standard gibt, gegen den sich ESG-Angaben eindeutig prüfen ließen. Regelwerke beschreiben oft nur allgemein, was von Unternehmen erwartet wird. Fachlich definierte Kriterien können daher zwischen Bewertern variieren und Verzerrungen (Bias) enthalten. Algorithmen, die auf einer solchen Grundlage trainiert werden, übernehmen diese Grenzen Quelle. Das ist ein zentraler Grund, warum KI hier die Aufbereitung übernimmt, die Beurteilung aber nicht.

Wie KI ESG-Daten beschafft und strukturiert

Maschinelles Lernen kann ESG-Daten automatisch aus verschiedenen Quellen sammeln: aus internen Unterlagen, öffentlichen Veröffentlichungen, Drittanbieter-Datenbanken und unstrukturierten Quellen wie Nachrichten oder Social Media. Die Systeme normalisieren die Informationen und versehen sie mit Kennzeichnungen, sodass konsistente Datensätze entstehen. So lassen sich relevante Datenpunkte und Kennzahlen identifizieren, ohne jedes Dokument manuell durchzusehen Quelle.

Der Schritt von unstrukturiertem Text zu strukturierten Daten ist der Kern. NLP-basierte Extraktionsverfahren wandeln Sätze aus Nachhaltigkeitsberichten in standardisierte Metriken um. Ein Projekt beschreibt, wie damit Effizienz und Genauigkeit der Datenerfassung steigen und wie so umfangreiche Datensätze für die Anlageanalyse bereitgestellt werden können Quelle. Ein anderes Beispiel: Eine Plattform analysiert nach eigenen Angaben täglich über vier Millionen Datenquellen, erkennt darin tausende öffentliche und private Unternehmen samt ihrer Marken und Kennungen und macht aus unstrukturiertem Text strukturierte, weiterverarbeitbare Daten Quelle.

Technisch stützen sich solche Systeme auf Bausteine, die in unserem Lexikon näher beschrieben sind: Dokumente werden in Abschnitte zerlegt (siehe Chunking), damit passende Textstellen gezielt gefunden werden. Bei der Extraktion helfen strukturierte Ausgabeformate, etwa als JSON, damit die Ergebnisse maschinell weiterverarbeitbar sind (siehe Structured Output).

Alternative Datenquellen und ihre Rolle

Neben Berichten und Ratings gewinnen alternative Datenquellen an Bedeutung. Ratingagenturen integrieren zunehmend solche Datensätze und nutzen maschinelles Lernen, um flexiblere und aktuellere Informationen bereitzustellen. Ein Anbieter nutzt NLP, um verschiedene Quellen zu analysieren und ESG-Kennzahlen für mehr als 20.000 Unternehmen weltweit auf Basis von 150 ESG-Metriken abzuleiten Quelle. Ein weiteres Beispiel verbindet Klimawissenschaft und maschinelles Lernen, um Klimarisiken für Marktteilnehmer zu messen und zu beobachten Quelle.

Für die Praxis heißt das: Je breiter die Quellenlage, desto wichtiger wird die saubere Zusammenführung. Erst wenn Angaben aus Berichten, Datenbanken und Nachrichten auf gemeinsame Kennzahlen abgebildet sind, lassen sich Unternehmen sinnvoll nebeneinanderstellen. Diese Vergleichbarkeit ist die eigentliche Leistung der Strukturierung.

Grenzen und die Rolle des Menschen

KI liefert bei ESG-Daten die Vorarbeit, nicht das Urteil. Studien betonen, dass NLP eine unterstützende Rolle beim Auffinden kritischer Textstellen in Nachhaltigkeitsberichten spielt, die abschließende Prüfung aber Menschen erfordert Quelle. Fehlende Standards, mögliche Verzerrungen und die Gefahr, dass Sprachmodelle Angaben falsch zusammenfassen, machen eine Kontrolle notwendig.

Für scoreprise.AI ist das die klare Trennung im Bereich Investment Intelligence: Die KI stellt ESG-Daten zusammen und gewichtet sie nach den Vorgaben des Instituts, die Entscheidung trifft der Berater. Das entspricht dem gleichen Prinzip wie beim Portfolio-Monitoring mit KI: beobachten und aufbereiten statt bewerten und empfehlen. Damit die aufbereiteten Angaben nachvollziehbar bleiben, ist der Rückbezug auf die Originalquelle wichtig, ein Thema, das auch für die Vermeidung von KI-Halluzinationen zentral ist.

Häufige Fragen

Woher stammen die ESG-Daten, die KI verarbeitet?

ESG-Daten kommen aus mehreren Quellen: internen Unterlagen, öffentlichen Veröffentlichungen wie Geschäfts- und Nachhaltigkeitsberichten, Drittanbieter-Datenbanken und unstrukturierten Quellen wie Nachrichten oder Social Media. KI sammelt diese Angaben, normalisiert sie und versieht sie mit Kennzeichnungen, sodass ein einheitlicher Datensatz entsteht. Die Breite der Quellen ist wichtig, weil einzelne Berichte allein oft lückenhaft sind.

Warum reicht ein Sprachmodell nicht aus, um ganze Berichte auszulesen?

Nachhaltigkeitsberichte sind sehr lang, ihre Rohdaten umfassen teils mehrere Millionen Zeichen. Sprachmodelle können jedoch nur eine begrenzte Textmenge auf einmal verarbeiten. Deshalb werden Dokumente vorab in Abschnitte zerlegt und relevante Stellen herausgefiltert, bevor das Modell sie strukturiert weiterverarbeitet.

Kann KI bei ESG-Daten eine Anlageempfehlung geben?

Nein. KI bereitet ESG-Daten auf, sie extrahiert, normalisiert und stellt Kennzahlen zusammen. Die Bewertung dieser Daten und jede Anlageentscheidung liegen beim Institut oder Berater. Studien betonen, dass die abschließende Prüfung der aufbereiteten Angaben menschliche Fachkompetenz erfordert.

Welche Risiken gibt es bei KI-gestützter ESG-Datenverarbeitung?

Das Hauptrisiko liegt in fehlenden einheitlichen Standards und in möglichen Verzerrungen der zugrundeliegenden Kriterien. Algorithmen übernehmen die Grenzen der Daten, mit denen sie arbeiten. Zusätzlich können Sprachmodelle Angaben falsch zusammenfassen. Deshalb sind Quellennachweise und eine menschliche Kontrolle notwendig.

Quellen

  1. Quelle diva-portal.org
  2. Quelle digital-public-services-switzerland.ch
  3. Quelle dydon.ai
  4. Quelle sentic.net
  5. Quelle sesamm.com
  6. Quelle worldquant.com
  7. Quelle paragonintel.com

Dieser Text wurde KI-generiert und durch eine menschliche Person geprüft.