Geht’s auch einfacher? Umformulieren mit KI beim Lesen und Schreiben

Vorwort

Es gibt schon viele KI-Tools für Einfache Sprache. Zumeist erfordern sie einen besonderen Zugang, verbunden mit Registrierung und oft auch Gebühren. Wie aber können wir Texte vereinfachen, die wir gerade lesen oder schreiben? Zum Beispiel auf ChatGPT oder auf einer Webseite von Behörden oder beim Arbeiten mit WORD?

In diesem Blog wollen wir zeigen, wie uns KI unmittelbar helfen kann, Texte zu vereinfachen. Dabei interessieren uns drei Aspekte:

  1. Mit welchen KI-gestützten Modellen können wir Texte vereinfachen? (> Überblick)
  2. Wie lösen wir das „Vereinfachen“ von Texten aus? Welche Prompts können uns dabei helfen? (> Test)
  3. Wie gut sind die Ergebnisse? Reichen „vereinfachte“ Texte an „Einfache Sprache“ heran? (> Vergleich)

Zunächst stellen wir die untersuchten KI-Modelle kurz vor. Anschließend testen wir automatische Befehle und eigene Prompts, die sich zum Vereinfachen von Texten eignen. Den besten Prompt nutzen wir danach, um die untersuchten KI-Modelle mit den erprobten KI-Tools für Einfache Sprache zu vergleichen. Abschließend bewerten wir die Leistung der KI beim Vereinfachen und fassen die Empfehlungen aus unserem Vergleich zusammen (> Fazit).

(1) Überblick der ausgewählten Modelle für das Vereinfachen

Für unsere Untersuchung haben wir KI-gestützte Modelle ausgewählt, die weit verbreitet und kostenlos (zumindest als Testversion) nutzbar sind.

Eines der Modelle bietet „Vereinfachen“ per Knopfdruck an: DeepL Write. Das ist ein KI-gestützter Schreibassistent, entwickelt vom deutschen Unternehmen DeepL SE. Man kann damit Texte korrigieren und stilistisch optimieren, unter anderem im Schreibstil „Vereinfachen“.
Interessant sind die vielfältigen Einsatzmöglichkeiten von DeepL Write. Das Programm ist nicht nur auf der Website von DeepL nutzbar. Es lässt sich auch als App in andere Text-Programme oder in Browser für beliebige Webseiten einbeziehen. So kann man zum Beispiel in einem Online-Text schwierige Stellen markieren und über ein Popup-Fenster die vereinfachte Version lesen.

Auch Schreibprogramme können umformulieren, vor allem mit KI-gestützter Textverarbeitung. Bei Microsoft WORD 365 enthält der Editor das Kriterium „Verständlichkeit“. Doch es lässt sich nicht aktiv auswählen. Stattdessen kann man das zugeschaltete KI-Modell Copilot nutzen, um eine markierte Textstelle verständlicher zu machen. Diese Aufforderung muss man aber selbst formulieren.
Wir haben ChatGPT nach einem Vorschlag gefragt, der zur „Verständlichkeit“ bei WORD 365 passt. Daraufhin haben wir folgende Aufforderung an Copilot genutzt: „Formuliere den markierten Text verständlicher. Verwende kurze, klare Sätze und einfache Wörter, ohne Informationen wegzulassen.“
Ähnlich funktioniert das Schreibprogramm Google Docs. Umformulieren kann man damit nur englischsprachige Texte. Als Assistenten verwendet Google Docs das KI-Modell Gemini, verfügbar für alle Sprachen. Zum „Vereinfachen“ einer markierten Textstelle muss man einen eigenen Prompt eingeben.

Auch außerhalb von Schreibprogrammen ermöglichen KI-Modelle wie Copilot und Gemini, Texte zu vereinfachen. Auf ChatGPT von Open AI (US) kann man in der kostenlosen Version „Schreiben oder Bearbeiten“ klicken. Darunter sind verschiedene Aufforderungen zu finden, die aber häufig wechseln. Hier ist eine Aufforderung, die dem „Vereinfachen“ sehr nahe kommt: „Formuliere den folgenden/markierten Text so um, dass er klarer, prägnanter und leichter lesbar wird.“

Andere KI-Modelle haben eine Chat-Funktion ohne Vorgaben, also nur für beliebige Aufforderungen. Wir müssen sie mit einem selbst formulierten Prompt zum Vereinfachen auffordern. Als Beispiele testen wir Claude von Anthropics (US) und Mistral Vibe vom französischen Unternehmen Mistral AI, beide in der kostenlosen Version.

Hier ist ein Überblick zu den getesteten Modellen:

Vereinfachen von Texten mit KI-gestützten Sprachmodellen

Modell: Typ und BeispieleVereinfachen von Texten
KI-gestützter Schreibassistent
> DeepL Write
Schreibstil > „Vereinfachen“
KI-gestütztes Schreibmodell
> Google Docs / Gemini
> Microsoft WORD 365 / Copilot
Prompt zum Vereinfachen einer Textstelle
KI-Modell
> ChatGPT
> Claude
> Mistral Vibe
Prompt zum Vereinfachen des Textes

(2) Test von Prompts für das Vereinfachen von Texten

Wir wollen herausfinden, mit welchen Aufforderungen (nachfolgend: Prompts) die gewählten KI-Modelle unsere Texte am besten vereinfachen. Es kommt darauf an, Prompts mit konkreten sprachlichen Anweisungen zu formulieren. Zugleich sollten diese Prompts kurz und einprägsam sein, denn sie lassen sich in einem kostenlosen KI-Modell nicht speichern und erneut abrufen.

Wir testen dazu die schon zitierten Prompts von ChatGPT und zwei eigene kurze Prompts.

Prompts zum Vereinfachen von Texten

Herkunft des PromptsWortlaut des Prompts
Prompt A:
Aufforderung auf ChatGPT unter „Schreiben oder Bearbeiten“
Formuliere den folgenden/markierten Text so um, dass er klarer, prägnanter und leichter lesbar wird.
Prompt B:
Vorschlag von ChatGPT für Aufforderung bei Microsoft WORD 365/Copilot (zur „Verständlichkeit“ von Texten)
Formuliere den folgenden/markierten Text verständlicher. Verwende kurze, klare Sätze und einfache Wörter, ohne Informationen wegzulassen.
Prompt C:
Unser Vorschlag 1 für einen „Kurzprompt“
Schreibe diesen Text klar und verständlich.
Prompt D:
Unser Vorschlag 2 für einen „Kurzprompt“
Schreibe diesen Text in Einfacher Sprache.

Für den Test dieser Prompts verwenden wir drei Ausgangstexte, die wir schon bei früheren Analysen (Blog Amtstexte) eingesetzt haben:

Die Tests zum Vergleich der Prompts führen wir in zwei Modellen aus: ChatGPT und Microsoft WORD 365/Copilot.

Wir testen, wie verständlich die Vereinfachungen sind, welches Sprachniveau sie erreichen und wie weit sie inhaltlich dem Ausgangstext entsprechen.

(2a) Verständlichkeit

Die Verständlichkeit messen wir mit dem Hohenheimer Verständlichkeitsindex (HIX) im TextLab. Der Index berücksichtigt hauptsächlich die Länge von Wörtern, Sätzen und Satzteilen. Er misst die Verständlichkeit von Texten auf der Skala von 0 bis 20. Je höher der erreichte Wert, desto leichter verständlich ist der Text. Ab HIX-Wert 10 ist ein Text verständlich; etwa ab HIX-Wert 16 beginnt die Einfache Sprache.

Wie die Grafik zeigt, erhöht sich die Verständlichkeit von Prompt A über Prompt B/C zu Prompt D. Der Kurzprompt „Schreibe diesen Text in Einfacher Sprache“ übertrifft deutlich die anderen Prompts. Er erreicht laut HIX bei beiden Modellen die Verständlichkeit der Einfachen Sprache. Dieser statistische Wert bezieht sich allerdings maßgeblich auf die Textstruktur, ohne die Verständlichkeit von Wörtern und Inhalten zu berücksichtigen.

(2b) Sprachniveau

Wir testen daher zusätzlich das Sprachniveau der Übersetzungen. Es bewertet außer der Textstruktur auch die Grammatik und den Anteil gebräuchlicher Wörter. Wir nutzen dafür die Niveaustufen, die in der Sprachanalyse von Wortliga angezeigt werden. Die Niveauskala basiert auf Kriterien des Gemeinsamen Europäischen Referenzrahmens für Sprachen (GER). Auf dieser Grundlage hat Uwe Roth in einem zurückliegenden Blog die Schwierigkeitsgrade des Textverständnisses zusammengestellt. Danach hat die Einfache Sprache ihren Schwerpunkt bei B1: mit Texten in gebräuchlicher Alltags- und Berufssprache.

Auch in diesem Vergleich hat der Kurzprompt „Schreibe diesen Text in Einfacher Sprache“ das beste Ergebnis. Mit der Niveaustufe B1 erreicht er das Zielniveau der Einfachen Sprache.

Insgesamt erhöht sich mit der Vereinfachung die Lesbarkeit von Texten. Das spiegelt sich auch in der Textgestaltung wider. Die Übersetzungen mit Prompt D für Einfache Sprache sind übersichtlicher strukturiert und deutlicher auf die Interessen der Leserschaft bezogen. Zwei Beispiele aus den getesteten Texten von ChatGPT sind in der folgenden Tabelle gegenübergestellt.

Ausschnitte der Übersetzung von ChatGPT

AusgangstextÜbersetzung mit Prompt AÜbersetzung mit Prompt D

Elektronischer Zugang
Die Stadt Aachen bietet die Möglichkeit zur elektronischen Kommunikation an.
[…]
Dabei bestehen unterschiedliche Möglichkeiten zur elektronischen Kommunikation mit der Stadtverwaltung. Hierzu gibt es diverse Vorgaben sowie Regelungen zu den möglichen Formaten und den technischen Standards.
Grundsätzlich wird zwischen einfachen formlosen Schreiben und formgebundenen Schreiben unterschieden, die in Papierform eine eigenhändige Unterschrift voraussetzen (zum Beispiel Widerspruch und viele Anträge).
Elektronischer Zugang zur Stadt Aachen
[…]
Je nach Art Ihres Anliegens stehen unterschiedliche Kommunikationswege zur Verfügung. Dabei sind bestimmte rechtliche, organisatorische und technische Vorgaben zu beachten. Insbesondere wird zwischen formfreier Kommunikation und formgebundener, rechtsverbindlicher Kommunikation unterschieden.



Elektronischer Kontakt mit der Stadt Aachen
[…]
Für den elektronischen Kontakt gibt es verschiedene Möglichkeiten. Je nach Anliegen gelten unterschiedliche Regeln.
Wichtig ist vor allem der Unterschied zwischen:
einfachen Nachrichten ohne Unterschrift
wichtigen Schreiben, für die eine Unterschrift vorgeschrieben ist


(2c) Inhaltliche Entsprechung

Erstmals mit diesem Blog testen wir auch die inhaltliche Entsprechung von Übersetzung und Ausgangstext. Wir haben die Messtools dafür in einem gesonderten Beitrag vorgestellt (Korrekt trotz Vereinfachung?). Für unseren Test nutzen wir den BERTScore, der Texte auf semantische Ähnlichkeit prüft (vgl. Artikel). Der BERTScore ermittelt, wie weit Inhalte übertragen und in veränderter Formulierung erhalten bleiben. Er berücksichtigt dabei die Einbettungen in Kontexte (contextual embeddings) aus vortrainierten BERT-Modellen, um Synonyme und Umschreibungen zu erkennen.
Werte nahe 1,0 deuten auf eine sehr hohe semantische Ähnlichkeit hin; Werte nahe 0 oder negativ zeigen eine niedrige oder sehr geringe Ähnlichkeit an. Eine genauere Unterteilung ist nicht vorgegeben. Nach Auskünften von ChatGPT und Gemini halten wir folgende Unterteilung der Indexwerte für sinnvoll: 1,00 bis 0,80 = hoch; 0,80 bis 0,70 = mittel; unter 0,70 = niedrig.

Zum Test der Übersetzungen von ChatGPT und WORD/Copilot haben wir ein multilinguales Modell von BERTScore (distilbert-base-multilingual-cased) verwendet und folgende Werte ermittelt:

Diese Grafik zeigt an, dass die inhaltliche Entsprechung zwischen Übersetzungen und Ausgangstext insgesamt hoch ist (Indexwert über 0,80). Dabei erreicht WORD/Copilot eine etwas höhere Entsprechung als ChatGPT. Doch es fällt auf, dass die Werte bei beiden Modellen von Prompt A bis Prompt D fallen. Die inhaltliche Entsprechung nimmt also ab und hat den geringsten Wert beim Kurzprompt für Einfache Sprache.

Dieses Ergebnis deutet auf einen wichtigen Aspekt der Vereinfachung: Je verständlicher ein Text formuliert wird, umso mehr kann er sich vom ursprünglichen Inhalt entfernen. Wichtig ist also eine Balance zwischen diesen beiden Tendenzen. Dafür bietet die Gegenüberstellung von HIX- und BERTScore-Werten einen nützlichen Anhaltspunkt. Entscheidend ist jedoch eine eingehende menschliche Überprüfung der Texte!

(3) Vergleich der Leistungen von KI-Modellen

Unser Test der Prompts hat ergeben, dass der kurze Prompt D („Schreibe diesen Text in Einfacher Sprache“) die verständlichsten Übersetzungen erzeugt. Allerdings ist die inhaltliche Entsprechung gegenüber dem Ausgangstext nicht so hoch wie bei den anderen Prompts. Doch andererseits sind die Übersetzungen mit Prompt D übersichtlicher strukturiert und klarer auf die Leserschaft ausgerichtet. Damit kommen sie dem Stil der Einfachen Sprache am nächsten.

Im folgenden Test nutzen wir Prompt D, um die Übersetzungen weiterer KI-Modelle miteinander zu vergleichen. Dazu gehören: das Schreibprogramm Google Docs/Gemini sowie die Sprachmodelle Claude und Mistral Vibe. Den Schreibassistenten DeepL Write (mit Knopfdruck „Vereinfachen“) beziehen wir ebenfalls in den Vergleich ein.

Überdies möchten wir herausfinden, ob die erzeugten Übersetzungen mit Prompt D an die Leistungen von K-Tools für Einfache Sprache heranreichen. Wir nutzen dazu die KI-Tools Bürgernah und Fair Text, die in unserer vorigen Analyse zu Amtstexten mit KI am besten abschnitten.

Wie im ersten Test prüfen wir alle Übersetzungen auf Verständlichkeit, Sprachniveau und inhaltliche Entsprechung.

(3a) Verständlichkeit

Hinsichtlich der Verständlichkeit liegen die KI-Tools Fair Text und Bürgernah im Mittelfeld. Unter den KI-Modellen erreicht DeepL Write nur annähernd den Indexbereich der Einfachen Sprache, während Claude deutlich an der Spitze steht. Insgesamt ergibt der Vergleich der HIX-Werte, dass sich der Kurzprompt D mit den speziellen Prompts der KI-Tools messen kann. Verglichen wird aber nur die Textstruktur, die für die Lesbarkeit relevant ist.

(3b) Sprachniveau

Zusätzlich prüfen wir daher das Sprachniveau, das auch Grammatik und Wortschatz berücksichtigt.

Die Stufen des Sprachniveaus sind ähnlich verteilt wie die HIX-Werte. Außer DeepL Write haben die Texte aller Modelle und Tools das Niveau B1, das für Einfache Sprache typisch ist. Das Modell Claude erreicht sogar das Niveau A2. Das sind beachtliche Ergebnisse. Doch welche Leserschaft passt zu diesen Texten?

Als Beispiel vergleichen wir die Übersetzungen von Fair Text und Claude mit dem Ausgangstext.

Übersetzung eines Textausschnitts durch Fair Text und Claude

Herkunft des TextesWortlaut des Textes
AusgangstextDer Wohnberechtigungsschein berechtigt zum Bezug einer geförderten Wohnung (Sozialwohnung). Es besteht kein Rechtsanspruch auf die Vermittlung einer entsprechenden Wohnung.
Bürgernah (Einfache Sprache)Mit einem Wohnberechtigungsschein dürfen Sie eine Sozialwohnung mieten. Es gibt aber keinen Anspruch darauf, dass Sie eine bestimmte Wohnung bekommen.
Claude (Prompt D)Was kann ich mit dem WBS machen?
Mit dem WBS dürfen Sie eine Sozial-Wohnung mieten. Aber Achtung: Niemand muss Ihnen eine Wohnung geben. Der WBS ist nur die Erlaubnis dafür.

Dieses Beispiel ist typisch für den Unterschied zwischen den KI-Tools (Bürgernah/ Fair Text) und den KI-Modellen (mit Prompt D):

  • Die beiden KI-Tools für Einfache Sprache sind so eingestellt, dass sie verständlich und zugleich exakt übersetzen sollen. Sie können auch dabei helfen, verständliche Mitteilungen von Behörden zu formulieren. Insofern entsprechen diese Tools den Vorgaben der DIN-ISO-Normen für Einfache Sprache (vgl. ABC der Einfachen Sprache).
  • Die KI-Modelle hingegen setzen den Kurzprompt für Einfache Sprache so um, wie es im allgemeinen Sprachgebrauch immer noch üblich ist: als leicht verständliche Texte, die für Menschen mit sprachlichen Schwierigkeiten geeignet sind und sich teilweise dicht an der Leichten Sprache bewegen. Das ist besonders deutlich bei Claude. Diesen „leichten“ Stil haben wir in dem vorangegangenen Blog Was ist leicht verständlich? genauer beschrieben.

(3c) Inhaltliche Entsprechung

Für beide Typen von Übersetzungen prüfen wir nun, wie weit sie dem Inhalt des Ausgangstextes entsprechen.

Bei der inhaltlichen Entsprechung kehrt sich das Bild um: Die Übersetzungen mit der geringeren Verständlichkeit (DeepL Write und WORD/Copilot) haben eine hohe Entsprechung, während die verständlichsten Übersetzungen (Claude und Google Docs/Gemini) eine geringere Entsprechung aufweisen. Den gleichen Befund hatten wir schon beim Vergleich der Prompts: Je mehr die KI die Texte vereinfacht, umso weiter können sie sich inhaltlich vom Ausgangstext entfernen.

Dieses Ergebnis ist zwar plausibel, aber es liefert nicht mehr als Messwerte. Offen bleibt die Frage, wie zuverlässig die Modelle und Tools den Ausgangstext tatsächlich übersetzt haben. Das kann man nur mit der „menschlichen“ Prüfung direkt am Text beantworten.
Wir haben dazu die wichtigen Informationen in den Ausgangstexten markiert und die Übersetzungen folgendermaßen geprüft:

  • Sind alle wichtigen Informationen in der Übersetzung enthalten?
  • Sind die betreffenden Informationen inhaltlich korrekt übersetzt?
  • Enthält die Übersetzung zusätzliche Informationen oder Bewertungen?

Unsere Prüfung der Übersetzungen hat ergeben: Einige Informationen fehlen, wenn der Inhalt zu stark gerafft wird. Andererseits werden keine Informationen hinzugefügt, abgesehen von Erläuterungen und gelegentlichen KI-Angeboten am Schluss. Die übersetzten Informationen sind inhaltlich weitgehend korrekt. Komplexe Informationen werden jedoch oft ungenau oder umständlich oder verkürzt übersetzt. Nützlich sind Übersetzungen, die eine Information auf praktisches Handeln beziehen – im Interesse der Leserschaft. Die folgende Übersicht stellt einige Übersetzungen vor.

Übersetzungen einer komplexen Information

QuelleInformationKommentar
Ausgangstext
Begrünung im Sinne dieser Satzung ist die Herstellung der Pflanzbereiche (ober- und unterirdisch) einschließlich der Bepflanzung.schwer verständlich (Nominalstil!)
Fair TextBegrünung bedeutet hier: Man legt Flächen mit Pflanzen an – sowohl oberirdisch (wie Gärten oder Rasen) als auch unterirdisch (z. B. Wurzelbereiche) – und bepflanzt sie.ausführlich erklärt (mit eingefügten Beispielen)
BürgernahMit „Begrünung“ ist das Anlegen von Pflanzflächen und das Bepflanzen gemeint.kurz erklärt
ChatGPTEs werden geeignete Flächen für Pflanzen geschaffen.
Dazu gehören die Bereiche über und unter der Erde.
Danach werden dort Pflanzen eingesetzt.
Aussage zerlegt: damit weniger zusammenhängend
Google Docs/Gemini
ODER
Mistral
Begrünung bedeutet: Man schafft Platz für Pflanzen (über und unter der Erde) und pflanzt sie dort ein.
ODER:
Begrünung bedeutet: Flächen für Pflanzen vorbereiten und Pflanzen setzen (auch unter der Erde).
in praktisches Handeln übertragen

Fazit

Vielen Menschen fällt es schwer, im Berufsleben oder im Alltag komplexe Texte zu verstehen. Sie können selten auf spezielle Tools zugreifen und besser mit ihren gewohnten Online-Programmen umgehen. In diesem Umfeld sind integrierte KI-Angebote zum Vereinfachen nützlich – als schnelle Hilfe beim Lesen und Schreiben.

Für diesen Zweck haben wir praktische Lösungen vorgestellt, um Texte zu vereinfachen:

  • Der Schreibassistent DeepL Write lässt sich kostenlos in Browser und Textprogramme integrieren. Auf Knopfdruck „Vereinfachen“ übersetzt er markierte Textstellen.
  • Häufig genutzte Schreibprogramme beziehen KI-Modelle ein, z.B. Microsoft WORD 365/ Copilot und Google Docs/ Gemini. Diese Modelle können mit einem Prompt markierte Textstellen vereinfachen.
  • Auch andere KI-Modelle, wie ChatGPT, Claude und Mistral Vibe, können vereinfachte Texte durch einen Prompt erzeugen.

Als Prompt für das schnelle Vereinfachen empfehlen wir: Schreibe diesen Text in Einfacher Sprache. In unserem Test kommt dieser Prompt der Einfachen Sprache am nächsten.

Die KI-Modelle erzeugen zumeist sehr einfach formulierte Übersetzungen. Diese sind nicht perfekt, aber zuverlässig genug, um den Ausgangstext verständlich zu machen. Wir sollten sie jedoch, wie alle KI-Texte, kritisch prüfen!

Sabine Manning

Dank:
Für Anregungen zu diesem Beitrag danke ich Bettina Mikhail und Uwe Roth vom Infoportal Einfache Sprache, Stephan Manning an der Universität Sussex, Kai Fedin von Fair Text (laizee.ai), Tobias Albers-Heinemann vom Zentrum Bildung und Gesellschaft EKHN, Erik Weckel von der Agentur Erwachsenen- und Weiterbildung Niedersachsen sowie Susanne Wagner und Oliver Zetsche vom Berufsbildungswerk Leipzig.

Bild: von Mohamed Hassan auf Pixabay

Hinweis:
Dieser Beitrag unterliegt der Creative Commons Lizenz. Das bedeutet, dass ihn Interessierte für nicht kommerzielle Zwecke weiterverwenden dürfen. Sie müssen dazu die Autorin und den Blog Multisprech (https://multisprech.org/) nennen und den Link angeben.

Hinterlasse einen Kommentar