Offene Sprach-KI: was in der Praxis bereits passiert ist und wie sie kein teures Spielzeug für Angreifer wird
Ein KI-Sprachberater auf der Website ist bequem: Der Besucher spricht direkt im Browser mit dem Unternehmen, statt eine Telefonnummer zu suchen. Doch eine offene Schaltfläche ist zugleich eine offene kostenpflichtige Ressource. Das Unternehmen bezahlt Spracherkennung, Sprachsynthese, die Arbeit des Modells und manchmal die Zeit eines Mitarbeiters. Wer die Schaltfläche aus Neugier oder in Schädigungsabsicht drückt, zahlt nichts.
Wir führen selbst einen Sprachagenten auf unserer Website ein. Deshalb halten wir es für richtig, die Grenzen dieser Technik nicht zu verschweigen und vorab zu erklären, welche Missbräuche in der Praxis bereits vorgekommen sind und welche Schutzmaßnahmen wir vor dem öffentlichen Start einbauen. Für uns ist Sprach-KI kein Experiment ohne Regeln, sondern ein öffentlicher Dienst, der in Befugnissen, Kosten und Datenverarbeitung begrenzt sein muss.
Was folgt, sind weder Schauergeschichten noch Werbung für Sicherheitsprodukte, sondern einige aufschlussreiche Fälle und die Schlüsse, die daraus folgen.
1. Der Bot, der über das eigene Unternehmen schimpfte
Im Januar 2024 brachte ein Nutzer den Chatbot des Zustelldienstes DPD dazu, zu fluchen und ein Gedicht zu schreiben, das das Unternehmen kritisierte. Die Aufzeichnung verbreitete sich schnell: Ein Beitrag kam binnen eines Tages auf rund 800 000 Aufrufe. DPD teilte mit, die betroffene KI-Funktion nach einem Systemupdate abgeschaltet zu haben. The Guardian, 20. Januar 2024.
Das war ein Text-Bot, kein Sprach-Bot. Für den Kunden macht das kaum einen Unterschied: Sagt ein Sprachagent etwas im Namen des Unternehmens, lässt sich die Aufnahme leicht zuschneiden, betiteln und veröffentlichen. Der Schutz besteht hier nicht aus einem „Zauberverbot im Prompt“, sondern aus einem begrenzten Themenumfang, dem Prüfen der Antworten auf Provokationen und einem schnellen Weg, eine fehlerhafte Version abzuschalten.
2. Ein Unternehmen haftete für die Worte seines Bots
Am 14. Februar 2024 verhandelte ein Tribunal in British Columbia den Streit eines Passagiers mit Air Canada. Der Bot auf der Website gab falsche Auskunft über die Bedingungen einer Erstattung, der Passagier verließ sich darauf, die Fluggesellschaft lehnte später ab. Das Tribunal entschied, dass ein Unternehmen für die Angaben auf seiner Website haftet, unabhängig davon, ob eine Seite oder ein Chatbot sie angezeigt hat, und sprach C$812,02 zu. Moffatt v. Air Canada, 2024 BCCRT 149.
Die Lehre liegt nicht in der Höhe der Summe. Für einen öffentlichen Agenten ist der beiläufige Satz „ja, das ist möglich“ gefährlicher — zu Preis, Frist, Rabatt, Leistungsbedingungen. Wo eine Antwort einem Versprechen gleichkommt, gibt man besser eine freigegebene Angabe aus einer Datenbank oder übergibt das Gespräch an einen Menschen.
3. Ein offizieller Bot riet Unternehmen zum Rechtsbruch
Im März 2024 zeigte eine Recherche von The Markup, dass der Chatbot New York City MyCity Gewerbetreibenden falsche Auskünfte zu Miete, Trinkgeld, Barzahlungen und Arbeitsrecht gab. In einzelnen Antworten empfahl er faktisch Handlungen, die rechtswidrig waren. The Markup, 29. März 2024.
Das ist kein „Hackerangriff“, sondern die gefährliche Mischung aus autoritativem Ton und falscher Antwort. Für einen Sprachassistenten ist es besonders wichtig, keine Sicherheit vorzutäuschen, wo er eine Tatsache nicht prüfen kann. Ein brauchbarer Grundsatz: Der Agent erklärt allgemeine Informationen, während Preise, Verträge, rechtliche und persönliche Fragen in einen überprüfbaren Prozess gehen.
4. Millionen Protokolle und Audioaufnahmen lagen wegen eines Speicherfehlers offen
Im Februar 2026 fand der Sicherheitsforscher Jeremiah Fowler drei frei zugängliche Datenbanken, die mit dem Sprach-KI-Agenten von Sears Home Services verbunden waren. Nach seinen Angaben enthielten sie 3,7 Millionen Chat-Protokolle, 1,4 Millionen Audiodateien und Textabschriften von Anrufen aus den Jahren 2024–2026 — mit Namen, Telefonnummern, Adressen und Auftragsdetails. Ein Teil der Aufnahmen dauerte stundenlang: Der Anruf blieb offen, nachdem der Kunde das Gespräch für beendet hielt, und alles ringsum geriet in die Aufzeichnung. Die Datenbanken wurden nach der Meldung des Forschers geschlossen; ob noch jemand Zugriff hatte, ist unbekannt. WIRED, März 2026.
Das ist das deutlichste Argument dagegen, den gesamten Ton „für alle Fälle“ aufzubewahren. Aufnahmen brauchen eine klare Frist, rollenbasierten Zugriff, Verschlüsselung und regelmäßige Kontrolle, ob der Speicher nicht versehentlich offen steht.
5. Telefoninfrastruktur wird bereits als Waffe eingesetzt
Telefonischer Dienstverweigerungsangriff — TDoS — funktioniert einfach: Eine riesige Zahl von Anrufen belegt Leitungen und Warteschlange, während echte Menschen nicht durchkommen. Die US-Cybersicherheitsbehörde CISA veröffentlichte die Auswertung eines realen Falls: Eine Notrufzentrale wehrte jahrelang tägliche TDoS-Angriffe ab. CISA, 2022. In einem anderen dokumentierten Fall stellte die FCC fest, dass die Beteiligten des Schemas ScammerBlaster fast 10 Millionen automatisierte Anrufe an für den Anrufer gebührenfreie Nummern führten, an dem Entgelt verdienten, das der Empfänger für solche Anrufe zahlt, und dieses Geld für TDoS-Angriffe einsetzten. Im September 2023 verhängte die Behörde eine Strafe von 116 Millionen Dollar. FCC, 2023.
Bei einem Sprach-Widget im Browser ist der Transportweg ein anderer, das Ziel aber dasselbe. Statt Tausender Telefonanrufe kann man versuchen, Tausende Browser-Sitzungen zu öffnen, Modell-Tokens zu verbrennen oder ein Mikrofon stumm offen zu halten. Deshalb muss die Begrenzung vor dem Start eines teuren Gesprächs greifen, nicht erst danach.
6. Die synthetische Stimme ist bereits ein Werkzeug des Telefonbetrugs
Im Januar 2024 erhielten Einwohner von New Hampshire Roboteranrufe mit gefälschter Rufnummer und einem KI-Klon der Stimme von Präsident Biden, die sie aufforderten, nicht wählen zu gehen. Im August 2024 schloss der Netzbetreiber Lingo Telecom, über dessen Netz die Anrufe liefen, einen Vergleich mit der FCC über 1 Million Dollar. Im September 2024 verhängte die FCC gegen den Organisator der Anrufe endgültig eine gesonderte Strafe von 6 Millionen Dollar. FCC, 21. August 2024.
Dieser Fall betrifft keinen Web-Bot und bedeutet nicht, dass jede künstliche Stimme kriminell wäre. Er zeigt etwas anderes: Sobald gewöhnliche Telefonleitungen angebunden sind, darf weder die Nummer auf dem Display noch eine vertraute Stimme als hinreichender Identitätsnachweis gelten. Ausgehende Anrufe, Rückrufe und Weiterleitungen an externe Nummern brauchen einen eigenen Betrugsschutz.
7. Die „teure Schaltfläche“ ist eine anerkannte Risikoklasse, auch wenn öffentliche Zahlen fehlen
In ihrer Liste der größten Risiken für Anwendungen auf Basis von Sprachmodellen (2025) hebt die Anwendungssicherheits-Gemeinschaft OWASP den „unbegrenzten Verbrauch“ hervor: Ein Angreifer stellt zu viele oder zu schwere Anfragen an das Modell und verwandelt die nutzungsabhängige Abrechnung in eine wirtschaftliche Dienstverweigerung. OWASP empfiehlt Eingabeprüfung, Begrenzung der Anfragerate, Kontingente, Zeitlimits und Ressourcenüberwachung. OWASP, 2025.
Bislang gibt es keinen breit veröffentlichten, belastbaren Fall mit einer genannten Schadenssumme, der speziell auf ein kostenloses Sprach-KI-Widget im Browser zurückgeht. Das ist eine wichtige ehrliche Einschränkung. Doch das Fehlen einer öffentlichen Zahl macht den Mechanismus nicht sicher: Bei einer Sprachschnittstelle werden mehrere Schichten gleichzeitig bezahlt — Audio, Modell und mitunter ein Mitarbeiter.
Was jeder tun sollte, der einen Sprach-KI-Agenten öffnet
- Dem Browser eine kurzlebige Sitzung geben, keinen dauerhaften Schlüssel zu den Diensten.
- Die Zahl der Starts, gleichzeitigen Gespräche, Minuten, Redebeiträge und Tokens begrenzen; einen täglichen und stündlichen Kosten-Notaus vorhalten.
- Das Gespräch nach angemessener Stille beenden, statt ein vergessenes Mikrofon zu bezahlen.
- An Menschen nur in die interne Warteschlange übergeben und dem Agenten nicht erlauben, beliebige Nummern anzurufen oder anzuschreiben.
- Auskünfte zu Preisen und Bedingungen nur aus einer freigegebenen Quelle geben; im Zweifel nichts versprechen, sondern an einen Menschen übergeben.
- Jede Aktualisierung gegen Provokationen prüfen: Aufforderungen, die Anweisungen offenzulegen, Beschimpfungen, falsche Preise, wiederholte Weiterleitungen, synthetischer Ton und lange Pausen.
- Aufzeichnungen minimieren, schützen und vorab eine Person benennen, die das Widget schnell abschalten kann.
Das ehrliche Fazit
Eine offene Sprach-KI wird nicht dadurch sicher, dass sie „höflich“ ist oder das Gesprächsthema erkennt. Man muss sie als öffentlichen, kostenpflichtigen Dienst entwerfen — und als Mitarbeiter, dessen Worte aufgezeichnet werden können. Man kann einen Menschen nicht vollständig von einem guten Automaten unterscheiden, und man kann Manipulationen an den Anweisungen des Modells nicht mit einem einzigen Filter zuverlässig abfangen. Man kann aber die maximalen Kosten im Voraus begrenzen, dem Modell gefährliche Befugnisse vorenthalten, einen Angreifer nicht endlos die Warteschlange besetzen lassen und Aufzeichnungen nicht ungeschützt liegen lassen.
Das nimmt dem Dienst nichts von seiner Bequemlichkeit. Es macht ihn lediglich tauglich für den offenen Zugang.
Woran wir gerade arbeiten
Wir bauen selbst Sprach-KI-Agenten und wissen gut, wie synthetisierte Sprache klingt. Als nächsten Schritt entwickeln wir deshalb einen Detektor für gefälschte Stimmen: ein Modul, das im Gesprächsverlauf einen lebenden Menschen von einer Aufnahme und von Synthese unterscheidet. Er wird innerhalb unserer eigenen Sprach-Engine arbeiten. Einzelheiten veröffentlichen wir, wenn es etwas zu zeigen gibt.