Stilisierte Browseroberfläche mit Profilkarten, umgeben von Begrüßungen in vielen Sprachen.

Frage auf Englisch, Fachwissen auf Deutsch

Warum klassische Chatbots an mehrsprachigen TYPO3-Websites scheitern – und wie die Lösung aussieht

Ein internationaler Nutzer fragt den Chatbot Ihrer TYPO3-Plattform auf Englisch nach regulatorischen Details – und erhält die Auskunft: „I cannot find any relevant information.“ Dabei existiert die Antwort längst: Sie steht in einem 30-seitigen PDF im TYPO3 FAL, allerdings rein auf Deutsch. Genau hier geraten Standard-RAG-Systeme an ihre Grenzen.

Die Falle: Asymmetrische Mehrsprachigkeit


In gewachsenen Multisite-Landschaften gibt es selten ein einheitliches Bild:

  • Subportal A bietet DE und EN.
  • Subportal B existiert nur auf Deutsch.
  • Subportal C deckt DE, FR und EN ab.
  • Über 90 % der vertiefenden Fach-PDFs, Satzungen und Datenblätter liegen ausschließlich auf Deutsch vor.

Wird ein herkömmlicher Sprachfilter auf Datenbankebene gesetzt (sys_language_uid = query_language), laufen fremdsprachige Suchanfragen unweigerlich ins Leere. Das Wissen ist vorhanden, bleibt aber in monolingualen Silos gefangen.

Der Lösungsansatz: Dreistufige Entkopplung


Statt Millionen Dokumente vorab teuer zu übersetzen, entkoppelt eine belastbare Architektur die Sprachebenen voneinander:

  1. Frontend-Ebene: Erkennt die Nutzersprache und steuert Interface sowie Dialogführung.
  2. Cross-Lingual Retrieval: Multilinguale Embeddings bilden die semantische Bedeutung sprachunabhängig im selben Vektorraum ab. Eine englische Anfrage matcht dadurch direkt auf deutsche Text- und PDF-Passagen. Zweisprachige Metadaten und synthetische Queries unterstützen das Auffinden rein deutscher Dokumente.
  3. LLM-Synthese: Das Sprachmodell fasst die gefundenen Inhalte strikt in der Nutzersprache zusammen und zitiert die Herkunft transparent („According to the official German document...“).

Enterprise-Governance und Zugriffsschutz


Ein intelligentes Retrieval darf niemals TYPO3-Sicherheitsgrenzen verwässern:

  • Pre- & Post-ACL-Filter: Frontend-Nutzergruppen (fe_groups), Rootline-Vererbungen und zeitliche Freigaben (starttime/endtime) werden vor und nach der Vektorsuche deterministisch geprüft.
  • Datenschutz nach DSGVO: Vektorindex und Sprachmodelle laufen auf isolierter europäischer Infrastruktur, ohne Datenabfluss an Dritte.
  • Kein Context-Leakage: Konversationen bleiben strikt sitzungsgebunden, um unautorisierte Zugriffe über den Chat-Verlauf auszuschließen.

Fazit


Mehrsprachigkeit erfordert keinen massiven Übersetzungsaufwand für statische Archive. Mit einem Cross-Lingual-Retrieval-Ansatz erschließen Sie vorhandene deutsche Fach-PDFs und Subportale direkt für internationale Nutzer – präzise, performant und revisionssicher.