Ein internationaler Nutzer fragt den Chatbot Ihrer TYPO3-Plattform auf Englisch nach regulatorischen Details – und erhält die Auskunft: „I cannot find any relevant information.“ Dabei existiert die Antwort längst: Sie steht in einem 30-seitigen PDF im TYPO3 FAL, allerdings rein auf Deutsch. Genau hier geraten Standard-RAG-Systeme an ihre Grenzen.
Die Falle: Asymmetrische Mehrsprachigkeit
In gewachsenen Multisite-Landschaften gibt es selten ein einheitliches Bild:
- Subportal A bietet DE und EN.
- Subportal B existiert nur auf Deutsch.
- Subportal C deckt DE, FR und EN ab.
- Über 90 % der vertiefenden Fach-PDFs, Satzungen und Datenblätter liegen ausschließlich auf Deutsch vor.
Wird ein herkömmlicher Sprachfilter auf Datenbankebene gesetzt (sys_language_uid = query_language), laufen fremdsprachige Suchanfragen unweigerlich ins Leere. Das Wissen ist vorhanden, bleibt aber in monolingualen Silos gefangen.
Der Lösungsansatz: Dreistufige Entkopplung
Statt Millionen Dokumente vorab teuer zu übersetzen, entkoppelt eine belastbare Architektur die Sprachebenen voneinander:
- Frontend-Ebene: Erkennt die Nutzersprache und steuert Interface sowie Dialogführung.
- Cross-Lingual Retrieval: Multilinguale Embeddings bilden die semantische Bedeutung sprachunabhängig im selben Vektorraum ab. Eine englische Anfrage matcht dadurch direkt auf deutsche Text- und PDF-Passagen. Zweisprachige Metadaten und synthetische Queries unterstützen das Auffinden rein deutscher Dokumente.
- LLM-Synthese: Das Sprachmodell fasst die gefundenen Inhalte strikt in der Nutzersprache zusammen und zitiert die Herkunft transparent („According to the official German document...“).
Enterprise-Governance und Zugriffsschutz
Ein intelligentes Retrieval darf niemals TYPO3-Sicherheitsgrenzen verwässern:
- Pre- & Post-ACL-Filter: Frontend-Nutzergruppen (fe_groups), Rootline-Vererbungen und zeitliche Freigaben (starttime/endtime) werden vor und nach der Vektorsuche deterministisch geprüft.
- Datenschutz nach DSGVO: Vektorindex und Sprachmodelle laufen auf isolierter europäischer Infrastruktur, ohne Datenabfluss an Dritte.
- Kein Context-Leakage: Konversationen bleiben strikt sitzungsgebunden, um unautorisierte Zugriffe über den Chat-Verlauf auszuschließen.
Fazit
Mehrsprachigkeit erfordert keinen massiven Übersetzungsaufwand für statische Archive. Mit einem Cross-Lingual-Retrieval-Ansatz erschließen Sie vorhandene deutsche Fach-PDFs und Subportale direkt für internationale Nutzer – präzise, performant und revisionssicher.