Ein tieferer Einblick, wie KI-Systeme heute aufgebaut sind: von einfachen Chatbots über Agenten und Subagenten bis zu den Sprachmodellen dahinter und der Fähigkeit, Sprache direkt zu verstehen.
Nicht jede KI-Anwendung funktioniert gleich. Die folgende Einordnung hilft, Angebote und Anbieter besser einzuschätzen.
ChatbotEinfachste Stufe
Beantwortet Fragen in einem Dialogfenster, meist auf Basis eines vorgegebenen Themenbereichs. Kann in der Regel keine eigenständigen Aktionen außerhalb des Gesprächs ausführen.
KI-AssistentErweitert
Ein Chatbot mit Zugriff auf zusätzliche Informationen oder einfache Funktionen, etwa Kalender, E-Mail-Postfach oder eine Wissensdatenbank des Unternehmens.
KI-AgentHandlungsfähig
Plant und führt mehrstufige Aufgaben eigenständig aus: recherchieren, ein Werkzeug aufrufen, das Ergebnis bewerten und den nächsten Schritt selbst festlegen – statt nur eine einzelne Antwort zu geben.
SubagentSpezialisiert
Ein Agent, der von einem übergeordneten Agenten für eine klar abgegrenzte Teilaufgabe eingesetzt wird, etwa reine Recherche, reine Datenauswertung oder das Verfassen eines Textabschnitts.
Multi-Agenten-SystemZusammenspiel
Mehrere Agenten und Subagenten, die sich eine komplexe Aufgabe aufteilen und ihre Teilergebnisse an einen koordinierenden Agenten zurückgeben, der sie zusammenführt.
Hinter Chatbots, Assistenten und Agenten steht meist ein Large Language Model (LLM). Die bekanntesten Modellfamilien im Überblick – ohne Wertung, als reine Orientierung.
GPT-ReiheOpenAI
Modellfamilie hinter ChatGPT. Proprietär, über eine API nutzbar, breit verbreitet in Chat- und Agenten-Anwendungen.
ClaudeAnthropic
Proprietäre Modellfamilie mit Fokus auf lange Kontextfenster und Werkzeugnutzung, ebenfalls über eine API einbindbar.
GeminiGoogle
Von Google entwickelte, multimodale Modellfamilie – von Beginn an für Text-, Bild- und Audioeingaben ausgelegt.
LlamaMeta, offen
Offen verfügbare Modellgewichte, die auch auf eigener Hardware oder in einer eigenen Cloud-Umgebung betrieben werden können – relevant für Unternehmen mit strengen Datenschutzanforderungen.
MistralEuropa, offen
Europäischer Anbieter mit teils offen verfügbaren Modellen; oft eine Option, wenn Datenverarbeitung innerhalb der EU gewünscht ist.
KI beschränkt sich längst nicht mehr auf Text. Für Unternehmen sind vor allem folgende Bausteine relevant.
Speech-to-TextTranskription
Wandelt gesprochene Sprache in Text um – etwa für Meeting-Protokolle, Diktierfunktionen oder die Verschriftlichung von Kundengesprächen.
Text-to-SpeechSprachausgabe
Erzeugt aus Text natürlich klingende Sprache, etwa für Sprachassistenten, Telefonansagen oder vorgelesene Inhalte.
Native AudioeingabeDirektverarbeitung
Neuere multimodale Modelle nehmen Audio direkt als Eingabe entgegen, ohne den Umweg über eine separate Transkription – das reduziert Verzögerung und erhält Tonfall und Betonung.
Echtzeit-SprachassistentenLive-Dialog
Ermöglichen ein gesprochenes Hin und Her nahezu ohne Verzögerung – Grundlage für KI-gestützte Telefonassistenz oder Voicebots im Kundenservice.
Viele aktuelle Modelle verarbeiten mehr als nur Text in einer einzigen Anfrage.
BildeingabeVision
Modelle können Fotos, Screenshots oder Diagramme lesen und beschreiben – etwa zur Auswertung von Belegen oder zur Qualitätsprüfung.
DokumenteneingabePDF & Co.
Ganze Dokumente lassen sich einlesen und zusammenfassen, durchsuchen oder mit gezielten Fragen auswerten.
Kombinierte EingabenText + Bild + Audio
Ein einziges Modell kann Text, Bild und Audio in derselben Anfrage gemeinsam berücksichtigen – etwa ein Foto plus eine gesprochene Frage dazu.