Gemini 3.8 Live ist da. Google DeepMind hat am 15. September 2026 zwei Varianten vorgestellt, Live und Live Extended Thinking. Das Versprechen: Echtzeit-Gespräche, längere Aufgabenketten, weniger Abbrüche. Quelle: DeepMind. Zwei Tage später ging noch ein anderes AI-Stück durch LinkedIn: OpenAIs GPT‑6 „Astra“ habe einen Weltkriegs-Funkspruch geknackt. Schlagzeile, Staunen, und dann die Ernüchterung: Der Code war wohl weniger spektakulär, eher Fleißarbeit mit Frequenzmustern. Quelle: t3n. Parallel sagt Ron Johnson, der Mann hinter den Apple Stores: AI-Shopping? Nett, aber die Magie kommt von Menschen. Quelle: TechCrunch.
Mein Take: Live-Modelle mit „Extended Thinking“ sind nützlich, aber nur, wenn sie in vorhandene Prozesse greifen. Nicht die große KI, die alles kann. Sondern kleine, messbare Entlastung in Support, Vertrieb, Retail. Wenn du nächste Woche startest, spürst du es in zwei Metriken: First-Contact-Resolution und Escalation-Rate. Alles andere ist Demo-Theater.
Was ist passiert, und warum die Schlagzeilen täuschen
Fakten zuerst. Am 15.09. hat DeepMind „Gemini 3.8 Live“ und „Gemini 3.8 Live Extended Thinking“ angekündigt. Laut Blog geht es um Live-Interaktionen und die Fähigkeit, komplexere Aufgabenketten über längere Zeit zu verfolgen, sprich: ein Gespräch führen, Zwischenschritte planen, Ergebnisse zusammenhalten. Keine Mondlandung, aber ein sinnvolles Upgrade für Telefon, Chat und On-Site-Guidance. Quelle: DeepMind.
Am 21.09. meldet t3n, OpenAIs GPT‑6 „Astra“ habe einen bisher als ungelöst geltenden WWI-Funkspruch entschlüsselt, und relativiert das direkt: Die „Leistung“ war wohl weniger ein Geniestreich, mehr solide Musterarbeit mit heutigen Rechenmitteln. Quelle: t3n. Sprich: Wenn ein Modell die Presse dominiert, heißt das noch nicht, dass dein Team morgen produktiver wird.
Und TechCrunch zitiert Ron Johnson, Ex-Apple-Retail: AI-Shopping allein löst keine Conversion-Probleme. Menschen bauen Vertrauen und lösen Sonderfälle. Quelle: TechCrunch. Das passt zum Bild: Live-Modelle werden die erste Meile übernehmen (Triage, Qualifizierung, Informationsabruf). Die letzte Meile bleibt erstmal beim Menschen.
Konsequenz: Die spannende Frage ist nicht „Wie klug ist Gemini 3.8 Live?“, sondern „Wo liegt die Schnittstelle zum Menschen, und wie messen wir sie?“ Wenn du das sauber trennst, Regeln, Übergaben, Metriken, ist der Effekt real. Wenn nicht, bekommst du teure Gespräche mit freundlicher Stimme und wackeligem Nutzen.
Wer in deinem Team es zuerst merkt
Zwei Bereiche werden als erste nervös, oder dankbar. Der Contact-Center-Lead und die verantwortliche Person für Onsite-Conversion. Warum? Weil Gemini 3.8 Live genau dort Reibung frisst: Anrufe nach Dienstschluss, Standardfragen, Vorqualifizierung, „Ich suche die Rechnung vom Juli“.
Ein Beispiel aus den letzten sechs Wochen: 14 Entscheider-Gespräche, in 11 davon dieselbe Bitte. „Können wir 30, 40 % der Supportanrufe vorsortieren, ohne die NPS zu ruinieren?“ Antwort: Ja, wenn du drei Dinge beachtest. Erstens: harte Escalation-Regeln (low confidence → Mensch, nicht raten). Zweitens: ein dünnes, gepflegtes Wissens-Backend (z. B. 120, 300 Artikel, nicht der gesamte SharePoint). Drittens: Logging, das wirklich lesbar ist, kein Prompt-Museum.
Operativ, nächste Woche:
- Contact Center: Testfenster außerhalb Peak-Zeiten (z. B. 17, 20 Uhr). Ziel: 15, 25 % Anrufe komplett lösen oder sauber übergeben. Messgrößen: Average Handle Time bei gelösten Fällen, Escalation-Rate, NPS bei Testkohorte.
- E‑Com/Onsite: Guided Selling als Overlay im Checkout für Rückfragen zur Passform, Lieferzeit, Retoure. Kein „Alles könnender Concierge“. Nur die Top-7 Fragen mit gesichertem Antwortpfad. Übergabe-Button an Live-Chat nach 2 Fehlversuchen.
- B2B-Vertrieb: Lead-Qualifizierung aus eingehenden Anrufen und Formularen zusammenführen. Live-Voice nimmt auf, ordnet Industrie/Größe/Use-Case zu, schreibt eine 5‑Zeilen-Zusammenfassung ins CRM. Terminvereinbarung bleibt beim Menschen.
Wer merkt es als Nächste? Legal/Compliance. DSGVO-Hinweis vor Aufnahme, PII-Redaktion in den Logs, Löschroutinen. Wenn du das nicht einbaust, stoppst du den Piloten nach drei Tagen.
Drei Workflows, die du in 30 Tagen shippen kannst (mit Gemini 3.8 Live)
- Voice-Triage im Support
- Tool-Stack: Inbound-Telefonie (z. B. Twilio/Placetel), Webhook, Gemini 3.8 Live für Gespräch, „Extended Thinking“ für Zwischenschritte, Wissenszugriff auf deine gepflegte FAQ/Runbook-Sammlung (z. B. über eine dünne Retrieval-Schicht), CRM-Logging (Zendesk, Salesforce, HubSpot).
- Ablauf: Anruf → Einwilligung zur Aufzeichnung → Intent-Erkennung (3, 5 Slots: Rechnung, Lieferung, Rücksendung, Zugang, Sonstiges) → Faktenabfrage (Kundennummer, Bestell-ID) → Antwort aus Wissensbasis oder Transaktionstrigger → bei Unsicherheit: Warm-Transfer mit 5‑Zeilen-Zusammenfassung.
- Beispiel: „Ich brauche die Rechnung vom Juli.“ Agent fragt nach Kundennummer und Zeitraum, zieht den passenden Helpcenter-Artikel und generiert eine E‑Mail mit dem Download-Link. Kein Freitext-Raten.
- Output: 20, 35 % Autolösungen bei Standardfällen in Woche 4, wenn die Wissensbasis aktuell ist. Escalation in unter 20 Sekunden bei „low confidence“.
- Meeting-Copilot mit Entscheidungsprotokoll
- Tool-Stack: Aufzeichnung (Google Meet/Zoom), Speech-to-Text, Gemini 3.8 Live Extended Thinking für robuste Kondensation, DMS (Confluence/Notion/SharePoint).
- Ablauf: Termin → Einwilligung → Transkript → Extended Thinking baut ein „Decision Register“ (Entscheidung, Begründung, Owner, Fällig, Risiken) und eine To‑do-Liste mit Verlinkung auf das Transkript.
- Beispiel-Output (gekürzt):
- Entscheidung: „Pilot Voice-Triage Mo, Fr, 17, 20 Uhr.“ Owner: CC-Leitung. Fällig: 15.10. Risiken: Eskalationsstau. Gegenmaßnahme: 2nd-Line Bereitschaft.
- Nutzen: Du ersetzt nicht die Notizen. Du fixierst Verantwortungen und vermeidest das „Haben wir doch letzte Woche entschieden“-Spiel.
- Guided Selling im Checkout mit Eskalation
- Tool-Stack: Web-Overlay (JS-Widget), Gemini 3.8 Live in Voice oder Text, Katalog/Policy-Retrieval (nur geprüfte Antworten), Übergabe an Live-Chat/Call.
- Ablauf: Nutzer stellt konkrete Frage („Passt Größe M bei 1,86 m und 82 kg?“) → Agent nutzt Größentabelle + Rückgaberichtlinie → schlägt Größe vor + Hinweis auf kostenlose Retoure → bei dritter Rückfrage Übergabe an Menschen.
- Leitplanke: Keine medizinischen/finanziellen Ratschläge, kein Rabattversprechen. Konfidenzgrenzen hart coden.
Für die technische Tiefe lohnt ein Blick in unsere Playbooks: Wie du Retrieval klein und sauber hältst, statt einen Daten-Sumpf zu bauen: RAG-Evaluation: Präzision vor Volumen. Und wie Agenten Übergaben, Zustände und Metriken managen: Agentic Ops für den Betrieb.
Was kostet das, realistisch gerechnet
Zeit:
- Woche 1: Scoping, Wissensinventur (Top-50 Fragen), Basis-Flows, Datenschutz-Check. 15, 25 Personstunden.
- Woche 2: Prototyp (Voice/Chat), Anbindung Wissensbasis, Logging ins CRM/DMS. 25, 40 Stunden Engineering.
- Woche 3: Pilot auf kleiner Kohorte (z. B. 10 % Traffic, 17, 20 Uhr), Feedback-Schleifen, Eskalationsregeln schärfen. 20, 30 Stunden.
- Woche 4: Härtung, Monitoring, Onboarding der Agenten. 15, 25 Stunden.
Team:
- 1 Full‑Stack-Dev mit API-/Webhook-Erfahrung.
- 1 Ops/Analyst für Wissensbasis und Metriken.
- 1 Process Owner (Support/Commerce) als Entscheider.
- 0.2 FTE Legal/Privacy für Einwilligung, DPA, Retention.
Tools & Laufzeitkosten (Pilotgröße: 200 Anrufe/Tag, Ø 2 Minuten; Chat-Pilot vergleichbar):
- Telephony/RTC: je nach Anbieter Minutenpreise und Rufnummern. Plane mittlere dreistellige EUR/Monat im Pilot.
- Modellnutzung (Gemini 3.8 Live/Extended Thinking): Preise sind zum Zeitpunkt der Ankündigung nicht öffentlich genannt; kalkuliere konservativ einen niedrigen bis mittleren vierstelligen Betrag/Monat für aktiven Piloteinsatz, abhängig von Turn-Länge und Parallelität.
- STT/TTS: falls separat genutzt, weitere zweistellige bis niedrige dreistellige EUR/Monat.
- CRM/DMS: bestehende Lizenzen; zusätzliche Automations- oder API-Kosten einplanen.
Total Pilot-Budget (4 Wochen):
- Einmalig (intern): 70, 120 Arbeitsstunden.
- Laufend (SaaS/Usage): grob 500, 2.500 EUR/Monat je nach Volumen, Region und Anbieter-Mix. Ohne Gewähr, weil Modellpreise schwanken und Voice-Minuten regional variieren.
Return-Anker:
- Wenn du 20 % Standardfälle ohne Mensch löst, sinkt die Last spürbar. Rechne konservativ mit 5, 15 % geringerer AHT auf der Gesamtlinie in Woche 6, 8, vorausgesetzt, Eskalationen sind sauber und die Wissensbasis ist schlank und aktuell.
Die Falle: Demo-Theater und Halluzinationen im Live-Betrieb
Was schiefgeht, wenn man „live“ ohne Betrieb denkt:
- Unklare Übergaben: Der Bot hängt zu lange in Unsicherheit. Regel: 2 Fehlversuche oder „low confidence“ → Warm-Transfer in unter 20 Sekunden. Immer mit Zusammenfassung für den Menschen.
- Latency & Barge‑In: Live‑Voice lebt von Unterbrechbarkeit. Wenn das Modell nicht elegant stoppt, wirkt es dumm. Teste mit echten Akzenten, Lärm, Dialekten. Nicht nur im ruhigen Konfi.
- Wissensmüll: „Wir indexieren mal alles.“ Schlechte Idee. Nimm die Top-100 Runbooks und ändert sie wöchentlich. Versioniere Antworten. Lösche Altlasten.
- Halluzinationen: Extended Thinking erhöht Qualität, aber kein Freibrief. Hartes Grounding: Antworten nur aus verifizierten Quellen, sonst Übergabe. Bau einen Ablehnungssatz ein, der nicht wie Ausrede klingt („Das kann ich nicht sicher beantworten. Ich verbinde dich.“).
- Datenschutz: Ohne explizite Einwilligung für Aufnahme/Transkript ist der Pilot in DACH tot. PII-Redaktion in Logs, Retention 30, 90 Tage, klare DPA mit dem Anbieter, EU/EWR‑Speicherung prüfen. Wenn Zahlungen involviert sind: PCI‑DSS-Umgehung (DTMF-Maskierung oder Handover).
- Metriken ohne Baseline: Miss nicht nur „Wow, das klang menschlich“. Miss: Deflection‑Rate, NPS der Pilotkohorte, AHT-Veränderung, First‑Contact‑Resolution, Anteil sauberer Übergaben. Setz eine Nullmessung eine Woche vor Pilot.
Noch ein Punkt zur Versuchung „alles AI“. Ron Johnsons Skepsis zum AI-Shopping ist gesund. Beratung, Upsell, Beschwerden mit Emotion, gib das schnell an Menschen. Nutze Gemini 3.8 Live für die Vorarbeit und Konsistenz. Nicht für Magie.
Wenn du tiefer gehen willst: Wir haben eine Checkliste für Agent‑Evaluierung (Testgespräche, Rubrics, Red‑Team‑Prompts) und ein schlankes RAG‑Playbook, das genau diese kleinen, verlässlichen Antwortpfade baut. Siehe: Agent‑Eval: von Demo zu Betrieb und RAG-Playbook für Support.
Wir bauen genau solche Workflows für Support- und Commerce-Teams in B2C und SaaS: Voice‑Triage, Decision Logs, Guided Selling. Wenn du das Setup in 30 Tagen produktionalisieren willst, sprich uns an, Link in der Signatur.




