GoHighLevel Voice AI
Ein KI-Agent nimmt Anrufe entgegen, klärt das Anliegen, bucht Termine und kann während des Gesprächs externe Systeme abfragen. Kein separates Tool, sondern Teil der Plattform.
Was Voice AI ist und was nicht
Voice AI ist der KI-Telefonassistent in GoHighLevel. Er hängt an derselben Plattform wie CRM, Kalender und Telefonie. Der Anrufer spricht mit einem Agenten, der das Anliegen klärt, Daten erhebt und danach einen Datensatz hinterlässt, den das Team weiterbearbeiten kann.
Der Vergleich mit dem Anrufbeantworter ist der häufigste Fehler. Ein Anrufbeantworter erzeugt eine Sprachnachricht. Jemand muss sie abhören, abtippen und entscheiden, was daraus folgt. Bis das passiert, ist der Anrufer oft schon bei der Konkurrenz. Voice AI erzeugt keinen Sprachspeicher, den jemand abarbeitet. Voice AI erzeugt einen Datensatz im CRM: Kontakt, Felder, gebuchter Termin, ausgelöster Workflow, je nachdem, was du dem Agenten erlaubt hast.
Die zweite Abgrenzung betrifft Conversation AI. Conversation AI ist Chat und SMS. Voice AI ist Telefon. Beide können in GoHighLevel Termine buchen und Felder schreiben. Der Kanal entscheidet, welches von beiden du einsetzt. Wer auf der Website oder per Messenger Fragen beantwortet, bleibt beim Chatbot. Wer das Telefon besetzen will, weil Anrufe sonst ins Leere laufen, richtet Voice AI ein.
Voice AI ist auch kein zweites Telefonsystem. Die Telefonie der Plattform bleibt die Leitung. Der Agent sitzt darauf und spricht. Deshalb fallen Telefoniekosten bei allen Anrufen zusätzlich an, unabhängig vom KI-Plan. Wer nur die KI-Pakete betrachtet und die Leitung vergisst, rechnet den Anruf zu billig.
Der Nutzen entsteht nicht dadurch, dass der Agent möglichst viel darf. Er entsteht dadurch, dass er die Anrufe übernimmt, die sonst liegen bleiben, und das Ergebnis so ablegt, dass ein Mensch oder ein Workflow danach weiterarbeiten kann. Für den Handwerksbetrieb haben wir das im Beitrag zum KI-Telefonassistenten im Handwerk durchgespielt. Diese Seite bleibt bei der Funktion: Modelle, Einstellungen, Aktionen, Kosten und die Stellen, an denen die Dokumentation endet.
Speech-to-Speech: Audio ohne Umweg über Text
Das ist der wichtigste neue Abschnitt auf dieser Seite. Die Kette aus Erkennung, Modell und Ausgabe ist der alte Weg. Speech-to-Speech verarbeitet das Audio direkt.
Warum die Kette Information verliert
Klassische Sprachbots arbeiten in einer Kette aus Spracherkennung, dann Sprachmodell, dann Sprachausgabe. Bei jedem Schritt geht Information verloren, besonders bei Ziffernfolgen. Eine Telefonnummer, eine Auftragsnummer oder eine E-Mail-Adresse wird erst zu Text, dann vom Modell gelesen, dann wieder zu Sprache. Was in der Mitte falsch erkannt wurde, kommt am Ende falsch an. Speech-to-Speech-Modelle verarbeiten Audio direkt, ohne den Umweg über Text.
Im Modellmenü tauchen laut einem öffentlich einsehbaren Video vom September 2026 die Optionen GPT Realtime 2.1, GPT Realtime 2 und Gemini 3.1 Flash Live Preview auf, letztere ausdrücklich als Beta gekennzeichnet. HighLevel führt diese Namen in der offiziellen Dokumentation bisher nicht, die Angabe stammt aus einem Nutzer-Video und kann sich je nach Konto unterscheiden.
Offiziell belegt ist dagegen: Google Gemini, OpenAI GPT und Anthropic Claude stehen als Anbieter zur Auswahl. Offiziell in der Preistabelle genannt: Gemini 2.0 Flash, Gemini 2.0 Flash Lite, Gemini 2.5 Flash, Gemini 2.5 Flash Lite, GPT-4o Mini, GPT-4o, GPT-4.1 Nano/Mini, GPT-5 Nano/Mini/Standard.
Ob Speech-to-Speech Telefonnummern und E-Mail-Adressen besser erkennt, ist technisch plausibel, weil der fehleranfällige Zwischenschritt über Text entfällt. HighLevel hat das nicht offiziell bestätigt. Wir schreiben es deshalb nicht als belegte Eigenschaft, sondern als technische Begründung, die man prüfen muss, statt sie vorauszusetzen.
Es gibt einen ehrlichen Gegenbefund. Ein Blogartikel vom Juli 2026 berichtet, dass Voice AI sich außerhalb des Englischen weiterhin schwer damit tut, Namen und E-Mail-Adressen zu buchstabieren. Das ist eine Drittquelle. Sie widerspricht der Hoffnung, dass der direkte Audioweg das Problem in jeder Sprache löst. Wer den Agenten auf Deutsch einsetzt, sollte Namen, Mailadressen und Nummern im Testanruf prüfen, nicht aus der Modellbeschreibung ableiten.
Die Modellnamen aus dem Video und die Modellnamen aus der Preistabelle sind zwei Listen. Die eine steht in der Oberfläche eines Kontos, das jemand gefilmt hat. Die andere steht in der offiziellen Preistabelle. Wer ein Konto öffnet und andere Bezeichnungen sieht, hat deshalb nicht automatisch eine andere Funktion, sondern eine andere Beschriftung. Die Anbieter Google Gemini, OpenAI GPT und Anthropic Claude bleiben der offiziell belegte Rahmen.
Einstellungen im Voice-AI-Builder
Was du einstellen kannst, hängt davon ab, ob HighLevel es dokumentiert oder ob nur ein Nutzer-Video es zeigt. Die dritte Spalte macht das sichtbar.
| Einstellung | Was sie bewirkt | Beleglage |
|---|---|---|
| Sprachauswahl | Der Agent führt das Gespräch in der gewählten Sprache. Offiziell dokumentiert sind über 54 Sprachen, darunter Deutsch als Einzelsprache. | Offiziell dokumentiert |
| Stimmauswahl | Über 340 Stimmen stehen zur Auswahl. Eigene ElevenLabs-Stimmen können importiert werden. Die Standardstimme ist Englisch, auch wenn die Sprache auf Deutsch steht, und muss von Hand geändert werden. | Offiziell dokumentiert |
| Modellauswahl im Builder | Im Builder wählst du das Sprachmodell. Offiziell zur Auswahl stehen die Anbieter Google Gemini, OpenAI GPT und Anthropic Claude. Die Preistabelle nennt konkrete Modellnamen, siehe Abschnitt Speech-to-Speech. | Offiziell dokumentiert |
| Idle Reminder Timer | Wartezeit bei Stille, einstellbar von 1 bis 20 Sekunden. Standard sind 8 Sekunden. Danach bleiben 15 Sekunden, bis das Gespräch endet. | Offiziell dokumentiert |
| Maximale Gesprächsdauer | Standard 5 Minuten, einstellbar bis 15 Minuten. Danach endet der Anruf, unabhängig vom Stand des Gesprächs. | Nur durch ein Nutzer-Video belegt, offiziell nicht bestätigt |
| Unterbrechbarkeit | Der Anrufer kann den Agenten unterbrechen, während der Agent spricht. Ob das in jedem Modell gleich zuverlässig greift, ist offiziell nicht beschrieben. | Nur durch ein Nutzer-Video belegt, offiziell nicht bestätigt |
| Sprechgeschwindigkeit | Die Geschwindigkeit der Sprachausgabe lässt sich im Builder einstellen. | Nur durch ein Nutzer-Video belegt, offiziell nicht bestätigt |
| Profile für Hintergrundgeräusche | Profile sollen den Agenten an typische Umgebungsgeräusche anpassen. Welche Profile es gibt und wie stark der Effekt ausfällt, ist offiziell nicht beschrieben. | Nur durch ein Nutzer-Video belegt, offiziell nicht bestätigt |
Was in der Tabelle bewusst fehlt
Ein Temperature-Regler ist weder offiziell noch in Drittquellen gefunden. Wir führen ihn deshalb nicht als Einstellung auf. Wer in englischen Sprachmodell-Oberflächen einen solchen Regler kennt, findet dafür in Voice AI bisher keinen Beleg, weder in der HighLevel-Dokumentation noch in den ausgewerteten Drittquellen.
Die Zeilen mit Nutzer-Video gelten nur für das, was in diesem Video sichtbar war. Maximale Gesprächsdauer, Unterbrechbarkeit, Sprechgeschwindigkeit und Profile für Hintergrundgeräusche können je nach Konto anders heißen oder fehlen. Offiziell gesichert bleiben Sprache, Stimme, Modell und Idle Reminder Timer.
Was der Agent während des Gesprächs tun kann
Offiziell dokumentierte Aktionen während des Anrufs, plus die Grenzen, die HighLevel selbst nennt.
Anruf weiterleiten
Der Agent gibt das Gespräch an eine Nummer oder einen Mitarbeiter weiter, zum Beispiel wenn das Anliegen nicht in seinen Auftrag fällt.
Workflow auslösen
Ein vorhandener Workflow startet mitten im Anruf. Der Kontakt landet damit in derselben Automatisierung, die ihr auch sonst im Account nutzt.
SMS senden
Der Agent schickt während des Gesprächs eine SMS, etwa mit einer Bestätigung oder einem Link, den der Anrufer danach braucht.
Termin buchen
Der Agent prüft freie Zeiten, erhebt fehlende Angaben und bestätigt die Buchung im Gespräch. Offiziell gilt: nur eine Terminbuchungs-Aktion je Anruf.
Custom Action ausführen
Der Agent sendet während des Gesprächs eine POST-Webhook-Anfrage an eine externe Schnittstelle. Offiziell als Beta gekennzeichnet.
Kontaktfeld aktualisieren
Werte, die im Gespräch erhoben wurden, schreibt der Agent in Felder des Kontakts. Nach dem Anruf kann der Kontakt zusätzlich aktualisiert werden.
Nach dem Anruf kommt eine weitere offizielle Aktion: Kontakt aktualisieren. Der Agent schreibt also nicht nur während des Gesprächs, sondern kann den Datensatz danach noch einmal angleichen. Das ist der Punkt, an dem aus dem Telefonat ein Eintrag in CRM und Pipelines wird, den ein Mensch später öffnet, ohne die Aufnahme abzuhören.
| Offizielle Grenze | Wert |
|---|---|
| Aktionen je Anruf | höchstens 15 |
| Terminbuchungs-Aktion | nur eine |
| Feldaktualisierungen nach dem Anruf | bis zu 25 |
Wer dem Agenten zehn Custom Actions, zwei Terminbuchungen und eine Kette aus SMS und Workflows zumutet, läuft in genau diese Grenzen. Eine Terminbuchung, fünfzehn Aktionen, 25 Felder danach: Das ist der offizielle Rahmen, nicht eine Empfehlung, ihn vollzumachen.
Custom Actions: externe Systeme im laufenden Gespräch
Custom Actions sind die mächtigste Funktion von Voice AI, und sie sind offiziell als Beta gekennzeichnet. Sinngemäß übersetzt: „Voice AI Custom Actions erlauben dem Agenten, während eines laufenden Gesprächs POST-Webhook-Anfragen an externe Schnittstellen zu senden, mit Adresse, Kopfzeilen, Authentifizierung und Werten, die im Gespräch erhoben wurden."
Das ist der Unterschied zu einem Agenten, der nur spricht. Der Anrufer fragt nach dem Lieferstatus. Der Agent erhebt die Bestellnummer, sendet sie während des Gesprächs an die Schnittstelle des Warenwirtschaftssystems und nennt das Ergebnis, ohne dass jemand in ein anderes Programm wechseln muss. Der Anrufer bleibt in der Leitung. Die Antwort kommt aus dem System, das die Ware kennt, nicht aus einer Knowledge Base, die gestern aktualisiert wurde.
Die Datentypen, die erhoben werden können, sind offiziell: Text, Zahl, E-Mail, Telefonnummer, Datum. Mehr steht in der ausgewerteten Dokumentation nicht. Wer andere Typen erwartet, etwa Dateien oder Auswahllisten mit eigenen Optionen, findet dafür hier keinen Beleg.
Der Weg in der Oberfläche: Voice AI, Agent Goals, Advanced Mode, Custom Actions. Ohne Advanced Mode fehlt der Einstieg. Wer nur den einfachen Auftragstext sieht und keine Custom Actions findet, ist fast immer noch im einfachen Modus.
Es gibt einen Testmodus, der die vollständige Anfrage samt Kopfzeilen und die rohe Antwort anzeigt, etwa 200 OK oder 404 Not Found. Das ist die Stelle, an der du prüfst, ob die Schnittstelle antwortet, bevor ein echter Anrufer in der Leitung hängt. Eine freundliche Stimme nützt nichts, wenn die Anfrage ins Leere läuft und der Agent den Status erfindet oder abbricht.
Custom Actions ersetzen weder Workflows noch SuperAgents. Der Workflow bleibt der Taktgeber für alles, was nach dem Anruf in fester Folge passiert. SuperAgents arbeiten im Sub-Account an Textaufgaben, nicht am Telefon. Voice AI Custom Actions sitzen in der Sekunde, in der der Anrufer noch spricht, und holen genau den Wert, ohne den das Gespräch nicht weitergeht.
Termine am Telefon buchen
Offiziell dokumentiert ist die Buchung in einen einzelnen Kalender und die Buchung über mehrere Kalender hinweg, wobei der Agent aus dem Gespräch erkennt, welche Terminart passt. Der Agent bietet freie Zeiten an, erhebt fehlende Angaben wie die E-Mail-Adresse und bestätigt die Buchung im Gespräch, ohne den Anrufer auf eine Buchungsseite zu schicken.
Das ist der praktische Kern. Der Anrufer muss nicht später einen Link öffnen, ein Formular ausfüllen und hoffen, dass der Slot noch frei ist. Der Slot wird in dem Moment vergeben, in dem beide in der Leitung sind. Dafür braucht der Agent Zugriff auf den Kalender, und du musst die Kalender so benennen und zuordnen, dass die Terminart aus dem Gespräch ableitbar ist.
Offiziell nicht unterstützt: Buchung nach Services. Wer Termine über Leistungen statt über Kalender führt, kann das mit Voice AI so nicht abbilden. Der Agent bucht Kalender, nicht Service-Objekte.
Umbuchen und Absagen sind für Voice AI nicht offiziell dokumentiert. Eine Drittquelle schreibt ausdrücklich, dass Conversation AI Terminänderungen bereits kann und die Umsetzung für Voice AI erst geplant ist. Das ist eine unbestätigte Drittquelle. Wir behandeln Umbuchen und Absagen deshalb nicht als vorhandene Voice-AI-Funktion. Wer Absagen am Telefon braucht, muss das heute anders lösen, etwa indem der Agent weiterleitet oder der Anrufer später vom Team zurückgerufen wird.
Offiziell gilt außerdem: nur eine Terminbuchungs-Aktion je Anruf. Zwei verschiedene Kalender in einem Gespräch nacheinander zu belegen, steht damit außerhalb des dokumentierten Rahmens. Der Agent erkennt bei mehreren Kalendern, welche Terminart passt, und bucht einmal.
Was Voice AI kostet
HighLevel nennt drei Pläne. Pay-per-Use ohne Grundgebühr, AI Employee Growth für 50 US-Dollar im Monat je Unterkonto, AI Employee Unlimited für 97 US-Dollar im Monat. Die Planübersicht mit Starter, Unlimited und Agency steht auf der Preisseite.
Offiziell sinngemäß: Telefoniekosten fallen bei allen Anrufen zusätzlich an, unabhängig vom Plan. Die KI-Minute und die Telefonieminute sind zwei Posten. Wer nur das AI-Employee-Paket sieht, rechnet die Leitung nicht mit.
Die Kostenbestandteile der Sprachverarbeitung selbst sind drei: Voice Engine als Minutenpreis für die Sprachverarbeitung, TTS als Minutenpreis für die Sprachausgabe, dazu Tokenkosten des gewählten Modells. Welches Modell du im Builder nimmst, ändert den Tokenanteil. Die Leitung ändert das nicht.
| Modell | Preis | Hinweis |
|---|---|---|
| Pay-per-Use | Ohne Grundgebühr | Abrechnung über den tatsächlichen Verbrauch, ohne monatliches AI-Employee-Abo. |
| AI Employee Growth | 50 US-Dollar im Monat | Preis gilt je Unterkonto. Telefoniekosten fallen zusätzlich an. |
| AI Employee Unlimited | 97 US-Dollar im Monat | Höheres monatliches Kontingent. Telefoniekosten fallen auch hier zusätzlich an. |
Minutenpreise laut Drittquellen
Die folgenden Zahlen stammen aus Drittquellen, nicht aus der offiziellen Preistabelle. Sie können sich je nach Konto und Zeitpunkt unterscheiden. Die Realtime-Werte kommen zusätzlich aus einem Nutzer-Video.
| Posten | Laut Drittquelle | Hinweis |
|---|---|---|
| Voice Engine | 0,045 US-Dollar je Minute | Minutenpreis für die Sprachverarbeitung |
| Sprachausgabe Standard | 0,015 US-Dollar je Minute | TTS-Minutenpreis |
| ElevenLabs V2.5 | 0,035 US-Dollar je Minute | TTS-Minutenpreis |
| ElevenLabs V3 | 0,17 US-Dollar je Minute | TTS-Minutenpreis |
| GPT-Realtime-Varianten | etwa 0,20 US-Dollar je Minute | Laut Nutzer-Video, nicht offiziell bestätigt |
| Gemini-Realtime-Variante | etwa 0,10 US-Dollar je Minute | Laut Nutzer-Video, nicht offiziell bestätigt |
Auch abgebrochene Gespräche kosten Minuten. Wer auflegt, bevor der Agent fertig ist, erzeugt trotzdem Voice-Engine-, TTS- und Telefoniekosten. Ein Testanruf, der nach zwanzig Sekunden stirbt, ist deshalb kein kostenloser Test. Plane die Sandbox-Anrufe mit ein, statt sie als Null zu rechnen.
Bekannte Probleme
Quelle ist das offizielle Ideas-Board von HighLevel, ausgewertet über eine Drittquelle. Die Stimmenzahlen stammen aus dieser Auswertung, nicht aus einer eigenen Zählung.
178 Stimmen
Robotisch klingende Stimme
Im Ideas-Board von HighLevel steht die Stimme ganz oben. Der Agent spricht, aber er klingt für viele Nutzer nach Maschine, nicht nach Mitarbeiter.
174 Stimmen
Keine Erkennung bekannter Anrufer
Wer schon als Kontakt im CRM liegt, wird vom Agenten trotzdem wie ein Unbekannter behandelt. Eine Begrüßung mit Namen aus dem Datensatz ist offiziell nicht als gelöste Funktion beschrieben.
91 Stimmen
Spam-Anrufe erzeugen Karteileichen
Jeder Anruf legt oder aktualisiert einen Kontakt. Werbelinien und Fehlanrufe erzeugen so Datensätze, die niemand gewollt hat und die jemand später aufräumen muss.
Dazu kommt die Sprache. Deutsch wird als Einzelsprache unterstützt. Der komfortable mehrsprachige Modus deckt nur Englisch und Spanisch ab. Wer Anrufer in Deutsch und einer dritten Sprache erwartet, kann das nicht über den mehrsprachigen Komfortmodus lösen. Die Standardstimme ist Englisch, auch wenn die Sprache auf Deutsch gesetzt ist. Sie muss von Hand geändert werden. Wer das übersieht, bekommt einen deutschsprachigen Auftrag mit englischer Stimme und wundert sich über den ersten Testanruf.
Zusammen mit dem Gegenbefund zur Erkennung von Namen und E-Mail-Adressen außerhalb des Englischen ergibt das ein klares Testprogramm: Stimme umstellen, Deutsch als Einzelsprache setzen, Namen buchstabieren lassen, Mailadresse und Telefonnummer im Gespräch erheben, bekannten Kontakt anrufen und prüfen, ob der Agent ihn erkennt. Was in diesem Test scheitert, ist keine Kleinigkeit in der Oberfläche, sondern die Grenze, mit der das Team leben oder den Anruf weiterleiten muss.
Wann Voice AI, wann lieber ein Workflow
Ein Agent kostet Minuten und entscheidet selbst. Ein Workflow kostet nichts extra und macht immer dasselbe.
| Situation | Was tragen soll | Begründung |
|---|---|---|
| Anrufer stellt eine Frage, die Antwort hängt vom Gespräch ab | Voice AI | Der Agent klärt das Anliegen, entscheidet im Dialog und schreibt das Ergebnis ins CRM. |
| Anruf verpasst, immer dieselbe Rückmeldung | Missed Call Text Back | Dieselbe SMS nach jedem verpassten Anruf. Kein Minutenpreis für einen Agenten, der nichts entscheiden muss. |
| Terminerinnerung 24 Stunden vorher | Workflow | Fester Zeitpunkt, fester Text, keine Entscheidung. Ein Agent kostet Minuten und entscheidet selbst. Ein Workflow kostet nichts extra und macht immer dasselbe. |
Missed Call Text Back ist die richtige Antwort auf den verpassten Anruf, der immer dieselbe SMS auslösen soll. Voice AI ist die richtige Antwort auf den angenommenen Anruf, dessen nächster Satz vom Inhalt abhängt. Eine Terminerinnerung 24 Stunden vorher bleibt ein Workflow. Der Agent würde dafür Minuten verbrauchen, um einen Text zu sagen, den der Workflow ohne Entscheidung verschickt.
Dieselbe Logik gilt neben dem Telefon. Conversation AI übernimmt Chat und SMS, SuperAgents die CRM-Aufgaben nach einem Trigger, Agent Studio den Unterbau für Agenten, die du nicht am Telefon brauchst. Voice AI bleibt der Kanal Leitung. Wer alles in einen Agenten stopft, zahlt Minuten für Arbeit, die ein Workflow umsonst erledigt.
Wir setzen GoHighLevel täglich für eigene Kunden ein
Wir setzen GoHighLevel täglich für eigene Kunden ein, vom Handwerksbetrieb über die Werkstatt bis zur Praxis. Der Nutzen entsteht durch saubere Aufgabenteilung, nicht durch einen möglichst mächtigen Agenten. Voice AI nimmt den Anruf an, der Workflow gibt den Takt nach dem Gespräch, der Mensch übernimmt, sobald es um den Auftrag selbst geht. Wenn du klären willst, welche Anrufe bei dir so liegen bleiben, dass sich ein Agent lohnt, gehen wir das im Gespräch durch.
Häufige Fragen zu GoHighLevel Voice AI
Spricht Voice AI Deutsch?
Ja. Deutsch ist als Einzelsprache offiziell unterstützt. Der komfortable mehrsprachige Modus deckt dagegen nur Englisch und Spanisch ab. Die Standardstimme bleibt Englisch, auch wenn du die Sprache auf Deutsch setzt. Die Stimme musst du von Hand umstellen. Ein Blogartikel vom Juli 2026 berichtet außerdem, dass Voice AI sich außerhalb des Englischen weiterhin schwer damit tut, Namen und E-Mail-Adressen zu buchstabieren. Das ist eine Drittquelle, HighLevel hat diesen Befund nicht offiziell bestätigt.
Was ist der Unterschied zu Conversation AI?
Conversation AI ist Chat und SMS. Voice AI ist Telefon. Beide sitzen in GoHighLevel und können Termine buchen oder Felder schreiben, aber sie arbeiten auf unterschiedlichen Kanälen. Ein Chatbot liest und schreibt Text. Voice AI nimmt Anrufe entgegen, spricht und legt danach einen Datensatz im CRM an, nicht nur eine Sprachnachricht. Wer Messaging automatisieren will, bleibt bei Conversation AI. Wer das Telefon besetzen will, richtet Voice AI ein.
Kann der Agent Termine umbuchen?
Umbuchen und Absagen sind für Voice AI nicht offiziell dokumentiert. Offiziell kann der Agent Termine in einen einzelnen Kalender oder über mehrere Kalender hinweg buchen, freie Zeiten anbieten, fehlende Angaben wie die E-Mail-Adresse erheben und die Buchung im Gespräch bestätigen. Buchung nach Services ist offiziell nicht unterstützt. Eine Drittquelle schreibt ausdrücklich, dass Conversation AI Terminänderungen bereits kann und die Umsetzung für Voice AI erst geplant ist. Das ist unbestätigt. Plane Umbuchen und Absagen deshalb nicht als vorhandene Voice-AI-Funktion.
Was kostet Voice AI wirklich?
Drei offizielle Wege: Pay-per-Use ohne Grundgebühr, AI Employee Growth für 50 US-Dollar im Monat je Unterkonto und AI Employee Unlimited für 97 US-Dollar im Monat. Telefoniekosten fallen bei allen Anrufen zusätzlich an, unabhängig vom Plan. Dazu kommen Voice Engine als Minutenpreis für die Sprachverarbeitung, TTS als Minutenpreis für die Sprachausgabe und die Tokenkosten des gewählten Modells. Laut Drittquelle liegen Voice Engine bei 0,045 US-Dollar je Minute und die Standard-Sprachausgabe bei 0,015 US-Dollar je Minute. Auch abgebrochene Gespräche kosten Minuten. Die Drittquellen-Zahlen sind nicht offiziell bestätigt.
Brauche ich Programmierkenntnisse, um Voice AI einzurichten?
Für den Basis-Agenten nicht. Sprache, Stimme, Modell und Idle Reminder stellst du im Builder ein, ohne Code. Custom Actions sind die Ausnahme: Dort trägst du Adresse, Kopfzeilen, Authentifizierung und die Werte ein, die im Gespräch erhoben werden. Das ist eine Webhook-Konfiguration, kein Canvas und kein Skript, das du schreiben musst. Es gibt einen Testmodus, der die vollständige Anfrage samt Kopfzeilen und die rohe Antwort zeigt, etwa 200 OK oder 404 Not Found. Wer die Schnittstelle des Warenwirtschaftssystems nicht kennt, kommt an dieser Stelle nicht weiter. Der Rest des Agenten braucht das nicht.
Was ist Speech-to-Speech?
Klassische Sprachbots arbeiten in einer Kette aus Spracherkennung, dann Sprachmodell, dann Sprachausgabe. Bei jedem Schritt geht Information verloren, besonders bei Ziffernfolgen. Speech-to-Speech-Modelle verarbeiten Audio direkt, ohne den Umweg über Text. Im Modellmenü tauchen laut einem öffentlich einsehbaren Video vom September 2026 die Optionen GPT Realtime 2.1, GPT Realtime 2 und Gemini 3.1 Flash Live Preview auf, letztere ausdrücklich als Beta gekennzeichnet. HighLevel führt diese Namen in der offiziellen Dokumentation bisher nicht. Offiziell belegt sind Google Gemini, OpenAI GPT und Anthropic Claude als Anbieter.
Was passiert bei einem Notfall?
Voice AI ist kein Notrufsystem. Offiziell dokumentiert ist die Aktion „Anruf weiterleiten“. Wenn du den Agenten so einrichtest, dass er bei bestimmten Anliegen weiterleitet, kann er das Gespräch an eine Nummer oder einen Mitarbeiter geben. Ob der Agent eine Notsituation selbst erkennt, ist offiziell nicht beschrieben. Für Betriebe, die echte Notfälle am Telefon erwarten, gehört die Weiterleitung in den Auftrag und in die Aktionen, nicht als Annahme in den Kopf. Der Agent entscheidet nur innerhalb der Regeln, die du ihm gibst, und höchstens 15 Aktionen je Anruf.
Verwandte Funktionen
Voice AI hängt eng mit diesen anderen GoHighLevel-Funktionen zusammen
Conversation AI (Chatbot)
KI-Chatbot für Messaging
Mehr erfahrenLC-Phone System
VoIP-Telefonsystem mit Nummern
Mehr erfahrenWorkflow Automation
Visuelle Workflow-Erstellung
Mehr erfahrenKalender & Buchung
Terminbuchungssystem
Mehr erfahrenMissed Call Text Back
Automatische SMS bei verpasstem Anruf
Mehr erfahrenSuperAgents
KI-Agenten per Beschreibung bauen statt im Canvas klicken
Mehr erfahren