Qualitätssicherung im Callcenter: wie QA-Scorecards funktionieren

Riellvriany Indriawan
Geschrieben von

Riellvriany Indriawan

Katelin Teen
Geprüft von

Katelin Teen

Zuletzt bearbeitet July 7, 2026

Expertengeprüft
Eine Qualitätssicherungs-Scorecard bei der Bewertung eines Kundensupport-Gesprächs

Was Qualitätssicherung im Callcenter eigentlich bedeutet

Jedes Supportteam stellt sich irgendwann eine Version der Frage "machen wir wirklich gute Arbeit, oder fühlt es sich nur so an?". Qualitätssicherung ist die Antwort auf diese Frage, in einen Prozess gegossen. Es ist die systematische Überprüfung von Support-Interaktionen - Anrufe, Chats, E-Mails, Tickets - anhand eines definierten Standards, damit "guter Service" aufhört, ein Gefühl zu sein, und stattdessen zu einer Zahl wird, auf die ein Manager verweisen kann.

Der Mechanismus, der fast jedem QA-Programm zugrunde liegt, ist die Scorecard: ein strukturiertes Bewertungsformular mit gewichteten Bewertungskategorien, das ein Prüfer - menschlich oder zunehmend KI - nach dem Lesen oder Anhören eines Gesprächs ausfüllt. Wie Zendesk es formuliert, existieren Scorecards, um "die Leistung von Agenten zu bewerten, Verbesserungspotenziale zu identifizieren und sicherzustellen, dass dein Team die Unternehmensziele erreicht". QA sitzt neben Personaleinsatzplanung und -prognose unter dem Oberbegriff Workforce Engagement Management (WEM) - die meisten Anbieter, Zendesk eingeschlossen, verkaufen es als eines von zwei oder drei Modulen dieser Suite.

Es ist aus Gründen wichtig, die sich verstärken, je größer ein Team wird. Ein Team aus drei Agenten kann von einem Manager geprüft werden, der einfach... alles liest. Ein Team aus dreißig kann das nicht. Scorecards und Sampling sind das, was es einer QA-Funktion erlaubt, über hunderte Agenten hinweg vergleichbare Bewertungen zu erzeugen, ohne dass ein Manager jedes einzelne Ticket persönlich lesen muss. Sie sind auch das Rohmaterial für Coaching - man kann darauf hinweisen, dass ein bestimmter Agent konsequent den Abschlusssatz auslässt, statt einer vagen "sei gründlicher"-Notiz in einem 1:1. Und in regulierten Branchen (Finanzdienstleistungen, Gesundheitswesen, Inkasso) haben QA-Scorecards oft rechtliches Gewicht: eine ausgelassene Offenlegung ist keine Stilfrage, sondern ein Compliance-Verstoß.

Auch der Business Case ist nicht abstrakt. Auf Zendesks eigener QA-Produktseite berichtet das Radiosendernetzwerk Audacy von 19% mehr Agentenproduktivität und 15% mehr Lösungen beim ersten Kontakt nach Einführung von strukturiertem QA; bei Kahoot! stieg der CSAT um 5 Prozentpunkte, begleitet von einem Sprung um 150% bei der Zahl tatsächlich geprüfter Tickets; Liberty berichtete von +2,3% CSAT und +4% beim eigenen Internal Quality Score. Keine dieser Zahlen ist QA um seiner selbst willen - sie zeigen, was passiert, wenn ein Team endlich seine eigenen blinden Flecken sehen kann.

Wie eine QA-Scorecard tatsächlich funktioniert

Entfernt man die Anbieter-Dashboards, ist eine Scorecard schlicht ein gewichteter Durchschnitt. Jede Kategorie - Genauigkeit, Tonfall, Empathie, Grammatik, Lösung, Compliance - erhält eine Bewertungsskala und eine Gewichtung von 0 bis 100. Zendesks Dokumentation ist unmissverständlich, was die Mathematik angeht: "Um die Bewertungspunktzahl einer Interaktion zu berechnen, multiplizierst du die Punktzahl jeder Kategorie mit ihrer Gewichtung und teilst die Summe dann durch die Summe der Gewichtungen." Ein Team, dem Ursachenverständnis wichtiger ist als Dokumentationsstil, gewichtet Ursachenanalyse einfach höher - die Formel erledigt den Rest.

Die gewählte Skala tauscht Geschwindigkeit gegen Nuancen. Zendesk QA bietet vier davon:

SkalaWie sie aussiehtAm besten geeignet für
BinärGut / schlechtHohes Volumen, schnelle Prüfungen
3-stufigGut / zufriedenstellend / schlechtEtwas mehr Nuance, immer noch schnell
4-stufigGut / eher gut / eher schlecht / schlechtErzwingt eine klare Entscheidung, keine neutrale Mitte
5-stufigBenotung im A-E-StilDetailliertestes Feedback, am langsamsten zu bewerten

Zwei Mechanismen leisten den Großteil der Arbeit in einem ausgereiften QA-Programm. Der erste ist die kritische Kategorie - markiere "Stornogebühr offengelegt" als kritisch, und eine schlechte Bewertung dort setzt die gesamte Prüfung auf 0%, egal wie warm und fehlerfrei der Rest der Antwort war. Das ist der Hebel, den regulierte Teams ziehen, um sicherzustellen, dass ein Compliance-Fehler nicht durch einen guten Tonfall wegdurchschnittet werden kann. Der zweite ist das Root-Cause-Tagging: statt einfach "Empathie: schlecht" zu bewerten, wählt der Prüfer einen vordefinierten Grund aus einer Liste - genau das macht QA-Daten für Coaching nützlich, statt nur eine Zahl zu sein, über die sich der Agent ärgert.

Das hauseigene AutoQA-System von Zendesk QA kommt mit acht Standardkategorien, die automatisch bewertet werden, sobald ein Ticket geschlossen wird:

KategorieWas geprüft wird
BegrüßungHat der Agent den Kunden begrüßt?
EmpathieWar der Agent empathisch gegenüber dem Anliegen?
Rechtschreibung und GrammatikFehler, Tippfehler, Stilfehler
AbschlussHat der Agent ordentlich abgeschlossen und weitere Hilfe angeboten?
Lösung angebotenHat der Agent während des Chats eine Lösung vorgeschlagen?
TonfallEingeteilt in 7 Grundtöne (fröhlich, unterstützend, ruhig usw.)
LesbarkeitWortkomplexität und Satzlänge
VerständnisHat der Agent das Problem tatsächlich verstanden?

(Zendesk Help Center)

AutoQA bewertet ein Gespräch anhand benutzerdefinierter Prompt-Kategorien wie Tonfall, Lösung und klare Anweisungen und erreicht dabei einen Erfolgswert von 92%, entnommen von Zendesk
AutoQA bewertet ein Gespräch anhand benutzerdefinierter Prompt-Kategorien wie Tonfall, Lösung und klare Anweisungen und erreicht dabei einen Erfolgswert von 92%, entnommen von Zendesk

Hier die Mathematik im Kleinen: Angenommen, Genauigkeit ist mit 40 gewichtet, Tonfall mit 20 und Compliance mit 40. Ein Agent erzielt 90% bei Genauigkeit, 100% bei Tonfall und 80% bei Compliance. Gewichtet ergibt das (90×40 + 100×20 + 80×40) ÷ 100 = 88%. Ändere die Gewichtungen, und dieselbe zugrunde liegende Leistung ergibt eine andere Kopfzahl - genau deshalb ist Kalibrierung (unten) so wichtig.

Mathematik einer gewichteten QA-Scorecard: drei Kategorie-Karten mit Gewichtungen und Punktzahlen fließen in ein einziges Ergebnis von 88% zusammen
Mathematik einer gewichteten QA-Scorecard: drei Kategorie-Karten mit Gewichtungen und Punktzahlen fließen in ein einziges Ergebnis von 88% zusammen

Sampling: die Mathematik, die still und leise aufgehört hat zu funktionieren

Für den größten Teil der QA-Geschichte konnte ein menschlicher Prüfer nicht jede Interaktion anhören oder lesen, also bauten Teams die gesamte Disziplin um das Zufalls-Sampling herum auf - eine Handvoll Tickets pro Agent und Woche herausgreifen, diese bewerten, hochrechnen.

Das Problem ist, dass die Mathematik auf Teamebene gut aussieht und auf Agentenebene zusammenbricht. Leo Gasperin hat das in einem LinkedIn-Beitrag über sein früheres Team unverblümt dargelegt: Sie verbrachten 200 Stunden im Monat damit, Tickets nach strengen Kriterien zu prüfen, und deckten trotzdem nur etwa 5% des Gesamtvolumens ab. Wöchentlich 5-10 Tickets von den etwa 500 monatlichen Tickets eines Agenten zu prüfen, ergibt keine statistisch belastbare Aussage über diesen Agenten, selbst wenn die gesamte Sampling-Quote auf einem QA-Dashboard akzeptabel aussieht. Seine Lösung, wörtlich: "100% mit KI-Agenten als konfigurierte Bewerter auditieren, und dann nur die Probleme überprüfen." Eine Kommentatorin desselben Beitrags, Shubhashree S., brachte den Fehlerfall in einem Satz auf den Punkt: "Sampling schafft Vertrauen, aber keine Klarheit."

Das ist keine Randbeschwerde. Auf G2 beschrieb eine MaestroQA-Rezensentin, die als Executive Director arbeitet, den vorherigen Zustand direkt: "wir haben QA anhand einer Zufallsstichprobe von Tickets gemacht", bevor sie zu einem Tool wechselte, das ihrem Team stattdessen "gezielte QA" ermöglichte. Aus einem anderen Blickwinkel ist es dieselbe Geschichte bei evaluagent, wo ein Senior Advisor im Luftfahrt-Support genau das Problem benennt, das KI-AutoQA lösen soll: es "löst das Problem der eingeschränkten Sichtbarkeit durch QA-Sampling und reduziert Zeit und Aufwand für manuelle Prüfungen."

Manuelles Sampling, das 5% der Tickets prüft, im Vergleich zu KI-AutoQA, das 100% der Tickets prüft, dargestellt als zwei Gitter aus Ticket-Symbolen
Manuelles Sampling, das 5% der Tickets prüft, im Vergleich zu KI-AutoQA, das 100% der Tickets prüft, dargestellt als zwei Gitter aus Ticket-Symbolen

Kalibrierung: Prüfer tatsächlich zur Übereinstimmung bringen

Scorecards funktionieren nur, wenn zwei Prüfer, die dasselbe Ticket bewerten, zum gleichen Ergebnis kommen. Diese Abstimmungsübung heißt Kalibrierung, und Zendesks eigene Definition trifft genau das, wonach es klingt: "die Praxis, alle Prüfer dieselbe Charge von Gesprächen bewerten zu lassen und ihre Punktzahlen und Kommentare zu vergleichen ... sorgt dafür, dass deine Prüfer in ihren Bewertungen aufeinander abgestimmt sind und Agenten konsistentes Feedback erhalten, unabhängig davon, wer die Prüfung durchführt."

Mechanisch läuft es meist nach dem Muster "erst prüfen, dann diskutieren": Prüfer bewerten unabhängig voneinander, ein Manager markiert eine Prüfung als Baseline, und die Gruppe trifft sich, um Lücken zu klären - oft mit einem QA-Lead, der bei Streitfragen die endgültige Entscheidung trifft. Was tatsächlich abgestimmt werden muss, sind selten die großen Dinge; es sind die Grenzfälle. Wie bewertet man eine Kategorie, die in diesem konkreten Gespräch nie vorkam? Wie lang sollte schriftliches Feedback sein? Kalibrierungswerte werden bewusst aus dem laufenden Internal Quality Score eines Agenten herausgehalten und leben in ihrem eigenen Dashboard, genau damit die Übung darauf ausgerichtet bleibt, Prüfer zu trainieren, statt zu einem zweiten, versteckten Bewertungskanal zu werden. Die meisten Teams machen das monatlich.

Der Wandel hin zu KI, die 100% der Gespräche prüft

Jeder wichtige QA-Anbieter, den ich mir angesehen habe, konvergiert auf dasselbe Verkaufsversprechen, und es lohnt sich, es klar zu benennen: KI prüft jede Interaktion und ersetzt manuelles Sampling vollständig, während die Scorecard-und-Kalibrierung-Struktur als Rückgrat darunter erhalten bleibt.

Zendesk QA (früher Klaus) führt mit AutoQA an - es bewertet 100% der Gespräche über Sprache, Chat, E-Mail und KI-Agenten-Transkripte hinweg, wobei Admins benutzerdefinierte, promptbasierte Kategorien in einfacher Sprache statt in Code schreiben können. Die Spotlight-Funktion markiert automatisch Abwanderungsrisiko und Wissenslücken, ohne dass ein Mensch jeden markierten Thread lesen muss, und Real-time QA bringt Probleme ans Licht, während ein Gespräch noch läuft, statt erst danach.

Spotlight markiert automatisch ein laufendes Gespräch wegen Eskalationsrisiko und eines schutzbedürftigen Kunden
Spotlight markiert automatisch ein laufendes Gespräch wegen Eskalationsrisiko und eines schutzbedürftigen Kunden

Am aufschlussreichsten finde ich AI Agent QA - dieselben Bewertungsstandards, die bei menschlichen Agenten verwendet werden, angewendet auf Bots. Zendesk vergleicht ausdrücklich die Werte von menschlichen und KI-Agenten nebeneinander, um zu sehen, wo der Bot nachbessern muss - was still und leise etwas bestätigt, das man sich bewusst machen sollte: Sobald ein KI-Agent echte Tickets bearbeitet, braucht er auch einen QA-Prozess, keinen Freifahrtschein nur weil er Software ist.

QA bewertet automatisch 100% der Gespräche von KI-Agenten anhand derselben Kategorien, die auch bei menschlichen Agenten angewendet werden
QA bewertet automatisch 100% der Gespräche von KI-Agenten anhand derselben Kategorien, die auch bei menschlichen Agenten angewendet werden

MaestroQA hat sich weiter von der Marke "QA-Tool" entfernt und nennt sich mittlerweile eine Conversation-Data-Plattform - die eigene Homepage rahmt diesen Wandel direkt so: "Wir haben als Contact-Center-QA-Unternehmen angefangen ... Seit ChatGPT 2023 aufkam, ist die Analyse von Gesprächsdaten zur C-Level-Priorität geworden." Die DraftKings-Case-Study ist als vollständiger Ersatz manueller QA-Prüfungen gerahmt, und Brex berichtet von 20-mal mehr erkannten gefährdeten Kunden, nachdem der eigene QA-Prozess rund um die Plattform neu aufgebaut wurde - ein Sprung, der laut Case Study so groß war, dass die COO von Brex dem Team angeblich nach einer einzigen Vorschau sagte: "kein manuelles QA mehr."

Playvox, inzwischen Teil von NICE, spielt eine ähnliche Rolle innerhalb einer breiteren Workforce-Engagement-Suite - flexible Scorecards, Kalibrierung und native Zendesk-/Salesforce-Integrationen -, wobei die eigenen Marketing-Seiten Scraping aktiv blockieren, weshalb konkrete Angaben zu Playvox eher als Orientierung denn als verifiziert zu behandeln sind.

Zendesk QAMaestroQAPlayvox
PositionierungQA-Add-on zu Support/SuiteConversation-Data-PlattformQA innerhalb der WEM-Suite (jetzt Teil von NICE)
AbdeckungsmodellAutoQA bewertet 100% der GesprächeKI-Prüfung ersetzt manuelles SamplingIndividuelle Scorecards, KI-Abdeckungsgrad unbestätigt
Bewertet auch KI-AgentenJa - AI Agent QAJa - Bot-/Chatbot-MonitoringUnbestätigt
KalibrierungIntegriert, Baseline-VergleichNicht der HauptfokusIntegriert
ComplianceSOC 2 Type 2, GDPR, HIPAA-fähigNicht veröffentlichtNicht veröffentlicht
PreisAdd-on, nicht öffentlichAuf AnfrageAuf Anfrage

Praktiker vor Ort bestätigen eher den Coaching- als den Benotungsgedanken. Eine MaestroQA-Rezensentin, die als unabhängige Auftragnehmerin arbeitet, brachte es gut auf den Punkt: "es hört auf, Qualitätsprüfungen wie einen simplen 'Bestanden/Nicht bestanden'-Test zu behandeln, und macht sie zu einer echten Möglichkeit, Menschen zu coachen." Und eine echte QA-Analystin - keine Managerin, sondern die Person, die die Bewertung tatsächlich Tag für Tag vornimmt - beschrieb zweieinhalb Jahre mit MaestroQA "zuerst als Agentin, die ihre eigenen Qualitätswerte überwachte, und jetzt als Quality Analyst, die die gesamte Bewertung durchführt", und bezeichnete den Prozess als "extrem unkompliziert."

Reibungslos ist es nicht. Ein Founder aus der Telekommunikationsbranche wies auf G2 auf einen echten Kosten-Stolperstein hin: "KI-Funktionen erfordern einen zusätzlichen Kauf, der die Kosten erheblich in die Höhe treibt" - budgetiere KI-Bewertung als zusätzlichen Posten über dem Basis-QA-Produkt, nicht als kostenloses Upgrade. Und eine Operations-Führungskraft bei evaluagent brachte eine kleinere, aber echte UX-Beschwerde aus Sicht des Agenten vor: Benachrichtigungs-E-Mails zu Bewertungen, die nur sagen, dass eine Prüfung stattgefunden hat, ohne das eigentliche Ergebnis - was er als "beunruhigend" beschrieb und als etwas, das ihn "ängstlich macht und dazu bringt, sofort Evaluagent zu öffnen." Ein technisch rigoroses QA-Programm kann trotzdem schlecht ankommen, wenn sich die agentenseitige Seite davon anfühlt wie ins Rektorenzimmer zitiert zu werden.

Wenn der bewertete Agent KI ist, kein Mensch

Hier kommen meine eigenen, echten Zahlen ins Spiel, denn genau das ist die Frage, die ein QA-Programm beantworten muss, sobald ein KI-Agent in die Warteschlange aufgenommen wird: nicht "klingt die KI richtig", sondern "hält sie derselben Scorecard stand, die man auch bei einem Menschen anlegen würde".

In einem kreuzvalidierten Test, den wir gegen echten Zendesk-Traffic für ein E-Commerce-Team durchgeführt haben, erreichte die KI von eesel 93% Triage-Genauigkeit und 100% Spam-Erkennung ohne falsch-positive Treffer, bei einem Posteingang, in dem Spam 22% des Gesamtvolumens ausmachte. Die direktionale Genauigkeit der Entwürfe lag bei 88%, was bedeutet, dass die inhaltliche Substanz der Antwort fast neun von zehn Mal auf dem richtigen Weg war. Aber nur 12% der Entwürfe wurden von Agenten so versendet, wie sie waren, und die Rate an sachlichen Fehlern lag bei 7%. Die Leistung nach Kategorie schwankte stark: Entwürfe zu Rückgaben und Rückerstattungen wurden in 93,8% der Fälle als nützlich bewertet, Garantieansprüche in 96,4%, und sowohl Produktanfragen als auch Nachfragen zum Rückerstattungsstatus erreichten jeweils 100%.

Balkendiagramm: Triage-Genauigkeit 93%, direktionale Entwurfsgenauigkeit 88%, unverändert von Agenten versendet 12%, Rate sachlicher Fehler 7%
Balkendiagramm: Triage-Genauigkeit 93%, direktionale Entwurfsgenauigkeit 88%, unverändert von Agenten versendet 12%, Rate sachlicher Fehler 7%

Die Lücke zwischen 88% direktionaler Genauigkeit und 12% unveränderter Übernahme ist der Teil, über den es sich nachzudenken lohnt. Es lag nicht daran, dass die Agenten dem Urteil der KI nicht vertrauten - das dominante Muster war "kurz drüberschauen und umschreiben": Agenten nahmen einen Entwurf aus 8-15 Sätzen und kürzten ihn vor dem Versenden auf 1-3 Sätze. Schlüsselt man dieses Umschreib-Muster auf, waren rund 65% davon reine Länge- und Tonfall-Bearbeitung, behebbar, indem man den Agenten anhand der tatsächlich vom Team in der Vergangenheit versendeten Antworten trainiert. Weitere 20% benötigten Daten, mit denen die KI schlicht noch nicht verbunden war, etwa Live-ERP- oder Logistikstatus. Nur etwa 5% der Umschreibungen erfolgten, weil der Entwurf schlichtweg sachlich falsch war. Ein Training mit einer Stichprobe von 200 aktuellen Agentenantworten brachte die unveränderte Übernahmerate von 12% in Folgetests in den Bereich von 30-40%.

Ich erwähne das, weil es genau das Muster ist, das eine echte QA-Scorecard aufdecken soll - und genau das Muster, das unsichtbar bleibt, wenn man nur 5% der Tickets stichprobenartig prüft. Wenn dein QA-Programm dir nicht sagen kann, ob die Entwürfe deines KI-Agenten falsch sind oder sich nur stilistisch von der Schreibweise deines Teams unterscheiden, misst du in Wirklichkeit gar keine Qualität - du misst ein Bauchgefühl mit ein paar Extraschritten.

Dieser Unterschied zeigt sich sogar schon, bevor ein Kunde überhaupt eine Live-Antwort sieht. Ein Interessent, der eesel evaluierte - ein Support-Leiter bei einem belgischen Unternehmen - baute sich eine eigene 67-Test-Bewertung auf, bevor er dem Tool echte Tickets anvertraute, und bewertete die Wissensantworten insgesamt als "solide" (er entschied sich letztlich aus einem unabhängigen Grund dagegen: Geschwindigkeit des Chat-Widgets, nicht Antwortqualität). Das ist ein QA-Prozess im Kleinen, durchgeführt von einem Käufer statt von einem Anbieter - und genau der Instinkt, den ich mir bei jedem Team wünsche, das einen KI-Agenten evaluiert: nimm nicht "es macht in der Demo einen guten Eindruck" als deine Scorecard.

Eine praktische QA-Scorecard, die du diese Woche aufbauen kannst

Man braucht keine WEM-Plattform, um anzufangen. Eine funktionierende erste Scorecard braucht vier Dinge:

  1. Wähle 4-6 Kategorien, die tatsächlich das abbilden, was für dein Geschäft wichtig ist - Genauigkeit, Tonfall, Lösung und, im regulierten Umfeld, eine compliance-kritische Kategorie. Wenige gut gewählte Kategorien schlagen ein aufgeblähtes 15-Punkte-Formular, das niemand konsistent ausfüllt.
  2. Wähle zu Beginn binäre oder 3-stufige Skalen. Nuancierte 5-stufige Skalen klingen rigoros, verlangsamen aber Prüfungen und führen zu mehr Uneinigkeit zwischen Prüfern - genau das, wofür Kalibrierung existiert. Fang einfach an, füge Nuancen hinzu, sobald das Programm läuft.
  3. Gewichte, was tatsächlich Ergebnisse beeinflusst, nicht das, was am leichtesten zu bewerten ist. Wenn Ursachendiagnose für deine Verlängerungsquote wichtiger ist als eine perfekt interpunktierte Antwort, gewichte es entsprechend - die Formel kümmert sich nicht darum, was bequem zu bewerten ist.
  4. Kalibriere, bevor du coachst. Führe eine Kalibrierungssitzung mit deinen Prüfern anhand derselben 10 Tickets durch, bevor die erste echte Bewertung jemandes rausgeht. Uneinigkeit ist hier normal und erwartet - das ist der ganze Sinn, es zuerst zu tun.
Coaching-Sitzungen und Follow-up-Aktionspunkte, geplant auf Basis von QA-Prüfungsdaten
Coaching-Sitzungen und Follow-up-Aktionspunkte, geplant auf Basis von QA-Prüfungsdaten

Sobald diese Scorecard für deine menschlichen Agenten existiert, wende sie auch auf deinen KI-Agenten an - einschließlich jedes Teils deines Stacks, der Eskalationen oder Callcenter-Automatisierung übernimmt. Dieselben gewichteten Kategorien, dieselbe kritische Compliance-Regel, dieselbe Kalibrierungsdisziplin. Ein KI-Agent, der nie an deiner echten Scorecard gemessen wurde, läuft nach Gefühl, genau wie es ein untrainierter Neuzugang tun würde.

eesel und Qualitätssicherung

Ich arbeite in der Support-Warteschlange von eesel, und die ehrliche Antwort auf "sollte ich den Antworten eines KI-Agenten vertrauen, ohne sie zu prüfen" lautet nein - man sollte niemandes Antworten ungeprüft vertrauen, weder Mensch noch KI. Deshalb baut eesel QA direkt in den Rollout ein, statt es als separates, nachträglich angeflanschtes Programm zu behandeln. Bevor ein Agent überhaupt ein Live-Ticket beantwortet, lässt der Simulationsmodus ihn gegen die eigenen historischen Tickets laufen, sodass man Abdeckung nach Thema sehen und Lücken erkennen kann, bevor ein Kunde sie je zu sehen bekommt - das Nächste, was einer vor dem Launch statt danach durchgeführten QA-Scorecard kommt. Sobald es live ist, fungiert vertrauensbasiertes Routing als laufendes QA-Gate für jede einzelne Antwort: Antworten mit niedrigem Konfidenzwert werden als Entwurf zurückgehalten, damit ein Mensch sie prüft, statt sie blind zu versenden - dieselbe Logik, die Zendesks AI Agent QA nachträglich anwendet, nur früher im Ablauf verschoben.

eesel-AI-Reports-Dashboard mit Analysen
eesel-AI-Reports-Dashboard mit Analysen

Wenn du bereits ein QA-Programm für dein menschliches Team betreibst und überlegst, ob ein KI-Agent derselben Messlatte standhalten könnte, ist genau das ein Gespräch, das sich lohnt: eesel lässt sich kostenlos testen, und die Preisgestaltung ist nutzungsbasiert pro Ticket statt einer festen Sitzplatzgebühr - Testen gegen deine eigene Scorecard erfordert also keinen vorgeschalteten Beschaffungsprozess.

Häufig gestellte Fragen

Was ist Qualitätssicherung im Callcenter?
Qualitätssicherung (QA) im Callcenter bzw. Kundensupport ist die Praxis, Support-Interaktionen - Anrufe, Chats, E-Mails, Tickets - anhand einer strukturierten QA-Scorecard zu überprüfen, um festzustellen, ob der Agent die Interaktion korrekt, markenkonform und regelkonform bearbeitet hat. Es ist der Mechanismus, der aus 'haben wir gute Arbeit geleistet' einen gemessenen, wiederholbaren Prozess macht, statt eines Bauchgefühls des Managers.
Was misst eine QA-Scorecard eigentlich?
Eine Scorecard ist eine Reihe gewichteter Kategorien - Genauigkeit, Tonfall, Empathie, Compliance, Lösung - die jeweils auf einer Skala (binär, 3-stufig, 4-stufig oder 5-stufig) bewertet und mit ihrer Gewichtung multipliziert werden, um eine Gesamtpunktzahl zu ergeben. Manche Kategorien sind als 'kritisch' markiert, was bedeutet, dass eine niedrige Bewertung dort die gesamte Prüfung auf null setzt, egal wie gut der Rest war. Sieh dir unsere Aufschlüsselung des Zendesk-QA-Workflows für ein durchgerechnetes Beispiel an.
Wie oft sollten QA-Prüfer kalibrieren?
Die meisten Teams führen Kalibrierungssitzungen monatlich durch, bei denen Prüfer unabhängig voneinander dieselbe Charge von Gesprächen bewerten und sich anschließend treffen, um Unstimmigkeiten bei der Bewertungsskala, Grenzfällen und dem Feedback-Ton zu klären. Kalibrierungswerte werden getrennt vom laufenden Qualitätswert eines Agenten geführt, damit die Übung darauf ausgerichtet bleibt, Prüfer aufeinander abzustimmen, statt Agenten zu bewerten.
Kann KI Qualitätssicherung im Callcenter tatsächlich übernehmen?
Ja - AutoQA von Zendesk QA, MaestroQA und Playvox bewerten mittlerweile alle 100% der Gespräche automatisch nach derselben Kategorielogik, die auch ein menschlicher Prüfer anwenden würde, und ersetzen damit das alte Modell, bei dem manuell nur eine Handvoll Tickets pro Agent und Woche gestichprobt wurde. eesel geht noch einen Schritt weiter, indem es ähnliche Leitplanken auf seine eigenen KI-verfassten Antworten anwendet, bevor sie überhaupt einen Kunden erreichen.
Warum bricht manuelles QA-Sampling zusammen, wenn ein Team wächst?
Ein Team, das etwa 5-10 Tickets pro Agent und Woche prüft, kann auf Teamebene statistisch unauffällig wirken, deckt dabei aber unter 5% des gesamten Ticketvolumens ab - bei weitem nicht genug, um in der Arbeit eines einzelnen Agenten ein echtes Muster zu erkennen. Diese Lücke ist der Hauptgrund, warum Teams zu vollständiger KI-Prüfung statt zu Stichproben wechseln.
Wie viel kostet Callcenter-QA-Software?
Zendesk QA wird als Add-on zu bestehenden Support- oder Suite-Plänen verkauft, und sowohl MaestroQA als auch Playvox sind ohne öffentlichen Preis - man füllt ein Kontaktformular für den Vertrieb aus und erhält ein auf Ticketvolumen und Sitzplatzanzahl zugeschnittenes Angebot. Rechne damit, dass KI-Bewertungsfunktionen zusätzlich zum Basis-QA-Produkt kosten; mehrere Rezensenten nennen das ausdrücklich als Preisüberraschung.
Was ist der Unterschied zwischen QA und CSAT?
CSAT ist die eigene Bewertung des Kunden für eine einzelne Interaktion; QA ist die strukturierte Bewertung eines Prüfers dazu, wie der Agent sie gehandhabt hat. Ein Ticket kann bei CSAT hoch bewertet werden, weil der Kunde seine Rückerstattung bekommen hat, und dennoch bei Tonfall oder Compliance an einer QA-Scorecard scheitern - die beiden Kennzahlen erfassen unterschiedliche Fehlerarten.

Share this article

Riellvriany Indriawan

Article by

Riellvriany Indriawan

Riell is a designer and writer at eesel AI with about two years of experience researching CX platforms, AI chatbots, and helpdesk software. She combines her design background with a sharp eye for how these tools actually look and feel in practice — making her comparisons unusually visual and user-focused.

Related Posts

All posts →
Illustration eines Support-Agenten, umgeben von einem sich wiederholenden Stapel Tickets, als Sinnbild für Kundenservice-Motivation und Burnout
Customer Support

Kundenservice-Motivation: Was Agenten wirklich bei der Stange hält

Pizzapartys und Bestenlisten lösen das Motivationsproblem im Kundenservice nicht. Hier ist, was Gallups Daten, Reddit-Agenten und eesels eigene Kunden sagen, was tatsächlich funktioniert.

Riellvriany IndriawanRiellvriany IndriawanJul 6, 2026
Illustration von Support-Tickets, die durch Eskalationsstufen zum richtigen Agenten fließen
Customer Support

Ticket-Eskalationsprozess: So bauen Sie einen, der funktioniert

Ein praktischer Leitfaden zum Ticket-Eskalationsprozess: die zwei Arten der Eskalation, was sie auslöst, ein Schritt-für-Schritt-Aufbau und wo KI heute ins Spiel kommt.

Riellvriany IndriawanRiellvriany IndriawanJul 6, 2026
Illustration der Perspektiven der Kundenverhaltensanalyse und von Support-Datencharts
customer support

Kundenverhaltensanalyse: der Leitfaden eines Support-Teams für 2026

Ein praktischer Leitfaden zur Kundenverhaltensanalyse für Support- und CX-Teams: die fünf Perspektiven, die Kennzahlen, die wirklich zählen, und wie man eine Analyse ohne Data-Team durchführt.

Riellvriany IndriawanRiellvriany IndriawanJul 6, 2026
Illustration eines Live-Chat-Gesprächs mit Sprechblasen auf einem Banner in eesel-Blau
Customer support

Live-Chat-Etikette: 9 Regeln, die Support menschlich wirken lassen

Die Live-Chat-Etikette-Regeln, die den CSAT wirklich bewegen: schnelle Bestätigungen, ein menschlicher Ton, ehrliche Wartezeiten und saubere Übergaben. Von jemandem, der die Queue selbst betreut.

Riellvriany IndriawanRiellvriany IndriawanJul 6, 2026
Illustration eines Support-Tickets, das anhand einer QA-Scorecard mit sechs Kriterien bewertet wird
Customer Service

QA-Feedback-Beispiele für Kundenservice-Teams

Fertige QA-Feedback-Beispiele für Support-Teams: Beispieltexte für Scorecards zu Genauigkeit, Tonfall, Klarheit, Richtlinien und Eskalation – plus wie man sie schreibt.

Riellvriany IndriawanRiellvriany IndriawanJul 6, 2026
Illustration eines SaaS-Support-Teams, das Softwarekunden hilft
customer-support

SaaS-Kundensupport: Best Practices für 2026

Die SaaS-Kundensupport-Best-Practices, die tatsächlich First Response Time, Lösungsquote und CSAT verbessern, von jemandem, der jeden Tag in der Warteschlange arbeitet.

Riellvriany IndriawanRiellvriany IndriawanJul 6, 2026
Illustration von automatisierter Kundenkommunikation, die über Support-Kanäle fließt
Customer Support

Automatisierte Kundenkommunikation: ein praktischer Leitfaden für 2026

Was automatisierte Kundenkommunikation wirklich umfasst, wie KI sie von Anfang bis Ende übernimmt, was sie kostet und wie man sie einführt, ohne das Vertrauen der Kunden zu verlieren.

Riellvriany IndriawanRiellvriany IndriawanJul 6, 2026
Illustration einer Conversational-AI-Chatblase, die an einen Support-Posteingang angeschlossen wird, mit einem Regler für schrittweisen Rollout
Customer Support

Conversational AI implementieren (ohne den Support zu gefährden)

Ein praktischer Leitfaden zur Einführung von Conversational AI in deiner Support-Queue: Aufgabe eingrenzen, Wissen anbinden, Leitplanken setzen, simulieren und schrittweise ausrollen.

Alicia Kirana UtomoAlicia Kirana UtomoJul 6, 2026
Illustration einer KI-Kundensupport-Qualitätsprüfung: eine Scorecard und eine Lupe über Support-Gesprächen
Guides

KI-Kundensupport-Qualitätssicherung: wie Sie Ihrem KI-Agenten wirklich vertrauen können

KI-Support-Qualitätssicherung zeigt, ob Ihr KI-Agent gut antwortet – nicht nur oft. Erfahren Sie, was Sie messen sollten und wie Sie vor und nach dem Launch QA betreiben.

Riellvriany IndriawanRiellvriany IndriawanJun 19, 2026

Bereit, Ihren KI-Teamkollegen einzustellen?

In Minuten eingerichtet. Keine Kreditkarte erforderlich.

Kostenlos starten