Kundenservice-Bewertung: Kennzahlen, Scorecards und KI 2026

Riellvriany Indriawan
Geschrieben von

Riellvriany Indriawan

Katelin Teen
Geprüft von

Katelin Teen

Zuletzt bearbeitet July 4, 2026

Expertengeprüft
Ein Support-Mitarbeiter und ein QA-Prüfer schauen sich das Scorecard-Dashboard eines Agenten an

Was Kundenservice-Bewertung eigentlich misst

Im Grunde ist Kundenservice-Bewertung Qualitätssicherung für den Support. SQM Group, ein CX-Marktforschungsunternehmen, das Hunderte nordamerikanischer Contact-Center benchmarkt, definiert QA als "a process used to ensure and maintain the highest standard of service delivery", umgesetzt durch "monitoring and evaluating agents' performance through various metrics". Es geht nicht um das Audit an sich, sondern um das, was danach kommt: Verbesserungsbereiche erkennen, den Agenten coachen und die Zufriedenheit steigern.

Das Verwirrende daran: Drei verschiedene Dinge werden „die Bewertung" genannt, und sie sind nicht dasselbe:

  • Der QA-Score ist die Zahl, meist zwischen 0 und 100, die die Qualität einer Interaktion anhand festgelegter Kriterien bewertet.
  • Die QA-Scorecard ist das Werkzeug, das ihn erzeugt. Wie SQM es formuliert: "the QA scorecard is used to calculate the CQA score".
  • Das Dashboard ist der Ort, an dem du den Trend im gesamten Team beobachtest.

Du brauchst alle drei, aber sie beantworten unterschiedliche Fragen, genau wie die Kennzahlen, die sie speisen. Eine CSAT-Umfrage sagt dir, wie sich der Kunde gefühlt hat. Eine Lösungsquote sagt dir, ob das Problem tatsächlich geschlossen wurde. Ein QA-Score sagt dir, ob der Agent es gut gehandhabt hat, unabhängig von beidem. Verlässt du dich nur auf eines, bekommst du ein verzerrtes Bild, weshalb die stärksten Kundenservice-Management-Programme sie gemeinsam lesen.

Die drei Ebenen der Support-Kennzahlen, von operativ über Qualität bis zum Ergebnis
Die drei Ebenen der Support-Kennzahlen, von operativ über Qualität bis zum Ergebnis

Die Kennzahlen, die wirklich zählen

Das sagt einem niemand, wenn man anfängt, ein Bewertungsprogramm aufzubauen: Man kann fast alles messen, weshalb die meisten Teams zu viel messen und auf nichts davon reagieren. SQM hat hier einen nützlichen Befund geliefert. Von den sieben Merkmalen eines wirksamen KPI erfüllen nur First Contact Resolution, CSAT und der Customer Service QA-Score alle sieben. Das ist dein Kern. Alles andere ist Nebendarsteller.

Ein kurzer Überblick über die Kennzahlen, die es zu verfolgen lohnt, mit SQMs Benchmarks aus über 500 Contact-Centern, damit du weißt, wie „gut" aussieht:

KennzahlWas sie dir sagtBranchendurchschnitt„Gut"Weltklasse
First Contact ResolutionProblem beim ersten Kontakt gelöst, kein Rückruf70%70–79%80%+ (nur ~5% erreichen das)
CSATWie zufrieden sich der Kunde nach dem Kontakt fühlte78%75–84%85%+
QA-ScoreQualität der Interaktion gemessen an deiner Scorecard85%90–99%100%
Durchschnittliche BearbeitungszeitWie lange der Kontakt dauerte~7 minkontextabhängigmaximiert, nicht minimiert
AbbruchquoteKunden, die auflegen, bevor sie einen Agenten erreichen6%unter 5%3% oder weniger
ServicelevelKontakte, die innerhalb einer Zielzeit beantwortet wurden80/2080% in 20s80% in 120s (CX-angepasst)

FCR verdient sich den Spitznamen „König der Kennzahlen", weil SQM eine auffällige Korrelation gefunden hat: für jeden Anstieg der FCR um 1% steigt die CSAT um etwa 1%. Löse es beim ersten Mal, und die Zufriedenheit folgt fast mechanisch. Deshalb sind ungelöste Kontakte auch so teuer; SQM fand heraus, dass "customer churn is more than five times higher for unresolved calls than when FCR is achieved".

Die Kennzahl, die mit Vorsicht zu behandeln ist, ist die durchschnittliche Bearbeitungszeit. Sie lässt sich am leichtesten manipulieren und am leichtesten falsch interpretieren. SQMs eigene Daten zeigen, dass die FCR tatsächlich sinkt, je länger Anrufe dauern (73% bei 1–3 Minuten, runter auf 62% bei 15+ Minuten), aber das heißt nicht „schneller ist besser". Ein gehetzter Dreiminuten-Anruf, der in einem Rückruf endet, ist schlechter als ein geduldiger Achtminuten-Anruf, der das Problem löst. Die AHT sollte die richtige Zeitmenge sein, um zur Lösung zu kommen, nicht die kleinste Zahl, die sich dem Team abpressen lässt. Behandle sie als Diagnosewerkzeug, nie als Ziel. Wenn du die KI-Ära-Version jeder dieser Kennzahlen willst, haben wir sie in unserem Leitfaden zu Kundenservice-Kennzahlen und der breiteren Sammlung von Kundenservice-KPIs aufgeschlüsselt.

Eine QA-Scorecard bauen, die kein bloßes Abhaken ist

Die Scorecard ist der Punkt, an dem die Bewertung real wird, weil dort entschieden wird, was „gut" bedeutet. Eine gut gebaute Scorecard bewertet mehrere Dimensionen statt eines einzigen Bauchgefühls. SQMs Scorecard-Aufbau deckt Gesprächsführung, Kommunikationsfähigkeiten, Einhaltung von Richtlinien und Gesprächslösung ab und gewichtet sie bewusst. Die eigene mySQM-Scorecard von SQM vergibt von 100 Punkten 40 für die Umfrage nach dem Kontakt, 45 für die Qualitätssicherung und 15 für Compliance, sodass 85% des Scores auf die Servicequalität entfallen und nur 15% auf Compliance. Dieses Verhältnis bringt die gesamte Philosophie auf eine einzige Zahl: Problemlösung belohnen, nicht das Aufsagen eines Skripts.

Bewerte doch selbst einmal eine Interaktion. Das Widget unten ist eine abgespeckte Scorecard, so gewichtet, dass „freundlich, aber falsch" trotzdem durchfällt, genau wie es sich verhalten sollte.

Das Fehlermuster hier ist, die Scorecard zu einem Überwachungswerkzeug zu machen. Esther M., eine QA-Leiterin in einem Callcenter, schrieb über die versteckten Kosten, wenn man das falsch macht:

"An agent might handle a call brilliantly, resolve the customer's issue, and provide a great experience. But if they forget to say a mandatory phrase verbatim, they could still get penalized. This kind of micromanagement kills creativity and makes agents focus more on avoiding penalties than on genuinely helping customers."

Ihre Lösung ist die Denkweise, um die das gesamte Programm herum aufgebaut werden sollte: "the best QA professionals don't just point out errors, they empower agents to improve. Instead of acting as enforcers, they should function as mentors and coaches." Eine Scorecard, der Agenten vertrauen, wird auch genutzt; eine, die sie für manipuliert halten, wird ausgetrickst. Wenn du Standards von Grund auf festlegst, sind unsere Beispiele für Kundenservice-Standards und Hinweise zur richtigen Kundenservice-Denkweise ein guter Ausgangspunkt.

Wie man die Bewertung tatsächlich durchführt

Eine Scorecard ist nur so gut, wie konsequent du sie anwendest. Drei Dinge unterscheiden ein echtes Bewertungsprogramm von einem Ordner mit halb ausgefüllten Tabellen.

Ausreichend und fair stichprobenartig prüfen. Traditionelles QA prüft nur einen winzigen Ausschnitt: SQM fand heraus, dass 60% der Center fünf oder mehr Kontakte pro Agent und Monat bewerten, und der QA-Software-Anbieter MaestroQA beschreibt Scores, die auf "four random conversation reviews per week" basieren. Wenn du das formalisierst, behandelt unser Leitfaden zu KI-Leistungskennzahlen, wonach man stichprobenartig prüfen sollte. Das liegt oft deutlich unter 2% des Volumens eines Agenten, was bedeutet, dass eine schlechte Woche für einen guten Agenten (oder eine glückliche Woche für einen, der sich schwertut) den Score stark ausschlagen lassen kann. Zufällige Stichproben helfen; genauso hilft es, eine Mischung aus Kanälen und Schwierigkeitsgraden zu prüfen, nicht nur die einfachen Chats.

Kalibriere deine Prüfer. Wenn zwei Führungskräfte dasselbe Ticket unterschiedlich bewerten, ist die Zahl nur Rauschen. Führe regelmäßige Kalibrierungssitzungen durch, bei denen alle dieselbe Interaktion bewerten und Abweichungen ausdiskutieren, damit eine „92" von jedem dasselbe bedeutet.

Achte auf den Trend, nicht auf die Momentaufnahme. Ein einzelner Score ist eine Anekdote. Der Wert liegt in der Dashboard-Ansicht über Wochen hinweg, wo du sehen kannst, wie ein Coaching-Eingriff tatsächlich FCR oder CSAT bewegt, oder ein Eskalations-Muster erkennst, das sich hochschleicht, bevor es zu einem Abwanderungsproblem wird. Hier zahlt sich auch ein KI-Copilot aus, indem er das Muster sichtbar macht, statt darauf zu warten, dass eine Führungskraft es entdeckt.

Das eesel-Berichts-Dashboard mit Support-Analysen und Trends im Zeitverlauf
Das eesel-Berichts-Dashboard mit Support-Analysen und Trends im Zeitverlauf

Genau hier verändert KI-gestütztes QA die Rechnung beim Stichprobenproblem. Statt eine Handvoll Kontakte pro Agent zu prüfen, kann eine KI-Bewertung jedes Gespräch anhand deiner Scorecard bewerten, sodass Coaching-Entscheidungen auf 100% der Daten beruhen statt auf einer nervösen 2%-Stichprobe.

Manuelles QA prüft nur eine winzige Stichprobe von Tickets, während KI-gestütztes QA alle prüfen kann
Manuelles QA prüft nur eine winzige Stichprobe von Tickets, während KI-gestütztes QA alle prüfen kann

Deinen KI-Support-Agenten bewerten

Das ist der Teil der Kundenservice-Bewertung, den es vor zwei Jahren kaum gab und der heute die Diskussion dominiert. Sobald ein KI-Agent Tickets beantwortet, musst du auch ihn bewerten, und die meisten Teams greifen zur falschen Zahl.

Der klassische Fehler ist, eine KI anhand von Containment oder Deflection zu beurteilen: dem Anteil der Gespräche, die sie ohne einen Menschen abgewickelt hat. Sam Talasila, der KI-Einführungen bei Wealthsimple und Shopify leitete, beschrieb, wie er den Chatbot eines Kunden prüfte, der auf dem Papier wie ein Erfolg aussah:

"My client's chatbot had a 75 percent containment rate. Customers still hated it... The bot was containing conversations it wasn't actually resolving. Customers would get answers, but not solutions. They'd end the chat frustrated and call back the next day. Containment looked great. Resolution was terrible."

Containment misst, ob der Bot das Gespräch beendet hat. Die Lösungsquote misst, ob das Problem des Kunden verschwunden ist. Das sind unterschiedliche Dinge, und die erste zu optimieren, während man die zweite ignoriert, ist der Weg, einen Bot auszuliefern, den alle hassen. Das ist dieselbe Falle des stillen Versagens, die unser Team intern beschäftigt; wie es eesel-Mitgründer Amogh Sarda über einen Agenten formulierte, der unter Last still versagt: "if hard-fail it's silent-failure class, the worst class for trust". Ein Bot, der selbstsicher Tickets schließt, die er nicht gelöst hat, ist genau das.

Wie bewertet man also einen KI-Agenten wirklich? Die Praktiker, die das gut machen, behandeln es wie Software-QA. In einem r/AI_Agents-Thread zur Bewertung der Agentenqualität legte ein Kommentator das Muster dar:

"I stress-test the conversations between the AI agent and a simulated end-user under a set of pre-defined conditions to see where it might break... I then use an LLM-as-a-judge as a grader to score the conversations and check whether the agent meets the required standards. This whole process can be integrated into CI/CD, so the AI agent is automatically tested against set criteria before every production release."

Das ist das Modell: gegen realistische Szenarien simulieren, die Transkripte bewerten, eine menschliche Stichprobenkontrolle im Prozess behalten und das bevor der Agent live geht. Es ist die KI-Support-Version genau der QA-Disziplin, die du bei Menschen bereits anwendest.

Das ist die Disziplin, um die wir eesel herum gebaut haben. Bevor ein eesel KI-Helpdesk-Agent einem einzigen echten Kunden antwortet, führt er eine Simulation über die eigenen historischen Tickets eines Unternehmens durch und liefert eine Lösungsschätzung sowie eine Abdeckungsübersicht nach Thema zurück, damit du Lücken findest, Wissen ergänzt und so lange erneut ausführst, bis die Zahl eine ist, für die du bei einem Kunden geradestehen würdest. In einem kürzlichen Test für einen europäischen Schmuckhändler, der rund 1.000 Tickets im Monat über Zendesk und Shopify abwickelt, deckte diese Bewertung eine Triage-Genauigkeit von 93% und eine Spam-Erkennung von 100% ohne Fehlalarme auf, zusammen mit einer ehrlichen Faktenfehlerquote von 7% bei Entwürfen, genau die Art von Zahl, die man vor dem Livegang sehen will, nicht danach.

Wie eesel einen KI-Agenten vor dem Livegang anhand vergangener Tickets bewertet: simulieren, Abdeckung nach Thema messen, Lücken füllen, erneut ausführen
Wie eesel einen KI-Agenten vor dem Livegang anhand vergangener Tickets bewertet: simulieren, Abdeckung nach Thema messen, Lücken füllen, erneut ausführen

Häufige Fehler, die man vermeiden sollte

  • Alles verfolgen, aber nichts umsetzen. Wähle die drei, die zählen (FCR, CSAT, QA-Score), und ergänze unterstützende Kennzahlen wie die Lösungsquote und den Customer Effort Score nur, wenn du sie auch nutzt.
  • Compliance statt Ergebnisse bewerten. Wenn ein Agent das Problem gelöst hat, sollte eine vergessene Skriptphrase den Score nicht zum Absturz bringen.
  • Zu wenig stichprobenartig prüfen. Eine manuelle 2%-Stichprobe ist besser als nichts, aber beurteile keine Karriere anhand von vier zufälligen Tickets pro Woche.
  • Eine Kennzahl isoliert lesen. Eine tolle AHT bei niedriger FCR ist keine Effizienz, das sind Kunden, die zurückrufen. Dieselbe Logik gilt für jeden KI-Support-Workflow, den du bewertest.
  • KI anhand der falschen Zahl bewerten. Containment und Deflection sind Eitelkeitskennzahlen, wenn die Lösungsquote schlecht ist. Miss, ob das Problem des Kunden tatsächlich geschlossen wurde, genauso wie du die automatisierte Ticketlösung beurteilen oder die Kosten eines KI- gegenüber einem menschlichen Agenten abwägen würdest.

Teste eesel zur Bewertung deines KI-Supports

Wenn du an dem Punkt angekommen bist, an dem „Kundenservice bewerten" jetzt auch einen KI-Agenten einschließt, ist genau das das Problem, für das eesel gebaut wurde. Als einer der besten KI-Agenten für den Kundenservice verbindet er sich mit deinem bestehenden Helpdesk (Zendesk, Freshdesk, Gorgias, HubSpot, Front und mehr), lernt aus deinen vergangenen Tickets und Hilfe-Dokumenten und lässt dich den Agenten an deiner echten Ticket-Historie simulieren, bevor er live geht, sodass du eine Lösungsquote und eine Abdeckungskarte bekommst statt eines Sprungs ins Ungewisse. Einmal im Einsatz, berichtet er darüber, was er tatsächlich löst, nicht nur, was er enthalten hat. Er ist kostenlos zu testen, ohne Kreditkarte, sodass du die Bewertung an deinen eigenen Tickets durchführen und die Zahlen selbst sehen kannst.

Das eesel-KI-Helpdesk-Dashboard, in dem du einen KI-Support-Agenten einrichtest, simulierst und überwachst
Das eesel-KI-Helpdesk-Dashboard, in dem du einen KI-Support-Agenten einrichtest, simulierst und überwachst

Häufig gestellte Fragen

Was ist Kundenservice-Bewertung?
Kundenservice-Bewertung ist der Prozess, mit dem gemessen wird, wie gut dein Support liefert, anhand einer Mischung aus Ergebniskennzahlen (CSAT, NPS), operativen Kennzahlen (Lösung beim ersten Kontakt, Bearbeitungszeit) und einem Qualitätsscore aus einer QA-Scorecard. Das Ziel ist keine Zahl an der Wand, sondern herauszufinden, wo gecoacht werden sollte. Unseren Leitfaden zu Kundenservice-Kennzahlen findest du für die vollständige Übersicht.
Welche Kennzahlen sollte ich zur Bewertung des Kundenservice verwenden?
Das Marktforschungsunternehmen SQM hat herausgefunden, dass nur drei Kennzahlen alle sieben Kriterien für einen starken KPI erfüllen: First Contact Resolution, CSAT und den QA-Score. Verfolge diese zuerst und ergänze dann unterstützende Zahlen wie die Lösungsquote, den Customer Effort Score und die Eskalationsquote. Unsere Übersicht der Kundenservice-KPIs schlüsselt jede einzelne davon auf.
Was ist ein guter QA-Score im Kundenservice?
QA-Scores liegen meist zwischen 75% und 90%. SQM setzt den Branchendurchschnitt bei 85%, wobei 90–99% als gut gelten und 100% als Weltklasse (nur etwa 5% der Agenten erreichen das). Achte einfach darauf, dass der Score widerspiegelt, ob das Problem des Kunden gelöst wurde, und nicht, ob der Agent eine vorgegebene Phrase gesagt hat. Eine gute Leistungskennzahl misst Ergebnisse, kein Compliance-Theater.
Wie bewertet man einen KI-Kundenservice-Agenten?
Bewerte ihn wie Software: Simuliere ihn an deinen historischen Tickets, bevor er überhaupt mit einem Kunden in Berührung kommt, miss die Lösungsquote (nicht nur Containment oder Deflection) und behalte eine menschliche Stichprobenkontrolle im Prozess bei. Der KI-Helpdesk-Agent von eesel führt eine Simulation über vergangene Tickets durch, sodass du vor dem Livegang eine Lösungsquote und eine Abdeckungsübersicht erhältst. Mehr dazu in unserem Beitrag zu KI vs. menschlichem Support.
Wie oft sollte man Kundenservice-Bewertungen durchführen?
Manuelles QA erfolgt meist wöchentlich oder monatlich anhand einer kleinen Stichprobe (SQM fand heraus, dass 60% der Center fünf oder mehr Anrufe pro Agent und Monat überprüfen). KI-gestütztes QA kann 100% der Gespräche kontinuierlich bewerten, wohin sich die meisten Teams bewegen. Kombiniere beide Taktungen mit regelmäßiger Kalibrierung, damit Prüfer einheitlich bewerten. Sieh dir an, wie KI in den Support-Workflow passt.

Share this article

Riellvriany Indriawan

Article by

Riellvriany Indriawan

Riell is a designer and writer at eesel AI with about two years of experience researching CX platforms, AI chatbots, and helpdesk software. She combines her design background with a sharp eye for how these tools actually look and feel in practice — making her comparisons unusually visual and user-focused.

Related Posts

All posts →
Illustrierter Header-Banner für einen Guide zu Kundenservice-Manager-Fähigkeiten in warmen Amberfarben
Guides

9 Kundenservice-Manager-Fähigkeiten, die 2026 wirklich zählen

Bei den Fähigkeiten für Kundenservice-Manager geht es nicht mehr um Empathie-Skripte. Hier sind die 9 Fähigkeiten, die 2026 einen guten von einem großartigen Manager unterscheiden.

Riellvriany IndriawanRiellvriany IndriawanJul 9, 2026
Ein Support-Team-Lead bespricht eine Schulungscheckliste mit einem neuen Agenten
Guides

Schulungsziele im Kundenservice: das SMART-Framework + Beispiele

SMART-Schulungsziele für Support-Teams, die 5 Kategorien, die jedes Programm braucht, und warum die falsche Kennzahl gute Schulung zunichtemachen kann.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 9, 2026
Illustrierte Hero-Grafik für einen Guide zu Beispielen für Kundenservice-Umfragen, CSAT, NPS und CES-Feedbackformulare
Guides

35+ Beispiele für Kundenservice-Umfragen zu CSAT, NPS und CES

Echte CSAT-, NPS- und CES-Fragebeispiele für Support-Teams, plus die Daten zu Timing, Länge und Antwortquote, die entscheiden, ob überhaupt jemand antwortet.

Riellvriany IndriawanRiellvriany IndriawanJul 8, 2026
Illustration eines Kundenservice-Portals mit Help Center, Ticketing und einem KI-Agenten
Guides

Kundenservice-Portal: Was es ist und wie man 2026 eines aufbaut

Ein Kundenservice-Portal ist die Self-Service-Eingangstür zu deinem Support. Hier erfährst du, was dazugehört, warum es wichtig ist, und wie du ein Portal baust, das Menschen wirklich nutzen.

Riellvriany IndriawanRiellvriany IndriawanJul 6, 2026
Illustration, die Empathie im Kundenservice darstellt
Guides

Empathie im Kundenservice: was sie ist und wo KI ansetzt

Was Empathie im Kundenservice wirklich bedeutet, warum sie darüber entscheidet, ob Kunden bleiben, und wo KI Mitarbeitenden tatsächlich hilft, mehr statt weniger Anteil zu nehmen.

Riellvriany IndriawanRiellvriany IndriawanJul 5, 2026
Illustration eines begeisterten Kunden und eines freundlichen Support-Mitarbeiters, die einen Fünf-Sterne-Moment teilen
Guides

9 exzellente Beispiele für Kundenservice (und wie man sie kopiert)

Neun exzellente Beispiele für Kundenservice, von Chewy bis zu einem Eck-Restaurant, plus das wiederholbare Muster dahinter und wie jedes Team es liefern kann.

Riellvriany IndriawanRiellvriany IndriawanJul 4, 2026
Kompletter Leitfaden zur Kundenservice-Automatisierung 2026 - eesel
Guides

Kundenservice-Automatisierung: Der komplette Leitfaden für 2026

Ein praktischer Leitfaden zur Kundenservice-Automatisierung 2026 - die fünf Typen mit echtem Wirkungsgrad, die richtige Reihenfolge bei der Einführung und die Fehler, die die meisten Projekte scheitern lassen.

Riellvriany IndriawanRiellvriany IndriawanJun 11, 2026
Eine ehrliche Bewertung von Abacus AI im Jahr 2025
Guides

Abacus AI Bewertung: ChatLLM, DeepAgent und Preise (2026)

Diese Rezension von Abacus AI erklärt, was es tatsächlich tut, wie viel es kostet und warum viele Teams es im Vergleich zu fokussierten Lösungen wie eesel AI als zu komplex empfinden.

Kenneth PanganKenneth PanganSep 8, 2025
Illustration eines E-Commerce-Callcenters, das Telefon, E-Mail, Chat, WhatsApp, SMS und soziale Kanäle verbindet
Guides

E-Commerce-Callcenter: Kosten, Kanäle und KI im Jahr 2026

Was ein E-Commerce-Callcenter wirklich kostet, welche Kanäle es bedient und wie KI 2026 leise die Tier-1-Fragen zu Bestellungen, Rückerstattungen und WISMO übernimmt.

Riellvriany IndriawanRiellvriany IndriawanJul 6, 2026

Bereit, Ihren KI-Teamkollegen einzustellen?

In Minuten eingerichtet. Keine Kreditkarte erforderlich.

Kostenlos starten