
Kurzfassung
Eine Leistungsbeurteilung im Kundenservice ist nur dann nützlich, wenn sie konkret ist. Die Beispiele, die einem Mitarbeiter wirklich beim Wachsen helfen, benennen ein Verhalten, hängen eine Zahl oder ein reales Ticket dran und enden mit einem nächsten Schritt, also ersetze "toller Kommunikator" durch "hielt CSAT bei 94% über 380 Tickets, bei einer Bearbeitungszeit unter 6 Minuten." Bewerte anhand mehrerer Kompetenzen (Kommunikation und Empathie, Qualität und Genauigkeit, Effizienz, Produktwissen, Teamarbeit) statt mit einer einzigen Mischbewertung, und ziehe die Belege aus deiner QA-Scorecard und den Kennzahlen statt aus dem Gedächtnis.
Dieser Beitrag ist eine Copy-Paste-Sammlung: Beurteilungsformulierungen gruppiert nach Kompetenz, Formulierungen für Verbesserungsbereiche, eine vollständige Beispielbeurteilung zum Anpassen und ein interaktiver Formulierungsauswähler. Ich habe die letzten Jahre im Support-Team von eesel verbracht, daher ist die eine Verschiebung, die ich gleich vorab nennen möchte: Sobald ein KI-Agent mehr Tier-1-Tickets übernimmt, geht es in der Beurteilung nicht mehr darum, wie viele Tickets ein Mitarbeiter geschlossen hat, sondern um das Urteilsvermögen, das er bei den schwierigen Fällen zeigt, die die KI zurückgibt.
Was eine Leistungsbeurteilung im Kundenservice wirklich misst
Der Fehler, den ich am häufigsten sehe, ist eine Beurteilung, die eigentlich nur eine einzige Zahl in Verkleidung ist: "solides Quartal, 4 von 5, weiter so." Das sagt dem Mitarbeiter nichts, worauf er reagieren kann. Eine Beurteilung verdient ihren Platz, wenn sie die einzelnen Dinge auftrennt, in denen ein Mitarbeiter tatsächlich gut (oder unsicher) ist, sodass das Feedback an einer konkreten Stelle landet.
In der Praxis sind das fünf oder sechs Kompetenzen. Jede ist ein anderer Muskel, und ein starker Mitarbeiter ist selten in allen gleich stark, was genau das ist, was eine gute Beurteilung sichtbar macht.

- Kommunikation und Empathie wie klar und warmherzig jemand schreibt oder spricht, besonders unter Druck. Hier zeigt sich Empathie im Kundenservice im Transkript.
- Produkt- und Fachwissen ob jemand die Antwort tatsächlich kennt oder um Nichtwissen herumnavigiert.
- Effizienz und Produktivität Geschwindigkeit und Durchsatz, gemessen gegen Qualität, damit beides nicht gegeneinander ausgespielt wird.
- Qualität und Genauigkeit hat die Antwort das Problem korrekt und beim ersten Mal gelöst.
- Teamarbeit, Eigeninitiative und Verlässlichkeit das, was in keinem Ticket auftaucht: Schichten übernehmen, einen Bug melden, ein Makro verbessern.
- Kundenergebnisse die CSAT- und Lösungszahlen, auf die das alles hinausläuft.
Wer nach all dem bewertet, bleibt ehrlich. Ein schneller Mitarbeiter mit niedrigem Qualitätswert und ein langsamer mit makellosem Wert brauchen sehr unterschiedliche Gespräche, und eine einzige Mischbewertung verbirgt beides. Wenn du ein Bild davon willst, wie "übertrifft Erwartungen" in der Praxis aussieht, ist unsere Zusammenstellung von herausragenden Kundenservice-Beispielen ein nützlicher Maßstab zum Vergleichen.
Die Kennzahlen, die in die Beurteilung gehören
Zahlen machen eine Beurteilung nachvollziehbar. Wenn ein Mitarbeiter "Kommunikation muss besser werden" anzweifelt, beenden ein Transkript und ein CSAT-Trend die Diskussion; "ich habe einfach das Gefühl" tut das nicht. Das CX-Forschungsunternehmen SQM hat herausgefunden, dass nur drei Kennzahlen alle sieben Kriterien für einen starken KPI erfüllen, also verankere die Beurteilung darin und behandle den Rest als unterstützende Evidenz.
| Kennzahl | Was sie dir in einer Beurteilung sagt | Worauf zu achten ist |
|---|---|---|
| CSAT | Ob Kunden zufrieden waren | Niedrige Antwortquoten verzerren sie; als Trend lesen, nicht als Urteil |
| First Contact Resolution | Ob Probleme auf Anhieb gelöst wurden | Kann manipuliert werden, indem Dinge vorschnell als "gelöst" markiert werden |
| QA-Wert | Antwortqualität gegen deine Rubrik | Nur nützlich, wenn die Rubrik Ergebnisse bewertet, nicht auswendig gelernte Phrasen |
| Lösungsquote | Anteil der zugewiesenen Tickets, die tatsächlich geschlossen wurden | Volumen ohne Qualität ist ein Warnsignal, kein Gewinn |
| Durchschnittliche Bearbeitungszeit | Geschwindigkeit pro Kontakt | Nie isoliert bewerten, sie steht im Widerspruch zur Qualität |
| Eskalationsrate | Urteilsvermögen, wann übergeben werden sollte | Zu niedrig kann Selbstüberschätzung bedeuten, zu hoch mangelnde Kompetenz |
Der Punkt ist nicht, alle sechs für jeden Mitarbeiter zu tracken, sondern zwei oder drei auszuwählen, die zur Rolle passen, und diese über das gesamte Team hinweg konstant zu halten. Unsere Zusammenstellung der Kundenservice-KPIs schlüsselt auf, wie sich jede verhält, der Leitfaden zu Kundenservice-Kennzahlen behandelt, wie KI-unterstützte Teams sie anders lesen, und wenn du die Trenddaten aus Umfragen ziehst, helfen unsere Hinweise zur Umfrageanalyse und zu Produktumfragefragen, CSAT ehrlich zu halten. Woher die Zahlen kommen, spielt ebenfalls eine Rolle, gutes Contact-Center-Management und moderne Kundenkommunikations-Software bringen das meiste davon automatisch zutage.
Formulierungsbank für Leistungsbeurteilungen
Unten findest du eine filterbare Sammlung von Beurteilungsformulierungen, die du übernehmen und anpassen kannst. Wähle eine Kompetenz, dann eine Bewertungsstufe, um Formulierungen zu sehen, die konkret bleiben statt in "toller Teamplayer" abzugleiten. Jede Zeile ist eine Vorlage, also setze die echte Zahl oder das echte Ticket ein, bevor du sie verwendest.
Die ausformulierten Versionen unten gehen tiefer auf jede Kompetenz ein, mit den Formulierungsmustern, auf die ich am häufigsten zurückgreife.
Kommunikation und Empathie
Das ist die Kompetenz, die Kunden zuerst spüren. Eine technisch korrekte Antwort, die kalt wirkt, kommt trotzdem als schlechter Service an, also bewerte den Ton genauso ernsthaft wie die Genauigkeit. Der stärkste Beleg hier ist ein gerettetes Ticket: ein Thread, der wütend begann und gelöst endete.
- Übertrifft Erwartungen: "Dreht angespannte Threads um. Bei der [Versandverzögerung]-Eskalation zuerst den Frust anerkannt, dann gelöst, und der Kunde antwortete mit einem Dankeschön mit Namensnennung."
- Erfüllt Erwartungen: "Warmes, klares, markenkonformes Schreiben. Keine Ton-Beschwerden in diesem Zyklus, CSAT hielt bei [92%]."
- Verbesserungsbedarf: "Antworten sind korrekt, aber knapp. Eine Zeile Anerkennung am Anfang hinzuzufügen, wie die Empathie-Formulierungen, die wir bei Rückerstattungen nutzen, würde die Kundenerfahrung verbessern."
Wenn Deeskalation eine wiederkehrende Lücke ist, ist das ein Coaching-Plan, kein einzeiliger Seitenhieb, unser Leitfaden zum Umgang mit wütenden Kunden ist ein guter Ausgangspunkt, um einen aufzubauen.
Produkt- und Fachwissen
Wissenstiefe ist das, was einen Mitarbeiter befähigt zu lösen statt weiterzuleiten. Bewerte es, indem du dir anschaust, was eskaliert wird: das Muster von "konnte das nicht beantworten" zeigt dir genau, wo die Lücke liegt.
- Übertrifft Erwartungen: "Der [Integrations]-Experte des Teams. Dokumentierte [4] Lösungen, die zu gemeinsamen Makros wurden."
- Erfüllt Erwartungen: "Beantwortet Standardfragen, ohne zu eskalieren, und hält gespeicherte Antworten aktuell."
- Verbesserungsbedarf: "Eskalierte [8] Tickets, die bereits im Hilfe-Center abgedeckt waren. Lass uns eine Doku-Durchsicht ansetzen."
Effizienz und Produktivität
Geschwindigkeit bedeutet nur etwas neben Qualität, also bewerte sie nie allein. Ein Mitarbeiter, der 40 Tickets am Tag abarbeitet, aber nur einen QA-Wert von 70% erreicht, ist kein Top-Performer, sondern erzeugt Nacharbeit. Die Bearbeitungszeit hängt auch von der Call-Center-Technologie ab, mit der jemand arbeitet, also berücksichtige die Tools, bevor du eine langsame Zahl an der Person festmachst.
- Übertrifft Erwartungen: "[30%] über der Team-Bearbeitungsrate, bei Qualität über [90%]."
- Erfüllt Erwartungen: "Stabiles Volumen, Erstreaktionszeit unter [2 Stunden]."
- Verbesserungsbedarf: "Bearbeitungszeit [40%] über dem Ziel bei Tickets mit gespeicherter Antwort, lass uns auf die Makro-Bibliothek setzen."
Qualität und Genauigkeit
Das ist die eine Kennzahl, bei der ich nie nachgeben würde, denn eine selbstsichere falsche Antwort untergräbt Vertrauen schneller als eine langsame richtige. Ziehe die Belege direkt aus deiner QA-Scorecard, nach der Rubrik der Kundenservice-Bewertung, und behandle den QA-Wert als eine Leistungskennzahl unter mehreren, nicht als die ganze Geschichte.
- Übertrifft Erwartungen: "[96%] QA-Wert, jede geprüfte Antwort löste das Problem beim ersten Kontakt."
- Erfüllt Erwartungen: "[88%] QA-Wert, verlässliche First Contact Resolution."
- Verbesserungsbedarf: "[2] Antworten enthielten ein falsches Richtliniendetail, lass uns eine Richtlinien-Selbstprüfung einführen."
Teamarbeit, Eigeninitiative und Verlässlichkeit
Die Arbeit, die in keiner Ticketzahl auftaucht: Schichten übernehmen, Bugs melden, die Wissensdatenbank verbessern. Sie zu bewerten signalisiert, dass die unsichtbare Klebstoffarbeit zählt.
- Übertrifft Erwartungen: "Übernahm [3] Schichten während des Ausfalls ungefragt und meldete den Bug, der zu einer dauerhaften Lösung führte."
- Erfüllt Erwartungen: "Verlässlich, teilt Antworten im Teamkanal, hält Zusagen ein."
- Verbesserungsbedarf: "Arbeitet allein, bringt selten wiederkehrende Probleme zur Sprache, lass uns diesen Quartal eine Prozessverbesserung übernehmen."
Verbesserungsbereiche, so formuliert, dass sie coachen
Der Abschnitt zu Verbesserungen ist der Punkt, an dem Beurteilungen am häufigsten schiefgehen, entweder zu weich, um nützlich zu sein, oder zu blunt, um gehört zu werden. Das Muster, das funktioniert: Verhalten, Beleg, nächste Handlung, immer bezogen auf die Arbeit.

- Statt "muss empathischer sein" schreibe: "Bei [3] Abrechnungstickets diesen Monat fehlte in der Antwort der Anerkennungsschritt, was mit niedrigerem CSAT korrelierte. Lass uns bei Rückerstattungen die Empathie-zuerst-Vorlage nutzen."
- Statt "zu langsam" schreibe: "Bearbeitungszeit lag [40%] über dem Ziel, konzentriert auf Tickets mit vorhandenem Makro. Ziel: bis Ende Q3 auf [10%] über dem Ziel kommen, mithilfe der Makro-Bibliothek."
- Statt "sollte mehr Eigeninitiative zeigen" schreibe: "Betreut die eigene Warteschlange gut, bringt aber selten wiederkehrende Probleme zur Sprache. Ziel: diesen Quartal eine Workflow-Verbesserung vorschlagen und mit dem Team teilen."
Jedes davon ist ein SMARTes Ziel in Verkleidung: konkret, messbar und an eine Zahl gebunden, die der Mitarbeiter tatsächlich bewegen kann. Das ist der Unterschied zwischen Feedback, das der Mitarbeiter nickend zur Kenntnis nimmt und vergisst, und Feedback, das die Zahlen des nächsten Quartals verändert.
Eine vollständige Beispiel-Leistungsbeurteilung im Kundenservice
So fügen sich die Teile zu einer Beurteilung zusammen. Passe die Zahlen und die Stimme an, das hier ist eine Struktur, kein Skript.
Mitarbeiter: [Name] · Zeitraum: Q2 2026 · Prüfer: [Manager]
Zusammenfassung. Ein starkes, stabiles Quartal. [Name] ist eine der verlässlichsten Autorinnen/Autoren im Team und erste Anlaufstelle bei [Abrechnungs]-Fragen. Der Wachstumsbereich ist Geschwindigkeit bei Routinetickets, wo gespeicherte Antworten nicht voll ausgeschöpft werden.
Kommunikation und Empathie (Übertrifft Erwartungen). CSAT hielt bei [94%] über [380] Tickets. Rettete bemerkenswert die [Enterprise-Verlängerungs]-Eskalation, einen wütenden Thread, der mit einer 5-Sterne-Bewertung und einem Dankeschön mit Namensnennung endete.
Qualität und Genauigkeit (Erfüllt Erwartungen). QA-Wert von [89%], über dem Team-Durchschnitt von [85%]. Zwei Richtlinienfehler bei [Rückgabe]-Tickets, beide noch am selben Tag korrigiert, unten als kleiner Fokusbereich markiert.
Effizienz (Verbesserungsbedarf). Durchschnittliche Bearbeitungszeit lag [35%] über dem Ziel, konzentriert auf Tickets mit vorhandenem Makro. Das ist der Hauptwachstumsbereich dieses Quartals.
Teamarbeit (Erfüllt Erwartungen). Verlässlich, übernahm [2] Schichten ungefragt und hält die [Abrechnungs]-Makros aktuell.
Ziele für Q3.
- Durchschnittliche Bearbeitungszeit auf [10%] über dem Ziel bringen, mithilfe der Makro-Bibliothek.
- Einen Richtlinien-Selbstprüfungsschritt bei [Rückgabe]-Tickets einführen, um die Genauigkeit über [90%] zu halten.
- Einen neuen [Abrechnungs]-Workflow für die gemeinsame Wissensdatenbank dokumentieren.
Beachte, dass darin keine Überraschung steckt. Jede Bewertung lässt sich auf eine Zahl oder ein konkretes Ticket zurückführen, das der Mitarbeiter selbst nachschlagen könnte, was das ganze Spiel ist, eine Beurteilung sollte bestätigen, was die Daten bereits gezeigt haben, statt ein Urteil aus dem Nichts zu präsentieren.
Wie KI verändert, worauf du Mitarbeitende bewertest
Das ist der Teil, mit dem die meisten Beurteilungsvorlagen noch nicht mitgekommen sind. Wenn ein KI-Agent das Tier-1-Volumen übernimmt, sind die Tickets, die bei einem Menschen landen, per Definition die schwierigeren, bei denen die KI sich nicht sicher war. Einen Mitarbeiter nach roher Ticketzahl zu bewerten, fängt also an, die falsche Sache zu messen, sie bearbeiten weniger Tickets, aber jedes davon ist kniffliger.

Die Kompetenzen, die nach oben rücken, sind Urteilskompetenzen: wie gut der Mitarbeiter eine KI-entworfene Antwort bearbeitet, wann er sie überstimmt, und wie sauber er eskaliert. Es ist derselbe Wandel, den man sieht, wenn man sich echte KI-Agenten-Beispiele in freier Wildbahn anschaut, die Routinearbeit wird automatisiert, und der Mensch rückt in der Wertschöpfungskette nach oben. Eine CX-Leiterin einer DTC-Ergänzungsmittel-Marke auf Shopify (rund 7.000 Tickets im Monat) brachte uns das dahinterliegende Prinzip klar auf den Punkt:
"Die KI wird niemals 100% der Fragen beantworten können... Ich brauche eine KI, die nur die Tickets bearbeitet, bei denen sie sich sicher ist, und alle anderen in Ruhe lässt."
Das ist jetzt die bewertungswürdige Fähigkeit: Der Mensch übernimmt die Tickets, die die KI in Ruhe lässt, und wie gut er sie übernimmt, ist das, was zu bewerten ist. Ein Service-Desk-Leiter bei einem Logistik-SaaS, das eesel im Copilot-Modus einsetzt, beschrieb den Wandel auf der Entwurfsseite:
"Es bringt uns wirklich schnell und einfach zu den richtigen Artikeln und formuliert gut durchdachte Antworten mit konsistentem, markenkonformem Ton, während unser eigener Stil und die menschliche Note erhalten bleiben."
Wenn der Entwurf bereits markenkonform ist, verschiebt sich die Beurteilungsfrage von "hat er es gut geschrieben?" zu "wusste er, wann er die menschliche Note behalten und wann er dem Entwurf vertrauen sollte?" Dieses Urteilsvermögen ist schwerer zu fälschen und wertvoller zu entwickeln, weshalb es genau deshalb ganz oben auf eine moderne Scorecard gehört. Die Daten, um es zu bewerten, Entwurfs-Annahmequote, Überstimmungsmuster, Eskalationsqualität, liegen in der Aktivitäts- und Berichtsansicht deines KI-Tools statt im rohen Ticket-Log, und sie fließen ganz natürlich in den Kundenservice-Workflow ein, den du bereits fährst.
Häufige Fehler beim Schreiben dieser Beurteilungen
Ein paar Fallstricke, um die ich einen Bogen machen würde, die meisten davon der Grund, warum eine Beurteilung flach wirkt:
- Aktualitäts-Verzerrung. Das ganze Quartal nach den Tickets der letzten Woche bewerten. Zieh die Daten des gesamten Zeitraums und lass sie argumentieren, nicht dein Gedächtnis.
- Eine einzige Mischzahl. Ein einzelnes "4 von 5" verbirgt sowohl den schnellen, aber schludrigen als auch den langsamen, aber präzisen Mitarbeiter gleichermaßen. Bewerte die Kompetenzen getrennt.
- Eigenschaftssprache statt Verhalten. "Kein Teamplayer" ist nicht umsetzbar und wirkt persönlich, "bringt selten wiederkehrende Probleme zur Sprache" zeigt auf ein behebbares Verhalten. Für Formulierungen, die konstruktiv bleiben, lohnt sich ein Blick auf unsere Feedback-Beispiele im Kundenservice und Hinweise zu einem Voice-of-Customer-Programm.
- Keine Zahl, kein Ticket. Jede Behauptung sollte sich auf einen Beleg zurückführen lassen, den der Mitarbeiter selbst nachschlagen kann. Wenn nicht, ist es eine Meinung, und über Meinungen wird gestritten.
- Ziele ohne Kennzahl. "Besser kommunizieren" ist kein Ziel, "CSAT von 88% auf 92% steigern" ist eines. Binde jedes Ziel an eine Zahl, genauso wie unser Leitfaden zur Kundenerfahrungsstrategie Initiativen an Ergebnisse bindet.
Bekomme diese fünf Punkte richtig hin, und die Beurteilung erfüllt ihren eigentlichen Zweck: nicht das vergangene Quartal zu beurteilen, sondern das nächste zu verbessern.
eesel für die Daten hinter der Beurteilung testen
Die halbe Arbeit einer fairen Leistungsbeurteilung besteht darin, die Belege an einem Ort zu haben. eesel bindet einen KI-Agenten in deinen bestehenden Helpdesk ein, löst die Tier-1-Tickets, bei denen er sich sicher ist, entwirft Antworten für den Rest, und gibt dir eine Berichtsansicht darüber, was er genau bearbeitet hat gegenüber dem, was er an einen Menschen weitergegeben hat, dieselben Daten, gegen die du das Urteilsvermögen eines Mitarbeiters bewerten würdest.

Da die Preisgestaltung nutzungsbasiert ist (rund 40 Cent pro Ticket, keine Sitzplatzgebühren), kannst du mit einem Ausschnitt deiner Warteschlange starten und die Zahlen sehen, bevor du breiter ausrollst. Es ist kostenlos zum Testen, und du kannst es zuerst gegen deine eigenen historischen Tickets simulieren, sodass die Lösungsquote, die du in jede Beurteilung schreiben würdest, eine ist, die du tatsächlich gesehen hast, nicht eine, die du dir erhoffst.
Häufig gestellte Fragen
Was sind gute Beispiele für Leistungsbeurteilungen im Kundenservice?
Was sollte eine Leistungsbeurteilung im Kundenservice enthalten?
Wie schreibt man konstruktives Feedback in einer Leistungsbeurteilung im Kundenservice?
Was sind Beispiele für SMARTe Ziele in einer Leistungsbeurteilung im Kundenservice?
Wie sollte ich einen Mitarbeiter bewerten, der einen KI-Assistenten nutzt?

Article by
Riellvriany Indriawan
Riell is a designer and writer at eesel AI with about two years of experience researching CX platforms, AI chatbots, and helpdesk software. She combines her design background with a sharp eye for how these tools actually look and feel in practice — making her comparisons unusually visual and user-focused.








