
まとめ
はい、AIはサポートの品質保証を行えます。そして、人間のQAには決してできなかったことを実現します。それは2%のサンプルではなく、すべての会話をスコアリングすることです。明確なルーブリックと自社の解決済みチケットを与えれば、クローズされた各会話を読み込み、正確性・トーン・解決度・ポリシー準拠・情報源の観点で採点し、人間が見るべきものにフラグを立てます。
正直な注意点:鋭い最初のパスであり、最終判決ではありません。顧客の実際のチケットに対してAIエージェントを監査した際、トリアージ精度は約93%でスパムを100%検出しましたが、ドラフト回答が方向性として正しかったのは88%に過ぎず、事実誤認率は7%でした。その7%こそが、人間がまだ判断を担う理由です。
多くのチームが忘れていること:AIがチケットに回答しているなら、そのAIはあなたが持つ最も対応量の多いエージェントです。顧客に触れる前にQAを行いましょう。eeselのAIヘルプデスクエージェントは、自社のチケット履歴に対してシミュレーションとしてそのチェックを実行します。これが本番稼働前のQAパスに最も近いアプローチです。
AIは実際にサポートQAをできるのか?
短い答え:はい、そして最も重要な一つの次元、カバレッジにおいて手動版よりも優れています。
私はこれを行うAIエージェントを構築しているので、「はい」の意味を正確に説明させてください。従来のサポートQAは、アナリストが週に担当者ごとに少数のチケットを抽出し、スプレッドシートで採点して次に進むものでした。チームが月に数千件の会話を処理するなら、それはせいぜい2%のレビューであり、しかも偏った2%です。レビュアーはスコアリングしやすいチケットに引き寄せられるからです。静かに顧客を離脱させたような奇妙なエッジケースは、ほとんどサンプルに入りません。
AIはそれを覆します。モデルがルーブリックに照らしてすべての会話を読むと、会話の100%をスコアリングするコストは2%をスコアリングするのとほぼ同じになります。カバレッジは節約するものではなくなります。ただし、「すべてを読む」と「すべてを正しく判断する」は別の主張です。AIは前者を確実にこなします。後者は人間をループに入れておく部分です。
AIが得意なこと(そして証拠)
AI QAが本当に強い部分を紹介します。形容詞よりも実際の数字でお見せしたいと思います。

ある顧客の実際のZendeskトラフィックに対してエージェントを実行したところ、トリアージ精度で約93%を記録し、受信箱の22%がスパムであったにもかかわらず、偽陽性ゼロでスパムを100%検出しました。カテゴリ別ではさらに鋭く、返品・返金では93.8%、保証申請では96.4%、商品問い合わせと返金状況確認では100%の有用なドラフトを生成しました。これらはQAが一貫性を保つために存在する、繰り返しの多いパターン重視のチケットです。そして自社の履歴を読んだモデルは、回答がパターンからずれている箇所の検出が非常に得意です。
この強みは人間にも適用できます。AIは疲れたレビュアーが見逃すものが非常に得意です。返金対応でトーンが崩れること、あるエージェントが微妙に間違い続けるポリシー、基礎にあるヘルプドキュメントが古くなっているために全回答のスコアが低いトピック。これらはパターンであり、キュー全体を読むモデルが見つけるものを、2%のサンプルは構造的に見つけられません。また4,000件目のチケットでも飽きることはなく、それは人間のQAシフトには言えないことです。
AIが実際に会話をスコアリングする仕組み
これはブラックボックスだと人々は想像しますが、実際はそうではありません。仕組みは人間のレビュアーが使うのと同じルーブリックで、それをすべてに適用するだけです。

クローズされた会話が入力されます。AIはいくつかの明確な評価軸で採点します。事実として正確か、トーンは適切か、問題を実際に解決したか、ポリシーに従ったか、何かを作り上げるのではなく実際の情報源を引用したか。合格した会話はログされ、スコアが低いものは人間がチェックするためにフラグが立てられます。欲しい出力は一つの数字ではなく、トレンドを追えるブレークダウンです。このバッチが同じポリシーで全て失敗したとか、あるトピックがスコアを引き下げているとかを確認できるようになります。
これを成功させるか失敗させるかは二つの点にかかっています。まず、ルーブリックは明確でなければなりません。「見ればわかる」ではだめです。AIにとっても人間にとっても、5つの鋭い評価軸は30の曖昧なものより優れています。次に、会話と回答が来るべきだったナレッジベースの両方を与える必要があります。「不正解」というスコアは、エージェントが間違っていたのかドキュメントが間違っていたのかを知る場合にのみ有用で、その区別は人をコーチングするかドキュメントを書き直すかの違いです。完全な構築方法については、AIによるサポートQAのステップバイステップガイドを書いています。
AI QAがまだ人間を必要とする部分
今度は正直な反対側を。強みだけを列挙するQA記事は、まさにAI QAが検出すべきものだからです。
その監査に戻りましょう。エージェントのドラフトは88%の確率で方向性として正しかったですが、エージェントがそのまま送れるレベルだったのは12%に過ぎず、事実誤認率は7%でした。ギャップを掘り下げると示唆的です。書き直しの約65%は長さとトーンだけの問題(AIがチームが3文で送るところを8文で書いた)、約20%はAIが見えないデータが必要(ERPまたは物流の検索)、そして約5%だけがAIが完全に間違っていました。つまり「人間が必要」なものの多くはより良いトレーニングで修正可能ですが、事実誤認の最後の部分は完全に自動化から排除することはできません。
私が目撃した最も顕著な例:あるチームのAIが、ヘルプセンターに「全モデルに対応しています」と書いてあったために、実際にはデータベースにない製品に対して「はい、お客様のモデルに対応しています」と自信を持って顧客に伝えました。AIはハルシネーションを起こしていたのではなく、間違ったドキュメントを忠実に繰り返していたのです。モデルの品質だけではそれを検出できません。フラグが立てられたパターンを読んだ人間なら5分で検出できます。それがAIと人間のサポートにおける本当の役割分担です。AIはすべてを読んで疑わしいパターンを浮かび上がらせ、人間がその意味を判断し根本原因を修正します。
したがって、人間が関わり続けるべき部分:履歴に前例のない新規の問題、善意の例外などの判断が必要な呼び出し、ドキュメントではなく誰かの頭の中にあるビジネスコンテキストに依存するもの、そしてAI自身のスコアの定期的な校正。AIの採点を最終判決ではなく2番目のアナリストの意見として扱えば、盲点なしにカバレッジを得られます。
多くのチームが見落とすテスト:AIは自分自身をQAできるのか?
ほとんどの「QAのためのAI」記事が軽く流す部分で、私が最も重要だと思う点です。AIにチケットを処理させるなら、そのAIは顧客に触れる前にQAに合格しなければなりません。そしてほとんどのチームはそのチェックを実行しません。

仕組みは信頼度ベースのルーティングです。エージェントは確信のある回答のみ自動送信し、閾値を下回るものは人間用のドラフトとして保留し、修正から学習して同じミスが繰り返されないようにします。あるDTCサプリメントのリーダーが私たちに的確に状況を伝えてくれました。「すべてに『申し訳ありませんが、わかりません』と答えるAIは役に立ちません。でも推測するAIはもっと悪い。なぜなら7,000件のチケットを再読して推測を検出できる人はいないからです。」QAがその両方への答えです。
そこで私たちはそのチェックをロールアウトに組み込みました。eeselエージェントが本番稼働する前に、顧客を関与させずに実際の過去のチケットに対してシミュレーションを実行し、トピック別の品質とカバレッジを確認できます。これが最初から93%と7%の数字を安全な側で得た方法です。稼働後は、同じスコアがエージェント分析に表示されるので、自動化に対するQAは実質的に終わりません。

これはまた「信頼できるのか?」という問いへの最も正直な答えでもあります。信頼は信念に基づくものではありません。QAを行い、信頼度が低い部分では自動送信ではなくドラフトに設定し、スコアが向上するにつれて自律性を広げます。それがデモとデプロイの違いです。
チームが実際に日常的にAI QAを活用する方法
実際にはループに落ち着き、個々のスコアよりもそのループの方が重要です。AIはクローズされるたびに各会話をスコアリングします。5件のランダムなチケットの代わりに、共通点でグループ化して、人間が見るべきコーチングの機会を浮かび上がらせます。チームリーダーはパターンに基づいて行動します。フラグが立てられたエージェントへのコーチング、繰り返し発生するミスの背後にあるドキュメントの修正、スコアの低いトピックが露わにするチケットタグ付けとエスカレーションルールの更新。繰り返されるミスの背後にあるドキュメントを修正すれば、同時にチケット量の削減にもつながることが多いです。
ツール面では、2つの陣営があります。Zendesk QA(旧称Klaus)やMaestroQAなどの専用QAプラットフォームは会話を自動スコアリングしてコーチングワークフローに供給し、QAが独立した機能としてある場合には最適です。もう一方の陣営は、作業を行うエージェントと一緒にQAをバンドルするAIカスタマーサービスソフトウェアで、チームの会話をスコアリングするのと同じエンジンがAIのドラフトをQAします。最後にはっきり言っておくべき注意点:QAはCSATではありません。顧客は自信を持って間違った回答に5つ星を付けることができるので、どちらか一方が他方の代わりになるのではなく、QAスコアとCSATレポートの両方が必要です。
サポートQAにeeselを試す
3つのツールを組み合わせることなくAIサポートQAを実現したいなら、eeselのAIヘルプデスクエージェントはまさにそれを中心に構築されています。既存のヘルプデスクに接続し、過去の会話とナレッジベースを読み込み、実際の過去チケットに対してシミュレーションを実行できます。本番稼働前に品質とカバレッジを確認できます。

QAにとって有用な点は、AIエージェントのドラフトをスコアリングするのと同じエンジンがチームの会話を読むため、人間に対するQAと自動化に対するQAが2つのスプレッドシートではなく一か所にあることです。午後に接続するだけで、すでにヘルプセンターを把握しており、使用量ベースの料金プランでは自分のチケットをレビューするためにシート課金が発生しません。無料でお試しいただけます。
よくある質問
AIはサポートの品質保証を正確に行えますか?
AIサポートQAは実際にどのように会話をスコアリングするのですか?
AIがサポートの品質保証でできないことは何ですか?
AIのQAはサポート量のどれくらいをカバーできますか?
AIサポートQAはQAアナリストの仕事を奪いますか?
AIサポートの品質保証ができるツールは何ですか?

Article by
Alicia Kirana Utomo
Kira is a writer at eesel AI with a Computer Science background and over a year of hands-on experience evaluating AI-powered customer service tools. She focuses on breaking down how helpdesk platforms and AI agents actually work so that support teams can make better buying decisions.



