
Was Exa Agent Ultra eigentlich ist
Zuerst das Unternehmen. Exa ist eine Such-API für KI-Agenten, die Modellen Echtzeitzugriff auf das Web samt strukturierter, belegter Ergebnisse gibt. Es ist auch kein kleiner Anbieter: Exa sagt, dass 500.000 Entwickler darauf aufbauen, mit einem Index, den es auf 100 Milliarden Dokumente beziffert. Cognitions Devin, Cursor und Firefox nutzen es für die Informationsabfrage.
Agent Ultra setzt auf diesem Index auf. Die Exa Agent API ist Exas "einzelne API für Frontier-Webrecherche", und der Aufwand ist der eine Regler, mit dem Sie bestimmen, wie hart sie arbeitet. Die Stufen heißen minimal, low, medium, high, xhigh, auto und ultra, wobei auto der Standard ist. Ultra ist die Spitze dieser Leiter, und das Changelog datiert sie auf den 24. September 2026.
Das Denkmodell, das mir geholfen hat: Die festen Stufen beantworten eine Frage, Ultra schließt eine Untersuchung ab. Exa beschreibt es als den Modus "für die schwierigste Recherche, bei der Vollständigkeit und Genauigkeit am wichtigsten sind", also Deep Research, Listenaufbau und Entitätsanreicherung, jede Aufgabe, die bis zur Erschöpfung laufen muss.

Konkret sind das Aufgaben wie "alle US-Unternehmen, die Tools für Browser-Automatisierung herstellen", oder "jedes Fintech der Serie A bis C, das in den letzten 12 Monaten einen Head of Risk eingestellt hat", oder das Anreichern einer Liste um ein Feld, das eine Einschätzung braucht, etwa "verkauft dieses Unternehmen an Krankenhäuser?", wobei jede Antwort eine zitierte URL als Beleg trägt. Wer je versucht hat, so eine Liste von Hand zusammenzustellen, weiß genau, welche Fleißarbeit Exa im Visier hat.
Wie Agent Ultra unter der Haube funktioniert
Interessant ist die Orchestrierung, nicht ein einzelnes Modell. Wenn Sie eine Anfrage senden, teilt Exa Agent die Aufgabe in Teilaufgaben auf und weist Subagenten zu, die mehrere Themenbereiche gleichzeitig recherchieren. Ultra erhöht einfach die Zahl der Subagenten und der Quellen deutlich.
Zwei Designentscheidungen sorgen dafür, dass es zusammenhält. Die erste ist ein Modellmix: Exa sagt, es setze "Frontier-Intelligenz dort ein, wo eine Aufgabe sie braucht, und schnellere Modelle dort, wo sie genügen", sodass Sie nicht für jeden trivialen Teilschritt Frontier-Preise zahlen. Die zweite ist Exas token-effizientes Highlights-Modell, das die relevantesten Auszüge einer Seite herauszieht, statt alles in den Kontext zu stopfen, mit angegebenen Reduktionen des Token-Verbrauchs von bis zu 94 %. Daher kommt ein großer Teil des Kostenvorteils.

Sie erhalten die zusammengestellte Recherche als ein fundiertes Ergebnis zurück, statt jeden /search- und /contents-Aufruf selbst zu orchestrieren. Ein abgeschlossener Durchlauf enthält output.text für eine Antwort in natürlicher Sprache, output.structured für schemavalidiertes JSON, wenn Sie ein outputSchema übergeben, und output.grounding für die Belege auf Feldebene. Sie können das Ganze auch über Exas MCP-Server mit dem Tool agent_run steuern, sodass ein Coding-Agent wie Claude Code oder Cursor es direkt aufrufen kann.
Die Benchmark-Angaben und wie man sie liest
Hier greift Exa groß aus. Agent Ultra, so heißt es, übertrifft Opus 5.5, GPT-6 Astra und Perplexity Agent auf deren maximalen Aufwandseinstellungen in vier Benchmarks. Die Rohzahlen:
| Benchmark | Was er misst | Agent Ultra | Opus 5.5 | GPT-6 Astra | Perplexity Agent |
|---|---|---|---|---|---|
| WANDR | Deep Research (Soft Recall) | 81.4% | 72.3% | 26.0% | 40.1% |
| DeepSearchQA | Mehrstufige Webrecherche (F1) | 93.9% | 77.6% | 85.3% | 89.7% |
| WideSearch | Breite Informationssammlung (Row-F1) | 58.9% | 51.6% | 54.7% | 56.0% |
| Find-All Company | GTM-Intelligence (bestandene Entitäten/Aufgabe) | 2,451 | 146 | 113 | 98 |
Die Zeile Find-All Company ist die, bei der man stutzt: durchschnittlich 2.451 bestandene Entitäten pro Aufgabe gegenüber 146 beim nächstbesten System. Das ist das Design "läuft bis zur Erschöpfung" als Zahl. Exas WANDR-Diagramm erzählt daneben die Kostengeschichte: Ultra landet bei rund 81 % Soft Recall für etwa 18 $ pro Aufgabe, während Opus 5.5 etwa 72 % bei knapp 38 $ erreicht.

Nun die ehrliche Einordnung. Das sind Exas eigene Benchmark-Läufe, auf einem von Exa gepflegten Testaufbau, bewertet von einem Modell, das Exa gewählt hat (es nutzt gpt-6-luna als Bewerter). Exa ist transparent bei der Methodik, was etwas zählt, und nennt veröffentlichte Wettbewerberzahlen, wo es sie gibt. Aber Herstellerbenchmarks schmeicheln dem Hersteller systembedingt, die faire Haltung lautet also: beeindruckend, plausibel und unbestätigt. Auf Community-Seite war der Start auf X laut, allerdings meist als Hype statt als praktischer Beweis.
"So perplexity is dead 2x now"
Diese Antwort stand an der Spitze der Reaktionen auf Exas Launch-Post, der selbst knapp 2.000 Likes erhielt. Einige Praktiker merkten an, sie würden es "jetzt ausprobieren", was ungefähr dem Stand der unabhängigen Überprüfung zwei Tage nach dem Start entspricht. Es ist wirklich früh, und ich würde auf externe Tests warten, bevor ich die Bestenliste für gesichert halte.
Was Exa Agent Ultra kostet
Exa funktioniert Pay-as-you-go ohne Lizenzplätze, und die Agent-Aufwandsstufen entsprechen direkt dem Preis. Die festen Stufen sind pro Anfrage planbar, und Ultra ist die nutzungsbasierte Ausnahme.

| Aufwandsstufe | Preis | Am besten für |
|---|---|---|
| minimal | $0.012 / Anfrage | Einfache Abfragen, niedrigste Kosten |
| low | $0.025 / Anfrage | Einfache, eng gefasste Faktenaufgaben |
| medium | $0.10 / Anfrage | Der Standard-Ausgangspunkt |
| high | $0.50 / Anfrage | Schwierigere Recherche, strengere Vollständigkeit |
| xhigh | $1.00 / Anfrage | Hochwertige Aufgaben, verifizierungsintensiv |
| ultra | Nach Verbrauch, $20 Standardlimit | Erschöpfender Listenaufbau und Recherche |
Unter den nutzungsbasierten Durchläufen rechnet Exa Agent Compute Units mit je 0,10 $ ab, Suchtool-Aufrufe mit 0,005 $, E-Mail-Anreicherung mit 0,02 $ und Telefon-Anreicherung mit 0,07 $. Der Parameter budget.maxCostDollars legt die Obergrenze für auto- und ultra-Durchläufe fest und akzeptiert 1 $ bis 100 $, und mit budget.maxDurationSeconds können Sie die Laufzeit von 5 Minuten bis zu 3 Stunden begrenzen. Ein Durchlauf, der früher fertig ist, kostet weniger als das Limit, und Sie können einen mittendrin stoppen und behalten, was er gefunden hat.
Das Standardlimit von 20 $ ist die Zahl, bei der man verweilen sollte. Für eine wirklich erschöpfende Marktübersicht sind 20 $ für eine Rechercheaufgabe, die einen Menschen einen ganzen Tag kosten würde, ein Schnäppchen. Für einen Workflow, der hunderte Male läuft, ist dasselbe Limit echtes Geld, und deshalb gibt Exa Ihnen überhaupt die Budget-Regler. Es gibt außerdem eine kostenlose Starter-Stufe mit 10 $ monatlichem Guthaben ohne Karte, sodass Sie es an Ihren eigenen Aufgaben testen können, bevor Sie sich festlegen.
Wo es passt: Recherche-Infrastruktur, keine Support-Einstellung
Das ist der Teil, den ich am meisten vermitteln will, denn die Darstellung "KI, die für Sie recherchiert" verleitet zu einer falschen Annahme. Exa Agent Ultra ist Infrastruktur. Es ist eine fantastische Engine für eine GTM-Pipeline, die Leads anreichert, einen Due-Diligence-Workflow, der einen Markt kartiert, oder einen Recherche-Agenten, den Sie selbst bauen. In jedem dieser Fälle schreiben Sie den Code, definieren das Schema und besitzen den Workflow rund um die API.
Das ist eine völlig andere Aufgabe, als eine KI auf Ihre Support-Warteschlange zu setzen, und der Unterschied bringt Teams ständig durcheinander.

Ich arbeite bei eesel auf der Produktseite, und wir haben Jahre damit verbracht, KI auf Live-Support-Warteschlangen zu setzen, über Tausende echte Tickets und Kunden-Rollouts hinweg. Die Lektion, die hängen blieb: Die rohe Retrieval-Qualität ist nicht das Schwierige an der Support-Automatisierung. Schwierig sind das Vertrauen, die Ticket-Integrationen, die Verankerung im internen Wissen und das Wissen, wann man an einen Menschen übergibt. Eine Recherche-API, so gut sie auch ist, liefert Ihnen davon nichts ab Werk. Sie müssten die Helpdesk-Anbindung, die Eskalationslogik und die Sicherheitsprüfungen selbst darauf aufbauen.
Das ist die Grenze zwischen Infrastruktur und einem Teammitglied, und deshalb sehen wir eesel als KI-Teammitglied-Plattform und nicht als API. Sie stellen ein Teammitglied für eine definierte Aufgabe ein, und es kommt arbeitsbereit.
eesel ausprobieren
Wenn Ihre eigentliche Aufgabe Support ist und keine Recherche-Pipeline, ist genau dafür ein eesel KI-Agent gebaut. Er verbindet sich mit Zendesk, Freshdesk oder Gorgias, lernt aus Ihren früheren Tickets und Hilfedokumenten und entwirft oder sendet Antworten ab dem ersten Tag, ganz ohne API-Klebecode. Und weil selbstsichere Bots selbstsicher falsch liegen können, wird jeder Rollout zuerst an Ihren historischen Tickets simuliert, sodass Sie die Lösungsrate sehen, bevor ein einziger Kunde sie sieht.

Wenn Ihnen die Idee gefallen hat, Exa über ein Terminal oder einen Coding-Agenten zu steuern, holt eesel Sie auch dort ab. Die eesel CLI bedient dasselbe Teammitglied und denselben Workspace wie das Dashboard und gibt JSON aus, sodass ein Mensch sie von Hand ausführen, ein Skript sie automatisieren und Coding-Agenten wie Claude Code, Codex und Cursor sie direkt steuern können. Sie können die Anweisungen eines Teammitglieds einsehen, einen fiktiven Test-Prompt senden, die genaue Antwort und die verwendeten Quellen prüfen und dann eine gezielte Anweisungsänderung vorschlagen, die ein Verantwortlicher freigibt. Es ist dieselbe agentenfreundliche, kopflose Steuerung, die Menschen an einer API wie der von Exa anzieht, nur auf die eigentliche Aufgabe gerichtet, den Support zu betreiben, statt einen Recherche-Stack zusammenzubauen. Sie können eesel kostenlos testen und an Ihren eigenen Tickets sehen, wie es funktioniert.
Häufig gestellte Fragen
Was ist Exa Agent Ultra?
Exa Agent Ultra ist die höchste Aufwandsstufe der Exa Agent API, eines Deep-Research-Endpunkts, der eine Anfrage in parallele Subagenten aufteilt, Tausende Quellen durchliest und ein belegtes, strukturiertes Ergebnis zurückgibt. Er ist für erschöpfenden Listenaufbau und die Anreicherung von Entitäten gedacht, nicht für schnelle Abfragen. Wenn Sie solche Recherche als KI-Agent für den Support statt als rohe API-Aufrufe wollen, ist das eine andere Produktkategorie.
Was kostet Exa Agent Ultra?
Ultra wird über Exas Pay-as-you-go-Preise abgerechnet, zu den üblichen Agent-Nutzungssätzen bis zu einem Standardlimit von 20 $ pro Durchlauf. Mit budget.maxCostDollars können Sie das Limit zwischen 1 $ und 100 $ verschieben. Die festen Aufwandsstufen sind günstiger und planbar: von minimal mit 0,012 $ bis xhigh mit 1,00 $ pro Anfrage. Support-Tools wie eesel Preise rechnen dagegen pro Lösung ab, was sich besser auf eine Ticket-Warteschlange übertragen lässt.
Wie unterscheidet sich Agent Ultra von den anderen Exa-Aufwandsstufen?
Der Aufwand ist bei Exa Agent ein einziger Regler: minimal, low, medium, high, xhigh, auto und ultra. Die festen Stufen haben einen festen Preis pro Anfrage, während ultra nutzungsbasiert abgerechnet wird und eine Aufgabe bis zur Erschöpfung ausführt. Wer den Regler höher dreht, bekommt mehr Subagenten, mehr Quellen und mehr Verifizierung zu höheren Kosten pro Aufgabe.
Eignet sich Exa Agent Ultra für den Kundensupport?
Es ist Retrieval-Infrastruktur und damit hervorragend darin, webbasierte, belegte Recherche zu sammeln, aber es bindet sich nicht in Ihren Helpdesk ein, lernt keine internen Dokumente und sendet nicht von selbst Antworten. Für den First-Level-Support brauchen Sie ein Teammitglied, das sich mit Ihrer Ticket-Warteschlange verbindet und mit Ihrem eigenen Wissen antwortet, und genau das leistet ein eesel KI-Agent.
Wie sind die Benchmark-Ergebnisse von Exa Agent Ultra?
Exa gibt an, dass Agent Ultra Opus 5.5, GPT-6 Astra und Perplexity Agent in vier Recherche-Benchmarks schlägt: 81,4 % Soft Recall bei WANDR, 93,9 % F1 bei DeepSearchQA, 58,9 % Row-Level-F1 bei WideSearch und durchschnittlich 2.451 bestandene Entitäten pro Aufgabe bei Find-All Company. Das sind Exas eigene Benchmark-Läufe, behandeln Sie sie also als Herstellerzahlen, bis unabhängige Tests vorliegen. Für jeden KI-Agenten, den Sie einsetzen, zählt der Test mit Ihren eigenen Daten mehr als die Bestenliste.

Article by
Rama Adi
Rama is a software engineer at eesel AI with two years of experience writing about B2B SaaS, AI tools, and customer support technology. Based in Bali, Indonesia, he brings a developer's perspective to product comparisons — cutting through marketing copy to what the integrations and APIs actually do.






