Codex Security Cloud im Test: Ich habe den Scanner auf eine fehlerhafte App losgelassen

Rama Adi
Geschrieben von

Rama Adi

Katelin Teen
Geprüft von

Katelin Teen

Zuletzt bearbeitet October 1, 2026

Expertengeprüft
Handgezeichnete Illustration eines Prüfers mit einer Bewertungskarte mit drei Häkchen und einem Fragezeichen, neben einem Cloud-verbundenen Code-Repository und einer Lupe über einem Bug in einer abgeschirmten Sandbox-Box

Was ist Codex Security Cloud?

Codex Security ist OpenAIs Application-Security-Agent in OpenAI Codex. Er liest Ihren Code und baut ein Bedrohungsmodell, sucht nach Schwachstellen, prüft jede einzelne und schlägt auch einen Fix vor. Die Cloud-Version startete auf der DevDay am 29. September 2026 als Plugin, das in Codex Cloud gegen verbundene GitHub-Repos läuft. Laut OpenAIs DevDay-Rückblick kann es ganze Repos "on demand or on a schedule, with ongoing checks of new commits" scannen, auch bei geschlossenem Laptop, was praktisch ist.

Das Findings-Dashboard von Codex Security Cloud mit den Tabs Overview, Findings, Repositories, Scans und Configure, einer Pipeline von Discovered bis Done und einer Tabelle Needs attention mit Fix-Buttons, entnommen aus OpenAIs DevDay-Rückblick
Das Findings-Dashboard von Codex Security Cloud mit den Tabs Overview, Findings, Repositories, Scans und Configure, einer Pipeline von Discovered bis Done und einer Tabelle Needs attention mit Fix-Buttons, entnommen aus OpenAIs DevDay-Rückblick

Das wichtigste Upgrade ist der Zugang zu Daybreak Blue, OpenAIs Modell mit weniger Ablehnungen für defensive Sicherheitsarbeit, "without a separate Daybreak application." Das zählt, denn die häufigste Beschwerde vor Cloud waren nicht schlechte Funde. Es waren Scans, die eine halbe Stunde liefen und dann abgelehnt wurden. Mein Beitrag zu GPT-5.6-Cyber erklärt, wie die Blue- und Red-Stufen funktionieren.

Wenn Sie die komplette Funktionstour wollen, führt mein Codex-Security-Cloud-Erklärstück durch Setup, die vier Oberflächen und die Geschichte bis zurück zu Aardvark. Dieser Beitrag ist das Fazit.

Wie ich getestet habe

Ich habe keinen Team-Workspace mit aktiviertem Cloud-Plugin, also nahm ich das Nächstbeste. Das ist die Open-Source-Codex-Security-CLI, die dasselbe Codex-Security-Plugin enthält und dieselbe Pipeline aus Ihrem Terminal ausführt. Ich nutzte Version 0.1.31 mit den Standardeinstellungen, also Modell gpt-5.6-sol mit xhigh Reasoning Effort im Standard-Scanmodus, authentifiziert mit einem OpenAI-API-Key.

Das Repository openai/codex-security auf GitHub mit Apache-2.0-Lizenz, 10,9k Sternen, 832 Forks und den Ordnern plugins und SDK, aufgenommen von GitHub
Das Repository openai/codex-security auf GitHub mit Apache-2.0-Lizenz, 10,9k Sternen, 832 Forks und den Ordnern plugins und SDK, aufgenommen von GitHub

Das Testziel war eine winzige interne Ticket-API, die ich für den Test geschrieben habe. Es ist eine einzige Flask-Datei mit etwa 60 Zeilen plus einer einzeiligen README, die sagt, dass sie in einem Firmennetz läuft. Ich habe fünf klassische Bugs eingebaut:

  1. SQL-Injection in einer Ticket-Suche, die die Kunden-E-Mail in die Abfrage konkateniert.
  2. Path Traversal in einem Anhang-Download, der einen vom Nutzer gelieferten Dateinamen an einen Ordner anhängt.
  3. Command Injection in einer Admin-Export-Route, die einen format-Wert an die Shell übergibt.
  4. Fehlende Autorisierung bei einer Delete-Route, mit dem Kommentar # TODO: only admins should do this.
  5. Debug-Modus auf allen Interfaces mit app.run(host="0.0.0.0", debug=True).

Das sind einfache Bugs, und genau das ist der Sinn des Tests. Wenn ein Sicherheitsagent Lehrbuch-Bugs in 60 Zeilen übersieht, ist alles andere egal. Findet er sie, lautet die interessante Frage, wie gut er sie erklärt und was es kostet, dorthin zu kommen.

Zwei Einschränkungen zu meinem Test vorab. Erstens bekommt ein API-Key kein Daybreak Blue, ich lief also mit den Standard-Schutzmechanismen, was bei Ablehnungen die härtere Einstellung gegenüber Cloud ist. Zweitens validierte der Standard-Scan der CLI Funde durch Nachverfolgen der Quelle, und der Bericht sagt "no runtime query was executed." Die Docs von Cloud beschreiben das Reproduzieren von Funden in einem Sandbox-Container, was ich hier nicht ausprobieren konnte.

Was Codex Security gefunden hat

Der zweite Lauf endete nach 8m 56s mit vollständiger Abdeckung. Das ist die ausgegebene Zusammenfassung:

Code
FINDINGS  5 (5 confirmed this scan; 0 previously found; 2 high, 2 medium, 1 low)
COVERAGE  complete
ELAPSED   8m 56s
TOKENS    18,684 uncached input, 3,357,854 cache reads, 173,804 cache writes, 73,204 output, 3,623,546 total
COST      $3.7509776–$6.7699152 (standard, context unknown)

Und so passen die Funde zu dem, was ich eingebaut habe:

Was ich eingebaut habeGefunden?Vergebene SchwereBegründung
Command Injection in /admin/exportJaHochEine einzige unauthentifizierte Anfrage ermöglicht Befehlsausführung, unter kritisch gehalten, weil die App intern ist
Fehlende Auth beim LöschenJa, auf jede Route ausgeweitetHochKeine Route prüft die Identität, daher kann jeder Netzwerk-Client Tickets lesen, ändern und löschen
Path Traversal bei AnhängenJaMittelDer Pfad-Ausbruch ist direkt, aber die Wirkung hängt davon ab, welche Dateien das Service-Konto lesen kann
SQL-Injection in der SucheJaMittelPythons SQLite führt nur ein Statement auf einmal aus, gestapelte Schreibzugriffe sind also nicht möglich, nur Datenlesen
debug=True auf 0.0.0.0JaNiedrigLegt Debug-Fehlerseiten offen, und die Konsole braucht weiterhin eine PIN zum Entsperren

Fünf von fünf, alle mit hoher Konfidenz, und nichts erfunden. Bei einer Spielzeug-App ist das das Minimum, keine Trophäe. Mehr beeindruckt hat mich die Begründung der Schwere. Die meisten Scanner würden die SQL-Injection reflexartig als kritisch einstufen, das ist die übliche Gewohnheit. Dieser hier bemerkte, dass Pythons sqlite3 keine gestapelten Statements ausführt, der Schaden also beim Datenlesen endet, und stufte sie als mittel ein, mit einem Hinweis, was sie erhöhen würde. Solch eine Einschätzung würde auch ein guter menschlicher Reviewer treffen.

Er blieb auch nicht bei meinem TODO-Kommentar stehen. Er stellte fest, dass die Route für Status-Updates dieselbe fehlende Prüfung hatte, und fasste beides zu einem breiteren Fund zusammen: Die App hat überhaupt keine Authentifizierung. Das ist die nützlichere Darstellung, denn den Fix für eine Route umzusetzen, ließe die übrigen offen.

Handgezeichnete Bewertungskarte auf einem Klemmbrett, die Codex Security in fünf Zeilen bewertet: gefundene eingebaute Bugs und Berichtstiefe mit fünf Punkten, Setup auf dem Laptop und Kosten pro winzigem Repo mit drei Punkten, Tarifklarheit mit zwei Punkten, mit eingekreistem Fazit "worth a pilot"
Handgezeichnete Bewertungskarte auf einem Klemmbrett, die Codex Security in fünf Zeilen bewertet: gefundene eingebaute Bugs und Berichtstiefe mit fünf Punkten, Setup auf dem Laptop und Kosten pro winzigem Repo mit drei Punkten, Tarifklarheit mit zwei Punkten, mit eingekreistem Fazit "worth a pilot"

Wie der Bericht aussieht

Der Ausgabeordner enthielt eine report.md, eine findings.json, eine coverage.json und einen SARIF-Export, den Sie in die Code-Scanning-Ansicht von GitHub hochladen können. Der Bericht umfasst 55 KB für eine 60-Zeilen-App, hier wird also nicht an Details gespart.

Vor allen Funden schreibt er ein Bedrohungsmodell Ihrer App. Es listet die Assets (die Ticket-Datenbank, den Anhangordner, den Shell-Zugriff des Prozesses), die Vertrauensgrenzen und auch, was ein realistischer Angreifer tun kann. Er markierte sogar, was er nicht sehen konnte. Meine Export-Route ruft eine export.py auf, die im Repo nicht existiert, und der Bericht sagt das, statt zu raten.

Jeder Fund bekommt dann eine Begründung der Schwere, die Belege Zeile für Zeile nachverfolgt, die "Gegenbelege", die das Risiko senken würden, und einen Abschnitt zur Behebung mit zu schreibenden Tests. Für die Command Injection lautet der Fix:

"Require administrator authorization, remove shell=True, invoke a fixed interpreter and script with an argument vector, and allowlist the supported export formats."

Das ist korrekt und auch konkret. Er schlug zudem zwei Tests vor: einen, der prüft, dass Shell-Metazeichen in format nie einen zweiten Prozess starten, und einen, der prüft, dass Nicht-Admins die Route nicht erreichen. Ich habe --patch nicht übergeben, also schrieb er keinen Code. In Cloud ist das Pendant der Button Fix with Codex, der einen Patch entwirft, den Sie prüfen, bevor Sie Create draft pull request wählen, laut Cloud-Setup-Anleitung.

Wenn Sie /security-review von Claude Code kennen: Das hier ist deutlich strukturierter. Der Bericht liest sich wie ein Audit-Dokument, nicht wie ein Code-Kommentar.

Wo es gehakt hat

Mein erster Lauf scheiterte. Der Scan verbrachte zweieinhalb Minuten in der Preflight-Phase und brach dann mit "Scan agent did not create required draft artifacts" und einem leeren Ausgabeordner ab. Die Logs zeigten, dass der Agent die benötigten Laufzeiteinstellungen nicht sehen konnte, darunter den Python-Pfad. Er hatte bereits 527.000 Input-Tokens verbraucht, etwa 0,74 bis 1,40 $, um nichts zu produzieren. Der zweite Lauf funktionierte, nachdem ich den Python-Pfad explizit übergab und meine Shell-Umgebung erben ließ.

Ich bin nicht der Einzige, der darauf stieß. Ein offenes Issue im Repo, #73, beschreibt dasselbe Muster unter Windows und Linux: Der Scan läuft, Tokens werden berechnet, dann scheitert das Speichern, und "the 'partial output' directory is completely empty." Das --max-cost-Flag der CLI rettet Sie hier nicht, und OpenAIs CLI-FAQ sagt, das Limit sei "an estimate, not a hard spending cap." Ich setzte es auf $4, und das obere Ende meiner finalen Schätzung lag bei 6,77 $.

Das ist das stärkste Argument für Cloud gegenüber der CLI. In Cloud gehören Container, Umgebung und Python-Setup OpenAI, diese ganze Klasse lokaler Setup-Fehler sollte Sie also nicht erreichen.

Sind die Kosten vertretbar?

Die Kosten haben meine Note gesenkt. Mein Scan verbrauchte 3,6 Millionen Tokens für 60 Zeilen Code. Die Aufschlüsselung erklärt, warum:

Handgezeichneter gestapelter Balken mit 3,6 Mio. Tokens für eine 60-Zeilen-App, Cache-Lesezugriffe 93 %, Cache-Schreibzugriffe 5 %, Output 2 % und frischer Input 0,5 %, und ein Preisschild mit 3,75 bis 6,77 $ sowie dem Hinweis 9 Minuten und 5 Funde
Handgezeichneter gestapelter Balken mit 3,6 Mio. Tokens für eine 60-Zeilen-App, Cache-Lesezugriffe 93 %, Cache-Schreibzugriffe 5 %, Output 2 % und frischer Input 0,5 %, und ein Preisschild mit 3,75 bis 6,77 $ sowie dem Hinweis 9 Minuten und 5 Funde

93 % der Tokens waren Cache-Lesezugriffe. Der Agent liest seine eigenen Anweisungen, das Bedrohungsmodell und den Code immer wieder, während er Threat Modeling, Discovery, Validierung, Angriffspfad-Analyse und Reporting durchläuft. Das meiste davon ist fester Overhead, ein größeres Repo sollte also nicht proportional mehr pro Zeile kosten. Aber es heißt, dass schon ein trivialer Scan ein paar Dollar kostet und das Commit-Monitoring einen Teil dieser Arbeit bei jedem Push wiederholt.

In der eigenen Preistabelle der CLI für gpt-5.6-sol kosten Cache-Lesezugriffe 0,40 $ pro Million Tokens und Output 20 $ pro Million. Output machte nur 2 % der Tokens aus, aber 1,46 $ der unteren Schätzung.

In Cloud sehen Sie keine Dollar. Scans ziehen vom im Tarif enthaltenen Codex-Kontingent und danach von Credits. OpenAIs Preisseite sagt "Daybreak Blue uses GPT-5.6 Sol credit rates," also 100 Credits pro Million Input-Tokens, 10 pro Million gecachtem Input und 500 pro Million Output. Das ist das Doppelte des Satzes von GPT-6 Sol.

Diese Tarife bekommen Cloud, laut DevDay-Rückblick und derselben Preisseite:

TarifPreisCloud-ZugangWeg bei Überschreitung
Plus20 $/MonatNicht enthaltenNicht zutreffend
Pro100, 200 oder 500 $/MonatJa, laut DevDayChatGPT-Credits
Business20 $/Nutzer/Monat jährlich, 25 $ monatlichJa, laut DevDayWorkspace-Credits
Enterprise und EduVertrieb kontaktierenJaWorkspace-Credits oder Pay-as-you-go
Nur API-KeyAPI-PreiseKeine Cloud-FunktionenAbrechnung pro Token

Beim Tarifbild gibt es einen Haken. Die Funktionsmatrix auf derselben Preisseite markiert "Codex Security for connected GitHub repositories" weiterhin nur für Enterprise und Edu. Ich würde dem neueren DevDay-Beitrag trauen, aber ich würde auch prüfen, ob das Plugin in Ihrem eigenen Workspace erscheint, bevor Sie dafür upgraden. Mein Codex-Preisratgeber erklärt mehr dazu, wie Credits verbraucht werden.

Zur Einordnung: Ein paar Dollar pro Repo-Scan sind günstig im Vergleich zu einer Stunde eines Security-Engineers. Teuer sind sie neben einem regelbasierten Scanner, der kostenlos bei jedem Pull Request läuft. Deshalb ist das richtige Modell beides, nicht entweder oder.

Der Daybreak-Blue-Haken, den die meisten übersehen

Daybreak Blue ist der beste Grund für Cloud, und es kommt mit einer Bedingung, die im Launch-Beitrag nicht steht. Es gilt nur, wenn Sie sich mit ChatGPT anmelden.

Handgezeichnetes Gabel-Diagramm: Anmeldung mit ChatGPT über das Cloud- oder Desktop-Plugin führt zu Daybreak Blue inklusive, während ein API-Key für die CLI in CI-Pipelines zu Standard-Schutzmechanismen führt, vermerkt als Issue 1024, offen
Handgezeichnetes Gabel-Diagramm: Anmeldung mit ChatGPT über das Cloud- oder Desktop-Plugin führt zu Daybreak Blue inklusive, während ein API-Key für die CLI in CI-Pipelines zu Standard-Schutzmechanismen führt, vermerkt als Issue 1024, offen

Ein offenes Issue, #1024, eingereicht von einem Team, das bereits für Daybreak Blue freigegeben ist, meldet, dass die angepinnte Codex-Version der CLI "filters out the cyber access program unless authentication is through ChatGPT." Die Blue-Auswahl fällt also weg, wenn Sie einen API-Key nutzen, und genau so laufen die meisten CI-Pipelines. Das Plugin-Changelog bestätigt das aus anderer Perspektive: "Sessions that use only an API key can't verify account access."

Warum ist das wichtig? Weil das Ablehnungsproblem real ist. Als OpenAI die CLI im Juli als Open Source veröffentlichte, füllte sich der Hacker-News-Thread mit Leuten, die darauf stießen:

Hacker News

"Thing is, you WILL encounter refusals with Sol doing anything remotely adjacent to security work. Which for Codex Security is kinda... problematic."

Ein anderer Nutzer sah, wie ein Scan einer kleinen Open-Source-Bibliothek über 40 Minuten lief und dann mit "This content was flagged for possible cybersecurity risk" endete:

Hacker News

"it ran for over 40 minutes and during that time I had no idea what was happening, thought it was frozen or in a bad state. Also, it ate through 25% of my weekly credits :("

Fairerweise: Ich bekam bei meiner Test-App keine einzige Ablehnung, auch nicht mit Standard-Schutzmechanismen. Das kann daran liegen, dass meine Bugs Lehrbuchfälle sind und die App winzig ist. Der Issue-Thread zu diesem Fehler, #56, ist weiterhin offen. Mein praktisches Fazit: Nutzen Sie Cloud oder ein mit ChatGPT angemeldetes Plugin für alles Ernsthafte, und behandeln Sie API-Key-CI-Scans als leichteres Gate, bis #1024 behoben ist.

Was andere Nutzer sagen

Praxisberichte speziell zu Cloud sind noch dünn, denn es ist erst zwei Tage alt. Der Hacker-News-Launch-Thread hatte bei meiner Prüfung keine Kommentare. Die Stimmen bisher stammen meist von der CLI und der früheren Plugin-Vorschau, die denselben Scanner nutzen.

Die positive Einschätzung kommt von Simon Willison, der es schon im April in der Vorschau hatte:

"I've been previewing this in Codex for a few weeks - it's very good! Had some great results from it having it run security reviews against code written using other models"

Die skeptischen Stimmen fallen in zwei Gruppen. Manche halten es für überwiegend ein Harness um OpenAIs Modelle. Das Teardown eines Entwicklers auf X fasste die CLI als "just JS calling Codex in a loop" zusammen. Dem würde ich ein wenig widersprechen. Nach dem Lesen meines 55-KB-Berichts ist klar, dass das Harness Struktur hinzufügt, die ein roher Prompt nicht hätte. Aber richtig ist, dass die Qualität vom Modell kommt.

Die andere Gruppe sorgt sich um die Abdeckung. Ein Hacker-News-Kommentator, der Beiträge von curl-Maintainer Daniel Stenberg wiedergab, sagte, sowohl Codex Security als auch Claude Mythos hätten bei curl null Funde gemeldet, bevor der Scan eines anderen Tools zu sechs CVEs führte. Es ist aus zweiter Hand, aber eine faire Warnung. Die beste von OpenAI veröffentlichte Zahl stammt aus den Aardvark-Tagen, als es 92 % der bekannten Schwachstellen in den eigenen "golden" Test-Repos fand, und es gibt noch keinen öffentlichen Vergleich mit regelbasierten Tools. Mein Fünf-von-fünf-Ergebnis bezog sich auf Bugs, von denen ich wusste. Eine reife Codebasis versteckt die schwierigeren.

Vergleich mit den Alternativen

OpenAIs eigene Cloud-FAQ beantwortet die Ersatzfrage in einer Zeile: "Codex Security complements SAST." So schneiden die nächsten Tools nach dem ab, was jeder Anbieter veröffentlicht:

ToolVeröffentlichter PreisPrüft seine Funde?Schlägt Fixes vor?Am besten für
Codex Security CloudEnthaltenes Codex-Kontingent, danach CreditsJa, reproduziert in einer SandboxJa, Sie öffnen den Draft-PRLogiklastige Bugs bei Teams mit ChatGPT-Tarif
Claude Code SecurityKein öffentlicher Preis, begrenzte VorschauPrüft jeden Fund erneutJa, mit menschlicher FreigabeTeams, die auf Claude Code setzen
GitHub Code Security30 $ pro aktivem Committer/MonatRegelbasierte CodeQL-AnalyseJa, Copilot AutofixEine deterministische Basis bei jedem PR
SnykGratis-Tarif, Team ab 25 $/MonatScannt Fix-Kandidaten erneutJa, Snyk Agent FixAbhängigkeits- und Open-Source-Risiken
SemgrepKostenlos bis 10 Contributors, Teams ab 30 $/Contributor/MonatNicht angegebenHinweise zur BehebungEigene Regeln, die Sie selbst schreiben

Das Setup, das ich fahren würde: ein regelbasierter Scanner bei jedem Pull Request als Basis, über GitHubs kostenpflichtige Tarife, Snyk oder Semgrep. Dann Codex Security Cloud nach Zeitplan für die Bugs, die eine Regel nicht ausdrücken kann, etwa eine fehlende Auth-Prüfung, die erst Sinn ergibt, wenn man die ganze App versteht.

Wenn Ihr Team in Claude Code arbeitet, bietet dessen GitHub-Integration das nächstliegende Pendant auf PR-Seite. Für das breitere Feld siehe meine Liste der OpenAI-Codex-Alternativen. Sicherheitsteams, die die spezialisierten Cyber-Modelle abwägen, sollten mit der Übersicht der GPT-5.6-Cyber-Alternativen beginnen.

Vor- und Nachteile

VorteileNachteile
Fand alle 5 eingebauten Bugs ohne FehlalarmeEine 60-Zeilen-App kostete 3,75 bis 6,77 $ und dauerte 9 Minuten
Schwere-Einstufungen mit echter Begründung, nicht aus ReflexMein erster Lauf scheiterte beim Setup und kostete trotzdem etwa 1 $
Bedrohungsmodell, Belege und Tests zu jedem FundTarifzugang widerspricht sich auf OpenAIs eigenen Seiten
SARIF-Export für GitHub Code ScanningDaybreak Blue gilt noch nicht für API-Key-CI-Scans
Wendet nie einen Patch ohne Menschen anKein öffentlicher Benchmark gegen SAST-Tools, nur OpenAIs eigene Zahlen

Noch etwas ist zu beachten: Das Repo entwickelt sich schnell. Ein vor zwei Tagen gemergter Commit, sichtbar im GitHub-Repo, stellt das Standardmodell der CLI auf GPT-6 Sol mit xhigh um. Die von mir installierte npm-Version nutzte noch standardmäßig gpt-5.6-sol. Wenn das landet, sollten Scans günstiger werden, da der Credit-Satz von GPT-6 Sol halb so hoch ist wie der von GPT-5.6 Sol.

Für wen ist Codex Security Cloud?

Nutzen Sie es, wenn Sie ChatGPT Pro, Business, Enterprise oder Edu haben, Ihr Code auf GitHub liegt und kein Security-Engineer jede Änderung prüft. Es ist eine starke Zweitmeinung zu den Logik-Bugs, die regelbasierte Tools übersehen, und die Berichte sind gut genug, um sie unverändert an einen Entwickler zu geben. Starten Sie mit einem Repository-Scan Ihres sensibelsten Dienstes, prüfen Sie Ihr Nutzungs-Dashboard vorher und nachher, und aktivieren Sie erst dann das Commit-Monitoring.

Verzichten Sie, wenn Ihre Richtlinie vorschreibt, dass Quellcode Ihre Umgebung nicht verlassen darf. Es ist kein Offline-Scanner, und wie ein OpenAI-Mitarbeiter auf Hacker News erklärte, gehen Code und Kontext an OpenAIs gehostetes Modell. Verzichten Sie auch, wenn Sie Plus nutzen oder ein günstiges, deterministisches Gate bei jedem Pull Request brauchen. Das ist ein Job für CodeQL oder Semgrep.

Warten Sie, wenn Sie es headless aus der CI mit einem API-Key betreiben wollten. Bis das Daybreak-Blue-Problem behoben ist und sich die Speicherfehler legen, ist die CLI in der CI der schwächste Weg, es zu nutzen.

Verglichen mit OpenAIs anderen jüngsten Launches, etwa dem Always-on-Agenten OpenAI Dots und GPT-6.1 Sol, fühlt sich dieser am nächsten an produktionsreif an. Er ist weiterhin als Research Preview gekennzeichnet, richten Sie Ihre Erwartungen also an der Version aus, die vor Ihnen liegt.

eesel für die Warteschlange, die nie aufhört

Codex Security erledigt eine Aufgabe, nämlich Sicherheits-Bugs zu finden und zu erklären, und verdient Vertrauen, indem es seine Belege zeigt, bevor ein Mensch handelt. Das ist dieselbe Form wie bei den Teammates, die ich bei eesel baue. eesel ist eine Plattform für KI-Teammates mit heute zwei einsatzbereiten Mitarbeitern: einem KI-Helpdesk-Teammate, das zu Zendesk, Freshdesk, Gorgias oder Front stößt, und einem KI-Blogautor für Content und SEO.

Im Support gilt die Lehre aus meinem Scan direkt. Konfidenz ist nicht dasselbe wie Richtigkeit. Ein B2B-Fahrzeug-Telematik-Team auf Zendesk sah, wie ein Bot "yes, we support your car model" für Marken antwortete, die nicht in ihrer Datenbank standen, nur weil die Wissensdatenbank "we support all models" sagte. Deshalb lässt eesel das Helpdesk-Teammate zuerst in einer Simulation gegen Hunderte Ihrer vergangenen Tickets laufen, sodass Sie jede Antwort sehen, die es gesendet hätte, bevor es einen Live-Kunden berührt. Aktionen außerhalb seiner Regeln warten auf menschliche Freigabe, wie ein Draft-PR, der auf Ihr Review wartet.

Die eesel-Reports-Ansicht für ein Zendesk-Teammate mit Aufgabenvolumen, Auslöseereignissen nach Typ und Freigabenutzung pro Tool
Die eesel-Reports-Ansicht für ein Zendesk-Teammate mit Aufgabenvolumen, Auslöseereignissen nach Typ und Freigabenutzung pro Tool

Wenn Ihnen die CLI-Seite von Codex Security gefallen hat: eesel hat auch eine. Die eesel CLI steuert dasselbe Teammate und denselben Workspace, die Sie im Dashboard sehen, aus einem Terminal oder Skript. eesel approvals list zeigt, was auf einen Menschen wartet, und eesel activity listet jeden Lauf auf, damit Sie prüfen können, was das Teammate getan hat. Auch Coding-Agenten wie Codex und Claude Code können sie bedienen, denn jeder Workspace funktioniert zugleich als MCP-Server. Mein Ratgeber zur KI-Agenten-CLI erklärt, warum das wichtig ist.

Die Preise sind öffentlich: ein kostenloser Tarif mit 100 Credits, dann Tarife ab 299 $/Monat für 500 Credits, wobei ein Ticket oder Chat einen Credit kostet, laut Preisseite. Testen Sie eesel und lassen Sie das Helpdesk-Teammate noch am selben Nachmittag auf Ihren eigenen vergangenen Tickets laufen. Mein Erklärstück zu KI-Teammates behandelt das Modell ausführlicher.

Häufig gestellte Fragen

Lohnt sich Codex Security Cloud?
Für ein Team, das bereits für ChatGPT Business, Enterprise oder Pro zahlt, ja, als Pilot auf einem Repo. In meinem Test fand es alle 5 eingebauten Bugs und erklärte jeden besser als die meisten Scanner. Als einziger Scanner lohnt es sich nicht, und OpenAI sagt selbst, dass es statische Analyse ergänzt und nicht ersetzt. Mein Codex-Security-Cloud-Erklärstück zeigt, wie es funktioniert.
Wie genau ist Codex Security Cloud?
Bei meiner kleinen Test-App meldete es 5 von 5 eingebauten Schwachstellen mit hoher Konfidenz und ohne Fehlalarme. Das ist eine winzige App, kein Benchmark. OpenAIs eigene Zahl aus den Aardvark-Zeiten liegt bei 92 % Recall auf den eigenen Test-Repos, und ein Bericht aus zweiter Hand sagt, es habe bei curl null Funde geliefert. Kombinieren Sie es daher mit einem regelbasierten Tool wie GitHub Copilot Autofix auf CodeQL.
Was kostet ein Codex-Security-Cloud-Scan?
Cloud hat keinen eigenen Preis. Scans nutzen das in Ihrem Tarif enthaltene Codex-Kontingent, danach Credits, und das mitgelieferte Modell Daybreak Blue wird zu GPT-5.6-Sol-Tarifen abgerechnet. Über die CLI mit API-Key verbrauchte mein Scan einer 60-Zeilen-App 3,6 Millionen Tokens und kostete 3,75 bis 6,77 $. Mein Codex-Preisratgeber erklärt die Credits.
Welche ChatGPT-Tarife enthalten Codex Security Cloud?
Laut OpenAIs DevDay-Rückblick Pro, Business, Enterprise und Edu. Plus ist nicht enthalten. OpenAIs eigene Preismatrix führt das Scannen von GitHub-Repos weiterhin nur für Enterprise und Edu auf. Prüfen Sie daher, ob das Plugin in Ihrem Workspace erscheint, bevor Sie dafür einen Tarif kaufen. Die Tarifkosten finden Sie in meiner ChatGPT-Preisübersicht.
Kann ich Codex Security Cloud mit einem API-Key nutzen?
Nein. Cloud braucht einen ChatGPT-Tarif, denn Konten mit reinem API-Key haben keine Cloud-Funktionen. Sie können die Open-Source-CLI mit einem API-Key ausführen, aber ein offenes GitHub-Issue meldet, dass Daybreak Blue bei API-Key-Authentifizierung wegfällt, Sie würden also mit den Standard-Schutzmechanismen scannen. Meine Anleitung zu OpenAI-API-Keys zeigt die Einrichtung.
Behebt Codex Security Cloud die gefundenen Bugs?
Es schlägt Fixes vor, wendet sie aber nie selbst an. In Cloud wählen Sie Fix with Codex, prüfen den Diff und öffnen dann selbst einen Draft-Pull-Request. Mein CLI-Scan lieferte zu jedem Fund eine schriftliche Behebung, etwa shell=True zu entfernen und Exportformate per Allowlist zu begrenzen. Einen Menschen beim Merge zu behalten, ist dieselbe Regel, die ich bei jedem KI-Agenten anwenden würde.
Was sind die besten Alternativen zu Codex Security Cloud?
Am nächsten kommen Claude Code Security von Anthropic, GitHub Code Security mit Copilot Autofix, Snyk und Semgrep. Die regelbasierten Tools sind pro Scan günstiger und deterministisch, während Codex Security darüber nachdenkt, wie Ihr Code zusammenhängt. Wenn Sie Agenten breiter vergleichen, ist meine Liste der OpenAI-Codex-Alternativen ein guter Start.

Share this article

Rama Adi

Article by

Rama Adi

Rama is a software engineer at eesel AI with two years of experience writing about B2B SaaS, AI tools, and customer support technology. Based in Bali, Indonesia, he brings a developer's perspective to product comparisons — cutting through marketing copy to what the integrations and APIs actually do.

Related Posts

All posts →
Handgezeichnete Illustration: ein Entwickler am Laptop und eine Kollegin, die auf ein Dashboard mit Code-Repository, Sicherheitsschild, Nutzungsanzeige und einem Stapel Credit-Münzen schaut
Trending

Codex Security Cloud Preise 2026: Tarife, Credits und was ein Scan kostet

Bei den Codex Security Cloud Preisen gibt es keine eigene Preisposition. Scans laufen über dein ChatGPT-Abo, danach über Credits zu Daybreak-Blue-Raten. Mein echter Scan kam auf etwa 89 Credits.

Kurnia KharismaKurnia KharismaOct 1, 2026
Handgezeichnete Illustration: Ein Entwickler am Laptop ist mit einer lächelnden Wolke verbunden, die ein Repository, eine abgeschirmte Sandbox-Box und eine Liste von Funden verknüpft; daneben schaut eine zweite Person zu
Trending

Codex Security Cloud erklärt: So funktioniert OpenAIs Sicherheitsagent

Codex Security Cloud scannt deine GitHub-Repos, prüft neue Commits und testet jeden Fund in einer Sandbox. So funktioniert es, wer Zugriff bekommt und was es kostet.

KiraKiraOct 1, 2026
Handgezeichnete Illustration eines Entwicklers, der fünf schildförmige Sicherheitsscanner vergleicht, die vor einem Code-Repository aufgereiht sind, jeweils mit einer Lupe über einem Bug
Alternatives

Die 8 besten Alternativen zu Codex Security Cloud 2026 (im Vergleich)

Die 8 besten Alternativen zu Codex Security Cloud 2026, von Claude Security bis Semgrep und Strix, verglichen danach, wie sie belegen, dass ein Bug echt ist, und was sie kosten.

KiraKiraOct 1, 2026
Handgezeichnete Illustration einer Person, die eine grüne ChatGPT-Schlüsselkarte vor einer Reihe offener Türen hält, mit einer wöchentlichen Nutzungsanzeige in der Ecke
Trending

Mit ChatGPT anmelden: So funktioniert es, welche Apps es unterstützen und wo die Grenzen liegen

Mit „Mit ChatGPT anmelden“ nutzen Plus- und Pro-Abonnenten ihren Tarif in 16 Partner-Apps. So funktionieren die zwei Berechtigungen, die Wochenlimits und was Partner weiterhin berechnen.

Rama AdiRama AdiOct 1, 2026
Illustriertes Titelbild: KI-Agenten arbeiten in getrennten Sandbox-Kästen, während ein schildförmiger Watchdog sie von außen überwacht, zu einem Beitrag über die NVIDIA Open Agent Safety Platform
Trending

NVIDIA Open Agent Safety Platform: Was es ist, wie es funktioniert und wer es braucht

Die NVIDIA Open Agent Safety Platform besteht aus zwei Teilen: OpenShell, einer kostenlosen Laufzeitumgebung, die Sie heute installieren können, und Sentry, einem Hardware-Watchdog, den die meisten Teams nie anfassen werden.

KiraKiraSep 29, 2026
Ein Plugin-Paket versorgt gleichzeitig mehrere verschiedene KI-Coding-Agenten
Trending

Agent Plugins: der neue offene Standard für KI-Agent-Erweiterungen

Agent Plugins 1.0.0 erschien am 6. August 2026, mit AWS, Cursor, Microsoft, OpenAI und Vercel dahinter. Was der Standard vereinheitlicht und was er offenlässt.

Rama AdiRama AdiAug 6, 2026
Image alt text
Guides

Ein vollständiger Leitfaden zur OpenAI Codex-App und ihrer Verfügbarkeit für macOS

OpenAI hat im Februar 2026 eine dedizierte Codex-App für macOS veröffentlicht. Dieser Leitfaden behandelt ihre Verfügbarkeit, Funktionen und andere Möglichkeiten, den KI-Codierungsassistenten auf einem Mac zu nutzen.

Stevia PutriStevia PutriFeb 2, 2026
Handgezeichnete Illustration eines Prüfers mit Klemmbrett, der eine Dokumentseite aus Textblock, Diagrammblock und Prompt-Button bewertet, während ein freundlicher Roboter einen Block bearbeitet
Trending

ChatGPT Pages im Test: Block für Block, welche Teile fertig sind

Ein ChatGPT-Pages-Test Block für Block: Prompt-Blöcke und Ask for change sind stark, Visualize ist langsam, und Pages haben noch weder Export noch Versionsverlauf.

Rama AdiRama AdiOct 1, 2026
Handgezeichnete Illustration eines Entwicklers am Laptop neben einem langen Kassenbon mit Input-Tokens, Output-Tokens und Runtime, dazu ein Diagramm aus Cloud und Gateway und das AWS-Logo auf einem orangefarbenen Kreis
Trending

Bedrock Managed Agents Preise 2026: was ein OpenAI-Agent auf AWS wirklich kostet

Bedrock Managed Agents kostet in der Preview $0, aber Tokens tragen einen AWS-Aufschlag von 10 %, und AgentCore bringt Runtime- und NAT-Kosten dazu. Echte Rechnung pro Aufgabe und pro Monat.

Kurnia KharismaKurnia KharismaOct 1, 2026

Bereit, Ihren KI-Teamkollegen einzustellen?

In Minuten eingerichtet. Keine Kreditkarte erforderlich.

Kostenlos starten