
Was ist Codex Security Cloud?
Codex Security ist OpenAIs Application-Security-Agent in OpenAI Codex. Er findet und bestätigt Schwachstellen und schlägt auch den Fix vor. Codex Security Cloud ist die Version, die in Codex Cloud gegen deine verbundenen GitHub-Repositories läuft. Du installierst es als Plugin und richtest es auf ein Repo, dann arbeitet es weiter, ob dein Rechner an ist oder nicht.
OpenAIs DevDay-Zusammenfassung sagt es klar: Codex "investigates findings, removes duplicates and prepares fixes in the cloud, even with your laptop closed." Es ist als Research Preview im Web und in der Codex-App verfügbar.
Es war einer von mehreren DevDay-Launches, neben dem immer aktiven OpenAI Dots und dem Modell GPT-6.1 Sol.

Das kam nicht aus dem Nichts. Das Produkt hat eine längere Geschichte, und die ist wichtig, weil die Zahlen, die OpenAI nennt, aus den früheren Stufen stammen:
| Datum | Was erschien | Wer es nutzen konnte |
|---|---|---|
| 30. Okt. 2025 | Aardvark, "an agentic security researcher powered by GPT-5" | Private Beta, ausgewählte Partner |
| 6. März 2026 | Umbenannt in Codex Security, Research Preview im Codex-Web | Pro, Enterprise, Business, Edu, im ersten Monat kostenlos |
| Jul. 2026 | Öffentliche CLI und TypeScript SDK auf GitHub, Apache-2.0 | Jeder kann installieren; Scans brauchen Codex-Security-Zugang |
| 29. Sep. 2026 | Codex-Security-Cloud-Plugin, Daybreak Blue inklusive | Pro, Business, Enterprise, Edu |
Die Bilanz, auf die OpenAI verweist, ist real. Aardvark fand 92 % der bekannten und synthetisch eingebauten Schwachstellen in seinen "Golden"-Test-Repos. In den 30 Tagen vor dem Launch im März deckten die Scans der Beta-Gruppe mehr als 1,2 Millionen Commits ab und lieferten 792 kritische und 10.561 Funde mit hohem Schweregrad. OpenAI sagt außerdem, dass die Falsch-Positiv-Raten über alle Repositories um mehr als 50 % gesunken sind, und aus seiner Open-Source-Arbeit wurden 14 CVEs vergeben, darunter Meldungen an OpenSSH und GnuTLS sowie Chromium.
So funktioniert Codex Security Cloud
Die Pipeline hat vier Stufen, und die Cloud-FAQ führt sie der Reihe nach auf. Ich habe bei eesel ähnliche Agent-Pipelines gebaut, deshalb finde ich die Reihenfolge interessant: Die Validierung sitzt vor allem, was einen Menschen erreicht.

- Analyse. Codex liest das Repo und schreibt ein Bedrohungsmodell: Einstiegspunkte, Vertrauensgrenzen, Auth-Annahmen, riskante Komponenten.
- Scannen. Ein Repository-Scan prüft einmal alles. Commit changes überwacht neue Commits und kann auch die bestehende Historie rückwirkend durchsehen.
- Validierung. Für jedes wahrscheinliche Problem versucht es, das Problem in einem sauberen Container nachzustellen, führt Befehle oder Tests aus und hängt Logs als Beleg an. Funde, die sich reproduzieren lassen, werden als validiert markiert. Die anderen bleiben unvalidiert, der Versuch bleibt protokolliert.
- Behebung. Du bekommst Hinweise und, wenn einer erzeugt werden kann, einen "minimal actionable diff" mit Datei- und Zeilenkontext.
Ein paar Verhaltensweisen solltest du kennen, bevor du dem Ergebnis traust. Es ist sprachunabhängig, OpenAI merkt aber an, dass die Qualität davon abhängt, wie gut das Modell über deine Sprache und dein Framework nachdenkt. Es braucht keinen Build-Schritt, um Probleme zu finden, versucht aber möglicherweise, im Container zu bauen, um eines nachzustellen. Und jeder Job läuft in einem "ephemeral Codex container with session-scoped tools", der nach Ende des Jobs abgebaut wird.
Die meisten Teams nutzen das Bedrohungsmodell zu wenig. Codex entwirft es aus deinem Code, und danach steuert es jeden künftigen Commit-Scan und die Rangfolge der Funde. OpenAIs Leitfaden zum Bedrohungsmodell sagt, du sollst es bearbeiten, wenn sich deine Architektur ändert oder "when findings miss the areas you care about." In der Praxis würde ich es am ersten Tag bearbeiten, denn das Modell kennt deinen Code, weiß aber nicht, dass der Billing-Service das ist, wonach deine Auditoren fragen.
Vier Wege, Codex Security zu betreiben, und welcher davon Cloud ist
Genau hier entsteht Verwirrung, deshalb hier die Übersicht. OpenAI liefert denselben Scanner über vier Oberflächen aus, und nur eine heißt "Cloud".

| Oberfläche | Wo sie läuft | Am besten für |
|---|---|---|
| Codex-Security-Cloud-Plugin | Codex Cloud, auf verbundenen GitHub-Repos | Dauerhafte Repo-Scans und Commit-Überwachung |
| Codex-Security-Plugin | Ein Codex-Task auf deinem Rechner, über die Desktop-Security-Workbench | Ein lokales Repo oder einen Ordner scannen, Deep Scans |
| CLI und TypeScript SDK | Dein Terminal oder CI, npx @openai/codex-security | Massenscans über viele Repos, CI-Gates, SARIF-Export |
| Codex Security Review | GitHub-Pull-Requests | Ein sicherheitsfokussierter Durchgang pro PR, @codex security review |
Security Review passt gut zu Cloud. Es geht bei Sicherheitsrisiken tiefer als Codex' allgemeines Code-Review, und du kannst es auslösen, wenn ein PR geöffnet wird oder bei jedem Push, oder zusätzlich zum Code-Review. Standardmäßig posten automatische Reviews nur Funde mit High und Critical in den PR. Wenn du schon Codex' GitHub-Integration nutzt, ist das ein Schalter in den Einstellungen, kein neues Tool.
Die CLI lohnt einen Blick, auch wenn du in Cloud leben willst. Dort sieht man die Mechanik. Du bekommst --max-cost für ein geschätztes Ausgabenlimit und --fail-on-severity high für CI, außerdem findings false-positive, um festzuhalten, warum ein Fund nicht zutrifft. Diese Notiz fließt als Kontext in künftige Scans ein, unterdrückt die Regel aber nicht. Aus demselben Grund mag ich bei jedem Agenten eine echte CLI: Das Muster der KI-Agenten-CLI macht den Agenten skriptbar, statt ein Dashboard zu sein, das du beaufsichtigen musst.
So richtest du Codex Security Cloud ein
Die Einrichtung dauert laut OpenAIs Setup-Anleitung fünf Schritte, und Codex Cloud muss für deinen Workspace bereits konfiguriert sein.
- Plugin installieren. Öffne Plugins in ChatGPT im Web oder auf dem Desktop, suche nach Codex Security Cloud, installiere und aktiviere es und öffne dann Security Cloud.
- GitHub verbinden. Wähle New scan, dann Connect GitHub, falls du dazu aufgefordert wirst, und gib Zugriff auf die Repos, die gescannt werden sollen.
- Repository-Scan starten. Wähle das Repo, nimm eine kompatible Cloud environment (oder erstelle eine), lass What to scan auf Repository und wähle Start scan.
- Funde prüfen. Öffne Findings, um betroffenen Code, Validierungsbelege und Hinweise zur Behebung zu sehen. Wo Fix with Codex steht, erzeuge einen Patch, prüfe ihn und wähle dann Create draft pull request.
- Commit-Überwachung aktivieren. Starte einen New scan, wähle Commit changes und dann Create. Unter Monitoring settings kannst du die Umgebung ändern, festlegen, wie viele Tage Historie geprüft werden, die Überwachung pausieren und das Bedrohungsmodell unter Project context bearbeiten.
Wenn das Plugin gar nicht auftaucht, geben die Docs nur eine Antwort: "check with your workspace administrator." Damit sind wir beim chaotischsten Teil des Launches.
Wer kann Codex Security Cloud nutzen?
Auf dem Papier sind es vier Tarife. OpenAIs DevDay-Zusammenfassung sagt, Cloud sei "Available to all Pro, Business, Enterprise and Edu users on desktop and web." Plus steht nicht auf der Liste, und die Security-Review-Docs sagen ausdrücklich, es sei "not available on Plus."
Der Haken: Am selben Tag führt die Funktionsmatrix auf OpenAIs Codex-Preisseite "Codex Security for connected GitHub repositories" weiterhin als nur für Enterprise / Education verfügbar, wobei Pro und Business als nicht verfügbar angezeigt werden. Eine der beiden Seiten ist veraltet, und ich tippe auf die Matrix, weil der Launch-Beitrag neuer ist. Trotzdem würde ich einem Pro- oder Business-Nutzer keinen Zugang versprechen, bevor er das Plugin im eigenen Marktplatz sieht.
| Tarif | Preis | Codex Security Cloud (laut DevDay) | Codex Cloud |
|---|---|---|---|
| Plus | $20/Monat | Nicht verfügbar | Ja |
| Pro | $100, $200 oder $500/Monat | Ja | Ja |
| Business | $20/Nutzer/Monat jährlich, $25 monatlich | Ja | Ja |
| Enterprise und Edu | Vertrieb kontaktieren | Ja | Ja |
| Nur API-Key | API-Preise | Nein (keine Cloud-Funktionen) | Nein |
Die Preise stammen von OpenAIs Codex-Preisseite. Ein weiteres Detail: Ein API-Key kann die CLI ausführen, aber die API-Key-Option hat "No cloud-based features", also braucht Cloud einen ChatGPT-Tarif.
Was kostet Codex Security Cloud?
Es gibt nirgends einen Posten für Codex Security. Scans laufen als Codex-Cloud-Arbeit und ziehen daher aus demselben Topf wie alles andere. Laut den Security-Review-Docs "consume" Security Reviews "included Codex allowance or ChatGPT credits." Ist die enthaltene Nutzung deines Tarifs aufgebraucht, können Plus- und Pro-Nutzer Credits kaufen, während Business-, Edu- und Enterprise-Tarife mit flexibler Preisgestaltung Workspace-Credits kaufen, wie in meinem Leitfaden zu den Codex-Preisen beschrieben.
Entscheidend ist der Modellsatz. OpenAIs Credit-Tabelle besagt: "Daybreak Blue uses GPT-5.6 Sol credit rates", das sind 100 Credits pro Million Input-Tokens, 10 pro Million gecachte Input-Tokens und 500 pro Million Output-Tokens.

Das ist der doppelte Token-Satz von GPT-6 Sol (50 / 5 / 250) und beim Output das 40-Fache von GPT-6 Luna. Der Zugang mit weniger Ablehnungen ist also nicht gratis, und du zahlst dafür den älteren Preis von GPT-5.6 Sol.
Daybreak Red, das Spezialmodell mit separater Freigabe, liegt bei 312,5 / 31,25 / 1.875. Fairerweise zu Blue: Die Deep-Scan-Docs des lokalen Plugins empfehlen für die beste Scanqualität ohnehin gpt-5.6-sol, es ist also ungefähr der Satz, bei dem ein ernsthafter Scan sowieso laufen würde.
Zur Veranschaulichung hier eine Beispielrechnung, kein gemessener Scan. Angenommen, ein Voll-Repo-Scan liest 5 Millionen Input-Tokens, die Hälfte davon gecacht, und schreibt 400.000 Output-Tokens auf Daybreak Blue:
| Posten | Tokens | Satz (Credits pro 1 Mio.) | Credits |
|---|---|---|---|
| Frischer Input | 2,5 Mio. | 100 | 250 |
| Gecachter Input | 2,5 Mio. | 10 | 25 |
| Output | 0,4 Mio. | 500 | 200 |
| Gesamt | 475 |
Zur Einordnung: OpenAI sagt, ein typischer GPT-5.6-Sol-Task verbraucht 5 bis 30 Credits. Ein Repo-Scan mit Validierung ist die Arbeit vieler Tasks, und die Commit-Überwachung läuft weiter. Wenn du die CLI stattdessen mit einem OpenAI-API-Key nutzt, richtet sich die Abrechnung nach den OpenAI-API-Preisen, nicht nach Credits. Echte CLI-Nutzer haben es genauso berichtet: Einer sagte, ein Scan "ate through 25% of my weekly credits", ein anderer, dass ein fehlgeschlagener Lauf etwa $13 kostete. Das --max-cost-Limit hilft, aber OpenAIs CLI-FAQ stellt klar, dass es "an estimate, not a hard spending cap" ist.
Mein Rat: Führe einen Repository-Scan auf einem mittelgroßen Repo aus und schau dir vorher und nachher dein Usage-Dashboard an. Erst dann schaltest du die Commit-Überwachung für die ganze Organisation ein.
Warum das mitgelieferte Daybreak Blue am wichtigsten ist
Wenn du nur einen Abschnitt liest, dann diesen. Die häufigste Beschwerde über Codex Security vor Cloud waren nicht Falsch-Positive, sondern Ablehnungen.
Daybreak ist OpenAIs Programm für Verteidiger. Daybreak Blue gibt "access to flagship models with reduced refusals for authorized defensive workflows" wie Schwachstellensuche, sicheres Code-Review, Bedrohungsmodellierung und Patch-Validierung. Normalerweise bekommst du es über eine Bewerbung bei Trusted Access for Cyber, und die Freigabe ist nicht garantiert. Die Stufen beschreibe ich ausführlich in meinem Beitrag zu GPT-5.6-Cyber.
Ohne es greifen die Cyber-Leitplanken des Standardmodells genau bei der Arbeit, für die ein Sicherheitsagent existiert. Als OpenAI die CLI im Juli als Open Source veröffentlichte, war der Hacker-News-Thread voller Leute, die an diese Wand stießen:
"Thing is, you WILL encounter refusals with Sol doing anything remotely adjacent to security work. Which for Codex Security is kinda... problematic."
Ein anderer Nutzer ließ es auf einer kleinen Open-Source-Bibliothek laufen und bekam nach 41 Minuten Zuschauen am Ende "This content was flagged for possible cybersecurity risk":
"it ran for over 40 minutes and during that time I had no idea what was happening, thought it was frozen or in a bad state. Also, it ate through 25% of my weekly credits :("
Codex Security Cloud "includes access to models offered through Daybreak Blue without a separate Daybreak application", laut DevDay-Zusammenfassung. Das ist das eigentliche Upgrade. Eine ehrliche Einschränkung: Der Launch ist erst zwei Tage alt, und ich habe noch niemanden gefunden, der bestätigt, dass die Ablehnungen speziell bei Cloud weg sind. Der Hacker-News-Launch-Thread hatte null Kommentare, als ich nachsah.
Was frühe Nutzer bisher sagen
Praxisberichte drehen sich bisher meist um die CLI und das frühere Plugin, da sie denselben Scanner nutzen. Das Lob ist echt, auch wenn es früh kommt. Simon Willison, der es im April in der Vorschau testete, formulierte es so:
"I've been previewing this in Codex for a few weeks - it's very good! Had some great results from it having it run security reviews against code written using other models"
Die Sorgen fallen in drei Gruppen:
- Kosten und Ausfallsicherheit. Neben den Ablehnungsgeschichten lief der Scan eines Nutzers ins Rate-Limit seines Kontos und gab nach einer Minute auf, Kosten etwa $13. Ein OpenAI-Teammitglied antwortete im Thread, Retries und Resume kämen noch (Hacker News).
- Code verlässt das Haus. Das ist kein Offline-Scanner. Wie ein OpenAI-Teammitglied auf Hacker News erklärte, werden Code und Kontext an OpenAIs gehostetes Modell gesendet, und "If your company doesn't allow source code to leave its environment, you shouldn't run this against that codebase."
- Abdeckungsversprechen. Ein Hacker-News-Kommentator, der Beiträge von curl-Maintainer Daniel Stenberg wiedergab, sagte, sowohl Codex Security als auch Anthropics Claude Mythos hätten bei curl null Probleme gefunden, bevor der Scan eines anderen Tools zu sechs CVEs führte. Das ist aus zweiter Hand, nimm es also als Warnung davor, dich auf nur einen Scanner zu verlassen, nicht als Benchmark.
Wie es neben den Tools passt, die du schon nutzt
OpenAIs eigene FAQ beantwortet die Ersatzfrage in einem Wort: "Does it replace SAST? No. Codex Security complements SAST." Regelbasierte Scanner liefern breite und deterministische Abdeckung, während Codex Security Schlussfolgerungen darüber ergänzt, wie dein Code zusammenhängt, plus Sandbox-Validierung. Und weil es ein KI-Scan ist, können Ergebnisse zwischen Läufen variieren, selbst bei gleicher Konfiguration.
So schneiden die nächsten Alternativen laut den Seiten der jeweiligen Anbieter ab:
| Tool | Veröffentlichter Preis | Testet Funde? | Schlägt Patches vor? |
|---|---|---|---|
| Codex Security Cloud | Enthaltene Codex-Nutzung, dann Credits | Ja, stellt in einer Sandbox nach | Ja, du öffnest den Draft-PR |
| Claude Code Security | Kein Preis; begrenzte Vorschau für Enterprise und Team | Prüft jeden Fund erneut, um ihn zu "prove or disprove" | Ja, mit menschlicher Freigabe |
| GitHub Code Security | $30 pro aktivem Committer/Monat | Nicht angegeben (CodeQL-Statische-Analyse) | Ja, Copilot Autofix |
| Snyk | Kostenlos; Team ab $25/Monat | Scannt jeden Fix-Kandidaten erneut | Ja, Snyk Agent Fix |
| Semgrep | Kostenlos bis 10 Contributors; Teams ab $30/Contributor/Monat | Nicht angegeben | Behebung aufgeführt |
Die Kombination, die ich tatsächlich fahren würde: Behalte deinen regelbasierten Scanner (CodeQL über GitHubs Bezahltarife oder Snyk oder Semgrep) als Fundament und ergänze Codex Security Cloud für die denklastigen Bugs, die eine Regel nicht ausdrücken kann. Wenn dein Team in Claude Code lebt, sind dessen /security-review-Befehl und die GitHub Action das nächste Äquivalent.
Mein Claude-Code-Review zeigt, wie sich dieser Agent im Alltag verhält. Wenn du dich überhaupt noch für einen Coding-Agenten entscheidest, ist meine Liste der besten KI-Coding-Assistenten der richtige Startpunkt, und Claude Codes GitHub-Integration zeigt das PR-seitige Setup.
Für das weitere Feld siehe die Übersicht der OpenAI-Codex-Alternativen und die Liste der GPT-5.6-Cyber-Alternativen.
Fünf Dinge, die du prüfen solltest, bevor du es einschaltest
Sie stammen direkt aus den Docs. Jedes davon hat schon jemanden erwischt oder wird es tun.
- PR-Kommentare sind so öffentlich wie dein PR. Laut den Security-Review-Docs "inherit" in einen Pull Request geposteten Funde "that pull request's GitHub visibility." In einem öffentlichen Repo kann jeder einen Schwachstellenbericht lesen, bevor du sie behoben hast. Stelle die Meldeschwelle entsprechend ein oder behalte die Funde in Codex.
- Ein fehlender Fund ist kein behobener Fund. Die CLI-FAQ sagt: "A missing finding or scan comparison alone doesn't prove that a fix worked." Führe den ursprünglichen Scan erneut aus und prüfe das konkrete Problem noch einmal.
- Achte auf Abdeckung, nicht nur auf Funde. Scans melden Abdeckung als
complete,partialoderunknown. Ein sauberer Bericht mit partieller Abdeckung heißt "nicht hingeschaut", nicht "nichts da". - Patches sind Vorschläge. Codex wendet nie automatisch einen Fix an und bearbeitet nie deinen PR-Branch, und das ist gut so. Behalte das auch in deinem Prozess bei und lass bei jedem Draft-PR, den es öffnet, deine Tests laufen.
- Es ist eine Research Preview. Verhalten, Limits und Tarifverfügbarkeit können sich ändern. Das Plugin hat zwischen dem 21. August und dem 24. September 2026 sechs Releases veröffentlicht, richte deine Erwartungen also an der Version aus, die vor dir liegt.
eesel, für die Aufgaben, die ein Sicherheitsagent nicht übernimmt
Codex Security Cloud ist ein gutes Beispiel dafür, wie ein einsatzbereites KI-Teammate aussieht: eine Aufgabe, die passenden Werkzeuge dafür und ein Beleg, bevor es einen Menschen zum Handeln auffordert. Genau diese Form baue ich bei eesel, nur für andere Aufgaben. eesel ist eine Plattform für KI-Teammates, und heute kannst du zwei Teammates einstellen: ein KI-Helpdesk-Teammate, das Zendesk, Freshdesk, Gorgias oder Front beitritt, und einen KI-Blogautor für Content und SEO. Die Übersicht der besten KI-Teammates zeigt, wie andere dieselbe Idee angehen.
Die Idee, erst zu validieren, lässt sich direkt übertragen. Codex stellt eine Schwachstelle nach, bevor es sie dir zeigt; eesel lässt das Helpdesk-Teammate in einer Simulation gegen Hunderte deiner früheren Tickets laufen, bevor es einen echten Kunden berührt. Und auch im Support ist die Lücke zwischen "validiert" und "auslieferbar" real. In einem Test mit echtem Traffic auf einem E-Commerce-Zendesk-Postfach erreichte das Teammate 93 % Triage-Genauigkeit und 100 % Spam-Erkennung, doch Agenten schickten nur 12 % der Entwürfe unverändert ab und schrieben den Rest um. Genau ist nicht dasselbe wie fertig, deshalb warten Aktionen außerhalb der Regeln eines Teammates auf menschliche Freigabe, und jeder Lauf landet in einem gemeinsamen Aktivitätsprotokoll.

Wenn dich die Codex Security CLI angesprochen hat: eesel hat dieselbe Art von Oberfläche. Die eesel CLI lässt dich dein Teammate und deinen Workspace vom Terminal aus bedienen: eesel approvals list zeigt, was auf einen Menschen wartet, eesel activity listet jeden Lauf, und Skripte können den Rest automatisieren. Jeder Workspace funktioniert außerdem als MCP-Server, sodass Codex oder Claude Code dasselbe Teammate steuern können, das du im Dashboard siehst. Meine Erklärung zu KI-Teammates geht tiefer auf das Modell ein.
Die Preise sind öffentlich: ein kostenloser Tarif mit 100 Credits, dann Teammate-Tarife ab $299/Monat für 500 Credits, wobei ein Ticket oder Chat einen Credit kostet. Siehe die Preisseite, oder teste eesel und sieh dem Helpdesk-Teammate noch am selben Nachmittag dabei zu, wie es deine echten früheren Tickets beantwortet.
Häufig gestellte Fragen
Was ist Codex Security Cloud?
Wer kann Codex Security Cloud nutzen?
Was kostet Codex Security Cloud?
Ersetzt Codex Security Cloud SAST-Tools wie CodeQL oder Snyk?
Behebt Codex Security Cloud Schwachstellen automatisch?
Was ist Daybreak Blue in Codex Security Cloud?
Ist mein Code bei Codex Security Cloud sicher?
Wie unterscheidet sich Codex Security Cloud von der Codex Security CLI?
@openai/codex-security) läuft aus deinem Terminal oder in CI und kann einen API-Key nutzen, während Codex Security Cloud in Codex Cloud gegen verbundene GitHub-Repos läuft und weiterarbeitet, wenn dein Laptop zu ist. Der Leitfaden zur KI-Agenten-CLI erklärt, warum eine CLI-Oberfläche fürs Scripting wichtig ist.
Article by
Kira
Kira is a writer at eesel AI with a Computer Science background and over a year of hands-on experience evaluating AI-powered customer service tools. She focuses on breaking down how helpdesk platforms and AI agents actually work so that support teams can make better buying decisions.








