
GPT-6 Luna API-Preise: die Standard-Stufe
Hier ist die Zahl, wegen der die meisten Leute kommen. Auf der API-Preisseite liegen die GPT-6 Luna Standardpreise bei $0.10 pro Million Input-Tokens und $0.50 pro Million Output-Tokens. Gecachter Input sinkt auf $0.01, und Cache-Writes kosten $0.125 pro Million.

Damit steht Luna ganz unten in der OpenAI-Modellübersicht: weit unter dem mittleren Sol und ein Rundungsfehler neben dem Flaggschiff Astra. So positioniert sich die GPT-6-Familie in der Standard-Kurzkontext-Stufe, mit dem auslaufenden GPT-5.6 Luna zum Vergleich:
| Modell | Input (pro 1M) | Gecachter Input | Output (pro 1M) | Position |
|---|---|---|---|---|
| gpt-6-astra | $10.00 | $1.00 | $50.00 | Flaggschiff |
| gpt-6-sol | $2.00 | $0.20 | $10.00 | Mittlere Stufe |
| gpt-6-luna | $0.10 | $0.01 | $0.50 | Günstigstes (neu) |
| gpt-5.6-luna | $0.20 | $0.02 | $1.20 | Vorherige leichte Stufe |
Quelle: OpenAI API-Preise. Die Tabelle erzählt eine einfache Geschichte: GPT-6 Luna ist das alte GPT-5.6 Luna, mit halbiertem Input und um deutlich mehr als die Hälfte gesenktem Output. OpenRouter bestätigte die Preise der Familie am Launch-Tag. OpenAIs eigene Einordnung im Launch-Post lautet „Build with Sol. Scale with Luna“, was genau zeigt, wo Luna hingehört: das Modell, das man für hochvolumige, einfachere Aufgaben einsetzt.
Der Preisschnitt: was sich geändert hat und was nicht
Ein Preisschnitt dieser Größenordnung geht normalerweise mit einer Fähigkeits-Geschichte einher. Bei diesem ist das größtenteils nicht der Fall, und das sollte man offen ansprechen.

Beim reinen Intelligenz-Maßstab berichtete Artificial Analysis, dass GPT-6 Sol und Luna „die Kosteneffizienz-Grenze durch Halbierung der Kosten verschieben“, während der Intelligence Index und der Coding Agent Index „auf dem Niveau von GPT-5.6 bleiben, mit Fortschritten bei manchen Auswertungen und Rückschritten bei anderen“. Die Bilanz lautet also: der Preis hat sich stark bewegt, die Intelligenz kaum.
Verbessert hat sich bei Luna die Zuverlässigkeit, und darauf stützte sich OpenAI:
- Faktentreue. OpenAI berichtet, dass die GPT-6-Familie weniger sachliche Fehler macht als ihre GPT-5.6-Vorgänger. Artificial Analysis erfasste einen Rückgang von Lunas Halluzinationsrate bei maximalem Aufwand von 93% auf 77%, eine echte Verbesserung, wenngleich immer noch höher als bei Sol im selben Test.
- Kosteneffizienz-Grenze. Der Sinn von Luna ist Durchsatz pro Dollar, und genau hier bewegt sich etwas: dieselbe leichte Intelligenz zu etwa der Hälfte der Token-Kosten.
- Agentische Evaluierungen. Die Familie erzielte kleine Fortschritte bei AutomationBench und Terminal-Bench, aber Luna ist nicht das Modell, zu dem man bei anspruchsvoller agentischer Arbeit greift. Das sind Sol und Astra.
Die Community sah es genauso. In der Launch-Diskussion brachte es ein Entwickler auf den Punkt:
„Ich hätte lieber bessere Leistung für den doppelten Preis gehabt als ~gleiche Leistung für den halben Preis.“
Das ist der ehrliche Rahmen für die GPT-6 Luna Preise. Wenn Sie bereits GPT-5.6 Luna genutzt haben, ist das eine Rechnungssenkung geschenkt. Wenn Sie gehofft hatten, dass die „6“ einen Sprung bei der rohen Intelligenz bedeutet, dämpfen das die Benchmark-Werte.
Service-Stufen: die 4-fache Schwankung, die die meisten übersehen
Der Standardsatz ist ein Ausgangspunkt, nicht die ganze Geschichte. GPT-6 Luna läuft auf denselben Service-Stufen wie der Rest der Familie, und die Lücke zwischen der günstigsten und der teuersten beträgt das 4-Fache für exakt dasselbe Modell. Für ein hochvolumiges Modell wie Luna ist das der größte einzelne Kostenhebel.
| Stufe | Input (pro 1M) | Gecachter Input | Output (pro 1M) | Kompromiss |
|---|---|---|---|---|
| Batch | $0.05 | $0.005 | $0.25 | 50% günstiger, asynchron, bis zu 24h |
| Flex | $0.05 | $0.005 | $0.25 | 50% günstiger, langsamer, kann in Warteschlange landen |
| Standard | $0.10 | $0.01 | $0.50 | Standard-Latenz |
| Fast-Modus | $0.20 | $0.02 | $1.00 | 2x, niedrigste Latenz |
Quelle: OpenAI API-Preise. Ein paar Dinge, die Sie vor der Wahl wissen sollten:
- Batch und Flex kosten gleich viel, sind aber für unterschiedliche Aufgaben gedacht. Batch ist für asynchrone Arbeit, die Sie einreichen und später abholen; Flex ist für interaktive Anfragen, bei denen Sie bereit sind, sie langsamer laufen zu lassen oder warten zu lassen. Beide halbieren Ihre Rechnung.
- Der Fast-Modus verdoppelt den Satz für die niedrigste Latenz und akzeptiert entweder
service_tier: "priority"oderservice_tier: "fast". - Der Fast-Modus hat einen regionalen Haken. Bei EU-Datenresidenz kann er auf Standard zurückfallen, gehen Sie also nicht überall davon aus.
Wenn eine Workload Latenz toleriert, halbiert die Umstellung auf Batch oder Flex Ihre Luna-Ausgaben erneut. Das kumuliert sich mit dem Preisrückgang gegenüber GPT-5.6: eine batch-fähige Aufgabe auf GPT-6 Luna läuft für $0.05/$0.25, und genau dort liegen die wirklich günstigen, hochvolumigen Klassifizierungs- und Extraktionsaufgaben.
Die Fallstricke: Long Context und die Spezifikation
Zwei Details verstecken sich im Kleingedruckten der Modellseite, und beide können ein Budget still verändern.
Erstens: Long Context wird für die gesamte Anfrage zu einem höheren Satz abgerechnet. Lunas Kontextfenster ist mit 1.050.000 Tokens groß, aber jeder Prompt über 272K Input-Tokens lässt die gesamte Anfrage auf den Long-Context-Satz umschalten: $0.20 pro Million Input und $0.75 pro Million Output in der Standard-Stufe. Das ist 2x beim Input und 1,5x beim Output, angewendet auf jedes Token in der Anfrage, nicht nur auf die Tokens über dem Schwellenwert.
| Standard-Stufe | Kurzer Kontext (≤272K) | Langer Kontext (>272K) |
|---|---|---|
| Input (pro 1M) | $0.10 | $0.20 |
| Gecachter Input | $0.01 | $0.02 |
| Output (pro 1M) | $0.50 | $0.75 |
Zweitens lohnt es sich, die Spezifikation zu kennen, bevor Sie sich festlegen. GPT-6 Luna nimmt bis zu 922.000 Input-Tokens auf und gibt bis zu 128.000 zurück, mit einem Wissensstand vom 18. Mai 2026, einen Monat später als bei Sol. Es akzeptiert Text und Bild als Input, Text als Output, und bietet Reasoning-Aufwand von none bis max, mit medium als Standard. Außerdem bringt es das vollständige Werkzeugset der Responses API mit: Websuche, Code-Interpreter, gehostete Shell, Computer-Nutzung und MCP. Die Rate-Limit-Untergrenze liegt bei Tier 1 mit 500 Anfragen und 500K Tokens pro Minute, skalierend auf 30.000 Anfragen und 180M Tokens pro Minute bei Tier 5.
Schätzen Sie Ihre GPT-6 Luna API-Rechnung
Listenpreise bleiben abstrakt, bis Sie Ihre eigenen Zahlen einsetzen. Geben Sie die Millionen an Input- und Output-Tokens ein, die Sie pro Monat erwarten, wählen Sie eine Service-Stufe, und das hier errechnet die monatlichen Kosten. Der Long-Context-Aufschlag wird automatisch berücksichtigt.
Das Muster, das die meisten Teams beobachten, ist, dass Output-Tokens die Rechnung dominieren, da der Output-Satz 5x so hoch ist wie der Input-Satz. Bei Lunas hochvolumigen Workloads skaliert diese Rechnung schnell, und die Verlagerung eines batch-fähigen Jobs auf Batch ist der Punkt, an dem sich die Einsparungen am schnellsten auszahlen.
GPT-6 Luna Preise in ChatGPT und Codex
Wenn Sie die API nicht aufrufen, erreicht Sie GPT-6 Luna über ChatGPT und Codex, und hier unterscheidet sich Lunas Geschichte vom Rest der Familie: Es ist dasjenige, das jeder bekommt.
| Plan | Preis | GPT-6 Luna Zugang |
|---|---|---|
| Free | $0 | Ja (Desktop-App) |
| Go | $8/Monat | Ja (Desktop-App) |
| Plus | $20/Monat | Ja |
| Pro | Ab $100/Monat | Ja |
| Business / Enterprise / Edu | Pro Sitzplatz | Ja |
Quelle: OpenAI Launch-Ankündigung. Ein paar Dinge fallen auf:
- Luna erreicht Free. Das ist die Schlagzeile für Nicht-Entwickler: der Free-Plan und der $8-Go-Plan erhalten GPT-6 Luna in der Desktop-App. Keiner der beiden enthält Sol, das erst mit dem $20/Monat-Plus-Plan beginnt. Wenn Sie schon einmal ein GPT-6-Modell genutzt haben, ohne für ChatGPT zu bezahlen, war es Luna.
- Kostenpflichtige Pläne stapeln Sol obendrauf. Plus und höher behalten Luna und fügen GPT-6 Sol hinzu, mehr zu zahlen nimmt Luna also nicht weg, es erweitert Ihr Modellangebot.
- Auch Codex erhält Luna. OpenAI hat beide Modelle in Codex in denselben Stufen ausgeliefert, sodass Nutzer von Coding-Agenten Luna für günstigere, leichtere Durchläufe auswählen können.
Nicht jeder war überzeugt, dass die Einsparungen beim Abo dem API-Schnitt entsprechen. Ein Entwickler stellte fest, dass Änderungen am Nachrichtenlimit darauf hindeuteten, dass sich der 50%ige API-Schnitt in den ChatGPT-Plänen eher wie ein Drittel-Schnitt anfühlte, prüfen Sie also Ihr eigenes Kontingent, statt anzunehmen, dass sich der Listenrabatt direkt durchschlägt.
Wie sich die GPT-6 Luna Preise einordnen
Zoomen wir heraus: Wo steht Luna im Vergleich zum Rest der Front? Kurz gesagt hat OpenAI mit Luna die Preisuntergrenze für ein wirklich brauchbares Modell gesetzt.
- Im Vergleich zur eigenen Modellreihe: Mit $0.10/$0.50 kostet Luna ein Fünftel von GPT-6 Sol ($2/$10) und ein Hundertstel von GPT-6 Astra beim Output ($50). Für hochvolumige, einfachere Aufgaben ist Luna die naheliegende Wahl; für anspruchsvolles Reasoning oder agentische Arbeit über längere Zeiträume wechseln Sie zu Sol oder Astra.
- Im Vergleich zu Anthropic: Luna unterbietet das leichte Ende von Anthropics Modellreihe deutlich beim reinen Token-Preis, genau die Positionierung, die OpenAI am unteren Ende des Marktes wollte.
- Im Vergleich zu Google: Es konkurriert direkt mit Geminis leichtesten Optionen wie Gemini 3 Flash im Preis-Intelligenz-Verhältnis, das ist der eigentliche Kampf in dieser Stufe.
Das größere Bild im Launch-Thread war, dass geschlossene Modelle immer günstiger werden, ohne wesentlich klüger zu werden, was mehrere Entwickler als Wettlauf nach unten beim Preis bezeichneten. Das sind gute Nachrichten, wenn Sie Tokens kaufen. Es ist aber auch eine Erinnerung daran, dass ein günstigeres Modell den schwierigeren Teil beim Einbinden von KI in einen echten Workflow nicht verändert, nämlich alles rund um das Modell.
Was die GPT-6 Luna Preise bedeuten, wenn Sie ein Support-Team leiten
Hier möchte ich nützlich sein, statt nur Preise aufzuzählen. Ich baue eesels Produkt, verbringe also meine Zeit damit, wie diese Modelle tatsächlich in einen laufenden Workflow eingebunden werden, und die ehrliche Antwort ist etwas gegen die Intuition.
Wenn Sie Kundensupport oder internes Ops leiten, ändert ein günstigeres Spitzenmodell weniger, als die Schlagzeile vermuten lässt. Ein rohes Modell wie Luna ist Infrastruktur. Es ist eine leistungsfähige, günstige Engine, kennt aber von Haus aus weder Ihre Rückerstattungsrichtlinie, noch kann es Ihre letzten 50.000 Tickets sehen, hat keinen Zugriff auf Ihr Bestellsystem und keine sichere Möglichkeit, gegen Ihre echte Warteschlange getestet zu werden, bevor es anfängt, Kunden zu antworten. Es wird pro Token fürs Denken abgerechnet, nicht pro gelöstem Problem. Ein Tiefstpreis pro Token ist real, aber es ist ein Rabatt auf den günstigsten Teil des Projekts.

Die Einheit, die für ein Support-Team wirklich zählt, sind die Kosten pro Lösung, nicht pro Token. Eine Token-Rechnung ist unvorhersehbar: Sie bewegt sich mit der Prompt-Länge, Wiederholungsversuchen und davon, wie gesprächig das Modell an einem bestimmten Tag ist. Über Jahre hinweg, in denen wir KI auf echten Support-Warteschlangen eingesetzt haben, haben wir beobachtet, wie selbstbewusst klingende Bots still falsche Antworten geben, genau deshalb sollte jedes Rollout gegen Ihre eigenen historischen Tickets simuliert werden, bevor es in die Nähe eines Kunden kommt. Das ist die Lücke zwischen einem Modell und einem System, das darum herum gebaut ist: Ihr Wissen, Ihre Integrationen, sichere Aktionen und eine Möglichkeit, es zuerst an Ihrer Historie zu testen.
Deshalb würde ich Ihre Support-Automatisierung auch nicht in der Woche neu aufsetzen, in der ein neues Modell erscheint. Die besten KI-Helpdesk-Agenten und Kundenservice-Tools sind von Natur aus modellflexibel, sodass Sie beim Erscheinen eines günstigeren oder klügeren Modells das Upgrade erben, ohne irgendetwas neu zu bauen und ohne Ihr Budget um einen neuen Token-Satz herum neu zu verhandeln.
eesel ausprobieren
Wenn es Ihnen bei Lunas Preis eigentlich um „was wird mich KI kosten, um Tickets tatsächlich zu lösen“ geht, ist das die Aufgabe, für die ein KI-Teammitglied gebaut ist, und genau dort setzt eesel an. GPT-6 Luna ist die Engine; eesel ist der Mitarbeiter, den Sie einstellen, um sie zu steuern. Der KI-Helpdesk-Agent trainiert auf Ihren vergangenen Tickets und Ihrem Help Center, dockt an das Helpdesk an, das Sie bereits nutzen, statt es zu ersetzen, und lässt Sie es gegen Tausende Ihrer echten historischen Tickets simulieren, damit Sie sehen, wie es abschneiden wird und was es kosten wird, bevor es je eine Live-Konversation berührt.
Die Abrechnung erzählt eine Geschichte, die ein Token-Satz nicht erzählen kann. Statt pro Token fürs Denken zu zahlen, zahlen Sie 40¢ pro Ticket, das tatsächlich bearbeitet wird, ohne Gebühren pro Sitzplatz und ohne Plattform-Minimum, sodass die Kosten den Ergebnissen folgen und nicht dem Modell-Geplauder. Sie können kostenlos mit $50 Nutzungsguthaben starten, ohne Kreditkarte.

Und weil dies eine entwicklerorientierte Preisfrage ist, lohnt es sich zu wissen, dass sich der gesamte eesel-Workspace vom Terminal aus steuern lässt, nicht nur über ein Dashboard. Die eesel CLI (npx @eesel/cli) lässt eine Person, ein Skript oder einen Coding-Agenten wie Claude Code, Codex oder Cursor dasselbe Teammitglied bedienen: ein Helpdesk verbinden, die laufenden Anweisungen lesen und bearbeiten, eesel activity ausführen, um vergangene Durchläufe zu prüfen, und Änderungen hinter eesel approvals absichern. Jeder Befehl gibt JSON aus, und --dry-run zeigt genau den Server-Aufruf, den ein Schreibvorgang machen würde, bevor er gesendet wird. Dieselbe Pro-Lösung-Abrechnung, die Sie in diesem Rechner modellieren würden, können Sie also in Ihr eigenes Tooling einbinden, statt sie nur in einer UI durchzuklicken.
Die GPT-6 Luna Preise sind derzeit die günstigste Art, ein leistungsfähiges Modell zu betreiben, und für hochvolumige, einfache Aufgaben lohnt sich der Preis. Aber für die meisten Support-Teams war der Token-Satz nie die Zahl, die zählte. Ein getestetes, angebundenes, verantwortliches Teammitglied in Ihren bestehenden Workflow zu bekommen, abgerechnet nach Ergebnis, ist der Teil, für den es sich lohnt, Ihr Budget auszugeben.
Häufig gestellte Fragen
Wie viel kostet GPT-6 Luna in der API?
Ist GPT-6 Luna günstiger als GPT-5.6 Luna?
Ist GPT-6 Luna im kostenlosen Plan verfügbar?
Was ist der GPT-6 Luna Long-Context-Aufschlag?
Wie viel kostet GPT-6 Luna in ChatGPT und Codex?
Was ändern Batch- und Fast-Modus an den GPT-6 Luna Preisen?
GPT-6 Luna vs. GPT-6 Sol Preise: Was sollte ich nutzen?

Article by
Rama Adi Nugraha
Rama is a software engineer at eesel AI with two years of experience writing about B2B SaaS, AI tools, and customer support technology. Based in Bali, Indonesia, he brings a developer's perspective to product comparisons — cutting through marketing copy to what the integrations and APIs actually do.








