65 % unserer Commits entstehen mit KI. Das ist die Untergrenze.
- Claude-Code-Sessions
- 2.233
- 520.926 Nachrichten
- Codex-Threads
- 720
- 5,4 Mrd. Token
- Projekte mit KI
- 26
- in 9 Bereichen
- Agenten im Dienst
- 7
- Nachtschicht, Triage, Ads. 19 gebaut
- Testantworten bewertet
- 25.090
- vom KI-Tutor
- Support-Anfragen triagiert
- 671
- seit 23. September
Vom Menschen bis zum Modell in fünf Ebenen.
- Menschen & Auslöser
- Schnittstellen
- Unternehmensbereiche
- Infrastruktur
- Modelle
Wo KI arbeitet: vom Lern-Chat bis zur Buchhaltung.
Claude schreibt den Code. Gemini antwortet den Lernenden.
- AnthropicBauen & Betreiben: Code, Agenten, Routinen92,8 %362,4 Mio. Token erzeugt
- OpenAICode-Review, Ads-Kritik, Belege, Video5,8 %22,7 Mio. Token erzeugt
- Google GeminiProdukt-Laufzeit: Chat, Support, Bewertungen, Creatives1,4 %5,5 Mio. Token erzeugt
Gezählt sind Ausgabe-Token, also Text und Code, den die Modelle erzeugt haben. Claude schreibt den Großteil, weil Code lang ist. Gemini liefert dafür jede Antwort, die Lernende sehen. Lokale Modelle erzeugen keine messbaren API-Token.
- Claude Opus 596,5 Mio.
- Claude Opus 4.885,9 Mio.
- Claude Fable 568,4 Mio.
- Claude Opus 4.733,4 Mio.
- Claude Opus 4.622,7 Mio.
- Claude Haiku 4.519,8 Mio.
- Claude Sonnet 513,7 Mio.
- Claude Fable 5.113,6 Mio.
- Claude Sonnet 4.67,6 Mio.
- GPT-5.6 Sol6 Mio.
Tagsüber das Team, abends die Lernenden, nachts die Agenten.
- 22 bis 05 UhrNachtschicht4 Jobs auf dem CI-Runner: Flaky-Tests, Dependencies, Doku, Lint. Ergebnis als Pull Request.
- 06:47 UhrMorgenberichtZusammenfassung der Nacht ohne Modell, 0 €.
- 07:55 UhrPostfach-Triage3 Postfächer sortiert, nichts gesendet.
- montagsAds-WochenreviewKampagnen-Analyse mit Kritiker-Modell.
Erst 12 Wartungsagenten, jetzt die Nachtschicht. Mergen dürfen nur Menschen.
- täglich≤ 300 ZeilenCI Guardianci-guardiantäglich26/28 erfolgreich9 PRs
- wöchentlich≤ 250 ZeilenRepository Truth Synctruth-syncwöchentlich5/5 erfolgreich4 PRs
- wöchentlich≤ 200 ZeilenDependency Janitordependency-janitorwöchentlich4/4 erfolgreich2 PRs
- 14-tägig≤ 400 ZeilenDead-Code Janitordead-code-janitor14-tägig4/4 erfolgreich3 PRs
- 14-tägig≤ 300 ZeilenReliability & Error-Handling Auditorreliability-auditor14-tägig3/3 erfolgreich3 PRs
- 14-tägig≤ 250 ZeilenBug Hunterbug-hunter14-tägig2/2 erfolgreich2 PRs
- 14-tägig≤ 400 ZeilenTest Guardiantest-guardian14-tägig2/2 erfolgreich2 PRs
- monatlich≤ 500 Zeilen+ Review-GateDuplication Unifierdup-unifiermonatlich2/2 erfolgreich1 PRs
- monatlich≤ 400 Zeilen+ Review-GateComplexity Simplifiercomplexity-simplifiermonatlich2/2 erfolgreich2 PRs
- monatlichnur lesenArchitecture Guardianarchitecture-guardianmonatlich2/2 erfolgreich2 Issues
- monatlich≤ 300 ZeilenContract & Schema Guardiancontract-guardianmonatlich2/2 erfolgreich2 PRs
- monatlichnur lesenSecurity Boundary Auditorsecurity-auditormonatlich1/1 erfolgreich1 Issues
Was Lernende und Kunden davon sehen: Tutor, Bewertungen, Antwortentwürfe.
Oktober bis zum Stichtag. Gemini beantwortet, Kontext aus den Lerninhalten.
Drei Modelle arbeiten nacheinander: Triage, Autor, Prüfer. Ein Mensch entscheidet immer, was rausgeht.
- Anfragen triagiert671Typ, Absicht, Sprache, Dringlichkeit
- Antwort entworfen538Autor-Modell schreibt Vorschlag
- Vom Prüfer geprüft527zweites Modell prüft jede Aussage gegen Quellen
- Prüfung bestanden340alle Aussagen belegt
- Vom Menschen gesendet320Mitarbeiter gibt frei, bearbeitet oder verwirft
Jede Rolle arbeitet mit KI. Manche Aufgaben übernimmt sie ganz.
- Produktentwicklung mit Claude Code
- Finanzmodell & Planung
- Kampagnensteuerung
- Ventures & Prototypen
- Lernplattform mit KI-Tutor
- Prüfungsvorbereitung der Schüler
- Feedback-Auswertung
- Antwortvorschläge im Support
- Übersetzung von Anfragen
- Medien-Verständnis in WhatsApp
- Nachtschicht im Code
- Wartungsroutinen
- Postfach-Triage
- Ads-Review
- Belegerfassung
Wie im Anthropic Economic Index: Wird eine Aufgabe delegiert oder gemeinsam erledigt? Verteilung über alle 26 Projekte.
- Tutor mit Folgefragendrifting-humming-lighthouse
- Automatische Bewertungdrifting-humming-lighthouse
- Wochen-Reviewbold-juggling-marlin
- Kritiker-Modellbold-juggling-marlin
- Entwürfe für Inseratebreezy-gliding-catamaran
- Mehrsprachigkeitbreezy-gliding-catamaran
- Antwortentwürfegentle-replying-heron
- Markentongentle-replying-heron
- Szenarienpatient-tallying-tortoise
- Kapazitätpatient-tallying-tortoise
- Tutor mit Folgefragendrifting-humming-lighthouse
- Automatische Bewertungdrifting-humming-lighthouse
- CI-Reparatursteady-polishing-barnacle
- Bug-Suchesteady-polishing-barnacle
- Flaky-Testsquiet-mending-lantern
- Updatesquiet-mending-lantern
- Klassifizierentidy-sorting-pelican
- Labelntidy-sorting-pelican
- Wochen-Reviewbold-juggling-marlin
- Kritiker-Modellbold-juggling-marlin
KI-Aktivität pro Woche seit Oktober 2025.
Was die Agenten tun, gezählt pro Werkzeugaufruf.
- Shell-Befehle29.164
- Dateien lesen5.064
- Externe Systeme (MCP)2.668
- Code ändern2.284
- Dateien schreiben970
- Webseiten lesen484
- Websuche415
- Werkzeuge nachladen346
- Sub-Agenten starten259
- Chrome-Browser861
- Eingebauter Browser509
- Connectoren (Docs, Vercel, Notion …)347
- PostHog-Analytics218
- Supabase203
- Terminal53
- general-purpose165×
- fork60×
- Explore28×
- Plan3×
- code-reviewer3×
Neun Grenzen für die Agenten. Alle stehen im Code, nicht in einer Richtlinie.
- Mensch merged
- Kein Agent merged eigenen Code. Jede Änderung kommt als Pull Request mit Prüfprotokoll.
- Budget pro Lauf
- Jeder Nacht-Job hat ein Kosten- und Zeitlimit. Der Morgenbericht läuft ganz ohne Modell.
- Getrennte Rechte
- Der Agent liest nur. Pushen und Pull Requests übernimmt ein zweiter Runner-User ohne Modell.
- Sandbox & Hooks
- Vor jedem Befehl prüft ein Hook Pfade, Shell-Operatoren und Wiederholungen. Acht Ausbruchsversuche laufen als Test.
- Sende-Sperre
- Die Postfach-Triage kann keine E-Mails senden. Ein automatisierter Test stellt das sicher.
- Zweites Modell prüft
- Support-Antworten prüft ein separates Modell gegen Quellen. Kritische Fälle gehen direkt an einen Menschen.
- Größengrenzen
- Wartungsagenten dürfen nur eine feste Zahl Zeilen ändern. Große Umbauten brauchen ein Review-Gate.
- Lokal, wo es geht
- Dubbing und Sprachmodelle laufen auf eigener Hardware. Produktdaten liegen bei Supabase und Vercel.
- GoBD & DSGVO
- Der Beleg-Agent arbeitet revisionssicher. Kundendaten werden nur mit Einwilligung zusammengeführt.
Wie wir messen. Und was wir nicht zeigen.
- Claude Code
- Lokale Statistik und Sitzungsprotokolle: Anzahl, Modelle, Token, Werkzeugaufrufe, Uhrzeit. Keine Inhalte.
- Codex
- Thread-Datenbank von Codex, inklusive archivierter Threads: Anzahl, Modell, Token, Art (CLI, Desktop, Exec, Review, Sub-Agent). Ausgabe-Token aus den Sitzungsprotokollen.
- Git
- Commits je Repository und Monat. Als KI-gestützt zählt ein Commit mit Claude-Co-Autor. Codex markiert seine Commits nicht, der Anteil ist deshalb eine Untergrenze.
- Agenten
- Laufprotokolle der Wartungsroutinen: Läufe, Erfolg, PRs, Issues.
- Produkt
- Aggregierte Zählungen aus der App-Datenbank: Tutor-Fragen, Bewertungen, Support-Brain-Entscheidungen.
- Alle Werte sind Aggregate. Prompts, Antworten, Kundendaten und Namen verlassen nie das System.
- Claude- und Codex-Summen umfassen die gesamte Entwicklungsarbeit der Geschäftsführung, auch für Ventures. Projektwerte zählen nur zugeordnete Arbeit.
- Projekte tragen zufällige Codenamen. Die Zuordnung zu echten Projekten liegt nur intern vor.
- Sitzungsprotokolle werden nach einiger Zeit gelöscht. Projektwerte (Treemap) decken daher nur die jüngsten Wochen ab; Summen stammen aus der vollständigen Statistik.
- Laufende Rechtsangelegenheiten und private Projekte sind ausgeschlossen.
- Token zählen Cache-Lesezugriffe mit. Sie sagen mehr über Arbeitsumfang als über Kosten.