NautigoInsights

Ein Unternehmen, gebaut mit KI. Nachts arbeiten die Agenten weiter.

Nautigo ist Bootsschule, Lernplattform und Bootshandel. Dieser Bericht zeigt, wo wir KI einsetzen, wie die Teile zusammenhängen und was die Nutzungsdaten sagen.

Stand 9. Oktober 2026Daten seit Oktober 2025Wie wir messen

Agenten-Protokoll
Ablauf einer Nacht, Zeiten beispielhaft
  • 22:00
    Startwacherunner
    Nachtfenster offen, Budget und Pause geprüft
  • 22:05
    Flaky-Testsagent
    Opus 5.5 in der Sandbox, höchstens 9 USD
  • 22:40
    Dependencies, Doku, Lintagent
    Sonnet 5.5, je ein Ziel oder nichts zu tun
  • 23:30
    PublishPR
    Patch neu geprüft, Pull Request geöffnet. Bisher 12 PRs, 11 gemergt
  • 06:47
    Morgenbericht0 €
    Zusammenfassung ohne Modell erstellt
  • 07:55
    Postfach-Triageagent
    3 Postfächer sortiert, nichts gesendet
  • jetzt
    Support-Brainlive
    671 Anfragen triagiert, Mensch gibt frei

65 % unserer Commits entstehen mit KI. Das ist die Untergrenze.

Nur Commits mit Claude als Co-Autor. Codex markiert seine Commits nicht.
Fig. 0.1
Commits mit KI-Co-Autor
65 %
3.910 von 6.056 Commits, alle erfassten Repositories
Claude-Code-Sessions
2.233
520.926 Nachrichten
Codex-Threads
720
5,4 Mrd. Token
Projekte mit KI
26
in 9 Bereichen
Agenten im Dienst
7
Nachtschicht, Triage, Ads. 19 gebaut
Testantworten bewertet
25.090
vom KI-Tutor
Support-Anfragen triagiert
671
seit 23. September

Vom Menschen bis zum Modell in fünf Ebenen.

Knoten anklicken, um einem Pfad zu folgen.
Fig. 0.2
Baustein antippen, um den Datenfluss zu verfolgen
AnthropicGoogle GeminiOpenAILokale ModelleElevenLabs
  1. Menschen & Auslöser
  2. Schnittstellen
  3. Unternehmensbereiche
  4. Infrastruktur
  5. Modelle

Wo KI arbeitet: vom Lern-Chat bis zur Buchhaltung.

Jedes Feld ein Projekt, inklusive Ventures-Lab.
Fig. 0.3
NautigoPlattformVentures
Fläche = Commits mit KI-Co-Autor. Projekte tragen zufällige Codenamen. Projekt antippen für Details.

Claude schreibt den Code. Gemini antwortet den Lernenden.

OpenAI prüft als zweite Meinung, Sprache läuft lokal.
Fig. 0.4
Generierte Token nach Anbieter
  • Anthropic
    Bauen & Betreiben: Code, Agenten, Routinen
    92,8 %
    362,4 Mio. Token erzeugt
  • OpenAI
    Code-Review, Ads-Kritik, Belege, Video
    5,8 %
    22,7 Mio. Token erzeugt
  • Google Gemini
    Produkt-Laufzeit: Chat, Support, Bewertungen, Creatives
    1,4 %
    5,5 Mio. Token erzeugt

Gezählt sind Ausgabe-Token, also Text und Code, den die Modelle erzeugt haben. Claude schreibt den Großteil, weil Code lang ist. Gemini liefert dafür jede Antwort, die Lernende sehen. Lokale Modelle erzeugen keine messbaren API-Token.

Die meistgenutzten Modelle
  • Claude Opus 596,5 Mio.
  • Claude Opus 4.885,9 Mio.
  • Claude Fable 568,4 Mio.
  • Claude Opus 4.733,4 Mio.
  • Claude Opus 4.622,7 Mio.
  • Claude Haiku 4.519,8 Mio.
  • Claude Sonnet 513,7 Mio.
  • Claude Fable 5.113,6 Mio.
  • Claude Sonnet 4.67,6 Mio.
  • GPT-5.6 Sol6 Mio.

Tagsüber das Team, abends die Lernenden, nachts die Agenten.

Fig. 0.5
Team
Claude-Code-Sessions
Spitze 11:00 Uhr00 · 06 · 12 · 18 · 23
Lernende
Fragen an den KI-Tutor
Spitze 21:00 Uhr00 · 06 · 12 · 18 · 23
Agenten
Geplante Zeitfenster
Nachtfenster 22 bis 05 Uhr00 · 06 · 12 · 18 · 23
Der Tag der Agenten
  1. 22 bis 05 Uhr
    Nachtschicht
    4 Jobs auf dem CI-Runner: Flaky-Tests, Dependencies, Doku, Lint. Ergebnis als Pull Request.
  2. 06:47 Uhr
    Morgenbericht
    Zusammenfassung der Nacht ohne Modell, 0 €.
  3. 07:55 Uhr
    Postfach-Triage
    3 Postfächer sortiert, nichts gesendet.
  4. montags
    Ads-Wochenreview
    Kampagnen-Analyse mit Kritiker-Modell.

Erst 12 Wartungsagenten, jetzt die Nachtschicht. Mergen dürfen nur Menschen.

12 Nacht-PRs seit Oktober, 11 davon von Menschen gemergt.
Fig. 0.6
Wartungsagenten auf der Workstationpausiert seit Oktober
AgentGrenze
  • CI Guardian
    ci-guardian
    täglich26/28 erfolgreich9 PRs
    ≤ 300 Zeilen
  • Repository Truth Sync
    truth-sync
    wöchentlich5/5 erfolgreich4 PRs
    ≤ 250 Zeilen
  • Dependency Janitor
    dependency-janitor
    wöchentlich4/4 erfolgreich2 PRs
    ≤ 200 Zeilen
  • Dead-Code Janitor
    dead-code-janitor
    14-tägig4/4 erfolgreich3 PRs
    ≤ 400 Zeilen
  • Reliability & Error-Handling Auditor
    reliability-auditor
    14-tägig3/3 erfolgreich3 PRs
    ≤ 300 Zeilen
  • Bug Hunter
    bug-hunter
    14-tägig2/2 erfolgreich2 PRs
    ≤ 250 Zeilen
  • Test Guardian
    test-guardian
    14-tägig2/2 erfolgreich2 PRs
    ≤ 400 Zeilen
  • Duplication Unifier
    dup-unifier
    monatlich2/2 erfolgreich1 PRs
    ≤ 500 Zeilen+ Review-Gate
  • Complexity Simplifier
    complexity-simplifier
    monatlich2/2 erfolgreich2 PRs
    ≤ 400 Zeilen+ Review-Gate
  • Architecture Guardian
    architecture-guardian
    monatlich2/2 erfolgreich2 Issues
    nur lesen
  • Contract & Schema Guardian
    contract-guardian
    monatlich2/2 erfolgreich2 PRs
    ≤ 300 Zeilen
  • Security Boundary Auditor
    security-auditor
    monatlich1/1 erfolgreich1 Issues
    nur lesen

Was Lernende und Kunden davon sehen: Tutor, Bewertungen, Antwortentwürfe.

Jede Support-Antwort gibt ein Mensch frei.
Fig. 0.7
KI-Tutor in der App
819
Fragen von 205 Lernenden
25.090
Antworten automatisch bewertet
Fragen pro Monatseit Januar 2026
2
Jan
24
Feb
58
Mär
60
Apr
88
Mai
48
Jun
95
Jul
133
Aug
263
Sep
48
Okt

Oktober bis zum Stichtag. Gemini beantwortet, Kontext aus den Lerninhalten.

Support-Brainlive seit 23.9.2026

Drei Modelle arbeiten nacheinander: Triage, Autor, Prüfer. Ein Mensch entscheidet immer, was rausgeht.

  1. Anfragen triagiert671
    Typ, Absicht, Sprache, Dringlichkeit
  2. Antwort entworfen538
    Autor-Modell schreibt Vorschlag
  3. Vom Prüfer geprüft527
    zweites Modell prüft jede Aussage gegen Quellen
  4. Prüfung bestanden340
    alle Aussagen belegt
  5. Vom Menschen gesendet320
    Mitarbeiter gibt frei, bearbeitet oder verwirft
87 %
über WhatsApp
48
direkt an Mensch
6
Sprachen erkannt
DE 563 · EN 7 · NL 6 · FR 5 · ES 5 · PT 1

Jede Rolle arbeitet mit KI. Manche Aufgaben übernimmt sie ganz.

Rollen statt Namen. Agenten zählen als eigene Rolle.
Fig. 0.8
Geschäftsführung
arbeiten mit KI zusammen
  • Produktentwicklung mit Claude Code
  • Finanzmodell & Planung
  • Kampagnensteuerung
  • Ventures & Prototypen
Ausbilder & Skipper
arbeiten mit KI zusammen
  • Lernplattform mit KI-Tutor
  • Prüfungsvorbereitung der Schüler
  • Feedback-Auswertung
Kundenservice
arbeiten mit KI zusammen
  • Antwortvorschläge im Support
  • Übersetzung von Anfragen
  • Medien-Verständnis in WhatsApp
KI-Agenten
arbeiten selbstständig
  • Nachtschicht im Code
  • Wartungsroutinen
  • Postfach-Triage
  • Ads-Review
  • Belegerfassung
Augmentation vs. Automation

Wie im Anthropic Economic Index: Wird eine Aufgabe delegiert oder gemeinsam erledigt? Verteilung über alle 26 Projekte.

AugmentationBeidesAutomation
14 gemeinsam4 beides8 delegiert
Gemeinsam mit KI
  • Tutor mit Folgefragendrifting-humming-lighthouse
  • Automatische Bewertungdrifting-humming-lighthouse
  • Wochen-Reviewbold-juggling-marlin
  • Kritiker-Modellbold-juggling-marlin
  • Entwürfe für Inseratebreezy-gliding-catamaran
  • Mehrsprachigkeitbreezy-gliding-catamaran
  • Antwortentwürfegentle-replying-heron
  • Markentongentle-replying-heron
  • Szenarienpatient-tallying-tortoise
  • Kapazitätpatient-tallying-tortoise
An Agenten delegiert
  • Tutor mit Folgefragendrifting-humming-lighthouse
  • Automatische Bewertungdrifting-humming-lighthouse
  • CI-Reparatursteady-polishing-barnacle
  • Bug-Suchesteady-polishing-barnacle
  • Flaky-Testsquiet-mending-lantern
  • Updatesquiet-mending-lantern
  • Klassifizierentidy-sorting-pelican
  • Labelntidy-sorting-pelican
  • Wochen-Reviewbold-juggling-marlin
  • Kritiker-Modellbold-juggling-marlin

KI-Aktivität pro Woche seit Oktober 2025.

Stand der Claude-Statistik: 13.9.2026.
Fig. 0.9
Gesamt 486.282
020.00040.00060.00080.000Okt. 25Dez. 25Feb. 26Apr. 26Juni 26Aug. 26
Commits pro Monat
mit KI-Co-Autor ohne
Balken antippen
Juni 25Okt. 26

Was die Agenten tun, gezählt pro Werkzeugaufruf.

Die meiste Arbeit passiert in der Shell.
Fig. 1.0
Was Claude Code tut
  • Shell-Befehle29.164
  • Dateien lesen5.064
  • Externe Systeme (MCP)2.668
  • Code ändern2.284
  • Dateien schreiben970
  • Webseiten lesen484
  • Websuche415
  • Werkzeuge nachladen346
  • Sub-Agenten starten259
Angebundene Systeme
  • Chrome-Browser861
  • Eingebauter Browser509
  • Connectoren (Docs, Vercel, Notion …)347
  • PostHog-Analytics218
  • Supabase203
  • Terminal53
Sub-Agenten & Skills
  • general-purpose165×
  • fork60×
  • Explore28×
  • Plan3×
  • code-reviewer3×
/code-review/artifact-design/tdd/dataviz/unslop/verify/impeccable/grilling/claude-api/hyperframes/domain-modeling/brainstorming

Neun Grenzen für die Agenten. Alle stehen im Code, nicht in einer Richtlinie.

Fig. 1.1
Mensch merged
Kein Agent merged eigenen Code. Jede Änderung kommt als Pull Request mit Prüfprotokoll.
Budget pro Lauf
Jeder Nacht-Job hat ein Kosten- und Zeitlimit. Der Morgenbericht läuft ganz ohne Modell.
Getrennte Rechte
Der Agent liest nur. Pushen und Pull Requests übernimmt ein zweiter Runner-User ohne Modell.
Sandbox & Hooks
Vor jedem Befehl prüft ein Hook Pfade, Shell-Operatoren und Wiederholungen. Acht Ausbruchsversuche laufen als Test.
Sende-Sperre
Die Postfach-Triage kann keine E-Mails senden. Ein automatisierter Test stellt das sicher.
Zweites Modell prüft
Support-Antworten prüft ein separates Modell gegen Quellen. Kritische Fälle gehen direkt an einen Menschen.
Größengrenzen
Wartungsagenten dürfen nur eine feste Zahl Zeilen ändern. Große Umbauten brauchen ein Review-Gate.
Lokal, wo es geht
Dubbing und Sprachmodelle laufen auf eigener Hardware. Produktdaten liegen bei Supabase und Vercel.
GoBD & DSGVO
Der Beleg-Agent arbeitet revisionssicher. Kundendaten werden nur mit Einwilligung zusammengeführt.

Wie wir messen. Und was wir nicht zeigen.

Fig. 1.2
Claude Code
Lokale Statistik und Sitzungsprotokolle: Anzahl, Modelle, Token, Werkzeugaufrufe, Uhrzeit. Keine Inhalte.
Codex
Thread-Datenbank von Codex, inklusive archivierter Threads: Anzahl, Modell, Token, Art (CLI, Desktop, Exec, Review, Sub-Agent). Ausgabe-Token aus den Sitzungsprotokollen.
Git
Commits je Repository und Monat. Als KI-gestützt zählt ein Commit mit Claude-Co-Autor. Codex markiert seine Commits nicht, der Anteil ist deshalb eine Untergrenze.
Agenten
Laufprotokolle der Wartungsroutinen: Läufe, Erfolg, PRs, Issues.
Produkt
Aggregierte Zählungen aus der App-Datenbank: Tutor-Fragen, Bewertungen, Support-Brain-Entscheidungen.
Grenzen der Daten
  • Alle Werte sind Aggregate. Prompts, Antworten, Kundendaten und Namen verlassen nie das System.
  • Claude- und Codex-Summen umfassen die gesamte Entwicklungsarbeit der Geschäftsführung, auch für Ventures. Projektwerte zählen nur zugeordnete Arbeit.
  • Projekte tragen zufällige Codenamen. Die Zuordnung zu echten Projekten liegt nur intern vor.
  • Sitzungsprotokolle werden nach einiger Zeit gelöscht. Projektwerte (Treemap) decken daher nur die jüngsten Wochen ab; Summen stammen aus der vollständigen Statistik.
  • Laufende Rechtsangelegenheiten und private Projekte sind ausgeschlossen.
  • Token zählen Cache-Lesezugriffe mit. Sie sagen mehr über Arbeitsumfang als über Kosten.
snapshot 2026-10-09 12:04 UTC · 26 Projekte · scripts/collect.py