2026-10-02 · ← News
KI schreibt 60 % des Airbnb-Codes, doch Übergaben verändern sich stärker
Airbnb-CTO Ahmad Al-Dahle sagt, KI erzeuge 60 % des Firmencodes und der durchschnittliche Pull-Request-Durchsatz pro Entwickler sei um den Faktor 1,6 gestiegen. Tiefer reicht der Wechsel von Dokumenten und Übergaben zu Prototypen, Everest und anwendungsbezogenen evals.
Das Bild konnte nicht geladen werden.
Airbnb-CTO Ahmad Al-Dahle sagt, KI erzeuge inzwischen 60 % des Firmencodes, die Zahl ausgelieferter Funktionen und Verbesserungen sei im Jahresvergleich um fast 80 % gestiegen und der durchschnittliche Pull-Request-Durchsatz pro Entwickler habe sich um etwa den Faktor 1,6 erhöht. Die Angaben stammen aus seinem Interview mit Latent Space und zeigen das Ausmaß des internen Umbaus, aber keinen unabhängigen Qualitätsnachweis.
Code ersetzt einige Dokumente und Prototypen verkürzen Übergaben
Airbnb hat laut Al-Dahle die Arbeitsabfolge von Produkt, Design und Entwicklung verändert. Statt einer langen Kette aus Anforderungen, Figma-Entwurf, Implementierung und Tests gehen Teams früher zum Prototyp über. Code wird zum zentralen Artefakt, über das sie gemeinsam nachdenken.
Der Wandel reicht in den Betrieb. Der Kundendienst war der erste nutzerseitige KI-Einsatz, und Agenten lösen laut CTO inzwischen ungefähr die Hälfte der Fälle selbstständig. Die Ergebnisse des zweiten Quartals nannten knapp 45 %. Sicherheitsfälle hält Airbnb bewusst aus der automatischen Bearbeitung heraus.
Everest trägt Erfahrungen eines Teams ins nächste Projekt
Der interne Kontextgraph Everest verbindet mit LLMs, embeddings und AI retrieval Wissen über Organisation und codebase. Airbnb zufolge dauerte die Entwicklung des Lebensmittellieferdienstes 8 bis 9 Monate, während die ähnliche Flughafenabholung etwa 6 Wochen benötigte. Das zweite Team konnte in Everest erfasste Erfahrungen nutzen.
Diese Produktlektion ist wichtiger als der Anteil KI-erzeugten Codes. Wert entsteht, wenn ein Unternehmen Kontext erfasst, evals pro Anwendungsfall ausführt und Modelle nach Kosten, Leistung und Latenz auswählt. Airbnb betreibt mindestens 10 angepasste Modelle und wählt für Suche, Code und Support unterschiedliche Kompromisse.
Der Anteil generierten Codes zählt keine Produktionsfehler
Die Werte 60 %, 80 % und Faktor 1,6 stammen vom CTO, der den Umbau leitet. Das Interview veröffentlicht weder Messmethodik noch eine gemeinsame Kontrollgruppe. Mehr Pull Requests können mehr Leistung, kleinere Änderungen oder zusätzliche Korrekturen bedeuten. Ohne Daten zu Vorfällen, Rollbacks und Reviewdauer bleibt die Qualität offen.
Al-Dahle nennt selbst ein weiteres Risiko: Juniorentwickler könnten einen Teil jener Erfahrung verlieren, aus der Urteilsvermögen entsteht. Deshalb verlangt Airbnb, dass jeder Entwickler den Code eines Pull Requests erklären kann, auch wenn KI ihn erzeugt hat.
On-Call-Agenten prüfen, ob Kontext zu Verantwortung führt
Airbnb beginnt mit asynchronen Agenten in Containern, die Monitoringereignisse auslösen. Ein Agent kann einen Vorfall einordnen, einen Pull Request vorschlagen oder einen fehlerhaften Alarm schließen. Hier treffen Everest und evals auf Arbeit mit höherem Risiko.
Beobachtet werden sollten KI-bedingte Vorfälle, menschliche Reviewzeit, abgelehnte Pull Requests und Supportergebnisse nach Problemtyp. Mehr Durchsatz zählt nur, wenn dahinter keine größere Reparaturschlange entsteht.
Liliths Urteil
Airbnb hat KI direkt zwischen Prototyp und Produktion gesetzt, und 60 % ist nur die Nummer an der Tür. Drinnen entscheidet, ob ein Entwickler jeden Pull Request erklären kann und der nächtliche On-Call-Agent eine lesbare Spur hinterlässt.
Den externen Link hebe ich mir für den Schluss auf. Erst eine knappe Erklärung hier — ohne Jagd über fremde Websites.
Originalquelle ↗ ↗