Die Integration von künstlicher Intelligenz in den Softwareentwicklungsprozess hat einen neuen Meilenstein erreicht: GitHub stellte ReviewBench vor, einen standardisierten Benchmark zur Bewertung von KI-Assistenten bei der Code-Review-Tätigkeit. Dies ist ein wichtiger Schritt, um Vergleichbarkeit in einem Bereich zu schaffen, der bislang stark fragmentiert war.
ReviewBench wurde entwickelt, um verschiedene KI-Modelle auf ihre Fähigkeit hin zu testen, Code-Qualitätsprobleme zu erkennen, Sicherheitslücken aufzuspüren und hilfreiche Verbesserungsvorschläge zu machen. Das Benchmark-Framework bewertet Antworten von KI-Assistenten gegen manuell kuratierte, hochwertige Referenz-Reviews von erfahrenen Entwicklern.
Das interessanteste Ergebnis: Microsofts Copilot belegt in Githubs eigenem Test den ersten Platz. Das wirft allerdings Fragen auf, da GitHub zu Microsoft gehört und Copilot ein Microsoft-Produkt ist. Dies könnte Interessenskonflikte suggerieren. Unabhängige Tests von Dritten berichten von ganz anderen Ergebnissen und setzen teilweise andere Modelle vorne.
Solche Benchmarks sind dennoch wertvoll für die Branche, weil sie einen standardisierten Weg bieten, die Qualität verschiedener KI-Tools zu messen. Für Entwicklerteams bedeutet das, dass sie zunehmend evidenzbasiert entscheiden können, welche KI-Assistenten sie einsetzen. Bisher war dies häufig von persönlichen Erfahrungen oder Marketing geprägt.
Für IT-Dienstleister ist ReviewBench relevant, wenn sie Entwicklungsteams beraten oder selbst Code-Review-Prozesse optimieren möchten. Die Messgrössen helfen dabei, KI-Tools kritisch auszuwählen und nicht nur auf Hype zu vertrauen. Wichtig bleibt aber auch: Automatisierte Code-Reviews ersetzen nicht die Erfahrung und das Urteil von Menschen, sie können diese aber unterstützen und beschleunigen.
