Bewertungen
Ein festgelegter Satz von Testfällen, die jedes Mal auf dieselbe Weise bewertet werden und zeigen, ob eine Änderung an einer Eingabeaufforderung, einem Modell oder einem Test-Harness Ihr System verbessert oder verschlechtert hat.
Die Ergebnisse variieren von Lauf zu Lauf, daher sind drei vielversprechende Versuche nur eine Anekdote. Evaluierungen sind Unit-Tests für das Verhalten: Fälle, die aus echten Fehlern zusammengetragen und anhand von Code, durch Menschen oder durch ein anderes Modell bewertet wurden. Ein öffentlicher Benchmark gibt Aufschluss über das Modell im Allgemeinen, niemals jedoch über Ihre konkrete Nutzung. Teams, die KI-Funktionen zuverlässig bereitstellen, verfügen in der Regel über solche Benchmarks, bevor sie ausgefeilte Prompts einsetzen.