← Alle Tags

#evals

3 Posts

Die beste Antwort ist keine Zielgröße

Ein Eval-Score, der nur Qualität misst, belohnt Brute Force - mehr Sampling, größeres Modell, mehr Retries. Warum die richtige Entscheidungsgrundlage eine Cost-Quality-Latency-Frontier ist, eine Kurve statt eines Punkts, und wie man den Operating-Point in Dollar wählt statt in Prozent.

aievalssoftware-engineeringobservability

Evals in die CI: Wenn AI-Features aufhören, Prompts zu sein

... und anfangen, Software zu werden - mit den entsprechenden Testpflichten

aicievalssoftware-engineering

AI Systems Architecture beginnt dort, wo Modelloutput Teil der Produktlogik wird

Wie ich aus einem GitHub Issue einen testbaren, beobachtbaren Umsetzungsplan mache

aifullstacksoftware-engineeringevalsobservability