Wer automatisiert testet, baut auf Determinismus, auf Konsistenz, auf klare Erwartungen. Mit Anupam Krishnamurthy spreche ich darüber, warum genau das bei LLMs nicht funktioniert und was wir stattdessen brauchen. Wir gehen der Frage nach, wie man einen Chatbot testet, der nie zweimal die gleiche Antwort gibt, warum ein LLM ein anderes LLM beurteilen kann und wo das an seine Grenzen stößt. Anupam erklärt, wie RAG-Systeme sich in Retrieval und Generation zerlegen lassen, und warum die meisten Fehler im Retrieval stecken.
Podden och tillhörande omslagsbild på den här sidan tillhör
Richard Seidl - Experte für Software-Entwicklung und Testautomatisierung. Innehållet i podden är skapat av Richard Seidl - Experte für Software-Entwicklung und Testautomatisierung och inte av,
eller tillsammans med, Poddtoppen.