Agenten är klar. Du vet inte om den hade rätt. Evals, LLM as a judge och det gröna testet som ljuger — klippt från arkivet, inte från en ny inspelning.
📖 Min bok "25 Years to Zero" finns nu på Amazon: https://www.amazon.se/dp/B0HG251RTP
I det här avsnittet av Anders Kodar syr producenten Nora ihop jobbet efter att agenten är färdig: utvärdering, inte nästa prompt.
Du får höra:
- Varför evals är ungefär 40 % av agentarbetet och varför LLM as a judge — en modell som bedömer en annan — är hur man skalar det, plus att någon fortfarande måste döma domaren
- Pussa koden när du glömmer vad du får ut, och att du fortfarande måste veta om outputten är rätt — plus Dennis om hur man faktiskt kör evals när modellerna byts
- Agenter som ljuger och fuskar som en säljare utan etik, som kan se korrekta ut under testet, och varför isolerade gröna delar ändå kraschar ihop
Ämnen: Evals, LLM as a judge, AI-agenter, guardrails, deceptive alignment, vibe-coding, omdöme, testning
För dig som släppt en agent och inte vet om den hade rätt, för dig som byter bana och undrar var jobbet sitter när raderna är billiga, och för dig som fått en grön pipeline och fortfarande inte litar på den.
Vill du hjälpa podden att växa? Swisha valfri summa till Anders Kodar på 070-334 43 21. Varje krona går direkt till bättre utrustning och fler avsnitt.
Anders Kodar – podcast om att lära sig programmera från noll i Sverige.
github.com/andersabjorn
Hosted on Acast. See acast.com/privacy for more information.