Bannato da GLM per aver messo LiteLLM davanti a Claude Code. Paolo racconta tutto: il pool di modelli, il middleware locale, il classifier dell'automode spostato su Gemma per non bruciare la quota del modello principale. Poi il fallback verso il cloud rigira le chiamate già modificate, GLM le legge come traffico di un harness non supportato, e parte il ban. Con mail di supplica annessa.


Prima di quella storia, Stripe che compra OpenRouter per 7 miliardi di dollari. La lettura di Paolo è che il routing sia una posizione da API Gateway: chi smista il traffico degli agenti può vendere servizi premium sul volume, esattamente come Stripe ha fatto con i pagamenti. Da lì i protocolli di pagamento tra agenti, AP2 sopra A2A, e lo scenario in cui a produrre reddito sono gli agenti stessi.


Poi i modelli. Qwen 3.8 27B denso è la prima volta che un modello locale su 16-24 giga di VRAM regge un coding agent vero e non solo il completamento: onniscienza peggiore del 3.6, capacità agentiche molto migliori, e il consiglio di tenerlo su low o medium thinking effort. GLM 5.3 guadagna 6-7 punti di intelligenza generale su Artificial Analysis, l'inferenza di Z.ai è diventata veloce, e resta il dubbio su cosa faccia girare davvero Ollama quando le risposte non combaciano.


Nella seconda parte: perché parlare ai modelli in italiano non spreca i token che pensi, il trick di chiedere l'output in inglese B2 o C1, le skill Wait What e handoff, il report di Hugging Face sullo stato dei modelli open (attention e adoption non sono la stessa cosa, solo l'1% sta sopra i 70 billion), Light Learner, il jailbreak del taccuino, e le quattro skill dell'AI engineer secondo Andrew Ng.


CAPITOLI

00:00 Stripe compra OpenRouter per 7 miliardi

02:59 A2A, AP2 e il routing dei pagamenti

08:18 LiteLLM: i modelli locali in un pool

13:20 Bannato da GLM: il classifier locale

16:22 Sandbox invece di validatori, e i cyborg

19:55 Qwen 3.8 27B: coding su 16 giga

26:01 GLM 5.3 e il dubbio su Ollama

32:20 Parlare ai modelli in italiano: latent space

39:23 Wait What, Grill with Docs e handoff

46:15 Report Hugging Face sui modelli open

50:54 Attention non è adoption: download contro like

56:26 Kimi K3, licenze e modelli sopra 70B

1:02:00 Light Learner e il jailbreak del taccuino

1:06:30 Andrew Ng: le 4 skill dell'AI engineer


Ascolta su Spotify: https://open.spotify.com/episode/45PF4g7gH6tHATi1SCm0u2?utm_source=youtube&utm_medium=description&utm_campaign=ep68_drop

Tutti gli episodi e le trascrizioni: https://risorseartificiali.com/?utm_source=youtube&utm_medium=description&utm_campaign=ep68_drop

LinkedIn: https://www.linkedin.com/company/risorseartificiali


Se la puntata ti è servita iscriviti al canale. E se avete voglia di precisare la spiegazione sul latent space, i commenti sono lì apposta.


Risorse Artificiali, AI Engineering in italiano. Puntata #68

Podden och tillhörande omslagsbild på den här sidan tillhör RisorseArtificiali. Innehållet i podden är skapat av RisorseArtificiali och inte av, eller tillsammans med, Poddtoppen.