//Strumenti1 min di lettura
Goodfire lancia Silico: il tool per debuggare gli LLM e capire come ragionano davvero

Finora correggere un Large Language Model è stato come riparare un'auto senza poter aprire il cofano: la maggior parte dei team si limitava a fare trial-and-error o ad aggiungere guardrail esterni per gestire i sintomi — le famose allucinazioni — senza mai capire la causa reale.
Goodfire, una startup specializzata in AI, ha appena rilasciato Silico, uno strumento che cambia l'approccio grazie alla mechanistic interpretability.
Cosa permette di fare Silico
Ispezionare i neuroni del modello
Silico consente ai team di guardare dentro il modello durante il training e vedere esattamente quali neuroni o circuiti si attivano per determinate decisioni. Non più una black box: si osserva il comportamento interno in tempo reale.
Risolvere i bug alla radice
Invece di riaddestrare l'intero modello alla cieca — un processo lungo e costosissimo — gli sviluppatori possono identificare l'errore a livello di circuito (correlazioni spurie, errori matematici causati da neuroni specifici) e sopprimere o modificare i comportamenti indesiderati direttamente mid-training.
Agenti AI che automatizzano l'analisi
La mechanistic interpretability è un campo complesso. Per questo Goodfire ha integrato agenti AI che automatizzano gran parte del processo, rendendolo accessibile anche a team più snelli e non solo ai grandi laboratori di ricerca.
Perché è importante
Per chi fa fine-tuning di modelli custom su dati proprietari, o per chi vuole costruire AI più sicure e allineate, avere strumenti per diagnosticare (Localize) e correggere (Steer) i comportamenti interni significa risparmiare enormi quantità di tempo e denaro, ottenendo sistemi più prevedibili e affidabili.
L'articolo completo è su MIT Technology Review.
La mechanistic interpretability è ancora un campo di nicchia, o pensate che strumenti come Silico possano diventare parte del workflow standard di chi fa fine-tuning?
📌 Questo articolo riassume una discussione su r/vibecodingitalia. Leggi il post originale.

Scritto da
Michael Gasperini@TheStreamCode
Full Stack Developer
Creatore di Vibe Coding Italia, la community italiana sull’intelligenza artificiale. Progetta e sviluppa prodotti con l’AI e ne racconta l’applicazione pratica attraverso guide e articoli.
DeepSeek V4.1 Flash: pesi open MIT, architettura nuova multimodale, e il Pro viene servito a prezzo Flash
DeepSeek rilascia V4.1 Flash: 552B MoE multimodale con pesi MIT su Hugging Face, KV cache a 1/4, prezzi tagliati fino al 57% e V4 Pro che resta in servizio.
Leggi articoloOpenAI rilascia GPT-6 Astra: il suo miglior modello di coding finora, e il primo designato Critical in cybersecurity
OpenAI rilascia GPT-6 Astra: nuovo record su Terminal-Bench 4.0, listino $10/$50, primo modello designato Critical in cybersecurity con capacità al lancio limitate.
Leggi articoloClaude Fable 5.1 è disponibile: più forte di Fable 5 nei benchmark, più economico sulle workload agentiche
Claude Fable 5.1 è disponibile: più forte di Fable 5 nei benchmark, cache read al 75% in meno, Mythos 5.1 riservato ai programmi verificati. Numeri e limiti.
Leggi articolo



