DeepSWE: il benchmark che mostra dove i modelli di coding divergono davvero
2 min
DeepSWE è il nuovo benchmark di Datacurve che valuta i modelli di coding su scenari agentici reali, non su test sintetici: ecco perché conta.
Leggi articolo// Tag
Articoli con il tag Agenti AI.
DeepSWE è il nuovo benchmark di Datacurve che valuta i modelli di coding su scenari agentici reali, non su test sintetici: ecco perché conta.
Leggi articoloMiniMax M3 si avvicina: l'Head of Engineering svela l'architettura Sparse Attention con speedup 9.7x in prefilling e 15.6x in decoding su 1M token.
Leggi articoloHermes Agent di Nous Research orchestra sub-agenti, crea skill automaticamente e coordina Claude Code come un tech lead. Ecco cosa lo distingue.
Leggi articoloGoogle lancia Gemini 3.5 Flash come motore agentico di Antigravity: 1M token di contesto, tool use avanzato e limiti triplicati per chi fa coding con agenti AI.
Leggi articolo