Google sort des ténèbres. Gemini 4 est out ! J’ai presque cru à un bug sur X en voyant tous ces posts. Le benchmark est plus que sympathique. Qui se dévoue pour un retour ? Trop traumatisé pour le laisser naviguer dans mon code sans l’avis du peuple mdr.
New Gemini 4 Argon a l’air plutôt intéressant ! Nouveau modèle frontier de @GoogleDeepMind, pensé pour les tâches complexes : coding agentique, legal, finance, cyberdéfense… Pas encore dispo pour tout le monde, mais les premiers résultats ont l’air solides. À suivre 👀
Premiers tests de GPT-6.1 Sol : un vrai progrès pour coder. Mais il ne remplace pas encore Astra dans mes projets. Sur mes essais de ce matin, je le trouve meilleur que Sol 6 et Sonnet 5.5. Il est convaincant sur les tâches bien cadrées, mais j’ai dû le corriger sur plusieurs
Opus 5.5 et Astra déjà « nerfés » ? Les premiers résultats de NerfBench ne vont pas dans ce sens. L’idée de modèles volontairement dégradés après leur sortie me laissait sceptique. Autant regarder des mesures. BridgeMind a retesté les deux modèles le 27 septembre, en comparant
Claude Opus 5.5 vient de sortir et le timing est assez brutal pour Grok 4.7. Grok 4.7 est sorti hier et xAI le présente comme son modèle le plus puissant pour le code, l'ingénierie et le travail de bureau, avec un gros effort sur les tâches qui durent plusieurs heures,
Sujets repérés · Modèles & recherche · Infra & self-host
Qwen-Image-2.1 tourne sur une Intel Arc Pro B70. Une image toutes les 52 secondes avec une très bonne qualité, et vous avez même la retouche ainsi que le support de la transparence. Cela vous tente ? Ce n'était pas acquis au lancement du projet. ComfyUI annonce le support natif https://t.co/WIe403J8vD
On entre dans une nouvelle ère. Et c’est formidable ! Qwen-Image 2.1, sur une RTX 5080 16 Go dans un PC, à la maison. Des illustrations de ce niveau, chez soi, sans API, sans cloud. C’est une époque incroyable. https://t.co/inPnxxFU2P https://t.co/Q3qQBjA9E1
Et hop, un petit coup de forge de tokens pour ce modèle sur une RTX 5080 (16 Go) et ça passe nickel 👌 80-90 tok/s sur nos benchs petit et moyen contexte (13k) entre code debug et prise EN/FR. C’est stable et efficace : pas de bug de justesse relevé. Un bon modèle donc 👏
Publication avec citation · Modèles & recherche · Infra & self-host
Presque 6 Go… 7,2 en Q2. Intéressant sur des GPU contraints en VRAM. 80 tok/s en génération et 3000 en prefill sur une 4090, par exemple. Sur Mac, le format GGUF est aussi dispo : #LocalAI
On a notre sujet de la semaine. Un nouveau modèle vient d’apparaître chez OpenCode appelé Union Alpha. 262k de contexte et orienté coding agentique, et comme les autres fois on ne sait pas qui est derrière. Ces derniers mois, plusieurs modèles ont suivi le même schéma : Pony
DeepSeek V4.1 Flash balaye la majorité des modèles frontières. Il atteint 98% du score de GPT-6 Astra à 1.4% du coût sur un benchmark concret de design. 510GB open weights. Benchmark OpenDesignHQ : - V4.1 Flash : 98% score Astra, 5.3 min, $0.023 - GPT-6 Astra : 11.1 min, $1.61
On est en plein dans la course à l'armement. Imaginons deux laboratoires qui pensent tous les deux que les futurs modèles pourraient devenir très difficiles à contrôler. Le premier ralentit pour travailler sur la sécurité pendant que l'autre prend de l'avance. Le premier a