Claude Opus 5.5 vient de sortir et le timing est assez brutal pour Grok 4.7. Grok 4.7 est sorti hier et xAI le présente comme son modèle le plus puissant pour le code, l'ingénierie et le travail de bureau, avec un gros effort sur les tâches qui durent plusieurs heures,
On a notre sujet de la semaine. Un nouveau modèle vient d’apparaître chez OpenCode appelé Union Alpha. 262k de contexte et orienté coding agentique, et comme les autres fois on ne sait pas qui est derrière. Ces derniers mois, plusieurs modèles ont suivi le même schéma : Pony
Publication avec citation · Agents & automatisation
Du coup j’ai testé Cursor Projects ces derniers jours. J'utilisais déjà l'orchestration de plusieurs agents et subagents. Ce n’est pas vraiment ça qui change avec Projects mais ça apporte des choses très intéressantes. Je l'ai fait bossé sur un projet from scratch avec la
DeepSeek V4.1 Flash balaye la majorité des modèles frontières. Il atteint 98% du score de GPT-6 Astra à 1.4% du coût sur un benchmark concret de design. 510GB open weights. Benchmark OpenDesignHQ : - V4.1 Flash : 98% score Astra, 5.3 min, $0.023 - GPT-6 Astra : 11.1 min, $1.61
On est en plein dans la course à l'armement. Imaginons deux laboratoires qui pensent tous les deux que les futurs modèles pourraient devenir très difficiles à contrôler. Le premier ralentit pour travailler sur la sécurité pendant que l'autre prend de l'avance. Le premier a
À quel point peut-on encore se fier au raisonnement affiché par un modèle pour savoir ce qu’il fait réellement ? Je me suis posé la question en testant GPT-6 Astra qui peut masquer son raisonnement, et d'ailleurs d'autres modèles frontier ne donnent déjà pas tous accès à leur
J'ouvre Cursor et je vois la nouvelle intégration de Grok Bot. 👀 Pour le moment ça ouvre uniquement l'app Grok Bot desktop, s'ils peuvent intégrer ça directement sur Cursor ça serait énorme. https://t.co/oiczx4fJH2