Claude Opus 5.5 : comment je l’utilise pour coder au quotidien
J’avais arrêté d’utiliser Opus 5. Je ne le trouvais pas assez bon pour son prix. Cette semaine, Opus 5.5 m’a redonné envie de travailler avec Claude.
Pierre ✺10 min
Ressources
Nouveaux modèles, benchmarks, méthodes d’entraînement et pistes de recherche.
10 articles20 signaux
J’avais arrêté d’utiliser Opus 5. Je ne le trouvais pas assez bon pour son prix. Cette semaine, Opus 5.5 m’a redonné envie de travailler avec Claude.
Pierre ✺10 min
Sur mes dernières implémentations avec Astra, les reviews ont trouvé très peu de choses à reprendre. J’ai donc commencé à lui confier davantage de travail.
Pierre ✺7 min
Vous avez probablement vu le film de lancement de GPT-6 Astra publié par OpenAI. Il part d’une archive de 1979 — un homme demande à un ordinateur de dessiner un cercle jaune — puis montre des utilisateurs qui parlent à Astra pendant que le cercle devient une fusée, passe dans Blender, se transforme en jeu 3D et rejoint d’autres tâches menées en parallèle.
Supersocks8 min
Chez QuEra, quatre spécialistes essayaient depuis plusieurs mois d’automatiser la remise en service d’un laser indispensable à leurs ordinateurs quantiques. Leur script réussissait dans 58 % des cas, en 150 secondes. Anthropic a alors relié Claude au laser grâce à MHS, une interface qui permet à une IA de lire et de piloter un appareil physique.
Mickaël Ahouansou3 min
J’utilise Hermes au quotidien depuis plusieurs mois. Ça m’a donné envie de comprendre l’architecture derrière le produit. Après pas mal de recherches et de tests, j’en ai tiré ce guide. J’espère que ça t’aidera à baisser le coût de tes modèles sur Hermes.
Barbatos11 min
Grok 4.6 arrive avec un positionnement assez clair : un niveau proche des modèles frontier pour un prix nettement inférieur. La question intéressante n'est donc pas de savoir si c'est « le meilleur modèle », mais de savoir sur quelles tâches ce compromis est gagnant, et sur lesquelles il ne l'est pas du tout.
Pierre ✺13 min
Effort, prompts, code review, orchestration et preuves d'exécution : comment l'intégrer proprement à un workflow de développement.
Pierre ✺20 min
Kimi K3 ne domine ni Claude Fable 5 ni GPT-5.6 Sol au classement général. Son concepteur le reconnaît, l'évaluation indépendante le confirme.
Pierre ✺10 min
C’est dimanche, le PSG vient de décrocher sa deuxième Ligue des champions, et j’ai choisi ce moment parfaitement raisonnable pour vous parler d’AMI Labs : une start-up qui a levé 1,03 milliard de dollars dès son tour d’amorçage, pour une valorisation de 3,5 milliards.
Supersocks28 min
Supersocks est un peu chauvin.
Supersocks15 min
@iamsupersocks
Publication avec citation · Modèles & recherche
🐳 Merci
@iamsupersocks
Publication avec citation · Modèles & recherche
Excellent 🤣
@iamsupersocks
Publication avec citation · Modèles & recherche
Google sort des ténèbres. Gemini 4 est out ! J’ai presque cru à un bug sur X en voyant tous ces posts. Le benchmark est plus que sympathique. Qui se dévoue pour un retour ? Trop traumatisé pour le laisser naviguer dans mon code sans l’avis du peuple mdr.
@barbatos_ai
Publication avec citation · Modèles & recherche
@barbatos_ai
Publication avec citation · Modèles & recherche
@barbatos_ai
Publication avec citation · Modèles & recherche
Beaucoup de rumeurs autour de Grok 4.7 qui arrive plus rapidement que prévu🚨
@barbatos_ai
Sujets repérés · Modèles & recherche
J'ouvre Cursor et je vois la nouvelle intégration de Grok Bot. 👀 Pour le moment ça ouvre uniquement l'app Grok Bot desktop, s'ils peuvent intégrer ça directement sur Cursor ça serait énorme. https://t.co/oiczx4fJH2
@barbatos_ai
Sujets repérés · Modèles & recherche
À quel point peut-on encore se fier au raisonnement affiché par un modèle pour savoir ce qu’il fait réellement ? Je me suis posé la question en testant GPT-6 Astra qui peut masquer son raisonnement, et d'ailleurs d'autres modèles frontier ne donnent déjà pas tous accès à leur
@barbatos_ai
Publication avec citation · Modèles & recherche
On est en plein dans la course à l'armement. Imaginons deux laboratoires qui pensent tous les deux que les futurs modèles pourraient devenir très difficiles à contrôler. Le premier ralentit pour travailler sur la sécurité pendant que l'autre prend de l'avance. Le premier a
@barbatos_ai
Publication avec citation · Modèles & recherche
DeepSeek V4.1 Flash balaye la majorité des modèles frontières. Il atteint 98% du score de GPT-6 Astra à 1.4% du coût sur un benchmark concret de design. 510GB open weights. Benchmark OpenDesignHQ : - V4.1 Flash : 98% score Astra, 5.3 min, $0.023 - GPT-6 Astra : 11.1 min, $1.61
@barbatos_ai
Publication avec citation · Modèles & recherche · Agents & automatisation
On a notre sujet de la semaine. Un nouveau modèle vient d’apparaître chez OpenCode appelé Union Alpha. 262k de contexte et orienté coding agentique, et comme les autres fois on ne sait pas qui est derrière. Ces derniers mois, plusieurs modèles ont suivi le même schéma : Pony
@barbatos_ai
Publication avec citation · Modèles & recherche
Claude Opus 5.5 vient de sortir et le timing est assez brutal pour Grok 4.7. Grok 4.7 est sorti hier et xAI le présente comme son modèle le plus puissant pour le code, l'ingénierie et le travail de bureau, avec un gros effort sur les tâches qui durent plusieurs heures,
@pgllmt
Publication avec citation · Modèles & recherche
Opus 5.5 et Astra déjà « nerfés » ? Les premiers résultats de NerfBench ne vont pas dans ce sens. L’idée de modèles volontairement dégradés après leur sortie me laissait sceptique. Autant regarder des mesures. BridgeMind a retesté les deux modèles le 27 septembre, en comparant
@pgllmt
Publication avec citation · Modèles & recherche
Claude Sonnet 5.5 est là !
@pgllmt
Sujets repérés · Modèles & recherche · Agents & automatisation
Premiers tests de GPT-6.1 Sol : un vrai progrès pour coder. Mais il ne remplace pas encore Astra dans mes projets. Sur mes essais de ce matin, je le trouve meilleur que Sol 6 et Sonnet 5.5. Il est convaincant sur les tâches bien cadrées, mais j’ai dû le corriger sur plusieurs
@pgllmt
Publication avec citation · Modèles & recherche · Agents & automatisation
New Gemini 4 Argon a l’air plutôt intéressant ! Nouveau modèle frontier de @GoogleDeepMind, pensé pour les tâches complexes : coding agentique, legal, finance, cyberdéfense… Pas encore dispo pour tout le monde, mais les premiers résultats ont l’air solides. À suivre 👀
@dumblebackdoor
Publication avec citation · Modèles & recherche · Infra & self-host
Presque 6 Go… 7,2 en Q2. Intéressant sur des GPU contraints en VRAM. 80 tok/s en génération et 3000 en prefill sur une 4090, par exemple. Sur Mac, le format GGUF est aussi dispo : #LocalAI
@dumblebackdoor
Publication avec citation · Modèles & recherche
Et hop, un petit coup de forge de tokens pour ce modèle sur une RTX 5080 (16 Go) et ça passe nickel 👌 80-90 tok/s sur nos benchs petit et moyen contexte (13k) entre code debug et prise EN/FR. C’est stable et efficace : pas de bug de justesse relevé. Un bon modèle donc 👏
@dumblebackdoor
Sujets repérés · Modèles & recherche
On entre dans une nouvelle ère. Et c’est formidable ! Qwen-Image 2.1, sur une RTX 5080 16 Go dans un PC, à la maison. Des illustrations de ce niveau, chez soi, sans API, sans cloud. C’est une époque incroyable. https://t.co/inPnxxFU2P https://t.co/Q3qQBjA9E1
@dumblebackdoor
Sujets repérés · Modèles & recherche · Infra & self-host
Qwen-Image-2.1 tourne sur une Intel Arc Pro B70. Une image toutes les 52 secondes avec une très bonne qualité, et vous avez même la retouche ainsi que le support de la transparence. Cela vous tente ? Ce n'était pas acquis au lancement du projet. ComfyUI annonce le support natif https://t.co/WIe403J8vD