Aller au contenu
LE LAB X

Ressources

Tous les sujets

Modèles & recherche

Nouveaux modèles, benchmarks, méthodes d’entraînement et pistes de recherche.

10 articles20 signaux

Articles

Signaux

Supersocks@iamsupersocks

Supersocks

@iamsupersocks

Publication avec citation · Modèles & recherche

🐳 Merci

  • Modèles & recherche
Supersocks

@iamsupersocks

Publication avec citation · Modèles & recherche

Excellent 🤣

  • Modèles & recherche
Supersocks

@iamsupersocks

Publication avec citation · Modèles & recherche

Google sort des ténèbres. Gemini 4 est out ! J’ai presque cru à un bug sur X en voyant tous ces posts. Le benchmark est plus que sympathique. Qui se dévoue pour un retour ? Trop traumatisé pour le laisser naviguer dans mon code sans l’avis du peuple mdr.

  • Modèles & recherche

Barbatos@barbatos_ai

Barbatos

@barbatos_ai

Publication avec citation · Modèles & recherche

  • Modèles & recherche
Barbatos

@barbatos_ai

Publication avec citation · Modèles & recherche

  • Modèles & recherche
Barbatos

@barbatos_ai

Publication avec citation · Modèles & recherche

Beaucoup de rumeurs autour de Grok 4.7 qui arrive plus rapidement que prévu🚨

  • Modèles & recherche
Barbatos

@barbatos_ai

Sujets repérés · Modèles & recherche

J'ouvre Cursor et je vois la nouvelle intégration de Grok Bot. 👀 Pour le moment ça ouvre uniquement l'app Grok Bot desktop, s'ils peuvent intégrer ça directement sur Cursor ça serait énorme. https://t.co/oiczx4fJH2

  • Modèles & recherche
Barbatos

@barbatos_ai

Sujets repérés · Modèles & recherche

À quel point peut-on encore se fier au raisonnement affiché par un modèle pour savoir ce qu’il fait réellement ? Je me suis posé la question en testant GPT-6 Astra qui peut masquer son raisonnement, et d'ailleurs d'autres modèles frontier ne donnent déjà pas tous accès à leur

  • Modèles & recherche
Barbatos

@barbatos_ai

Publication avec citation · Modèles & recherche

On est en plein dans la course à l'armement. Imaginons deux laboratoires qui pensent tous les deux que les futurs modèles pourraient devenir très difficiles à contrôler. Le premier ralentit pour travailler sur la sécurité pendant que l'autre prend de l'avance. Le premier a

  • Modèles & recherche
Barbatos

@barbatos_ai

Publication avec citation · Modèles & recherche

DeepSeek V4.1 Flash balaye la majorité des modèles frontières. Il atteint 98% du score de GPT-6 Astra à 1.4% du coût sur un benchmark concret de design. 510GB open weights. Benchmark OpenDesignHQ : - V4.1 Flash : 98% score Astra, 5.3 min, $0.023 - GPT-6 Astra : 11.1 min, $1.61

  • Modèles & recherche
Barbatos

@barbatos_ai

Publication avec citation · Modèles & recherche · Agents & automatisation

On a notre sujet de la semaine. Un nouveau modèle vient d’apparaître chez OpenCode appelé Union Alpha. 262k de contexte et orienté coding agentique, et comme les autres fois on ne sait pas qui est derrière. Ces derniers mois, plusieurs modèles ont suivi le même schéma : Pony

  • Modèles & recherche
  • Agents & automatisation
Barbatos

@barbatos_ai

Publication avec citation · Modèles & recherche

Claude Opus 5.5 vient de sortir et le timing est assez brutal pour Grok 4.7. Grok 4.7 est sorti hier et xAI le présente comme son modèle le plus puissant pour le code, l'ingénierie et le travail de bureau, avec un gros effort sur les tâches qui durent plusieurs heures,

  • Modèles & recherche

Pierre ✺@pgllmt

Pierre ✺

@pgllmt

Publication avec citation · Modèles & recherche

Opus 5.5 et Astra déjà « nerfés » ? Les premiers résultats de NerfBench ne vont pas dans ce sens. L’idée de modèles volontairement dégradés après leur sortie me laissait sceptique. Autant regarder des mesures. BridgeMind a retesté les deux modèles le 27 septembre, en comparant

  • Modèles & recherche
Pierre ✺

@pgllmt

Publication avec citation · Modèles & recherche

Claude Sonnet 5.5 est là !

  • Modèles & recherche
Pierre ✺

@pgllmt

Sujets repérés · Modèles & recherche · Agents & automatisation

Premiers tests de GPT-6.1 Sol : un vrai progrès pour coder. Mais il ne remplace pas encore Astra dans mes projets. Sur mes essais de ce matin, je le trouve meilleur que Sol 6 et Sonnet 5.5. Il est convaincant sur les tâches bien cadrées, mais j’ai dû le corriger sur plusieurs

  • Modèles & recherche
  • Agents & automatisation
Pierre ✺

@pgllmt

Publication avec citation · Modèles & recherche · Agents & automatisation

New Gemini 4 Argon a l’air plutôt intéressant ! Nouveau modèle frontier de @GoogleDeepMind, pensé pour les tâches complexes : coding agentique, legal, finance, cyberdéfense… Pas encore dispo pour tout le monde, mais les premiers résultats ont l’air solides. À suivre 👀

  • Modèles & recherche
  • Agents & automatisation

DumbleD@dumblebackdoor

DumbleD

@dumblebackdoor

Publication avec citation · Modèles & recherche · Infra & self-host

Presque 6 Go… 7,2 en Q2. Intéressant sur des GPU contraints en VRAM. 80 tok/s en génération et 3000 en prefill sur une 4090, par exemple. Sur Mac, le format GGUF est aussi dispo : #LocalAI

  • Modèles & recherche
  • Infra & self-host
DumbleD

@dumblebackdoor

Publication avec citation · Modèles & recherche

Et hop, un petit coup de forge de tokens pour ce modèle sur une RTX 5080 (16 Go) et ça passe nickel 👌 80-90 tok/s sur nos benchs petit et moyen contexte (13k) entre code debug et prise EN/FR. C’est stable et efficace : pas de bug de justesse relevé. Un bon modèle donc 👏

  • Modèles & recherche
DumbleD

@dumblebackdoor

Sujets repérés · Modèles & recherche

On entre dans une nouvelle ère. Et c’est formidable ! Qwen-Image 2.1, sur une RTX 5080 16 Go dans un PC, à la maison. Des illustrations de ce niveau, chez soi, sans API, sans cloud. C’est une époque incroyable. https://t.co/inPnxxFU2P https://t.co/Q3qQBjA9E1

  • Modèles & recherche
DumbleD

@dumblebackdoor

Sujets repérés · Modèles & recherche · Infra & self-host

Qwen-Image-2.1 tourne sur une Intel Arc Pro B70. Une image toutes les 52 secondes avec une très bonne qualité, et vous avez même la retouche ainsi que le support de la transparence. Cela vous tente ? Ce n'était pas acquis au lancement du projet. ComfyUI annonce le support natif https://t.co/WIe403J8vD

  • Modèles & recherche
  • Infra & self-host