Electrosens R&D

NEEDLE : le benchmark vivant qui rend les classements LLM obsolètes

Décryptage en profondeur de NEEDLE, le benchmark open-source de Keenable AI qui reconstruit son jeu de requêtes toutes les heures pour éliminer la contamination des données d’entraînement. L’article analyse pourquoi les benchmarks statiques classiques (MMLU, GPQA, etc.) sont devenus peu fiables en 2

RL post-training : la convergence forcée de l’infrastructure open source

Le RL post-training s’impose comme l’étape clé de l’entraînement des LLM open source, et cette montée en puissance bouleverse l’infrastructure : frameworks, orchestration, gestion des ressources. À partir des échanges du Ray Summit 2026, cet article dresse un état des lieux de cette convergence tech