vLLM 0.25.0 officialise Model Runner V2, Llama.cpp fixe Vulkan, et la pression régulatoire monte

ApiDelta · 2026-07-13 · 656 mots · apidelta.maxiaworld.app

🚀 Modèles & Releases

vLLM v0.25.0 est sorti, faisant de Model Runner V2 le chemin d'exécution par défaut pour tous les modèles denses, avec un support pour EVS et les embeddings en temps réel. (v0.25.0)

🛠️ Outils & Produits

Llama.cpp a publié un correctif Vulkan pour le binaire llama-cli qui plantait sur des prompts longs pour les réseaux quantifiés q4_0, dû à une mémoire partagée insuffisante sur Adreno. (b9969) Crush (client CLI pour Cloudflare AI) a publié la version 0.84.1, corrigeant l'envoi des en-têtes d'ID de session pour l'affinité de session. (v0.84.1) browser-use (framework pour agents web) a publié la version 0.13.4, apportant un serveur MCP pour la CLI 3.0 et des correctifs pour la détection de navigation. (0.13.4)

🔬 Recherche

Jet-Long est une nouvelle méthode d'extension de contexte long utilisant un RoPE bifocal dynamique pour une extrapolation de contexte zéro-shot plus efficace. (2607.07740) OpenCoF explore un nouveau chemin de raisonnement pour les grands modèles via la génération de vidéo comme alternative au Chain-of-Thought. (2607.08763) Long-Horizon-Terminal-Bench est un nouveau benchmark pour tester les limites des agents sur des tâches terminales à long horizon, avec une évaluation basée sur des récompenses denses pour mesurer les progrès intermédiaires. (2607.08964)

🏢 Industrie & Business

OpenAI recrute un chef de produit dédié pour créer des expériences destinées aux familles, aux aidants et aux adultes plus âgés, indiquant une stratégie de pénétration plus profonde dans les foyers. (TechCrunch)

⚖️ Régulation & Société

Plus de 200 manifestants ont marché vers les bureaux d'OpenAI et de Google DeepMind pour exiger une régulation de l'IA et une pause dans la course à l'IA. (Hindustan Times) Des experts plaident pour une régulation équilibrée de l'IA afin de débloquer l'économie numérique. (Punch Newspapers) Un article souligne qu'une bonne politique d'IA pourrait s'inspirer d'une certaine faculté de droit. (The Princetonian)

💡 À retenir

La sortie de vLLM 0.25.0 avec Model Runner V2 par défaut est l'évolution la plus concrète pour les développeurs backend, car elle impacte directement la stack d'inférence. La pression régulatoire et sociétale sur les grands labos continue de monter, avec des manifestations et des appels à une régulation équilibrée.

#ia#actualité#fr