🚀 Modèles & Releases
- SGLang v0.5.17 : Intègre Kimi K3, un modèle multimodal LatentMoE de 2,8T paramètres (896 experts, top-16, routage dans un espace latent 3584-dim), avec 1M-token de contexte, 69 couches d'attention linéaire KDA et 24 couches MLA, plus une tour vision MoonViT3d. Livré en checkpoint MXFP4 natif. Impact immédiat : vérifiez la compatibilité des pipelines de serving existants. (GitHub)
⚙️ API & Dépréciations
- Weaviate v1.38.9 : Patch critique avec corrections pour le module de usage (évite les lectures inutiles de tailles de fichiers) et la réplication asynchrone. Aucun breaking change déclaré, mais les fixes impactent la stabilité en production. Mise à jour recommandée sous 48h. (GitHub)
- Anthropic API : Ajout d'un budget pour les sessions de Claude Managed Agents. Un plafond de dépenses (basé sur les tarifs publics) peut être défini ; la session s'interrompt avec le motif
budget_reachedet reprend après ajustement. Utile pour contrôler les coûts des agents autonomes. (Docs)
🛠️ Outils & Produits
- llama.cpp b10326 : Correction des timings pour la synthèse vocale (TTS) en intégrant le temps de passage du vocodeur dans les métriques. Améliore la précision des rapports de performance pour les pipelines audio. (GitHub)
- OpenHands v1.11.0 : Ajout du coût LLM par run dans les logs d'activité et les exports. Permet un suivi financier précis des workflows d'agents. (GitHub)
- pydantic-ai v1.107.2 : Correctif de sécurité pour une vulnérabilité de disponibilité : limite les téléchargements distants à 50 MiB par défaut (outils
web_fetchetFileUrl). Mise à jour urgente si vous utilisez ces fonctionnalités. (GitHub)
🔬 Recherche
- Selective Context Preference Optimization : Méthode pour entraîner les modèles à ignorer sélectivement les signaux contextuels trompeurs, évitant à la fois les réponses incorrectes et l'ignorance totale du contexte. Publication pertinente pour les systèmes RAG ou agents critiques. (arXiv)
- The Bitter Lesson of Tool Calling : Évaluation systématique des outils programmatiques (vs JSON) pour les LLMs. Montre que les scripts améliorent le chaînage et la parallélisation, mais avec des trade-offs en robustesse. (arXiv)
⚖️ Régulation & Société
- OpenAI ralentit Astra : Le développement du modèle Astra (capable d'attaques cyber autonomes) a été freiné pour des raisons de sécurité après avoir franchi un seuil critique. Impact potentiel sur les roadmaps des labos concurrents. (TechCrunch)
💡 À retenir
- SGLang v0.5.17 et Weaviate v1.38.9 imposent des mises à jour urgentes (48h) pour éviter des casses en production. Kimi K3, bien que puissant, nécessite une revue des infrastructures de serving (MXFP4, 2,8T paramètres).
- Anthropic introduit un budget session pour les agents, un outil concret pour maîtriser les coûts des workflows autonomes.