🚀 Modèles & Releases
-
TensorRT-LLM v1.3.0rc22 :
torch.compilecrash dans le backend PyTorch et erreursKeyErroren multi-GPU pour des configs comme DeepSeek-V3-Lite (bf16/FP8/NVFP4) ou Llama-3.1-8B-Instruct FP8 avec FlashInfer. Workaround immédiat : désactivertorch.compilepour les configs impactées. DeepSeek-V3.2 FP8 bloque aussi sur des OOM liés aux block-scale. ( Source ) -
Ling-3.0-flash : Modèle MoE 124B (5.1B activés/token) optimisé pour l’inférence agentique à grande échelle. Disponible gratuitement via OpenRouter. ( Source )
-
Laguna S 2.1 (Poolside) : Agent de code 118B (8B actifs) avec 70.2% sur Terminal-Bench 2.1. ( Source )
-
Gemini 3.5 Flash Lite : Version légère de Gemini 3.5 pour les sous-agents dans des workflows multi-agents. ( Source )
🔬 Recherche
-
3D-Aware VLMs : Framework VLM-IE3D pour améliorer la compréhension spatiale 3D des modèles vision-language, comblant un gap dans les tâches nécessitant une précision géométrique fine. ( arXiv:2607.21595v1 )
-
Expanding Flow Maps : EFlows permet aux modèles génératifs flow-based de gérer des dimensions ou séquences dynamiques, une limitation majeure des approches existantes. ( arXiv:2607.21585v1 )
-
GraphVid : Génération vidéo contrôlée par graphes pour spécifier des interactions multi-objets précises, alternative aux prompts textuels ou aux trajectoires pixel-based. ( arXiv:2607.21580v1 )
🛠️ Outils & Produits
-
llama.cpp b10099 : Améliorations CUDA pour la quantification NVFP4 W4A4, avec optimisations des kernels (chargement 32-byte, fusion des kernels amax et quantification). ( Source )
-
goose v1.44.0 : Support des derniers modèles Gemini, intégration déclarative du provider Sakana AI pour l’API Fugu (compatible OpenAI), et passage du
working_dirau contexte du hookStop. ( Source ) -
cline Desktop v0.0.4 : Sessions de chat sans workspace, drag-and-drop de fichiers, affichage inline des images, et planification de routines ponctuelles. ( Source )
-
AutoGPT Platform v0.6.69 : Sidebar redessinée, posting proactif pour Slack/Telegram, mode Agent-Building pour les workflows complexes. ( Source )
-
pydantic-ai v2.17.0 : Support de champs arbitraires pour
RequestUsage/RunUsage(préparation pour genai-prices), cache des serializations OTel pour éviter la complexitéO(n²). ( Source )
⚙️ API & Dépréciations
-
Anthropic API : Nouveaux effort levels pour les agents Claude Managed Agents (à configurer dans l’objet
modellors de la création). Webhooks étendus pour couvrir le cycle de vie des environnements (environment.*) et des memory stores (memory_store.*). ( Source ) -
TensorRT-LLM : Breaking change urgent — voir section Modèles & Releases pour les détails et le workaround. Aucun délai de migration annoncé, mais impact immédiat sur les pipelines en production.
⚖️ Régulation & Société
-
Démocrates US vs USTR : Pressions pour restaurer les pouvoirs de régulation de l’IA dans la mise à jour de l’accord USMCA (remplace l’ALÉNA). ( Source MLex )
-
Cybersécurité offensive : Les guardrails d’OpenAI et Anthropic bloquent des outils de recherche en vulnérabilités, selon des chercheurs interrogés par TechCrunch. ( Source )
💡 À retenir
- TensorRT-LLM v1.3.0rc22 casse
torch.compile: Workaround obligatoire pour éviter des crashes en production (DeepSeek-V3, Llama-3.1). Priorité absolue si vous utilisez ces configs. - Ling-3.0-flash : MoE 124B gratuit et optimisé pour l’inférence agentique — à évaluer face à des modèles comme Gemini Flash Lite pour les workflows multi-agents.