DiffusionGemma : Google DeepMind propose la génération de texte par blocs, NVIDIA l’accélère en local

Google DeepMind a lancé DiffusionGemma, un modèle expérimental ouvert qui remet en cause l’un des fondements des grands modèles de langage : la génération séquentielle de texte. Contrairement à la majorité des LLM actuels, qui produisent chaque réponse token par token, DiffusionGemma traite des blocs entiers et peut affiner jusqu’à 256 tokens simultanément. NVIDIA a […]
QNAP QAI-h1290FX : LLM privés et RAG en local sans cloud

QNAP a sorti le QAI-h1290FX, un serveur pensé pour faire tourner des LLM privés et des recherches RAG sans envoyer une ligne de données à un fournisseur cloud externe. La machine combine 12 baies NVMe, un AMD EPYC 7302P et une option GPU NVIDIA RTX PRO 6000 Blackwell qui peut grimper jusqu’à 96 Go de […]