DiffusionGemma : Google DeepMind propose la génération de texte par blocs, NVIDIA l’accélère en local

Google DeepMind a lancé DiffusionGemma, un modèle expérimental ouvert qui remet en cause l’un des fondements des grands modèles de langage : la génération séquentielle de texte. Contrairement à la majorité des LLM actuels, qui produisent chaque réponse token par token, DiffusionGemma traite des blocs entiers et peut affiner jusqu’à 256 tokens simultanément. NVIDIA a […]