Google, Gemma 4'ü Metin Difüzyon Modelini Dönüştürerek Yeniden Eğitti
Google DeepMind, metin üretimi süreçlerini hızlandırmak amacıyla DiffusionGemma adını verdiği yeni bir modeli kullanıma sundu. Geleneksel dil modelleri metinleri her seferinde tek bir token üreterek oluştururken, bu yeni yapı 256 tokenlık blokları paralel olarak işliyor. Nvidia H100 hızlandırıcılar üzerinde yapılan testlerde modelin saniyede yaklaşık 1.500 token üretebildiği belirtiliyor.
Araştırmacılar, mevcut Gemma-4-26B-A4B modelini temel alarak, orijinal eğitim bütçesinin yüzde onundan daha az bir kaynakla difüzyon modeline dönüştürdü. Eğitim süreci iki aşamadan oluşuyor: İlk aşamada model gürültülü metin bloklarını yeniden oluşturmayı öğreniyor. İkinci aşamada ise Google'ın SD·RL adını verdiği, pekiştirmeli öğrenme ve örnekleyici damıtma yöntemlerini birleştiren bir süreç devreye giriyor. Bu yöntem, mantık yürütme testlerinde başarıyı ortalama 10 puan artırırken, hesaplama başına üretilen token sayısını da yaklaşık dört katına çıkarıyor.
Standart modeller, yanıtın ilk kısmını oluştururken henüz tüm mantıksal süreci tamamlamamış oluyor. Ancak DiffusionGemma, yanıtı ve mantık yürütme sürecini paralel geliştirdiği için çıktı kesinleşmeden önce hataları fark edip düzeltebiliyor. Örneğin, bir matematik probleminde başlangıçta yanlış bir sayı üreten model, çözüm ilerledikçe bu hatayı fark ederek çıktısını güncelleyebiliyor. Bu yetenek, Sudoku gibi her adımın bir sonrakine bağlı olduğu görevlerde modelin yüzde 85 başarı oranına ulaşmasını sağlıyor.
Modelin bazı performans eksiklikleri de bulunuyor. Agresif hesaplama adımları nedeniyle bazen tekrara düşebiliyor ve çok kullanıcılı senaryolarda standart modellerin gerisinde kalabiliyor. Google, bu projeyi Apache 2.0 lisansı ile Hugging Face üzerinden araştırmacıların kullanımına açtı. Şu an için deneysel aşamada olan bu çalışma, çok dilli konuşma tanıma ve radyoloji raporu oluşturma gibi spesifik alanlarda test ediliyor.

