„Google Diffusion Gemma“ funkcijos ir naujos funkcijos

Paskutiniai pakeitimai: Liepa 9 2026
  • Jis naudoja diskrečiosios difuzijos techniką, kad lygiagrečiai generuotų 256 žetonų blokus, viršydamas autoregresinių modelių greitį.
  • Jame įdiegta „Mixing Experts“ (MoE) architektūra su 26B parametrų (4B aktyvių), optimizuota vietinei aparatinei įrangai ir vartotojų GPU.
  • Tai leidžia sutelkti dėmesį dviem kryptimis, todėl idealiai tinka netiesinėms užduotims, tokioms kaip kodo redagavimas, matematiniai grafikai ir biologinė sekoskaita.

Google AI

Jei domitės dirbtiniu intelektu, tikriausiai esate įpratę, kad kalbos modeliai rašo žodį po žodžio, tarsi kažkas rašytų realiu laiku priešais jus. Na, o „Google DeepMind“ nusprendė laužyti stereotipus su „DiffusionGemma“ – drąsiu eksperimentu, kuris rašomąją mašinėlę pakeičia pramonine spausdinimo mašina ir leidžia jai vienu kartu generuoti ištisus teksto fragmentus.

Šis modelis nėra tiesiog ankstesnių atnaujinimas; jis atspindi paradigmos pokytį, taikant diskretišką difuziją natūraliai kalbai. Iš esmės, jis paima technologiją, leidžiančią „Midjourney“ ar „DALL-E“ kurti stulbinančius vaizdus, ​​ir pritaiko ją žodžių pasauliui, siūlydamas atvirą ir stebėtinai greitą alternatyvą tiems, kurie nori optimizuoti savo vietinius darbo eigą.

Kaip iš tikrųjų veikia difuzijos generavimas?

Kitaip nei klasikinė autoregresinė architektūra, kai modelis numato kitą žetoną pagal ankstesnįjį, „DiffusionGemma“ pradeda nuo tekstinio triukšmo drobės . Įsivaizduokite, kad turite 256 pozicijų bloką, užpildytą atsitiktiniais, beprasmiais simboliais; modelis, taikydamas iteracinį triukšmo mažinimo procesą, valo ir tobulina šiuos žetonus, kol sukuriamas nuoseklus ir struktūrizuotas atsakas.

Tai gali jus dominti:  Grafinė atmintis: išsamus VRAM vadovas

Galingiausias šio metodo aspektas yra dvikryptis dėmesys . Nors tradicinės teisės magistro (LLM) sistemos žvelgia tik atgal, ši sistema gali analizuoti visą teksto bloką vienu metu – ir tai, kas buvo prieš, ir tai, kas buvo po. Tai leidžia jai realiuoju laiku pataisyti save , įvertinant viso fragmento kokybę ir pakoreguojant žetonus ten, kur ji yra mažiau patikima, prieš pateikiant galutinį rezultatą.

Teksto sklaidos technologija

Techninė architektūra ir aparatinės įrangos efektyvumas

Šis modelis išnaudoja „Gemma 4“ galią ir naudoja „ Mix Experts“ (MoE) architektūrą . Nors iš viso gali pasigirti 26 milijardais parametrų, išvados metu aktyvuojama tik apie 4 milijardus. Šis sprendimas yra labai svarbus, nes leidžia modeliui itin efektyviai naudoti vaizdo atmintį ir neviršyti 18 GB, kurie paprastai randami dabartinėse vartotojams skirtose vaizdo plokštėse.

Kalbant apie savo galimybes, tai yra iš esmės multimodalinė sistema . Tai reiškia, kad ji gali apdoroti tekstą, vaizdus (nepriklausomai nuo skiriamosios gebos ar kraštinių santykio) ir vaizdo įrašus, kad sugeneruotų tekstinius atsakymus. Tačiau svarbu atkreipti dėmesį, kad kol kas ji nepalaiko garso įvesties – tai svarbi detalė, jei svarstote apie jos naudojimą tiesioginėms transkripcijoms.

Našumas ir lyginamieji rodikliai: greitis yra svarbiausia

Kalbant apie skaičius, „DiffusionGemma“ yra neįtikėtinai greita. „NVIDIA H100“ vaizdo plokštėje ji gali pasiekti 1000 žetonų per sekundę , o „RTX 5090“ – daugiau nei 700. Kad susidarytumėte vaizdą, tai maždaug keturis kartus greičiau nei „Gemma 4“ našumas vietinėje aplinkoje, nes ji daug geriau išnaudoja aparatinę įrangą, neapdorodama informacijos po vieną.

Tai gali jus dominti:  Kaip pagerinti mintininius skaičiavimus: metodai, gudrybės ir kasdienė praktika

Tačiau yra svarbus trūkumas: šis pranašumas yra reikšmingiausias vieno vartotojo arba mažo lygiagretumo konfigūracijose . Debesų kompiuterijos aplinkose, kuriose yra tūkstančiai vienu metu vykdomų užklausų (didelis QPS), nauda sumažėja, nes tradiciniai modeliai yra geriau optimizuoti masiniam paketiniam apdorojimui. Todėl tai idealus įrankis greitam prototipų kūrimui ir vietiniam vykdymui.

Idealūs naudojimo atvejai ir apribojimai

Dėl gebėjimo atsižvelgti į bendrą kontekstą, šis modelis puikiai tinka netiesinėms užduotims. Jis ypač naudingas kodo užbaigimui , kai reikia suprasti funkcijos uždarymą rašant pradžią, arba analizuojant matematinius grafikus ir biologines sekas (pvz., aminorūgštis), kur bendra struktūra yra svarbesnė nei eilės tvarka.

  • Internetinis leidimas: Tai leidžia modifikuoti tarpines teksto dalis nepažeidžiant likusios dalies nuoseklumo.
  • Šablono užpildymas: Idealiai tinka kurti turinį, kuris turi tilpti tarp iš anksto nustatytų frazių.
  • Samprotavimo būdas: Jame yra konfigūruojami modelio kanalai pagalvokite žingsnis po žingsnio prieš pateikdami tirpalą.

Tačiau būkite įspėti, ne viskas yra gražu. „Google“ buvo sąžininga ir pripažino, kad šis modelis teikia pirmenybę greičiui, o ne kokybei . Jei jums reikia chirurginio lygio faktinio tikslumo arba itin sudėtingo samprotavimo, geriausia laikytis standartinių autoregresinių modelių. Be to, dirbant su fiksuotais 256 žetonų blokais, labai ilgų tekstų generavimas gali padidinti bendrą delsą.

Konfigūravimas ir diegimas kūrėjams

Tiems, kurie nori pasinerti giliau, modelis prieinamas „Hugging Face“ ir „Kaggle“ platformose pagal „Apache 2.0“ licenciją, kuri leidžia jį naudoti komerciniais tikslais ir nemokamai modifikuoti. Siekiant geriausių rezultatų, rekomenduojama sukonfigūruoti adaptyvų triukšmo mažinimą su 48 žingsnių riba ir linijiniu temperatūros grafiku, kuris sumažėja nuo 0.8 iki 0.4, kad būtų užtikrintas tinkamas galutinių žetonų užrakinimas.

Tai gali jus dominti:  Kaip pasidaryti natūralų makiažą?

Integracija yra nesudėtinga dėl palaikymo vLLM, MLX (skirta „Mac“ naudotojams) ir „Hugging Face“ „Transformers“ bibliotekoje. Nors apie „llama.cpp“ palaikymą jau paskelbta ir jis bus pasiekiamas netrukus, šiuo metu greičiausias būdas yra per „Python“. Sklandžiam veikimui ir sistemos gedimams išvengti tereikia GPU su bent 18 GB VRAM .

Šis „Google DeepMind“ eksperimentas parodo, kad teksto generavimas nebūtinai turi būti lėtas ir linijinis procesas. Sujungę „MoE“ architektūrą su transliavimo galia, jie sukūrė įrankį, optimizuotą vartotojų įrangai, kuris, nors ir aukodamas tam tikrą tikslumą, įgyja precedento neturintį lankstumą redagavimo ir techninio kūrimo užduotyse.