- Tas izmanto diskrētās difūzijas tehniku, lai paralēli ģenerētu 256 žetonu blokus, pārsniedzot autoregresīvo modeļu ātrumu.
- Tā ievieš Mixing Experts (MoE) arhitektūru ar 26 B parametriem (4 B aktīvi), kas ir optimizēti lokālajai aparatūrai un patērētāju GPU.
- Tas nodrošina divvirzienu uzmanību, padarot to ideāli piemērotu nelineāriem uzdevumiem, piemēram, koda rediģēšanai, matemātiskiem grafikiem un bioloģiskajai sekvencēšanai.

Ja jūs interesē mākslīgais intelekts, jūs droši vien esat pieradis pie valodas modeļiem, kas raksta vārds pa vārdam, it kā kāds rakstītu reāllaikā jūsu priekšā. Nu, Google DeepMind ir nolēmis lauzt ierasto ar DiffusionGemma — drosmīgu eksperimentu, kas rakstāmmašīnu aizstāj ar rūpniecisko iespiedmašīnu, ļaujot tai ģenerēt veselus teksta fragmentus vienā piegājienā.
Šis modelis nav vienkārši iepriekšējo modeļu atjauninājums; tas atspoguļo paradigmas maiņu, piemērojot diskrētu difūziju dabiskajai valodai. Būtībā tas izmanto tehnoloģiju, kas ļauj Midjourney vai DALL-E radīt satriecošus vizuālos attēlus, un pielieto to vārdu pasaulē, piedāvājot atvērtu un pārsteidzoši ātru alternatīvu tiem, kas vēlas optimizēt savas lokālās darbplūsmas.
Kā īsti darbojas difūzijas ģenerēšana?
Atšķirībā no klasiskās autoregresīvās arhitektūras, kur modelis paredz nākamo marķieri, pamatojoties uz iepriekšējo, DiffusionGemma sākas ar teksta trokšņa audeklu . Iedomājieties, ka jums ir 256 pozīciju bloks, kas piepildīts ar nejaušām, bezjēdzīgām rakstzīmēm; modelis, izmantojot iteratīvu trokšņa samazināšanas procesu, pulē un pilnveido šos marķierus, līdz rodas saskaņota un strukturēta atbilde.
Šīs pieejas spēcīgākais aspekts ir tās divvirzienu uzmanība . Kamēr tradicionālās tiesību zinātnes metodes (LLM) skatās tikai atpakaļ, šī sistēma var vienlaikus analizēt visu teksta bloku — gan iepriekšējo, gan nākamo. Tas ļauj tai reāllaikā labot sevi , novērtējot visa fragmenta kvalitāti un pielāgojot marķierus tur, kur tai ir mazāka pārliecība, pirms sniegt galīgo rezultātu.
Tehniskā arhitektūra un aparatūras efektivitāte
Zem pārsega šis modelis izmanto Gemma 4 jaudu un Mix Experts (MoE) arhitektūru . Lai gan tam kopumā ir 26 miljardi parametru, secinājumu laikā tas aktivizē tikai aptuveni 4 miljardus. Šis lēmums ir ļoti svarīgs, jo tas ļauj modelim būt ārkārtīgi efektīvam VRAM ziņā, iekļaujoties 18 GB, kas parasti ir pašreizējās patērētāju grafikas kartēs.
Runājot par tās iespējām, tā ir dabiski multimodāla sistēma . Tas nozīmē, ka tā var apstrādāt tekstu, attēlus (neatkarīgi no izšķirtspējas vai malu attiecības) un video, lai ģenerētu teksta atbildes. Tomēr ir svarīgi atzīmēt, ka pagaidām tā neatbalsta audio ievadi , kas ir būtiska detaļa, ja apsverat tās izmantošanu tiešraides transkripcijām.
Veiktspēja un etaloni: ātrums ir galvenais
Skaitliski DiffusionGemma ir neticami ātra. Uz NVIDIA H100 tā var sasniegt 1000 žetonus sekundē , bet uz RTX 5090 tā pārsniedz 700. Lai sniegtu priekšstatu, tas ir aptuveni četras reizes ātrāk nekā Gemma 4 veiktspēja lokālā vidē, jo tā daudz labāk izmanto aparatūru, neapstrādājot informāciju pa vienai.
Tomēr pastāv svarīgs brīdinājums: šī priekšrocība ir visizteiktākā viena lietotāja vai zemas vienlaicības konfigurācijās . Mākoņvidē ar tūkstošiem vienlaicīgu pieprasījumu (augsts QPS) ieguvums samazinās, jo tradicionālie modeļi ir labāk optimizēti masveida pakešapstrādei. Tāpēc tas ir ideāls rīks ātrai prototipu izveidei un lokālai izpildei.
Ideāli lietošanas gadījumi un ierobežojumi
Pateicoties spējai ņemt vērā kopējo kontekstu, šis modelis izceļas ar nelineāriem uzdevumiem. Tas ir īpaši noderīgs koda pabeigšanā , kur, rakstot sākumu, ir jāsaprot funkcijas aizvēršanās, vai matemātisko grafiku un bioloģisko secību (piemēram, aminoskābju) analīzē , kur kopējā struktūra ir svarīgāka par secību.
- Tiešsaistes izdevums: Tas ļauj modificēt teksta starpdaļas, neizjaucot pārējā teksta saskaņotību.
- Veidnes aizpildīšana: Ideāli piemērots satura ģenerēšanai, kam jāiekļaujas iepriekš definētās frāzēs.
- Argumentācijas veids: Tas ietver konfigurējamus kanālus modelim domāt soli pa solim pirms šķīduma sniegšanas.
Taču esiet brīdināti, ne viss ir tik gluds un spožs. Google ir bijis godīgs un atzinis, ka šajā modelī prioritāte ir ātrums, nevis kvalitāte . Ja nepieciešama ķirurģiska līmeņa faktuāla precizitāte vai ārkārtīgi sarežģīta spriešana, vislabāk ir pieturēties pie standarta autoregresīvajiem modeļiem. Turklāt, strādājot ar fiksētiem 256 žetonu blokiem, ļoti garu tekstu ģenerēšana var palielināt kumulatīvo latentumu.
Konfigurēšana un izvietošana izstrādātājiem
Tiem, kas vēlas iedziļināties, modelis ir pieejams Hugging Face un Kaggle platformās saskaņā ar Apache 2.0 licenci, kas ļauj to izmantot komerciāli un veikt bezmaksas modifikācijas. Lai sasniegtu labākos rezultātus, ieteicams konfigurēt adaptīvo trokšņu samazināšanu ar 48 soļu ierobežojumu un lineāru temperatūras grafiku, kas samazinās no 0.8 līdz 0.4, lai nodrošinātu, ka galīgie žetoni ir pareizi bloķēti.
Integrācija ir vienkārša, pateicoties vLLM, MLX (Mac lietotājiem) un Hugging Face Transformers bibliotēkas atbalstam. Lai gan ir paziņots par llama.cpp atbalstu, kas drīzumā būs pieejams, pašlaik ātrākais veids ir, izmantojot Python. Viss, kas nepieciešams, ir GPU ar vismaz 18 GB VRAM, lai nodrošinātu vienmērīgu darbību un novērstu sistēmas avārijas.
Šis Google DeepMind eksperiments parāda, ka teksta ģenerēšanai nav jābūt lēnam un lineāram procesam. Apvienojot MoE arhitektūru ar apraides iespējām, viņi ir izveidojuši rīku, kas optimizēts patērētāju aparatūrai un, lai gan upurē zināmu precizitāti, iegūst nepieredzētu elastību rediģēšanas un tehniskās izstrādes uzdevumos.
