logo elektroda
logo elektroda
X
logo elektroda
REKLAMA
REKLAMA
Adblock/uBlockOrigin/AdGuard mogą powodować znikanie niektórych postów z powodu nowej reguły.

Nowy model do generowania obrazków lokalnie - Z-Image (wersje Turbo, Edit, Base)

p.kaczmarek2 28 Lis 2025 09:26 534 3

TL;DR LABEL_AI_GENERATED

  • Z-Image to otwarty model generowania obrazów od Tongyi-MAI i Alibaba z trzema wariantami: Turbo, Base i Edit.
  • Z-Image-Turbo generuje obrazy w 8 krokach (NFEs) i działa lokalnie na typowej karcie z 16 GB VRAM.
  • Model dobrze radzi sobie z fotorealizmem, realistyczną teksturą, oświetleniem oraz poprawnym renderowaniem tekstu po angielsku i chińsku.
  • Z-Image-Base udostępnia pełny rdzeń do fine-tuningu, a Z-Image-Edit pozwala modyfikować istniejące obrazy na podstawie opisu tekstowego.
Podsumowanie AI na podstawie dyskusji. Może zawierać błędy.
REKLAMA
Słuchaj:
  • Schemat działania modelu Z-Image z blokami uwagi i przetwarzania obrazów
    Najnowszy model Z-Image - stworzony przez zespół Tongyi-MAI przy współpracy z Alibaba - został udostępniony jako otwarte narzędzie do generowania obrazów. Z-Image to model z 6 miliardami parametrów, który w zaskakująco dobry sposób łączy wysoką jakość z relatywnie niewielkimi wymaganiami sprzętowymi. Projekt oferuje trzy warianty: błyskawiczny i wydajny Z-Image-Turbo, bazowy Z-Image-Base do samodzielnej dalszej pracy oraz wersję Z-Image-Edit przeznaczoną do modyfikacji istniejących obrazów. Turbo potrafi wygenerować obraz przy użyciu zaledwie 8 kroków (NFEs), co przekłada się na bardzo szybkie działanie - poniżej sekundy przy odpowiednim GPU. Co ważne, model mieści się w typowej karcie graficznej z 16 GB VRAM, co czyni go osiągalnym także dla zwykłych użytkowników. Z-Image-Turbo świetnie radzi sobie z generacją fotorealistycznych obrazów, realistyczną teksturą, oświetleniem i detalami. Ponadto umie poprawnie renderować tekst zarówno po angielsku, jak i po chińsku - przydatne przy plakatach, ilustracjach czy wielojęzycznych grafikach. Wersja Base udostępnia pełny "rdzeń" modelu, co pozwala społeczności na fine-tuning, eksperymenty albo rozwój własnych stylów. Z kolei Z-Image-Edit umożliwia kreatywne zmiany na istniejących obrazach - np. zmianę tła, koloru, detali, a wszystko to na podstawie tekstowego opisu. Autorzy zapewniają też otwartą licencję i łatwy dostęp do wag modelu, co sprzyja adaptacji przez hobbystów, artystów i deweloperów. Podsumowując, Z-Image to obiecująca propozycja dla tych, którzy chcą generować atrakcyjne obrazy AI lokalnie, szybko i bez ogromnych wymagań sprzętowych.

    Przykłady z Z-Image-Turbo - tryb fotorealistyczny:
    Kolaż realistycznych obrazów przedstawiających ludzi, wydarzenia i krajobrazy

    Przykłady z Z-Image-Turbo - tekst:
    Mozaika plakatów wygenerowanych przez model Z-Image, ukazująca różne style i języki

    Przykłady rozumowania:
    Porównanie dwóch par obrazów ilustrujących zadania z rozumowaniem i bez.

    Przykłady edycji:
    Zestaw przykładów generowania i edycji obrazów przez model Z-Image-Turbo

    Porównanie (leaderboard) z platformy AI Arena - na ten moment to najlepszy otwarty model dla obrazów, przebijający Qwen-Image:
    Tabela rankingowa modeli tekst-do-obrazów z Z-Image-Turbo na 4. miejscu

    Źródło oraz instrukcja instalacji i model do pobrania:
    https://huggingface.co/Tongyi-MAI/Z-Image-Turbo

    Wygląda na to, że każdy ma teraz namiastkę Nano Banana do pobrania i uruchomienia lokalnie... czy testowaliście już Z-Image? Zapraszam do komentarzy.

    Fajne? Ranking DIY
    Pomogłem? Kup mi kawę.
    O autorze
    p.kaczmarek2
    Moderator Smart Home
    Offline 
    Inżynier programista z wieloletnim doświadczeniem embedded i full stack developer.
    Specjalizuje się w: embedded, Full-Stack Developer
    p.kaczmarek2 napisał 14804 postów o ocenie 12972, pomógł 659 razy. Jest z nami od 2014 roku.
  • REKLAMA
  • #2 21764795
    mack12
    Poziom 12  
    Posty: 72
    Pomógł: 1
    Ocena: 4
    Na stronie jest link do filmu. System ubuntu i karta nvidia RTX A6000. Tak patrze na znanym portalu i to cena kilkanascie tys za karte.
    Ja wiem ze im lepsza karta tym szybciej ujrzymy efekt ale czy. bez takich kosztow nie da sie rozpoczac zabawy z tym?
  • REKLAMA
  • #3 21764808
    p.kaczmarek2
    Moderator Smart Home
    Posty: 14804
    Pomógł: 659
    Ocena: 12972
    Z tym konkretnym modelem czy ogólnie z generowaniem obrazów? Na 6 GB VRAM na laptopie odpalałem już to:
    [AI] Generator grafiki i zdjęć na własnym komputerze - interfejs WWW dla Stable Diffusion
    Pomogłem? Kup mi kawę.
  • #4 21765508
    andrzejlisek
    Poziom 32  
    Posty: 3646
    Pomógł: 82
    Ocena: 713
    mack12 napisał:
    Na stronie jest link do filmu. System ubuntu i karta nvidia RTX A6000. Tak patrze na znanym portalu i to cena kilkanascie tys za karte.

    Natomiast używane RTX 3090 z 24GB VRAM stoją gdzieś ok. 3000zł za sztukę, więc jeszcze jako tako ujdzie, jak na sprzęt do zabawy w domu.

    p.kaczmarek2 napisał:
    Z tym konkretnym modelem czy ogólnie z generowaniem obrazów? Na 6 GB VRAM na laptopie odpalałem już to:
    [AI] Generator grafiki i zdjęć na własnym komputerze - interfejs WWW dla Stable Diffusion

    Ja to dobrze znam, jednak przeszedłem na ComfyUI i Automatic1111. ComfyUI obsługuje Stable Diffusion 3.5 i FLUX.1, które są najlepszym, ale wciąż mieszczącym się modelem na 24GB VRAM (CLIP+MODEL+VAE) w przypadku kwantyzacji FP8. A SDXL i pochodne (np. Juggernaut) to wejdą do 16GB bez żadnego problemu, nawet wystarczy 12GB.

    Ciekawe, czy Z-Image będzie obsługiwany przez ComfyUI i Automatic1111/Fooocus, a także, jaki poziom reprezentuje "out of the box" (bardzoej SDXL 1.0, czy FLUX/SD3.5) i jak wydajnie będzie to działać. Jak dla mnie, warte zainteresowania.

    Z drugiej strony, to już testowałem Qwen-Image i HiDream według https://comfyui-wiki.com/en/tutorial/advanced/image/qwen/qwen-image https://comfyui-wiki.com/en/tutorial/advanced/image/hidream/i1-t2i i z wymaganiami sprzętowymi to jest troszeczkę ściema. Owszem, cały model wejdzie do 24GB VRAM i 32GB RAM, ale faktem jest, że sam koder tekstu wazy ok. 10GB, a sam model dyfuzyjny FP8 wazy ok. 20GB. Ten stan rzeczy sprawia, ze ComfyUI musi załadować koder tekstu, przetworzyć prompt, rozładować koder tekstu, załadować model dyfuzyjny i wytworzyć obraz. Zadziałać, zadziała i obraz będzie, ale ładowanie 20GB trwa, trwa i trwa, w sumie ok. 10minut czekałem. A jak chce kolejny obraz wytworzyć, to cały proces musi być powtórzony w całości, bo model nie rezyduje w karcie graficznej. A nawet, jak model dyfuzyjny rezyduje, to trzeba go rozładować i załadować koder tekstu w pierwszej kolejności. Obrazy, może i są lepsze, ale jednak trochę się zniechęciłem i wolę pozostać przy SDXL, Jugernaut, EpicRealism, DreamShaper (wszystkie trzy to fine tunowany SDXL) lub ewentualnie SD 3.5 i FLUX.1 dla lepszych rezultatów.

    Dodano po 9 [godziny] 5 [minuty]:

    Co nie co już wiem. Już istnieje model w wersji dostosowany do ComfyUI.

    Zaktualizowałem ComfyUI do najnowszej wersji, pobrałem pliki modelu z https://huggingface.co/Comfy-Org/z_image_turbo/tree/main/split_files , następnie pobrałem przykładowy workflow z https://docs.comfy.org/tutorials/image/z-image/z-image-turbo .

    Same pliki modelu (wszystkie trzy razem) wazą ok. 21GB.

    Według nvidia-smi, proces python (tak predstawia się ComfyUI w Ubuntu Linux 20.04) zajmuje ok. 14 GB w karcie graficznej podczas generowania obrazu, a w RAM zajmuje ok 18GB, w czasie działania wszystko trzymane jest w RAM. Widocznie wersja 0.3.75 ma coś zmienione w zarządzaniu pamięcią. W wersji 0.3.70, po wygenerowaniu obrazu w standardowy sposób, wszystko było w karcie graficznej w miarę możliwości, więc po wytworzeniu obrazu mogłem zobaczyć, ile potrzeba pamięci VRAM do optymalnego działania.

    A w standardowym workflow po wygenerowaniu obrazów (nie potrzeba żadnych custom nodes), proces python zajmuje ok. 20GB VRAM w karcie graficznej. Nie wiem, czym różni się ten przykładowy workflow od standardowego, że ComfyUI od razu rozładowuje model, a standardowy nie rozładowuje.

    Wygląda na to, że mój eksperyment potwierdza, iż 16GB VRAM to jest minimum i będzie działać, a teoretycznie 24 GB VRAM będzie najbardziej optymalne, wtedy wszystko wejdzie do karty graficznej.

    A jeśli chodzi o jakość obrazu, to na pierwszy rzut oka, po kilku próbach, Z-Image reprezentuje poziom FLUX.1 lub Stable Diffusion 3.5, czyli jakość bardzo dobra, a czas generowania znaczne krótszy, bo to jest "Turbo".

    Z niecierpliwością czekam na standardową wersję modelu i wersje "Edit", bo tych wersji jeszcze nie wydano.
Słuchaj:
REKLAMA