Open source

Open Generative AI samlar hundratals AI-modeller i en öppen studio för bild och video

Open Generative AI är en MIT-licensierad studio för AI-bilder, AI-video, lip sync, workflows och lokal inference. Här är funktionerna, kraven och begränsningarna.

Open Generative AI med gränssnitt för generativ bild-AI

Open Generative AI har vuxit till ett av de mer uppmärksammade open source-projekten för generativ media på GitHub. Projektet samlar bildgenerering, AI-video, lip sync, arbetsflöden, AI-agenter och lokal inference i ett gemensamt gränssnitt – och kan köras som desktopapp på macOS, Windows och Linux.

Den 20 augusti 2026 ligger projektet på omkring 26 000 GitHub-stjärnor och 4 700 forks. Den aktuella koden är märkt som version 2.0.0 och släpps under MIT-licens.

Det mest intressanta är inte bara antalet modeller. Open Generative AI försöker bygga ett gemensamt kreativt lager ovanpå många olika AI-modeller, så att användaren kan arbeta med bilder, video och ljud utan att byta mellan ett stort antal separata tjänster.

> Kort sagt: Open Generative AI är en öppen AI-studio som kombinerar molnbaserade modeller via API med vissa modeller som kan köras lokalt på den egna datorn.

Open Generative AI – exempel från projektets eget repository

Vad är Open Generative AI?

Open Generative AI är ett open source-projekt skapat av Anil Matcha och andra bidragsgivare. Målet är att erbjuda ett öppnare alternativ till kommersiella plattformar för generativ bild och video.

Projektets README beskriver i dag stöd för 400+ modelldefinitioner och ett stort antal separata studios. GitHub-projektets korta beskrivning nämner samtidigt 500+ modeller, så det exakta antalet förändras löpande. Det mest korrekta är därför att beskriva plattformen som en studio med hundratals AI-modeller.

Bland modellfamiljer och tjänster som nämns i projektet finns bland annat:

  • Flux
  • Midjourney
  • Kling
  • Sora
  • Veo
  • Seedream
  • Wan
  • Hailuo
  • Nano Banana
  • GPT-baserade bildmodeller
  • LTX-modeller
  • olika modeller för lip sync och bildredigering

Alla dessa modeller körs dock inte lokalt. Många nås genom Muapi.ai, som fungerar som ett API-lager mot olika generativa modeller.

Bild, video, lip sync och workflows i samma app

Open Generative AI är uppdelat i flera specialiserade arbetsytor.

Image Studio

Image Studio växlar automatiskt mellan text-till-bild och bild-till-bild beroende på om användaren laddar upp en referensbild.

Projektet listar över 50 modeller för text-till-bild och över 50 modeller för bildredigering och image-to-image. Vissa modeller kan använda flera referensbilder samtidigt – i vissa fall upp till 14 bilder.

Det gör verktyget intressant för exempelvis:

  • produktbilder
  • sociala medier
  • stilöverföring
  • konceptbilder
  • bildredigering med naturligt språk
  • variationer utifrån flera referenser

Video Studio

Video Studio använder samma princip och växlar mellan text-till-video och bild-till-video.

Repositoryt listar över 40 text-till-video-modeller och över 60 modeller för bild-till-video. Bland namnen finns Kling, Veo, Wan, Seedance, Hailuo och andra moderna videogeneratorer.

Det betyder att användaren i teorin kan testa flera olika videogeneratorer från samma gränssnitt i stället för att bygga separata integrationer för varje leverantör.

Lip Sync Studio

En separat Lip Sync Studio kan kombinera porträtt eller video med ljud och skapa talande videoklipp.

Projektet beskriver nio dedikerade modeller för lip sync, bland annat LTX, Infinite Talk och Wan-baserade alternativ.

Workflow Studio

En av de mer avancerade delarna är Workflow Studio. Här kan användaren bygga flerstegsflöden med noder, där resultatet från en modell skickas vidare till nästa steg.

Det öppnar för arbetsflöden som:

  1. generera en bild,
  2. redigera bilden,
  3. animera den till video,
  4. lägga till tal eller lip sync,
  5. skicka resultatet vidare i ett automatiserat flöde.

För utvecklare är detta sannolikt mer intressant än själva gränssnittet, eftersom det gör projektet till en möjlig grund för egna generativa medieverktyg.

Version 2.0.0 lägger till ljud, Vibe Motion och Design Agent

Den senaste markerade releasen är v2.0.0, publicerad den 23 maj 2026.

Versionen lade bland annat till:

  • Audio Studio
  • Vibe Motion
  • ett nytt verktyg för AI clipping
  • Design Agent
  • språkväxling mellan engelska och kinesiska
  • förbättringar av MCP/CLI-studion
  • möjlighet att välja egen lagringsplats för lokala AI-modeller
  • förbättrad Linux-paketering

Version 2.0.0 finns som färdig desktopapp för macOS Apple Silicon, macOS Intel, Windows och Linux.

Bild från Open Generative AI-repositoryt

Kan Open Generative AI köras lokalt?

Ja – men här är en viktig skillnad.

Open Generative AI är open source och kan köras på den egna datorn, men det betyder inte att alla modeller i gränssnittet körs lokalt.

Desktopappen har två huvudsakliga vägar för lokal inference:

1. stable-diffusion.cpp / sd.cpp

Den inbyggda lokala motorn använder `stable-diffusion.cpp` och kan bland annat använda:

  • CPU
  • Apple Metal på Apple Silicon
  • CUDA
  • Vulkan
  • ROCm

Projektet listar exempelvis DreamShaper, Realistic Vision, Anything och Z-Image som lokala alternativ.

På Mac är Metal-accelerationen särskilt intressant eftersom den gör att vissa bildmodeller kan köras direkt på en M-serie-Mac utan en separat Nvidia-GPU.

Utvecklarna rekommenderar omkring 16 GB RAM för de tyngre Z-Image-varianterna. För enklare SD 1.5-modeller är kraven lägre.

2. Wan2GP

För större bild- och videogeneratorer kan appen ansluta till en separat Wan2GP-server.

Detta är i praktiken en "bring your own server"-lösning. Själva desktopappen kan exempelvis ligga på en Mac, medan den tunga inferensen körs på en annan Linux- eller Windows-maskin med Nvidia- eller AMD-GPU.

Det gör arkitekturen flexibel, men det är viktigt att förstå att detta inte är samma sak som att stora video-AI-modeller plötsligt kan köras snabbt lokalt på vilken laptop som helst.

Är Open Generative AI verkligen gratis?

Själva programvaran är gratis och open source. Koden ligger på GitHub och licensen är MIT.

Men formuleringen "gratis AI-bild- och videogenerering" behöver nyanseras.

För många av de hundratals modeller som finns i gränssnittet krävs en Muapi API-nyckel. API-anrop kan medföra kostnader beroende på modell och användning.

Det finns alltså tre olika saker att hålla isär:

| Del | Kostnad | |---|---| | Open Generative AI-koden | Gratis, MIT | | Lokala modeller på egen hårdvara | Ingen API-kostnad, men kräver egen dator/GPU | | Molnmodeller via Muapi | Kan innebära API-kostnader |

Det är en viktig skillnad för den som jämför projektet med exempelvis lokala Stable Diffusion-gränssnitt.

"Inga innehållsfilter" är projektets egen positionering

Projektet marknadsför sig uttryckligen som en plattform utan centrala promptfilter och utan samma typ av låst ekosystem som många kommersiella AI-tjänster.

Det bör tolkas som projektets egen produktpositionering, inte som att alla underliggande modeller eller API-leverantörer saknar regler, tekniska begränsningar eller användarvillkor.

Den som använder externa modell-API:er behöver fortfarande följa respektive leverantörs villkor och tillämplig lagstiftning.

Stöd för Mac med Apple Silicon

För Mac-användare är projektet extra intressant eftersom det finns en separat ARM64-version för Apple Silicon.

Projektet uppger stöd för Metal-acceleration i den lokala `sd.cpp`-motorn. Det innebär att vissa bildmodeller kan använda GPU-delen i M1, M2, M3 och M4 i stället för att enbart köra på CPU.

För tyngre videogenerering är läget annorlunda. Wan2GP-vägen kräver i dag en separat server med lämplig Nvidia- eller AMD-GPU för de tyngre modellerna.

Så installerar du Open Generative AI

Det enklaste är att använda en färdig release från GitHub.

Desktopversioner finns för:

  • macOS Apple Silicon
  • macOS Intel
  • Windows x64
  • Linux AppImage
  • Debian/Ubuntu `.deb`

Utvecklare kan även klona projektet:

git clone --recurse-submodules https://github.com/Anil-matcha/Open-Generative-AI.git
cd Open-Generative-AI
npm run setup
npm run electron:dev

För webbläsarversionen kan utvecklingsservern startas med:

npm run dev

Repositoryt anger Node.js 18 eller senare som förutsättning för utvecklingsvägen.

> Mac-användare: projektets desktopapp är enligt dokumentationen inte notariserad av Apple. macOS kan därför blockera första starten via Gatekeeper. Använd bara installationsfiler från projektets officiella GitHub Releases-sida och kontrollera alltid vad du installerar.

Tekniken bakom

Kodbasen använder bland annat:

  • Next.js
  • React
  • Electron
  • Vite
  • Tailwind CSS
  • npm workspaces

Själva studion ligger som ett delat paket i `packages/studio`. Modellkonfigurationer och API-integrationer samlas centralt, vilket gör det möjligt för både desktop- och webbversionen att använda samma grund.

Version 2.0.0 använder enligt projektets `package.json` bland annat Next.js 15, React 19 och Electron 33.

Varför projektet är intressant

Det finns redan många AI-gränssnitt för Stable Diffusion, bildgenerering och video. Open Generative AI skiljer sig främst genom bredden.

I stället för att fokusera på en modell försöker projektet samla:

  • bildgenerering
  • video
  • ljud
  • lip sync
  • AI-agenter
  • design
  • clipping
  • workflows
  • lokala modeller
  • molnmodeller
  • MCP och CLI

i samma produkt.

Det kan göra Open Generative AI särskilt intressant för utvecklare, kreatörer och små team som vill bygga en egen AI-studio utan att börja från noll.

Samtidigt gör bredden projektet mer komplext. Användaren behöver förstå vilka modeller som körs lokalt, vilka som går genom Muapi och vilka kostnader och villkor som gäller för respektive tjänst.

YouTube

Projektets nuvarande README länkar till följande Muapi-tutorial:

▶ Se: How to Access Midjourney API (V8, V7, Niji) på YouTube

![YouTube-video om Midjourney API via Muapi](https://www.youtube.com/watch?v=uhy7aRW4HUU)

Det finns även en fristående visualisering av repositoryts utvecklingshistorik:

▶ Se: Anil-matcha/Open-Generative-AI – Gource visualisation

Vanliga frågor om Open Generative AI

Är Open Generative AI open source?

Ja. Projektets källkod publiceras på GitHub under MIT-licens.

Kan Open Generative AI köras på Mac?

Ja. Det finns en färdig Apple Silicon-version och projektets lokala `sd.cpp`-motor kan använda Metal på M-serie-Macar.

Kan alla modeller köras lokalt?

Nej. Vissa bildmodeller kan köras via den lokala motorn, medan många andra modeller används genom Muapi eller genom en separat Wan2GP-server.

Är all bild- och videogenerering gratis?

Nej. Själva programvaran är gratis och open source, men användning av externa modell-API:er kan kosta pengar.

Vilken är den senaste versionen?

Den senaste markerade GitHub-releasen vid publicering är v2.0.0, släppt den 23 maj 2026.

Källor

Primärkällor:

  • GitHub repository: https://github.com/Anil-matcha/Open-Generative-AI
  • README: https://github.com/Anil-matcha/Open-Generative-AI/blob/main/README.md
  • Releases: https://github.com/Anil-matcha/Open-Generative-AI/releases
  • Version 2.0.0: https://github.com/Anil-matcha/Open-Generative-AI/releases/tag/v2.0.0
  • package.json: https://github.com/Anil-matcha/Open-Generative-AI/blob/main/package.json
  • MIT-licens: https://github.com/Anil-matcha/Open-Generative-AI/blob/main/LICENSE
  • Projektets bildmaterial: https://github.com/Anil-matcha/Open-Generative-AI/tree/main/docs/assets
  • Hosted version / Muapi: https://muapi.ai/open-generative-ai

YouTube:

  • Muapi tutorial – Midjourney API: https://www.youtube.com/watch?v=uhy7aRW4HUU
  • Gource repository visualization: https://www.youtube.com/watch?v=97NUGY0GuCk

Läs mer om ämnet

Open Generative AI AI bildgenerator AI videogenerator open source AI lokal AI Apple Silicon

Källor