AI-guider

Guide: Superlinked SIE – kör över 100 öppna AI-modeller på din egen dator

Superlinked SIE låter dig köra embeddings, reranking, OCR och öppna AI-modeller på egen dator eller server. Så fungerar det – och så provar du själv.

Superlinked SIE – open source-inferensmotor för AI-agenter

De flesta guider om lokal AI börjar med en enda modell och en enda server. Superlinked SIE löser i stället problemet som AI-utvecklare faktiskt möter: en app behöver flera specialiserade modeller – embeddings, reranking, OCR, entity extraction och en språkmodell – helst bakom ett gemensamt API. Här är guiden som tar dig från noll till en körande inferensmotor på din Mac.

SIE är inte en ny AI-modell och inte en konkurrent till ChatGPT. Det är en open source-inferensmotor (Apache 2.0) som laddar, kör och delar resurser mellan många olika öppna modeller. En AI-agent kan till exempel behöva en embeddingmodell för sökning, en reranker för att sortera resultat, en OCR-modell för dokument och en LLM för själva svaret. SIE samlar hela det lagret bakom ett system – på din egen dator, server eller i molnet.

Så kopplar SIE en AI-agent till flera olika AI-modeller

Enligt projektets README stöds 100+ modeller; Superlinkeds egen katalog visade 112 modeller vid verifiering den 7 augusti 2026.

Vad du behöver

  • En Mac med Apple Silicon (M1 eller senare)
  • Python 3.12 installerat
  • Terminal
  • Några GB ledigt diskutrymme för modellvikter
  • (Linux med NVIDIA fungerar också
  • stegen nedan gäller Apple Silicon)
Fyra steg för att prova Superlinked SIE lokalt på Mac

Steg 1: Kontrollera Python 3.12

Öppna Terminal och kör:

python3.12 --version

Om kommandot saknas installerar du Python 3.12 först (till exempel via python.org eller Homebrew).

Steg 2: Skapa en testmapp

mkdir -p ~/Desktop/sie-test
cd ~/Desktop/sie-test

Steg 3: Skapa en virtuell miljö

python3.12 -m venv .venv
source .venv/bin/activate

Steg 4: Installera SIE

pip install "sie-server[local]"

Tillägget [local] inkluderar stöd för lokala modellkörningar.

Steg 5: Starta servern

sie-server serve

Servern körs normalt på http://localhost:8080.

Steg 6: Kontrollera att servern är igång

Öppna en ny Terminal och kör:

curl http://localhost:8080/readyz

Förväntat svar:

ok

Du vet att det fungerar när: kommandot skriver ok.

Steg 7: Kör din första modell

Testa embeddings med en liten modell:

curl http://localhost:8080/v1/embeddings \
 -H 'Content-Type: application/json' \
 -d '{
 "model": "sentence-transformers/all-MiniLM-L6-v2",
 "input": "Hej världen"
 }'

Första gången modellen används laddar SIE ner vikterna från Hugging Face. Senare anrop använder den lokala cachen.

Du vet att det fungerar när: servern svarar med en vektor på 384 dimensioner.

Steg 8: Prova Python SDK

Installera SDK:t:

pip install sie-sdk

Skapa filen test.py:

from sie_sdk import SIEClient
from sie_sdk.types import Item

client = SIEClient("http://localhost:8080")

result = client.encode(
 "sentence-transformers/all-MiniLM-L6-v2",
 Item(text="AI förändrar hur vi söker information")
)

print(result["dense"].shape)

Kör:

python test.py

Du vet att det fungerar när: utskriften blir (384,) – texten har blivit en embedding med 384 dimensioner.

Steg 9: Prova reranking

Reranking sorterar sökträffar efter verklig relevans – särskilt värdefullt i RAG-system. Testa med en cross-encoder:

from sie_sdk import SIEClient
from sie_sdk.types import Item

client = SIEClient("http://localhost:8080")

scores = client.score(
 "cross-encoder/ms-marco-MiniLM-L-6-v2",
 Item(text="Vad är maskininlärning?"),
 [
 Item(text="Maskininlärning använder data för att lära modeller."),
 Item(text="Det ska regna imorgon.")
 ]
)

print(scores)

Du vet att det fungerar när: dokumentet om maskininlärning får högre poäng än väderraden.

Steg 10: Prova entity extraction

SIE kan plocka strukturerad information ur vanlig text:

result = client.extract(
 "urchade/gliner_multi-v2.1",
 Item(text="Tim Cook är vd för Apple."),
 labels=["person", "organization"]
)

print(result["entities"])

Du vet att det fungerar när: Tim Cook identifieras som person och Apple som organisation.

Felsökning

Problem: python3.12: command not found Trolig orsak: Python 3.12 saknas eller ligger inte i PATH. Lösning: Installera Python 3.12 och kontrollera med python3.12 --version igen.

Problem: Port 8080 är upptagen Trolig orsak: En annan tjänst använder porten. Lösning: Stoppa tjänsten eller starta SIE med en annan port enligt dokumentationen, och uppdatera sedan SDK-adressen i koden.

Problem: Första anropet tar lång tid Trolig orsak: Modellvikterna laddas ner från Hugging Face första gången. Lösning: Vänta – efterföljande anrop går från den lokala cachen.

Problem: Jag vill inte skicka telemetri Trolig orsak: Anonym telemetri (version, OS, arkitektur, GPU-typ) är på som standard. Lösning: Sätt export SIE_TELEMETRY_DISABLED=1 eller export DO_NOT_TRACK=1 innan du startar servern. Enligt README samlas IP-adresser, hostnames och request-data inte in.

Mer avancerade funktioner

SIE:s roll mellan AI-agent, modeller och hårdvara
  • OpenAI-kompatibelt API
  • /v1/embeddings, /v1/chat/completions, /v1/completions och /v1/responses. Appar som redan pratar med OpenAI kan ofta byta serveradress i stället för att skriva om koden.
  • Dokumentpipeline
  • PDF → Markdown, Office-filer, OCR och skannade dokument (till exempel LightOnOCR, GLM-OCR, MinerU och Docling).
  • Content safety
  • köra egna modereringsmodeller lokalt i stället för att skicka innehåll till en extern leverantör.
  • Lokala LLM:er
  • projektets README visar Qwen3-0.6B som ett enkelt generationsexempel. På Linux med NVIDIA används en särskild generation-image; på Apple Silicon hänvisar Superlinked till MLX-vägen i quickstarten.
  • Produktionsstack
  • load-balancing gateway, worker pools, KEDA autoscaling, scale-to-zero, Grafana, Helm och Terraform för GKE, EKS och AKS. Air-gapped drift utan publik internetåtkomst är dokumenterad.

SIE ersätter inte vektordatabaser (Qdrant, Chroma, Weaviate, LanceDB) eller agentramverk (LangChain, LlamaIndex, CrewAI, DSPy) – det kompletterar dem med själva inferenslagret.

Skillnaden mot Ollama: Ollama är enklare när du bara vill chatta med en lokal LLM. SIE är relevant när du bygger en applikation som behöver flera modelltyper som delar GPU-resurser – reranking, entity extraction och OCR är inte Ollamas huvudfokus, och SIE kan hålla många modeller i samma miljö med LRU-eviction av GPU-minne.

Video-tutorial

(lägg till din YouTube-länk)

Källa


Källa: Superlinked (GitHub + officiella sidor)

Relaterade guider

Superlinked SIE lokal AI open source AI-agent RAG embeddings inference

Källor