Per miljon tokens, i SEK. Listan hämtas direkt från gatewayen — det du ser här är de modeller som faktiskt kör just nu, till det pris som faktiskt debiteras. Du betalar i förskott och användningen dras från ditt saldo; betalt belopp × 1,3 blir ditt saldotak.
fast
Svarar direkt utan att tänka först: snabbast och billigast per fråga. Extraktion, klassificering, JSON, korta kundtjänstsvar.
Modell: Qwen2.5-32B-Instruct (AWQ) · kontextfönster 8 192 tokens (in och ut delar på fönstret)
fast-budget
· budget
Samma modell som fast till halva priset. Rabatten betalar du med väntetid: anropen körs bara när ingen ordinarie förfrågan väntar. Ingen SLA — för batchjobb, inte interaktivt.
Modell: Qwen2.5-32B-Instruct (AWQ) · kontextfönster 8 192 tokens (in och ut delar på fönstret)
performance
Samma motor som deepthinking men utan tänk-steget: bra på flerstegsuppgifter, analys och kod utan att kosta extra ut-tokens.
Modell: Qwen3.8-27B (FP8) · kontextfönster 90 112 tokens (in och ut delar på fönstret)
performance-budget
· budget
Samma modell och tänk-nivå som performance, till halva priset, sist i kön.
Modell: Qwen3.8-27B (FP8) · kontextfönster 90 112 tokens (in och ut delar på fönstret)
deepthinking
Resonerar igenom problemet innan svaret: skattelogik, juridik, komplicerade beräkningar. Tänkandet räknas som ut-tokens, så ett svar kostar mer och tar längre tid. Rekommenderat max_tokens 4 000+.
Modell: Qwen3.8-27B (FP8) · kontextfönster 90 112 tokens (in och ut delar på fönstret)
deepthinking-budget
· budget
Fullt resonemang till halva priset, sist i kön — billigaste sättet att låta modellen tänka länge på svåra jobb över natten.
Modell: Qwen3.8-27B (FP8) · kontextfönster 90 112 tokens (in och ut delar på fönstret)
vision
Läser fakturor, kvitton, skärmdumpar och foton. Mätt på riktiga kvitton: 19 av 20 totalbelopp exakt rätt. Felen syns inte — du får giltig JSON med fel siffra — så validera alltid kontrollsiffror, datum och summor. Skala upp små bilder före anropet.
Modell: Qwen3-VL-8B-Instruct · kontextfönster 12 288 tokens (in och ut delar på fönstret)
vision-budget
· budget
Samma bildmodell som vision, till halva priset, sist i kön. Lämpligt för att beta av en hög med fakturor eller kvitton över natten.
Modell: Qwen3-VL-8B-Instruct · kontextfönster 12 288 tokens (in och ut delar på fönstret)
transcribe
Svensk taligenkänning från Kungliga bibliotekets modell, tränad på svenska. Mätt på FLEURS: 6,87 % ordfelsfrekvens mot 8,65 % för vanliga Whisper large. Ungefär 11 gånger snabbare än realtid. Skicka ljudfilen till /v1/audio/transcriptions.
Modell: KBLab/kb-whisper-large
transcribe-meeting
Tal till text med talarseparering: varje yttrande får en talaretikett och en tidsstämpel. Gjord för möten där flera delar samma mikrofon — på en styrelseinspelning hittade den rätt antal talare, sju av sju. Etiketterna är anonyma (SPEAKER_00 …); namnen sätts utifrån sammanhanget. Vet du hur många som var med, skicka num_speakers — då kan den inte hitta på fler. segmentation=whisper ger kortare bitar med en etikett var, för chattvyer. För telefonsamtal i stereo: använd transcribe per kanal i stället, kanalen säger redan vem som talar. Ett timslångt möte tar några minuter.
Modell: KB-Whisper large + pyannote 3.1
speak
Svensk talsyntes, tre röster, snabbare än realtid. Tydlig och fullt begriplig men hörbart syntetisk — gjord för talsvar och bekräftelser, inte för att låta som en människa. Anropet MÅSTE ange voice. Skicka texten till /v1/audio/speech.
Modell: Piper (sv_SE: alma, lisa, nst)
claude-haiku-4-5
Kompatibilitetsnamn
Detta är INTE Anthropics Claude. Namnet finns bara för att Claude Desktop och liknande klienter vägrar modellnamn som inte ser ut som Anthropics. Bakom namnet ligger exakt samma fast-nivå som ovan, på vår hårdvara i Gävle, till samma pris.
Modell: Qwen2.5-32B-Instruct (AWQ) · kontextfönster 8 192 tokens (in och ut delar på fönstret)
claude-sonnet-4-5
Kompatibilitetsnamn
Detta är INTE Anthropics Claude. Kompatibilitetsnamn för klienter som kräver ett Anthropic-liknande modellnamn; bakom det ligger performance-nivån, samma pris.
Modell: Qwen3.8-27B (FP8) · kontextfönster 90 112 tokens (in och ut delar på fönstret)
claude-opus-4-1
Kompatibilitetsnamn
Detta är INTE Anthropics Claude. Kompatibilitetsnamn för klienter som kräver ett Anthropic-liknande modellnamn; bakom det ligger deepthinking-nivån, samma pris.
Modell: Qwen3.8-27B (FP8) · kontextfönster 90 112 tokens (in och ut delar på fönstret)
extern-gpt-oss-120b
Lämnar Sverige · på begäran
OpenAI:s öppna 120-miljardersmodell, köpt av extern leverantör. Starkare på svåra resonemang än något vi kan köra själva på fyra kort, och 131 000 tokens kontext. MEN: anropet lämnar Sverige. Leverantörer som sparar eller tränar på det du skickar är bortvalda, men datan behandlas utomlands. Aktiveras per nyckel på begäran — hör av dig så öppnar vi den.
Modell: OpenAI gpt-oss-120b via OpenRouter · kontextfönster 131 072 tokens (in och ut delar på fönstret)
Valfri OpenAI-kompatibel klient: Base URL
https://api.pellesprocessor.se, modellnamnet från listan ovan, och en
API-nyckel du skapar under Mitt konto.
Alla modeller ovan körs på vår egen hårdvara i Gävle, med ett undantag som är märkt Lämnar Sverige och bara öppnas på begäran. Datan lämnar maskinen bara om reservlinjen används — den slår in automatiskt när riggen inte går att nå, och går att stänga av per nyckel eller konto under Mitt konto.
Budget-varianterna är samma modell till halva priset, men läggs sist i kön och körs bara när ingen ordinarie förfrågan väntar. Ingen SLA — gjorda för batchjobb, inte för något någon sitter och väntar på.
Pelle Pilot AB · Integritetspolicy · AI@pellepilot.com