Cost & Model Operations
Control inference cost, choose hosting patterns, route models, and understand operational trade-offs.
13 historier (6 artikler · 7 videoer)
Start her
Et par gode steder at begynde, før du går på opdagelse i hele oversigten.
10 min læsningOrkestrering af flere modeller: routing efter omkostninger, latenstid og kvalitet
Routing af forskellige opgaver til forskellige modeller kan reducere omkostninger eller latenstid, men kun evaluering af den konkrete arbejdsbelastning kan vise, om den ekstra kompleksitet betaler sig. Her er mønstrene, målingerne og fejltilstandene.
Let øvet
12 min læsningOptimer inferensomkostninger: cachelagring af prompts, styring af modelvalg og kontrol af output
Byg en sporingsbaseret omkostningsmodel for inferens, optimér de største målte omkostningsposter, og dokumentér, at hver ændring bevarer opgavekvaliteten.
Avanceret
11 min læsningSelvhostet eller administreret inferens: en efterprøvbar nulpunktsmodel
Hvornår slår selvhosting API-kald? Beregningerne, de praktiske driftsforhold og de mønstre, der adskiller teams, der bør selvhoste, fra dem, der bør fortsætte med at betale for administreret inferens.
AvanceretFlere i dette emne
13 min læsningLLM-stacken i 2026: modeller, inferens, værktøjer og afvejninger
En praktiserende arkitekts blik på LLM-stacken i 2026 — modelniveauer, inferensudbydere, orkestreringslag, evalueringsværktøjer og de afvejninger, der faktisk betyder noget, når AI sættes i produktion.
Avanceret
6 min læsningGratis eller betalt ChatGPT: Det får du faktisk med en opgradering
En sammenligning uden jargon mellem gratis ChatGPT, ChatGPT Plus og ChatGPT Pro — hvad der ændres, når du opgraderer, og hvordan du afgør, om du overhovedet har brug for det.
Ny inden for AI
10 min læsningLokal AI på din Mac: Ollama, LM Studio, og hvad 7B-modeller reelt kan
Lokal AI er blevet moden. Med Ollama eller LM Studio og en moderne Mac kan du køre kompetente modeller offline, gratis og privat. Her er, hvad der virker, hvad der ikke gør, og hvilke anvendelser der reelt har gavn af det.
Let øvet
211 minutterDybdegående gennemgang af LLM'er som ChatGPT
Andrej Karpathy. Dette er den klareste end-to-end-forklaring på YouTube af, hvad en LLM faktisk er — pretraining, tokenization, SFT, RLHF, reasoning RL, tool use, hallucinationer — på det detaljeniveau, en ingeniør behøver for at ræsonnere om model-trade-offs. Se den én gang, og beslutningerne "GPT-class vs. open-weights vs. reasoning model" i artiklen holder op med at føles som brandvalg og begynder at føles som valg af træningsopskrift.
Avanceret
40 minutterAndrej Karpathy: Software ændrer sig (igen)
Y Combinator. Karpathys AI Startup School-keynote rammesætter LLM'er som en ny slags computer — utility, fab og OS rullet sammen — og argumenterer for "partial autonomy"-produkter med et menneske-kontrolleret leash. Det er den klareste artikulation af den stack-niveau mentale model, artiklen antager: at du vælger inferensvendors og tooling til et programmerbart substrate, ikke en chatbot.
Avanceret
19 minutterEr det slutningen på RAG? Anthropics NYE prompt-caching
Prompt Engineering. Gennemgår Anthropics promptcaching op mod Geminis context caching med konkrete latenstid- og omkostningsreduktioner pr. use case (long-document chat, few-shot, multi-turn). Nedbrydningen af cache-write-tillæg kontra cache-read-rabat er præcis det, artiklen antager, når den taler om, hvornår caching betaler sig.
Avanceret
56 minutterBuild Hour: prompt-caching
OpenAI. OpenAIs egen Build Hour om promptcaching — 1024-token-tærsklen, kravet om prefix-stabilitet, stejle audio-caching-rabatter for realtime (tjek den aktuelle prisside for den præcise sats), time-to-first-token-effekter ved lange inputs. Nyttig, når du dimensionerer engineering-indsatsen for faktisk at ramme cachen pålideligt på dine produktionsprompts.
Avanceret
19 minutterAlle AI-modeller forklaret
Tina Huang. En overskuelig gennemgang af det aktuelle modellandskab opdelt i flagskibsmodeller, letvægtsmodeller, mellemklassen og specialiserede modeller med konkrete eksempler på, hvad hvert niveau egner sig til. Videoen dækker den del af artiklen, der handler om at kende mulighederne før routing, og Huang beskriver afvejningen mellem omkostning og kapacitet uden at gøre benchmarkresultater til hele beslutningsgrundlaget.
Let øvet
9 minutterRouteLLM opnår 90% GPT-4o-kvalitet OG 80% BILLIGERE
Matthew Berman. Videoen gennemgår LMSYS' RouteLLM-artikel og kode. En lille klassifikator placeres foran et par af stærke og svage modeller og vælger, hvilken model der skal kaldes. I den viste evaluering nås omtrent 95% af den stærke models kvalitet til en brøkdel af omkostningen. Visningstallet ligger under den sædvanlige grænse på 100k, men videoen viser konkret modelrouting frem for blot at sammenligne modeller og passer derfor direkte til artiklens afvejning mellem kvalitet og omkostninger.
Let øvet
32 minutterHurtig LLM-inferens med vLLM og PagedAttention
Anyscale. Præsentationen rapporterer, at en enkel LLM-server i det viste miljø spilder 60–80 % af GPU-hukommelsen, forklarer hvordan PagedAttention bruger en sideinddeling inspireret af operativsystemer, og viser de 24×-tal for gennemløb, som artiklen omtaler. Tallene stammer fra den beskrevne opsætning og udgør ikke et generelt sammenligningsgrundlag. De giver kontekst til artiklens forsigtige antagelse om 50 % udnyttelse.
Avanceret