Cost & Model Operations
Control inference cost, choose hosting patterns, route models, and understand operational trade-offs.
13 historier (6 artikler · 7 videoer)
Start her
Et par gode steder at begynde, før du går på opdagelse i hele oversigten.
10 min læsningOrkestrering af flere modeller: Routing efter omkostning, latenstid og kvalitet
At bruge én model til alt er en begynderfejl. AI-systemer i produktion sender forskellige forespørgsler til forskellige modeller og sparer 60-90% i omkostninger, samtidig med at kvaliteten forbedres. Her er mønstrene, routinglogikken og afvejningerne.
Let øvet
12 min læsningOmkostningsoptimering af inferens: promptcaching, routing og outputkontrol
LLM-inferensomkostninger kan reduceres med 60-90% med de rigtige teknikker. Promptcaching, modelrouting, outputkontrol, batching og nogle mindre kendte mønstre. Her er tallene, mønstrene og den produktionsdisciplin, der adskiller veldrevet inferens fra en løbsk regning.
Avanceret
11 min læsningSelvhostet kontra hostet inferens: vLLM, TGI og break-even-regnestykket
Ved hvilken skala slår selvhosting API-kald? Det faktiske regnestykke, de driftsmæssige realiteter og de mønstre, der adskiller teams, som bør selvhoste, fra teams, som fortsat bør betale for administreret inferens.
AvanceretFlere i dette emne
13 min læsningLLM-stacken i 2026: modeller, inferens, værktøjer og afvejninger
En praktiserende arkitekts blik på LLM-stacken i 2026 — modelniveauer, inferensudbydere, orkestreringslag, evalueringsværktøjer og de afvejninger, der faktisk betyder noget, når AI sættes i produktion.
Avanceret
6 min læsningGratis eller betalt ChatGPT: Det får du faktisk med en opgradering
En sammenligning uden jargon mellem gratis ChatGPT, ChatGPT Plus og ChatGPT Pro — hvad der ændres, når du opgraderer, og hvordan du afgør, om du overhovedet har brug for det.
Ny inden for AI
10 min læsningLokal AI på din Mac: Ollama, LM Studio, og hvad 7B-modeller reelt kan
Lokal AI er blevet moden. Med Ollama eller LM Studio og en moderne Mac kan du køre kompetente modeller offline, gratis og privat. Her er, hvad der virker, hvad der ikke gør, og hvilke anvendelser der reelt har gavn af det.
Let øvet
Dybdegående gennemgang af LLM'er som ChatGPT
Andrej Karpathy.
Avanceret
Andrej Karpathy: Software Is Changing (Again)
Y Combinator.
Avanceret
Is This the End of RAG? Anthropic's NEW Prompt Caching
Prompt Engineering.
Avanceret
Build Hour: Prompt Caching
OpenAI.
Avanceret
Alle AI-modeller forklaret
Tina Huang.
Let øvet
RouteLLM opnår 90% GPT-4o-kvalitet OG 80% BILLIGERE
Matthew Berman.
Let øvet
Fast LLM Serving with vLLM and PagedAttention
Anyscale.
Avanceret