Production LLM Apps
Architect, ship, observe, and operate LLM applications after the demo stage.
34 historier (23 artikler · 11 videoer)
Start her
Et par gode steder at begynde, før du går på opdagelse i hele oversigten.
13 min læsningLLM-stacken i 2026: modeller, inferens, værktøjer og afvejninger
En praktiserende arkitekts blik på LLM-stacken i 2026 — modelniveauer, inferensudbydere, orkestreringslag, evalueringsværktøjer og de afvejninger, der faktisk betyder noget, når AI sættes i produktion.
Avanceret
12 min læsningDesign af produktionsprompts: system-, udvikler- og brugerlag
Et styringsmønster til at adskille betroede instruktioner, runtime-data og brugerinput og derefter versionere, evaluere, udrulle og observere prompts efter risiko.
Avanceret
10 min læsningFejltilstande i AI-produktion: det, der går i stykker efter demoen
AI-systemer fejler som regel på forudsigelige måder: hallucinationer, forældet kontekst, medløberi, prompt injection, usikker værktøjsbrug, skemadrift og svage fallbacks. Et register over fejltilstande til teams, der sætter reelle workflows i produktion.
AvanceretFlere i dette emne
8 min læsningHermes vs n8n: vælg efter opgaven (og hvornår du skal bruge begge)
En beslutningsramme for Hermes Agent over for n8n: Deterministisk integrationslogik bliver i n8n, mens et Hermes-API-trin med bearer-autentificering eller et særskilt forløb for hændelseswebhooks håndterer afgrænset agentarbejde.
Let øvet
8 min læsningOpenClaw vs Hermes: vælg efter jobbet, ikke brandet
OpenClaw og Hermes er overlappende agentsystemer i egen drift med forskellige driftsmæssige styrker. Sammenlign kanalrouting, webhooks, værktøjer og automatiseringsgrænser, før du vælger det ene, det andet eller begge.
Let øvet
10 min læsningEksperimentel stak med to DGX Spark-enheder, DeepSeek-V4-Flash, n8n og Hermes
Sådan evaluerer du en eksperimentel fællesskabsudviklet løsning med to DGX Spark-systemer til DeepSeek-V4-Flash, hvor n8n håndterer den deterministiske del og Hermes vurderingsopgaverne.
Avanceret
69 minutterAgentlandskabet – erfaringer fra at sætte agenter i produktion
MLOps.community. Prosus' VP of AI og en AI-ingeniør rapporterer, hvad der faktisk brød, da de deployede agenter på tværs af gruppens porteføljevirksomheder: promptinjektion-pentest før launch, en usikker write, da en Jira-agent fejlede på menneskelig stenografi, forældet kontekst håndteret ved at få agenter til at synliggøre deres antagelser, og fallback-design, der merged eller dræbte agenter, når de tilføjede cognitive load. Det læser som artiklens fejltilstandsregister genafspillet som en live postmortem.
Avanceret
11 min læsningLangGraph vs. CrewAI vs. direkte API: valg af agentframework i 2026
Landskabet for agentframeworks er i 2026 mere modent, men ikke mere overskueligt. LangGraph, CrewAI, Pydantic AI, OpenAI Agents SDK og direkte API passer hver til nogle teams og projekter, men ingen passer til alle. Her får du en ærlig sammenligning og en beslutningsramme.
Avanceret
13 min læsningDesign af agenter, der ikke fortsætter i det uendelige
Den mest almindelige fejl for produktionsagenter er uendelige eller næsten uendelige løkker — agenter, der prøver igen, forgrener sig og bruger tokens uden at gøre fremskridt. Her er de arkitekturmønstre, der forhindrer det og skaber agenter, som afslutter selv svære opgaver.
Avanceret
12 min læsningComputerstyring og browseragenter i produktion
Computerstyring og browseragenter skaber virale demoer. Produktionsklare implementeringer i stor skala ser anderledes ud — afgrænset omfang, stærke sikkerhedsforanstaltninger og fokus på brugeroplevelsen. Her er de mønstre, der virker, de fejl, vi fortsat ser, og den reelle økonomi.
Avanceret
12 min læsningKontekstengineering: håndtering af 1M-tokenvinduer uden kontekstforringelse
Der findes kontekstvinduer på 1M tokens, men kvaliteten forringes længe før grænsen nås. Kontekstengineering er disciplinen i at bruge kontekstvinduer effektivt — hvad der skal medtages, hvad der skal sammenfattes, hvad der skal hentes på ny, og hvilke mønstre der holder kvaliteten høj, når konteksten vokser.
Avanceret
12 min læsningOptimer inferensomkostninger: cachelagring af prompts, styring af modelvalg og kontrol af output
Byg en sporingsbaseret omkostningsmodel for inferens, optimér de største målte omkostningsposter, og dokumentér, at hver ændring bevarer opgavekvaliteten.
Avanceret
13 min læsningSådan bygger du evalueringer, der faktisk opdager regressioner
De fleste evalueringssuiter ser imponerende ud, men overser reelle regressioner. Det kræver omhyggelig opbygning af datasæt, følsomme målinger, kalibrering af dommermodeller og en kultur præget af tillid at bygge evalueringer, der opdager det væsentlige. Her er mønstrene fra de teams, der lykkes med det.
Avanceret
13 min læsningFinjustering i 2026: et LoRA- og QLoRA-eksperiment med dokumentationen i centrum
Afgør, om parametereffektiv finjustering er berettiget, styr dataene, fastlås et reproducerbart eksperiment, sammenlign resultater på et adskilt testsæt og i sikkerhedstests, og mål modeldriften før idriftsættelse.
Avanceret
14 min læsningMCP fra bunden: byg en produktionsklar server i TypeScript
At bygge en produktionsklar Model Context Protocol-server kræver mere end at forbinde nogle få værktøjer. Her er mønstrene for skemadesign, godkendelse, fejlhåndtering, streaming og observabilitet samt de praktiske produktionsforhold, der gør MCP-servere nyttige i stor skala.
Avanceret
12 min læsningDesign MCP-værktøjer, som LLM'er faktisk bruger korrekt
De fleste MCP-værktøjer, vi ser, er teknisk korrekte, men praktisk talt ubrugelige. LLM'er ignorerer dem, bruger dem forkert eller foretager unødvendige kald. Her er principperne for at designe værktøjer, som LLM'er tager naturligt i brug, med eksempler på almindelige fejl og løsninger.
Avanceret
12 min læsningByg hukommelse til agenter med langvarige forløb
Agenter med langvarige forløb kræver et persistensdesign med en tydelig ejer: dokumenteret oprindelse, bekræftelse, isolering mellem lejere, test af søgning, regler for opbevaring, rettelse og verificerbar sletning.
Avanceret
10 min læsningOrkestrering af flere modeller: routing efter omkostninger, latenstid og kvalitet
Routing af forskellige opgaver til forskellige modeller kan reducere omkostninger eller latenstid, men kun evaluering af den konkrete arbejdsbelastning kan vise, om den ekstra kompleksitet betaler sig. Her er mønstrene, målingerne og fejltilstandene.
Let øvet
12 min læsningObserverbarhed i LLM-applikationer: sporing, omkostninger, svartid og kvalitetsændringer
Udvid almindelig observerbarhed med flertrinsspor, henførbare omkostninger, prompt- og modelversioner, evaluerede kvalitetssignaler, databeskyttelseskontroller og advarsler baseret på arbejdsbelastningen.
Avanceret
12 min læsningByg produktionsklar RAG: indlæsning, embeddings, søgning, reranking og evaluering
En produktionsklar RAG-pipeline består af seks faser, hvor konkrete mønstre afgør kvaliteten. Her er arkitekturen, valgene i hver fase og den iterative evalueringsdisciplin, der adskiller velfungerende RAG fra skuffende løsninger.
Avanceret
14 min læsningPromptinjektion og LLM-sikkerhed: trusselsmodeller og forsvar i dybden
Promptinjektion er en permanent klasse af LLM-sikkerhedsrisici, ikke en fejl i promptformuleringen. En produktionsguide til trusselsmodeller, datagrænser, værktøjsrettigheder, regressionstest, overvågning og hændelseshåndtering.
Avanceret
12 min læsningVælg mellem prompting, RAG og finjustering (og hvornår de skal kombineres)
Prompting, RAG og finjustering er de tre store greb til at tilpasse LLM'er til dit problem. De passer hver især til nogle problemer og ikke til andre. Her er en ramme for valget, de realistiske omkostninger og de produktionsmønstre, hvor kombinationen virker bedst.
Avanceret
13 min læsningLLM-produktets enhedsøkonomi: et evidensbaseret prisark
Kortlæg fordelingen af modelanvendelse, bidragsmargin, fejlhåndtering, support og kundefastholdelse før prisfastsættelsen. Dette ark erstatter udokumenterede markedsintervaller med efterprøvelige input.
Avanceret
13 min læsningStrukturerede output og funktionskald: produktionsmønstrene
Strukturerede output og funktionskald er broen fra 'LLM, der genererer tekst' til 'system, der udfører arbejde'. I produktion handler de vigtige mønstre om skemaer, fejlhåndtering, idempotens og kontrolleret forringelse — ikke kun JSON-tilstand.
Avanceret
211 minutterDybdegående gennemgang af LLM'er som ChatGPT
Andrej Karpathy. Dette er den klareste end-to-end-forklaring på YouTube af, hvad en LLM faktisk er — pretraining, tokenization, SFT, RLHF, reasoning RL, tool use, hallucinationer — på det detaljeniveau, en ingeniør behøver for at ræsonnere om model-trade-offs. Se den én gang, og beslutningerne "GPT-class vs. open-weights vs. reasoning model" i artiklen holder op med at føles som brandvalg og begynder at føles som valg af træningsopskrift.
Avanceret
40 minutterAndrej Karpathy: Software ændrer sig (igen)
Y Combinator. Karpathys AI Startup School-keynote rammesætter LLM'er som en ny slags computer — utility, fab og OS rullet sammen — og argumenterer for "partial autonomy"-produkter med et menneske-kontrolleret leash. Det er den klareste artikulation af den stack-niveau mentale model, artiklen antager: at du vælger inferensvendors og tooling til et programmerbart substrate, ikke en chatbot.
Avanceret
9 minutterLangSmith på 10 minutter
LangChain. En guidet tour af en LLM-trace, project og dataset af LangChains medstifter — token-omkostning, latenstid, fejlrate, feedback-aggregering, drill-down i et enkelt retrieval-step-span. Det er den nærmeste visuelle analog til det, artiklen beskriver, når den taler om "hvert kald er et span", og hvorfor strukturerede traces slår print-logging.
Avanceret
154 minutterInstrumentering og evaluering af LLM'er
Hamel Husain. Hamel Husain, Eugene Yan, Brian Bischof, Harrison Chase og Shreya Shankar arbejder sig igennem tracing, loganalyse, LLM-as-judge og arbejdsgangen omkring at se på rigtige produktionsdata. Sid med den på samme måde, som du ville med en lang podcast — det er den bedste dybe behandling af artiklens tese "se på dine traces" på YouTube.
Avanceret
77 minutterAI prompt engineering: En dybdegående gennemgang
Anthropic. Fire Anthropic prompt engineers (research, alignment, applied, developer relations) taler længe om, hvad de faktisk gør til daglig — hvordan de redigerer prompts under pres, hvordan de tænker om "honesty" i instruktioner, hvornår XML-scaffolds hjælper, hvornår de ikke gør. Artiklens lagdelte model mapper rent over på, hvordan de beskriver arbejdet; dette er den bedste måde at høre den mentale model højt.
Avanceret
25 minutterPrompting 101 | Code med Claude
Anthropic. En live-bygningssession af Anthropics Applied AI-team på en forsikringsclaims-prompt — de starter med en vag instruktion og itererer til noget, en udvikler faktisk ville shippe, og viser den slags revisioner, artiklen beskriver for system- og developer-lagene. Se den, før du genlæser artiklens tjekliste om eksempler, outputstruktur og refusal-håndtering.
Avanceret
42 minutterVertikale AI-agenter kan blive 10X større end SaaS
Y Combinator. Lightcone-værterne arbejder sig gennem, hvorfor vertikale AI-agenter — ikke horisontale wrappers — er den forsvarlige form for application-layer-virksomheder, med konkrete eksempler og et klart syn på, hvilke kategorier modeludbyderne vil æde. Det er anti-moat-fælden, artiklen advarede om, udtrykt som en positiv playbook.
Avanceret
34 minutterSådan genopfinder AI software-forretningsmodeller med Bret Taylor fra Sierra
Sequoia Capital. Bret Taylor gennemgår skiftet fra per-seat SaaS til outcomes-baseret prissætning — hvad du skal forankre i (resolution, CSAT, NPS), hvorfor incumbents har svært ved at følge med, og hvordan vertikal specialisering skaber pricing power. Det spejler direkte artiklens afsnit om prissætning og marginer.
Avanceret
41 minutterOpenAI DevDay 2024 | Strukturerede outputs til pålidelige applikationer
OpenAI. Gennemgår `strict: true`, forskellen fra gammel JSON-mode, refusal-håndtering og hvordan function calling og response-format-schemas komponerer. Nyttig præcis, fordi den beskriver den kontrakt, API'et giver dig, som er det, artiklens produktionsmønstre er bygget ovenpå.
Avanceret
18 minutterPydantic er alt, du har brug for: Jason Liu
AI Engineer. Talket, der krystalliserede det moderne mønster "definér en Pydantic-model, giv den til LLM'en, lad validering gøre resten", med konkrete eksempler på nestede objekter, validators der fanger hallucinerede URL'er, og Chain-of-Thought som et typet felt. Se den, før du genlæser artiklens afsnit om validators, og du vil genkende, hvor dens retry- og refusal-regler kommer fra.
Avanceret