Emne

Production LLM Apps

Architect, ship, observe, and operate LLM applications after the demo stage.

34 historier (23 artikler · 11 videoer)

Start her

Et par gode steder at begynde, før du går på opdagelse i hele oversigten.

Flere i dette emne

8 min læsning
Artikel

Hermes vs n8n: vælg efter opgaven (og hvornår du skal bruge begge)

En beslutningsramme for Hermes Agent over for n8n: Deterministisk integrationslogik bliver i n8n, mens et Hermes-API-trin med bearer-autentificering eller et særskilt forløb for hændelseswebhooks håndterer afgrænset agentarbejde.

Let øvet
8 min læsning
Artikel

OpenClaw vs Hermes: vælg efter jobbet, ikke brandet

OpenClaw og Hermes er overlappende agentsystemer i egen drift med forskellige driftsmæssige styrker. Sammenlign kanalrouting, webhooks, værktøjer og automatiseringsgrænser, før du vælger det ene, det andet eller begge.

Let øvet
10 min læsning
Artikel

Eksperimentel stak med to DGX Spark-enheder, DeepSeek-V4-Flash, n8n og Hermes

Sådan evaluerer du en eksperimentel fællesskabsudviklet løsning med to DGX Spark-systemer til DeepSeek-V4-Flash, hvor n8n håndterer den deterministiske del og Hermes vurderingsopgaverne.

Avanceret
69 minutter
Video

Agentlandskabet – erfaringer fra at sætte agenter i produktion

MLOps.community. Prosus' VP of AI og en AI-ingeniør rapporterer, hvad der faktisk brød, da de deployede agenter på tværs af gruppens porteføljevirksomheder: promptinjektion-pentest før launch, en usikker write, da en Jira-agent fejlede på menneskelig stenografi, forældet kontekst håndteret ved at få agenter til at synliggøre deres antagelser, og fallback-design, der merged eller dræbte agenter, når de tilføjede cognitive load. Det læser som artiklens fejltilstandsregister genafspillet som en live postmortem.

Avanceret
11 min læsning
Artikel

LangGraph vs. CrewAI vs. direkte API: valg af agentframework i 2026

Landskabet for agentframeworks er i 2026 mere modent, men ikke mere overskueligt. LangGraph, CrewAI, Pydantic AI, OpenAI Agents SDK og direkte API passer hver til nogle teams og projekter, men ingen passer til alle. Her får du en ærlig sammenligning og en beslutningsramme.

Avanceret
13 min læsning
Artikel

Design af agenter, der ikke fortsætter i det uendelige

Den mest almindelige fejl for produktionsagenter er uendelige eller næsten uendelige løkker — agenter, der prøver igen, forgrener sig og bruger tokens uden at gøre fremskridt. Her er de arkitekturmønstre, der forhindrer det og skaber agenter, som afslutter selv svære opgaver.

Avanceret
12 min læsning
Artikel

Computerstyring og browseragenter i produktion

Computerstyring og browseragenter skaber virale demoer. Produktionsklare implementeringer i stor skala ser anderledes ud — afgrænset omfang, stærke sikkerhedsforanstaltninger og fokus på brugeroplevelsen. Her er de mønstre, der virker, de fejl, vi fortsat ser, og den reelle økonomi.

Avanceret
12 min læsning
Artikel

Kontekstengineering: håndtering af 1M-tokenvinduer uden kontekstforringelse

Der findes kontekstvinduer på 1M tokens, men kvaliteten forringes længe før grænsen nås. Kontekstengineering er disciplinen i at bruge kontekstvinduer effektivt — hvad der skal medtages, hvad der skal sammenfattes, hvad der skal hentes på ny, og hvilke mønstre der holder kvaliteten høj, når konteksten vokser.

Avanceret
12 min læsning
Artikel

Optimer inferensomkostninger: cachelagring af prompts, styring af modelvalg og kontrol af output

Byg en sporingsbaseret omkostningsmodel for inferens, optimér de største målte omkostningsposter, og dokumentér, at hver ændring bevarer opgavekvaliteten.

Avanceret
13 min læsning
Artikel

Sådan bygger du evalueringer, der faktisk opdager regressioner

De fleste evalueringssuiter ser imponerende ud, men overser reelle regressioner. Det kræver omhyggelig opbygning af datasæt, følsomme målinger, kalibrering af dommermodeller og en kultur præget af tillid at bygge evalueringer, der opdager det væsentlige. Her er mønstrene fra de teams, der lykkes med det.

Avanceret
13 min læsning
Artikel

Finjustering i 2026: et LoRA- og QLoRA-eksperiment med dokumentationen i centrum

Afgør, om parametereffektiv finjustering er berettiget, styr dataene, fastlås et reproducerbart eksperiment, sammenlign resultater på et adskilt testsæt og i sikkerhedstests, og mål modeldriften før idriftsættelse.

Avanceret
14 min læsning
Artikel

MCP fra bunden: byg en produktionsklar server i TypeScript

At bygge en produktionsklar Model Context Protocol-server kræver mere end at forbinde nogle få værktøjer. Her er mønstrene for skemadesign, godkendelse, fejlhåndtering, streaming og observabilitet samt de praktiske produktionsforhold, der gør MCP-servere nyttige i stor skala.

Avanceret
12 min læsning
Artikel

Design MCP-værktøjer, som LLM'er faktisk bruger korrekt

De fleste MCP-værktøjer, vi ser, er teknisk korrekte, men praktisk talt ubrugelige. LLM'er ignorerer dem, bruger dem forkert eller foretager unødvendige kald. Her er principperne for at designe værktøjer, som LLM'er tager naturligt i brug, med eksempler på almindelige fejl og løsninger.

Avanceret
12 min læsning
Artikel

Byg hukommelse til agenter med langvarige forløb

Agenter med langvarige forløb kræver et persistensdesign med en tydelig ejer: dokumenteret oprindelse, bekræftelse, isolering mellem lejere, test af søgning, regler for opbevaring, rettelse og verificerbar sletning.

Avanceret
10 min læsning
Artikel

Orkestrering af flere modeller: routing efter omkostninger, latenstid og kvalitet

Routing af forskellige opgaver til forskellige modeller kan reducere omkostninger eller latenstid, men kun evaluering af den konkrete arbejdsbelastning kan vise, om den ekstra kompleksitet betaler sig. Her er mønstrene, målingerne og fejltilstandene.

Let øvet
12 min læsning
Artikel

Observerbarhed i LLM-applikationer: sporing, omkostninger, svartid og kvalitetsændringer

Udvid almindelig observerbarhed med flertrinsspor, henførbare omkostninger, prompt- og modelversioner, evaluerede kvalitetssignaler, databeskyttelseskontroller og advarsler baseret på arbejdsbelastningen.

Avanceret
12 min læsning
Artikel

Byg produktionsklar RAG: indlæsning, embeddings, søgning, reranking og evaluering

En produktionsklar RAG-pipeline består af seks faser, hvor konkrete mønstre afgør kvaliteten. Her er arkitekturen, valgene i hver fase og den iterative evalueringsdisciplin, der adskiller velfungerende RAG fra skuffende løsninger.

Avanceret
14 min læsning
Artikel

Promptinjektion og LLM-sikkerhed: trusselsmodeller og forsvar i dybden

Promptinjektion er en permanent klasse af LLM-sikkerhedsrisici, ikke en fejl i promptformuleringen. En produktionsguide til trusselsmodeller, datagrænser, værktøjsrettigheder, regressionstest, overvågning og hændelseshåndtering.

Avanceret
12 min læsning
Artikel

Vælg mellem prompting, RAG og finjustering (og hvornår de skal kombineres)

Prompting, RAG og finjustering er de tre store greb til at tilpasse LLM'er til dit problem. De passer hver især til nogle problemer og ikke til andre. Her er en ramme for valget, de realistiske omkostninger og de produktionsmønstre, hvor kombinationen virker bedst.

Avanceret
13 min læsning
Artikel

LLM-produktets enhedsøkonomi: et evidensbaseret prisark

Kortlæg fordelingen af modelanvendelse, bidragsmargin, fejlhåndtering, support og kundefastholdelse før prisfastsættelsen. Dette ark erstatter udokumenterede markedsintervaller med efterprøvelige input.

Avanceret
13 min læsning
Artikel

Strukturerede output og funktionskald: produktionsmønstrene

Strukturerede output og funktionskald er broen fra 'LLM, der genererer tekst' til 'system, der udfører arbejde'. I produktion handler de vigtige mønstre om skemaer, fejlhåndtering, idempotens og kontrolleret forringelse — ikke kun JSON-tilstand.

Avanceret
211 minutter
Video

Dybdegående gennemgang af LLM'er som ChatGPT

Andrej Karpathy. Dette er den klareste end-to-end-forklaring på YouTube af, hvad en LLM faktisk er — pretraining, tokenization, SFT, RLHF, reasoning RL, tool use, hallucinationer — på det detaljeniveau, en ingeniør behøver for at ræsonnere om model-trade-offs. Se den én gang, og beslutningerne "GPT-class vs. open-weights vs. reasoning model" i artiklen holder op med at føles som brandvalg og begynder at føles som valg af træningsopskrift.

Avanceret
40 minutter
Video

Andrej Karpathy: Software ændrer sig (igen)

Y Combinator. Karpathys AI Startup School-keynote rammesætter LLM'er som en ny slags computer — utility, fab og OS rullet sammen — og argumenterer for "partial autonomy"-produkter med et menneske-kontrolleret leash. Det er den klareste artikulation af den stack-niveau mentale model, artiklen antager: at du vælger inferensvendors og tooling til et programmerbart substrate, ikke en chatbot.

Avanceret
9 minutter
Video

LangSmith på 10 minutter

LangChain. En guidet tour af en LLM-trace, project og dataset af LangChains medstifter — token-omkostning, latenstid, fejlrate, feedback-aggregering, drill-down i et enkelt retrieval-step-span. Det er den nærmeste visuelle analog til det, artiklen beskriver, når den taler om "hvert kald er et span", og hvorfor strukturerede traces slår print-logging.

Avanceret
154 minutter
Video

Instrumentering og evaluering af LLM'er

Hamel Husain. Hamel Husain, Eugene Yan, Brian Bischof, Harrison Chase og Shreya Shankar arbejder sig igennem tracing, loganalyse, LLM-as-judge og arbejdsgangen omkring at se på rigtige produktionsdata. Sid med den på samme måde, som du ville med en lang podcast — det er den bedste dybe behandling af artiklens tese "se på dine traces" på YouTube.

Avanceret
77 minutter
Video

AI prompt engineering: En dybdegående gennemgang

Anthropic. Fire Anthropic prompt engineers (research, alignment, applied, developer relations) taler længe om, hvad de faktisk gør til daglig — hvordan de redigerer prompts under pres, hvordan de tænker om "honesty" i instruktioner, hvornår XML-scaffolds hjælper, hvornår de ikke gør. Artiklens lagdelte model mapper rent over på, hvordan de beskriver arbejdet; dette er den bedste måde at høre den mentale model højt.

Avanceret
25 minutter
Video

Prompting 101 | Code med Claude

Anthropic. En live-bygningssession af Anthropics Applied AI-team på en forsikringsclaims-prompt — de starter med en vag instruktion og itererer til noget, en udvikler faktisk ville shippe, og viser den slags revisioner, artiklen beskriver for system- og developer-lagene. Se den, før du genlæser artiklens tjekliste om eksempler, outputstruktur og refusal-håndtering.

Avanceret
42 minutter
Video

Vertikale AI-agenter kan blive 10X større end SaaS

Y Combinator. Lightcone-værterne arbejder sig gennem, hvorfor vertikale AI-agenter — ikke horisontale wrappers — er den forsvarlige form for application-layer-virksomheder, med konkrete eksempler og et klart syn på, hvilke kategorier modeludbyderne vil æde. Det er anti-moat-fælden, artiklen advarede om, udtrykt som en positiv playbook.

Avanceret
34 minutter
Video

Sådan genopfinder AI software-forretningsmodeller med Bret Taylor fra Sierra

Sequoia Capital. Bret Taylor gennemgår skiftet fra per-seat SaaS til outcomes-baseret prissætning — hvad du skal forankre i (resolution, CSAT, NPS), hvorfor incumbents har svært ved at følge med, og hvordan vertikal specialisering skaber pricing power. Det spejler direkte artiklens afsnit om prissætning og marginer.

Avanceret
41 minutter
Video

OpenAI DevDay 2024 | Strukturerede outputs til pålidelige applikationer

OpenAI. Gennemgår `strict: true`, forskellen fra gammel JSON-mode, refusal-håndtering og hvordan function calling og response-format-schemas komponerer. Nyttig præcis, fordi den beskriver den kontrakt, API'et giver dig, som er det, artiklens produktionsmønstre er bygget ovenpå.

Avanceret
18 minutter
Video

Pydantic er alt, du har brug for: Jason Liu

AI Engineer. Talket, der krystalliserede det moderne mønster "definér en Pydantic-model, giv den til LLM'en, lad validering gøre resten", med konkrete eksempler på nestede objekter, validators der fanger hallucinerede URL'er, og Chain-of-Thought som et typet felt. Se den, før du genlæser artiklens afsnit om validators, og du vil genkende, hvor dens retry- og refusal-regler kommer fra.

Avanceret