LLM-appar i produktion
Utforma, lansera, observera och driva LLM-applikationer efter demostadiet.
34 innehållsposter (23 artiklar · 11 videor)
Börja här
Börja med några rekommenderade innehållsposter innan du går igenom hela flödet.
13 min läsningLLM-stacken 2026: modeller, inferens, verktyg och avvägningar
En verksam arkitekts syn på LLM-stacken 2026 – modellnivåerna, inferensleverantörerna, orkestreringslagren, utvärderingsverktygen och de avvägningar som verkligen spelar roll när produktions-AI ska levereras. Allt du önskar att någon hade förklarat innan du började.
Avancerad
12 min läsningUtforma prompter för produktion: system-, utvecklar- och användarlager
Ett styrningsmönster för att skilja betrodda instruktioner, körningsdata och användarindata åt och sedan versionshantera, utvärdera, driftsätta och observera prompter i proportion till risken.
Avancerad
10 min läsningFellägen för AI i produktion: det som går sönder efter demon
Bygg ett fellägesregister för hallucinationer, inaktuell kontext, promptinjektion, osäker verktygsanvändning, schemadrift, bristfällig felhantering och luckor i observerbarheten.
AvanceradMer i detta ämne
8 min läsningHermes kontra n8n: välj efter arbetsuppgift (och när du ska använda båda)
Ett beslutsramverk för Hermes Agent och n8n: deterministiska flöden stannar i n8n, medan ett bearer-autentiserat Hermes API-steg eller en separat händelsewebhook hanterar avgränsat agentarbete.
Mellannivå
8 min läsningOpenClaw kontra Hermes: välj efter arbetsuppgift, inte varumärke
OpenClaw och Hermes är överlappande agentsystem i egen drift med olika operativa styrkor. Jämför kanaldirigering, webhooks, verktyg och automatiseringsgränser innan du väljer det ena, det andra eller båda.
Mellannivå
10 min läsningExperimentell stack med två DGX Spark-enheter, DeepSeek-V4-Flash, n8n och Hermes
Så utvärderar du en experimentell väg från användargemenskapen för DeepSeek-V4-Flash på två DGX Spark-enheter, med n8n för den deterministiska delen och Hermes för bedömningsuppgifter.
Avancerad
69 minuterAgentlandskapet – lärdomar från att driftsätta agenter i produktion
MLOps.community. Prosus AI-chef och en AI-utvecklare berättar vad som faktiskt gick sönder när de driftsatte agenter i koncernens portföljbolag: penetrationstestning av promptinjektion före lansering, en osäker skrivning när en Jira-agent inte kunde tolka mänsklig kortnotation, inaktuell kontext som hanterades genom att agenterna fick redovisa sina antaganden samt reservlösningar som slog samman eller stängde av agenter när dessa började öka den kognitiva belastningen. Det är som att se artikelns register över fellägen spelas upp som en direktsänd incidentanalys.
Avancerad
11 min läsningVälja agentramverk 2026: en reproducerbar utvärdering
Jämför agentramverk mot ett representativt arbetsflöde, uttalade driftkrav och en genomgång av utträdeskostnaden – i stället för att luta dig mot popularitet och tyckande.
Avancerad
13 min läsningUtforma agenter som inte fastnar i oändliga loopar
Det vanligaste agentfelet i produktion är oändliga eller skenbart oändliga loopar – agenter som försöker igen, förgrenar sig och förbrukar token utan att göra framsteg. Här är arkitekturmönstren som förhindrar detta och skapar agenter som slutför även svåra uppgifter.
Avancerad
12 min läsningDatoranvändning och webbläsaragenter i produktion
Datoranvändning och webbläsaragenter ger demonstrationer som blir virala. Produktionsdrift i stor skala ser annorlunda ut – snäv avgränsning, omfattande skyddsräcken och genomtänkt användarupplevelse. Här är mönstren som fungerar, felen vi ser gång på gång och den ärliga ekonomiska kalkylen.
Avancerad
12 min läsningKontextutveckling: hantera fönster med 1 miljon token utan kontextförfall
Kontextfönster med 1 miljon token finns, men kvaliteten försämras långt före gränsen. Kontextutveckling är disciplinen att använda kontextfönster effektivt – vad som ska tas med, sammanfattas eller hämtas på nytt, samt mönstren som håller kvaliteten hög när kontexten växer.
Avancerad
12 min läsningKostnadsoptimera inferens: promptcachning, routing och kontroll av utdata
Bygg en kostnadsmodell för inferens utifrån mätdata, optimera de största kostnadsposterna och visa att varje ändring bevarar kvaliteten i uppgiften.
Avancerad
13 min läsningBygg utvärderingar som faktiskt upptäcker regressioner
De flesta utvärderingssviter ser imponerande ut men missar verkliga regressioner. För att bygga utvärderingar som upptäcker det viktiga krävs noggrann konstruktion av dataset, känsliga mätetal, kalibrering av bedömare och en tillitskultur. Här är mönstren från team som lyckas.
Avancerad
13 min läsningFinjustering 2026: ett evidensbaserat experiment med LoRA och QLoRA
Avgör om parametereffektiv finjustering är motiverad, styr datahanteringen, lås ett reproducerbart experiment, jämför resultat på undanhållna data och säkerhetstester samt mät serveringen före driftsättning.
Avancerad
14 min läsningMCP-serverdesign i TypeScript: från minimal server till produktionsgranskning
Bygg en minimal Model Context Protocol-server och granska sedan designen – scheman, behörighetskontroll, idempotens, observerbarhet, driftsättning och säkerhet – innan du kallar den produktionsklar.
Avancerad
12 min läsningUtforma MCP-verktyg som LLM-modeller faktiskt använder rätt
De flesta MCP-verktyg vi ser är tekniskt korrekta men praktiskt oanvändbara. LLM-modeller ignorerar dem, använder dem fel eller anropar dem på olämpliga sätt. Här är principerna för att utforma verktyg som LLM-modeller tar till sig naturligt, med exempel på vanliga fel och hur de åtgärdas.
Avancerad
12 min läsningSå bygger du minne för långvariga agenter
Långvariga agenter behöver en persistenslösning med tydligt ansvar: proveniens, bekräftelse, isolering mellan kundorganisationer, tester av informationshämtning, lagringstid, korrigering och verifierbar radering.
Avancerad
10 min läsningFlermodellsorkestrering: routning efter kostnad, latens och kvalitet
Att routa olika uppgifter till olika modeller kan minska kostnader eller svarstid, men bara en arbetsbelastningsspecifik utvärdering kan visa om den ökade komplexiteten lönar sig. Mönster, mätningar och felkällor.
Mellannivå
12 min läsningObserverbarhet för LLM-appar: spårning, kostnader, svarstid och kvalitetsdrift
Utöka vanlig observerbarhet med flerstegsspår, hänförbar kostnad, prompt- och modellversioner, utvärderade kvalitetssignaler, integritetskontroller och aviseringar som härleds från arbetsbelastningen.
Avancerad
12 min läsningBygg ett produktionsklart RAG-system: inläsning, inbäddning, hämtning, omrangordning och utvärdering
En produktionsklar RAG-pipeline består av sex steg, vart och ett med specifika mönster som avgör kvaliteten. Arkitekturen, valen i varje steg och den iterativa utvärderingsdisciplin som skiljer ett fungerande RAG-system från ett som gör användarna besvikna.
Avancerad
14 min läsningPromptinjektion och LLM-säkerhet: hotmodeller och djupförsvar
Promptinjektion är en permanent säkerhetsriskklass för LLM-system, inte ett misstag i promptskrivningen. En produktionsguide till hotmodeller, datagränser, verktygsbehörigheter, regressionstester, övervakning och incidenthantering.
Avancerad
12 min läsningVälj mellan promptning, RAG och finjustering (och när de bör kombineras)
Promptning, RAG och finjustering är de tre stora verktygen för att anpassa LLM-modeller till ditt problem. Var och en passar vissa problem och är fel för andra. Ett ramverk för valet, de realistiska kostnaderna och de produktionsmönster där kombinationer ger bäst resultat.
Avancerad
13 min läsningLLM-produktens enhetsekonomi: ett underlagsbaserat arbetsblad för prissättning
Modellanvändningens fördelning, marginalbidrag, felhantering, support och kundbehållning innan du väljer pris. Arbetsbladet ersätter ogrundade marknadsintervall med granskningsbara indata.
Avancerad
13 min läsningStrukturerade utdata och funktionsanrop: produktionsmönstren
Strukturerade utdata och funktionsanrop är bron från ”en LLM som genererar text” till ”ett system som utför arbete”. I produktion handlar de viktiga mönstren om scheman, felhantering, idempotens och kontrollerad degradering – inte bara JSON-läge.
Avancerad
211 minuterDjupdykning i LLM:er som ChatGPT
Andrej Karpathy. Det här är YouTubes tydligaste heltäckande förklaring av vad en LLM faktiskt är – förträning, tokenisering, SFT, RLHF, resonemangsträning med förstärkningsinlärning, verktygsanvändning och hallucinationer – på den detaljnivå en ingenjör behöver för att kunna resonera om modellavvägningar. Se den en gång, så slutar artikelns beslut mellan ”modeller i GPT-klassen, modeller med öppna vikter och resonemangsmodeller” att kännas som varumärkesval och börjar kännas som val mellan träningsmetoder.
Avancerad
40 minuterAndrej Karpathy: mjukvara förändras (igen)
Y Combinator. I sitt huvudanförande på AI Startup School beskriver Karpathy LLM:er som en ny sorts dator – allmännyttig tjänst, fabrik och operativsystem i ett – och argumenterar för produkter med ”partiell autonomi” där människan håller systemet i strama tyglar. Det är den tydligaste formuleringen av den mentala modell på stacknivå som artikeln förutsätter: du väljer inferensleverantörer och verktyg för ett programmerbart fundament, inte för en chattbot.
Avancerad
9 minuterLangSmith på 10 minuter
LangChain. En av LangChains medgrundare ger en guidad rundtur i ett LLM-spår, ett projekt och en datamängd – tokenkostnad, latens, felfrekvens, aggregering av återkoppling och fördjupning i ett enskilt spann för ett hämtningssteg. Det är den närmaste visuella motsvarigheten till det artikeln beskriver med ”varje anrop är ett spann” och varför strukturerade spår är bättre än loggning med utskrifter.
Avancerad
154 minuterInstrumentering och utvärdering av LLM:er
Hamel Husain. Hamel Husain, Eugene Yan, Brian Bischof, Harrison Chase och Shreya Shankar arbetar med spårning, logganalys, LLM som bedömare och arbetsflödet för att granska verkliga produktionsdata. Ge den samma uppmärksamhet som en lång podd. Det är den bästa enskilda djupgående genomgången på YouTube av artikelns tes ”titta på dina spår”.
Avancerad
77 minuterPromptteknik för AI: en djupdykning
Anthropic. Fyra promptingenjörer på Anthropic – inom forskning, anpassning, tillämpning och utvecklarrelationer – talar utförligt om vad de faktiskt gör till vardags: hur de redigerar prompter under press, hur de ser på ”ärlighet” i instruktioner, när XML-strukturer hjälper och när de inte gör det. Artikelns lagermodell stämmer väl överens med hur de beskriver arbetet. Det här är det bästa sättet att höra den mentala modellen formuleras högt.
Avancerad
25 minuterPromptning 101 | Code w/ Claude
Anthropic. En direktsänd byggsession där Anthropics Applied AI-team arbetar med en prompt för försäkringsanspråk. De börjar med en vag instruktion och itererar fram något som en utvecklare faktiskt skulle driftsätta, vilket visar den typ av ändringar i system- och utvecklarlagren som artikeln beskriver. Se den innan du läser om artikelns checklista för exempel, utdatastruktur och hantering av vägran.
Avancerad
42 minuterVertikala AI-agenter kan bli 10X större än SaaS
Y Combinator. Värdarna för Lightcone går igenom varför vertikala AI-agenter – inte horisontella omslagstjänster – är den försvarbara formen för företag i applikationslagret, med konkreta exempel och en nykter bedömning av vilka kategorier modelleverantörerna kommer att sluka. Det är den omvända vallgravsfälla som artikeln varnar för, uttryckt som en positiv spelplan.
Avancerad
34 minuterSå förändrar AI affärsmodellerna för programvara med Bret Taylor från Sierra
Sequoia Capital. Bret Taylor går igenom skiftet från SaaS-prissättning per användarplats till resultatbaserad prissättning – vilka mått man bör utgå från (lösningsgrad, CSAT och NPS), varför etablerade aktörer har svårt att följa efter och hur vertikal specialisering skapar prissättningskraft. Det speglar direkt artikelns avsnitt om prissättning och marginaler.
Avancerad
41 minuterOpenAI DevDay 2024 | Strukturerade utdata för tillförlitliga applikationer
OpenAI. Går igenom `strict: true`, skillnaden mot det gamla JSON-läget, hantering av vägran och hur funktionsanrop kombineras med scheman för svarsformat. Den är användbar just för att den beskriver det avtal som API:et ger dig, vilket är grunden för artikelns produktionsmönster.
Avancerad
18 minuterPydantic är allt du behöver: Jason Liu
AI Engineer. Föredraget som utkristalliserade det moderna mönstret ”definiera en Pydantic-modell, ge den till LLM:en och låt valideringen sköta resten”, med konkreta exempel på nästlade objekt, validerare som upptäcker hallucinerade URL:er och Chain-of-Thought som ett typat fält. Se den innan du läser om artikelns avsnitt om validerare, så kommer du att känna igen varifrån reglerna för nya försök och vägran kommer.
Avancerad