LLM-appar i produktion
Utforma, lansera, observera och driva LLM-applikationer efter demostadiet.
31 innehållsposter (20 artiklar · 11 videor)
Börja här
Börja med några rekommenderade innehållsposter innan du går igenom hela flödet.
13 min läsningLLM-stacken 2026: modeller, inferens, verktyg och avvägningar
En verksam arkitekts syn på LLM-stacken 2026 – modellnivåerna, inferensleverantörerna, orkestreringslagren, utvärderingsverktygen och de avvägningar som verkligen spelar roll när produktions-AI ska levereras. Allt du önskar att någon hade förklarat innan du började.
Avancerad
12 min läsningUtforma prompter för produktion: system-, utvecklar- och användarlager
Produktionsprompter är inte att ”berätta för AI:n vad du vill”. De är ett system i flera lager – stabila instruktioner, dynamisk kontext och variabler per anrop – som hanteras som kod. Arkitekturen, mönstren och disciplinen som skiljer produktion från prototyp.
Avancerad
10 min läsningFellägen för AI i produktion: det som går sönder efter demon
AI-system fallerar ofta på förutsägbara sätt: hallucinationer, inaktuell kontext, överdriven medhållsamhet, promptinjektion, osäker verktygsanvändning, schemadrift och bristfällig felhantering. Ett fellägesregister för team som driftsätter verkliga arbetsflöden.
AvanceradMer i detta ämne
69 minuterAgentlandskapet – lärdomar från att driftsätta agenter i produktion
MLOps.community. Prosus AI-chef och en AI-utvecklare berättar vad som faktiskt gick sönder när de driftsatte agenter i koncernens portföljbolag: penetrationstestning av promptinjektion före lansering, en osäker skrivning när en Jira-agent inte kunde tolka mänsklig kortnotation, inaktuell kontext som hanterades genom att agenterna fick redovisa sina antaganden samt reservlösningar som slog samman eller stängde av agenter när dessa började öka den kognitiva belastningen. Det är som att se artikelns register över fellägen spelas upp som en direktsänd incidentanalys.
Avancerad
11 min läsningLangGraph vs CrewAI vs direkt-API: välj agentramverk 2026
Landskapet för agentramverk är mognare 2026, men inte tydligare. LangGraph, CrewAI, Pydantic AI, OpenAI Agents SDK och direkt-API – alla passar vissa team och projekt, men inget passar alla. En ärlig jämförelse och ett beslutsramverk.
Avancerad
13 min läsningUtforma agenter som inte fastnar i oändliga loopar
Det vanligaste agentfelet i produktion är oändliga eller skenbart oändliga loopar – agenter som försöker igen, förgrenar sig och förbrukar token utan att göra framsteg. Här är arkitekturmönstren som förhindrar detta och skapar agenter som slutför även svåra uppgifter.
Avancerad
12 min läsningDatoranvändning och webbläsaragenter i produktion
Datoranvändning och webbläsaragenter ger demonstrationer som blir virala. Produktionsdrift i stor skala ser annorlunda ut – snäv avgränsning, omfattande skyddsräcken och genomtänkt användarupplevelse. Här är mönstren som fungerar, felen vi ser gång på gång och den ärliga ekonomiska kalkylen.
Avancerad
12 min läsningKontextutveckling: hantera fönster med 1 miljon token utan kontextförfall
Kontextfönster med 1 miljon token finns, men kvaliteten försämras långt före gränsen. Kontextutveckling är disciplinen att använda kontextfönster effektivt – vad som ska tas med, sammanfattas eller hämtas på nytt, samt mönstren som håller kvaliteten hög när kontexten växer.
Avancerad
12 min läsningKostnadsoptimera inferens: promptcache, styrning och kontroll av utdata
Med rätt metoder kan kostnaden för LLM-inferens minskas med 60–90 %. Promptcache, modellstyrning, kontroll av utdata, batchning och några mindre kända mönster. Siffrorna, mönstren och den produktionsdisciplin som skiljer välskött inferens från en skenande faktura.
Avancerad
13 min läsningBygg utvärderingar som faktiskt upptäcker regressioner
De flesta utvärderingssviter ser imponerande ut men missar verkliga regressioner. För att bygga utvärderingar som upptäcker det viktiga krävs noggrann konstruktion av dataset, känsliga mätetal, kalibrering av bedömare och en tillitskultur. Här är mönstren från team som lyckas.
Avancerad
13 min läsningFinjustering 2026: när LoRA slår RAG och hur du gör utan ett kluster
LoRA-finjustering har blivit tillgänglig – du kan göra riktiga finjusteringar på en bärbar dator eller hyra en GPU i en timme. Här är mönstren som fungerar, fallen där finjustering slår RAG och ett praktiskt arbetsflöde från dataförberedelse till driftsättning.
Avancerad
14 min läsningMCP från grunden: bygg en produktionsklar server i TypeScript
Att bygga en Model Context Protocol-server för produktion kräver mer än att koppla ihop några verktyg. Här är mönstren för schemadesign, autentisering, felhantering, strömning, observerbarhet och den produktionsverklighet som gör MCP-servrar användbara i stor skala.
Avancerad
12 min läsningUtforma MCP-verktyg som LLM-modeller faktiskt använder rätt
De flesta MCP-verktyg vi ser är tekniskt korrekta men praktiskt oanvändbara. LLM-modeller ignorerar dem, använder dem fel eller anropar dem på olämpliga sätt. Här är principerna för att utforma verktyg som LLM-modeller tar till sig naturligt, med exempel på vanliga fel och hur de åtgärdas.
Avancerad
12 min läsningBygg minne för långvariga agenter
Agenter behöver minne utanför kontextfönstret. Arkitekturen för långtidsminne – vad som lagras, när det hämtas och hur det glöms – avgör om agenter känns som om de ”känner” dig eller börjar om från början i varje samtal. Mönstren och avvägningarna i produktion.
Avancerad
10 min läsningOrkestrering av flera modeller: dirigering efter kostnad, latens och kvalitet
Att använda en modell till allt är ett nybörjardrag. AI-system i produktion dirigerar olika förfrågningar till olika modeller – och sparar 60–90 % i kostnad samtidigt som kvaliteten förbättras. Mönstren, dirigeringslogiken och avvägningarna.
Mellannivå
12 min läsningObserverbarhet för LLM-appar: spårning, kostnader, latens och kvalitetsdrift
LLM-applikationer fallerar på unika sätt som traditionell observerbarhet missar. Här är mönstren för att spåra flerstegsflöden, följa kostnader som varierar 100 gånger per anrop, övervaka kvalitetsdrift och felsöka hallucinationer i produktionsskala.
Avancerad
12 min läsningBygg ett produktionsklart RAG-system: inläsning, inbäddning, hämtning, omrangordning och utvärdering
En produktionsklar RAG-pipeline består av sex steg, vart och ett med specifika mönster som avgör kvaliteten. Arkitekturen, valen i varje steg och den iterativa utvärderingsdisciplin som skiljer ett fungerande RAG-system från ett som gör användarna besvikna.
Avancerad
14 min läsningPromptinjektion och LLM-säkerhet: hotmodeller och djupförsvar
Promptinjektion är en permanent säkerhetsriskklass för LLM-system, inte ett misstag i promptskrivningen. En produktionsguide till hotmodeller, datagränser, verktygsbehörigheter, regressionstester, övervakning och incidenthantering.
Avancerad
12 min läsningVälj mellan promptning, RAG och finjustering (och när de bör kombineras)
Promptning, RAG och finjustering är de tre stora verktygen för att anpassa LLM-modeller till ditt problem. Var och en passar vissa problem och är fel för andra. Ett ramverk för valet, de realistiska kostnaderna och de produktionsmönster där kombinationer ger bäst resultat.
Avancerad
13 min läsningLansera en LLM-produkt: prissättning, marginaler och fällan med skenbara konkurrensvallgravar
LLM-baserade produkter har svårare ekonomi än traditionell SaaS: rörliga kostnader som följer användningen, marginaler som pressas av inferens, risk för standardisering och konkurrenter med samma grundmodeller. Så bygger du en produkt som faktiskt går att försvara – och undviker mönstren bakom LLM-uppstartsföretag som försvinner.
Avancerad
13 min läsningStrukturerade utdata och funktionsanrop: produktionsmönstren
Strukturerade utdata och funktionsanrop är bron från ”en LLM som genererar text” till ”ett system som utför arbete”. I produktion handlar de viktiga mönstren om scheman, felhantering, idempotens och kontrollerad degradering – inte bara JSON-läge.
Avancerad
211 minuterDjupdykning i LLM:er som ChatGPT
Andrej Karpathy. Det här är YouTubes tydligaste heltäckande förklaring av vad en LLM faktiskt är – förträning, tokenisering, SFT, RLHF, resonemangsträning med förstärkningsinlärning, verktygsanvändning och hallucinationer – på den detaljnivå en ingenjör behöver för att kunna resonera om modellavvägningar. Se den en gång, så slutar artikelns beslut mellan ”modeller i GPT-klassen, modeller med öppna vikter och resonemangsmodeller” att kännas som varumärkesval och börjar kännas som val mellan träningsmetoder.
Avancerad
40 minuterAndrej Karpathy: mjukvara förändras (igen)
Y Combinator. I sitt huvudanförande på AI Startup School beskriver Karpathy LLM:er som en ny sorts dator – allmännyttig tjänst, fabrik och operativsystem i ett – och argumenterar för produkter med ”partiell autonomi” där människan håller systemet i strama tyglar. Det är den tydligaste formuleringen av den mentala modell på stacknivå som artikeln förutsätter: du väljer inferensleverantörer och verktyg för ett programmerbart fundament, inte för en chattbot.
Avancerad
9 minuterLangSmith på 10 minuter
LangChain. En av LangChains medgrundare ger en guidad rundtur i ett LLM-spår, ett projekt och en datamängd – tokenkostnad, latens, felfrekvens, aggregering av återkoppling och fördjupning i ett enskilt spann för ett hämtningssteg. Det är den närmaste visuella motsvarigheten till det artikeln beskriver med ”varje anrop är ett spann” och varför strukturerade spår är bättre än loggning med utskrifter.
Avancerad
154 minuterInstrumentering och utvärdering av LLM:er
Hamel Husain. Hamel Husain, Eugene Yan, Brian Bischof, Harrison Chase och Shreya Shankar arbetar med spårning, logganalys, LLM som bedömare och arbetsflödet för att granska verkliga produktionsdata. Ge den samma uppmärksamhet som en lång podd – det är YouTubes bästa enskilda djupbehandling av artikelns tes ”titta på dina spår”.
Avancerad
77 minuterPromptteknik för AI: en djupdykning
Anthropic. Fyra promptingenjörer på Anthropic – inom forskning, anpassning, tillämpning och utvecklarrelationer – talar utförligt om vad de faktiskt gör till vardags: hur de redigerar prompter under press, hur de ser på ”ärlighet” i instruktioner, när XML-strukturer hjälper och när de inte gör det. Artikelns lagermodell stämmer väl överens med hur de beskriver arbetet. Det här är det bästa sättet att höra den mentala modellen formuleras högt.
Avancerad
25 minuterPromptning 101 | Code w/ Claude
Anthropic. En direktsänd byggsession där Anthropics Applied AI-team arbetar med en prompt för försäkringsanspråk. De börjar med en vag instruktion och itererar fram något som en utvecklare faktiskt skulle driftsätta, vilket visar den typ av ändringar i system- och utvecklarlagren som artikeln beskriver. Se den innan du läser om artikelns checklista för exempel, utdatastruktur och hantering av vägran.
Avancerad
42 minuterVertikala AI-agenter kan bli 10X större än SaaS
Y Combinator. Värdarna för Lightcone går igenom varför vertikala AI-agenter – inte horisontella omslagstjänster – är den försvarbara formen för företag i applikationslagret, med konkreta exempel och en nykter bedömning av vilka kategorier modelleverantörerna kommer att sluka. Det är den omvända vallgravsfälla som artikeln varnar för, uttryckt som en positiv spelplan.
Avancerad
34 minuterSå förändrar AI affärsmodellerna för programvara med Bret Taylor från Sierra
Sequoia Capital. Bret Taylor går igenom skiftet från SaaS-prissättning per användarplats till resultatbaserad prissättning – vilka mått man bör utgå från (lösningsgrad, CSAT och NPS), varför etablerade aktörer har svårt att följa efter och hur vertikal specialisering skapar prissättningskraft. Det speglar direkt artikelns avsnitt om prissättning och marginaler.
Avancerad
41 minuterOpenAI DevDay 2024 | Strukturerade utdata för tillförlitliga applikationer
OpenAI. Går igenom `strict: true`, skillnaden mot det gamla JSON-läget, hantering av vägran och hur funktionsanrop kombineras med scheman för svarsformat. Den är användbar just för att den beskriver det avtal som API:et ger dig, vilket är grunden för artikelns produktionsmönster.
Avancerad
18 minuterPydantic är allt du behöver: Jason Liu
AI Engineer. Föredraget som utkristalliserade det moderna mönstret ”definiera en Pydantic-modell, ge den till LLM:en och låt valideringen sköta resten”, med konkreta exempel på nästlade objekt, validerare som upptäcker hallucinerade URL:er och Chain-of-Thought som ett typat fält. Se den innan du läser om artikelns avsnitt om validerare, så kommer du att känna igen varifrån reglerna för nya försök och vägran kommer.
Avancerad