Ämne

LLM-appar i produktion

Utforma, lansera, observera och driva LLM-applikationer efter demostadiet.

31 innehållsposter (20 artiklar · 11 videor)

Börja här

Börja med några rekommenderade innehållsposter innan du går igenom hela flödet.

Mer i detta ämne

69 minuter
Video

Agentlandskapet – lärdomar från att driftsätta agenter i produktion

MLOps.community. Prosus AI-chef och en AI-utvecklare berättar vad som faktiskt gick sönder när de driftsatte agenter i koncernens portföljbolag: penetrationstestning av promptinjektion före lansering, en osäker skrivning när en Jira-agent inte kunde tolka mänsklig kortnotation, inaktuell kontext som hanterades genom att agenterna fick redovisa sina antaganden samt reservlösningar som slog samman eller stängde av agenter när dessa började öka den kognitiva belastningen. Det är som att se artikelns register över fellägen spelas upp som en direktsänd incidentanalys.

Avancerad
11 min läsning
Artikel

LangGraph vs CrewAI vs direkt-API: välj agentramverk 2026

Landskapet för agentramverk är mognare 2026, men inte tydligare. LangGraph, CrewAI, Pydantic AI, OpenAI Agents SDK och direkt-API – alla passar vissa team och projekt, men inget passar alla. En ärlig jämförelse och ett beslutsramverk.

Avancerad
13 min läsning
Artikel

Utforma agenter som inte fastnar i oändliga loopar

Det vanligaste agentfelet i produktion är oändliga eller skenbart oändliga loopar – agenter som försöker igen, förgrenar sig och förbrukar token utan att göra framsteg. Här är arkitekturmönstren som förhindrar detta och skapar agenter som slutför även svåra uppgifter.

Avancerad
12 min läsning
Artikel

Datoranvändning och webbläsaragenter i produktion

Datoranvändning och webbläsaragenter ger demonstrationer som blir virala. Produktionsdrift i stor skala ser annorlunda ut – snäv avgränsning, omfattande skyddsräcken och genomtänkt användarupplevelse. Här är mönstren som fungerar, felen vi ser gång på gång och den ärliga ekonomiska kalkylen.

Avancerad
12 min läsning
Artikel

Kontextutveckling: hantera fönster med 1 miljon token utan kontextförfall

Kontextfönster med 1 miljon token finns, men kvaliteten försämras långt före gränsen. Kontextutveckling är disciplinen att använda kontextfönster effektivt – vad som ska tas med, sammanfattas eller hämtas på nytt, samt mönstren som håller kvaliteten hög när kontexten växer.

Avancerad
12 min läsning
Artikel

Kostnadsoptimera inferens: promptcache, styrning och kontroll av utdata

Med rätt metoder kan kostnaden för LLM-inferens minskas med 60–90 %. Promptcache, modellstyrning, kontroll av utdata, batchning och några mindre kända mönster. Siffrorna, mönstren och den produktionsdisciplin som skiljer välskött inferens från en skenande faktura.

Avancerad
13 min läsning
Artikel

Bygg utvärderingar som faktiskt upptäcker regressioner

De flesta utvärderingssviter ser imponerande ut men missar verkliga regressioner. För att bygga utvärderingar som upptäcker det viktiga krävs noggrann konstruktion av dataset, känsliga mätetal, kalibrering av bedömare och en tillitskultur. Här är mönstren från team som lyckas.

Avancerad
13 min läsning
Artikel

Finjustering 2026: när LoRA slår RAG och hur du gör utan ett kluster

LoRA-finjustering har blivit tillgänglig – du kan göra riktiga finjusteringar på en bärbar dator eller hyra en GPU i en timme. Här är mönstren som fungerar, fallen där finjustering slår RAG och ett praktiskt arbetsflöde från dataförberedelse till driftsättning.

Avancerad
14 min läsning
Artikel

MCP från grunden: bygg en produktionsklar server i TypeScript

Att bygga en Model Context Protocol-server för produktion kräver mer än att koppla ihop några verktyg. Här är mönstren för schemadesign, autentisering, felhantering, strömning, observerbarhet och den produktionsverklighet som gör MCP-servrar användbara i stor skala.

Avancerad
12 min läsning
Artikel

Utforma MCP-verktyg som LLM-modeller faktiskt använder rätt

De flesta MCP-verktyg vi ser är tekniskt korrekta men praktiskt oanvändbara. LLM-modeller ignorerar dem, använder dem fel eller anropar dem på olämpliga sätt. Här är principerna för att utforma verktyg som LLM-modeller tar till sig naturligt, med exempel på vanliga fel och hur de åtgärdas.

Avancerad
12 min läsning
Artikel

Bygg minne för långvariga agenter

Agenter behöver minne utanför kontextfönstret. Arkitekturen för långtidsminne – vad som lagras, när det hämtas och hur det glöms – avgör om agenter känns som om de ”känner” dig eller börjar om från början i varje samtal. Mönstren och avvägningarna i produktion.

Avancerad
10 min läsning
Artikel

Orkestrering av flera modeller: dirigering efter kostnad, latens och kvalitet

Att använda en modell till allt är ett nybörjardrag. AI-system i produktion dirigerar olika förfrågningar till olika modeller – och sparar 60–90 % i kostnad samtidigt som kvaliteten förbättras. Mönstren, dirigeringslogiken och avvägningarna.

Mellannivå
12 min läsning
Artikel

Observerbarhet för LLM-appar: spårning, kostnader, latens och kvalitetsdrift

LLM-applikationer fallerar på unika sätt som traditionell observerbarhet missar. Här är mönstren för att spåra flerstegsflöden, följa kostnader som varierar 100 gånger per anrop, övervaka kvalitetsdrift och felsöka hallucinationer i produktionsskala.

Avancerad
12 min läsning
Artikel

Bygg ett produktionsklart RAG-system: inläsning, inbäddning, hämtning, omrangordning och utvärdering

En produktionsklar RAG-pipeline består av sex steg, vart och ett med specifika mönster som avgör kvaliteten. Arkitekturen, valen i varje steg och den iterativa utvärderingsdisciplin som skiljer ett fungerande RAG-system från ett som gör användarna besvikna.

Avancerad
14 min läsning
Artikel

Promptinjektion och LLM-säkerhet: hotmodeller och djupförsvar

Promptinjektion är en permanent säkerhetsriskklass för LLM-system, inte ett misstag i promptskrivningen. En produktionsguide till hotmodeller, datagränser, verktygsbehörigheter, regressionstester, övervakning och incidenthantering.

Avancerad
12 min läsning
Artikel

Välj mellan promptning, RAG och finjustering (och när de bör kombineras)

Promptning, RAG och finjustering är de tre stora verktygen för att anpassa LLM-modeller till ditt problem. Var och en passar vissa problem och är fel för andra. Ett ramverk för valet, de realistiska kostnaderna och de produktionsmönster där kombinationer ger bäst resultat.

Avancerad
13 min läsning
Artikel

Lansera en LLM-produkt: prissättning, marginaler och fällan med skenbara konkurrensvallgravar

LLM-baserade produkter har svårare ekonomi än traditionell SaaS: rörliga kostnader som följer användningen, marginaler som pressas av inferens, risk för standardisering och konkurrenter med samma grundmodeller. Så bygger du en produkt som faktiskt går att försvara – och undviker mönstren bakom LLM-uppstartsföretag som försvinner.

Avancerad
13 min läsning
Artikel

Strukturerade utdata och funktionsanrop: produktionsmönstren

Strukturerade utdata och funktionsanrop är bron från ”en LLM som genererar text” till ”ett system som utför arbete”. I produktion handlar de viktiga mönstren om scheman, felhantering, idempotens och kontrollerad degradering – inte bara JSON-läge.

Avancerad
211 minuter
Video

Djupdykning i LLM:er som ChatGPT

Andrej Karpathy. Det här är YouTubes tydligaste heltäckande förklaring av vad en LLM faktiskt är – förträning, tokenisering, SFT, RLHF, resonemangsträning med förstärkningsinlärning, verktygsanvändning och hallucinationer – på den detaljnivå en ingenjör behöver för att kunna resonera om modellavvägningar. Se den en gång, så slutar artikelns beslut mellan ”modeller i GPT-klassen, modeller med öppna vikter och resonemangsmodeller” att kännas som varumärkesval och börjar kännas som val mellan träningsmetoder.

Avancerad
40 minuter
Video

Andrej Karpathy: mjukvara förändras (igen)

Y Combinator. I sitt huvudanförande på AI Startup School beskriver Karpathy LLM:er som en ny sorts dator – allmännyttig tjänst, fabrik och operativsystem i ett – och argumenterar för produkter med ”partiell autonomi” där människan håller systemet i strama tyglar. Det är den tydligaste formuleringen av den mentala modell på stacknivå som artikeln förutsätter: du väljer inferensleverantörer och verktyg för ett programmerbart fundament, inte för en chattbot.

Avancerad
9 minuter
Video

LangSmith på 10 minuter

LangChain. En av LangChains medgrundare ger en guidad rundtur i ett LLM-spår, ett projekt och en datamängd – tokenkostnad, latens, felfrekvens, aggregering av återkoppling och fördjupning i ett enskilt spann för ett hämtningssteg. Det är den närmaste visuella motsvarigheten till det artikeln beskriver med ”varje anrop är ett spann” och varför strukturerade spår är bättre än loggning med utskrifter.

Avancerad
154 minuter
Video

Instrumentering och utvärdering av LLM:er

Hamel Husain. Hamel Husain, Eugene Yan, Brian Bischof, Harrison Chase och Shreya Shankar arbetar med spårning, logganalys, LLM som bedömare och arbetsflödet för att granska verkliga produktionsdata. Ge den samma uppmärksamhet som en lång podd – det är YouTubes bästa enskilda djupbehandling av artikelns tes ”titta på dina spår”.

Avancerad
77 minuter
Video

Promptteknik för AI: en djupdykning

Anthropic. Fyra promptingenjörer på Anthropic – inom forskning, anpassning, tillämpning och utvecklarrelationer – talar utförligt om vad de faktiskt gör till vardags: hur de redigerar prompter under press, hur de ser på ”ärlighet” i instruktioner, när XML-strukturer hjälper och när de inte gör det. Artikelns lagermodell stämmer väl överens med hur de beskriver arbetet. Det här är det bästa sättet att höra den mentala modellen formuleras högt.

Avancerad
25 minuter
Video

Promptning 101 | Code w/ Claude

Anthropic. En direktsänd byggsession där Anthropics Applied AI-team arbetar med en prompt för försäkringsanspråk. De börjar med en vag instruktion och itererar fram något som en utvecklare faktiskt skulle driftsätta, vilket visar den typ av ändringar i system- och utvecklarlagren som artikeln beskriver. Se den innan du läser om artikelns checklista för exempel, utdatastruktur och hantering av vägran.

Avancerad
42 minuter
Video

Vertikala AI-agenter kan bli 10X större än SaaS

Y Combinator. Värdarna för Lightcone går igenom varför vertikala AI-agenter – inte horisontella omslagstjänster – är den försvarbara formen för företag i applikationslagret, med konkreta exempel och en nykter bedömning av vilka kategorier modelleverantörerna kommer att sluka. Det är den omvända vallgravsfälla som artikeln varnar för, uttryckt som en positiv spelplan.

Avancerad
34 minuter
Video

Så förändrar AI affärsmodellerna för programvara med Bret Taylor från Sierra

Sequoia Capital. Bret Taylor går igenom skiftet från SaaS-prissättning per användarplats till resultatbaserad prissättning – vilka mått man bör utgå från (lösningsgrad, CSAT och NPS), varför etablerade aktörer har svårt att följa efter och hur vertikal specialisering skapar prissättningskraft. Det speglar direkt artikelns avsnitt om prissättning och marginaler.

Avancerad
41 minuter
Video

OpenAI DevDay 2024 | Strukturerade utdata för tillförlitliga applikationer

OpenAI. Går igenom `strict: true`, skillnaden mot det gamla JSON-läget, hantering av vägran och hur funktionsanrop kombineras med scheman för svarsformat. Den är användbar just för att den beskriver det avtal som API:et ger dig, vilket är grunden för artikelns produktionsmönster.

Avancerad
18 minuter
Video

Pydantic är allt du behöver: Jason Liu

AI Engineer. Föredraget som utkristalliserade det moderna mönstret ”definiera en Pydantic-modell, ge den till LLM:en och låt valideringen sköta resten”, med konkreta exempel på nästlade objekt, validerare som upptäcker hallucinerade URL:er och Chain-of-Thought som ett typat fält. Se den innan du läser om artikelns avsnitt om validerare, så kommer du att känna igen varifrån reglerna för nya försök och vägran kommer.

Avancerad