Ämne

LLM-appar i produktion

Utforma, lansera, observera och driva LLM-applikationer efter demostadiet.

34 innehållsposter (23 artiklar · 11 videor)

Börja här

Börja med några rekommenderade innehållsposter innan du går igenom hela flödet.

Mer i detta ämne

8 min läsning
Artikel

Hermes kontra n8n: välj efter arbetsuppgift (och när du ska använda båda)

Ett beslutsramverk för Hermes Agent och n8n: deterministiska flöden stannar i n8n, medan ett bearer-autentiserat Hermes API-steg eller en separat händelsewebhook hanterar avgränsat agentarbete.

Mellannivå
8 min läsning
Artikel

OpenClaw kontra Hermes: välj efter arbetsuppgift, inte varumärke

OpenClaw och Hermes är överlappande agentsystem i egen drift med olika operativa styrkor. Jämför kanaldirigering, webhooks, verktyg och automatiseringsgränser innan du väljer det ena, det andra eller båda.

Mellannivå
10 min läsning
Artikel

Experimentell stack med två DGX Spark-enheter, DeepSeek-V4-Flash, n8n och Hermes

Så utvärderar du en experimentell väg från användargemenskapen för DeepSeek-V4-Flash på två DGX Spark-enheter, med n8n för den deterministiska delen och Hermes för bedömningsuppgifter.

Avancerad
69 minuter
Video

Agentlandskapet – lärdomar från att driftsätta agenter i produktion

MLOps.community. Prosus AI-chef och en AI-utvecklare berättar vad som faktiskt gick sönder när de driftsatte agenter i koncernens portföljbolag: penetrationstestning av promptinjektion före lansering, en osäker skrivning när en Jira-agent inte kunde tolka mänsklig kortnotation, inaktuell kontext som hanterades genom att agenterna fick redovisa sina antaganden samt reservlösningar som slog samman eller stängde av agenter när dessa började öka den kognitiva belastningen. Det är som att se artikelns register över fellägen spelas upp som en direktsänd incidentanalys.

Avancerad
11 min läsning
Artikel

Välja agentramverk 2026: en reproducerbar utvärdering

Jämför agentramverk mot ett representativt arbetsflöde, uttalade driftkrav och en genomgång av utträdeskostnaden – i stället för att luta dig mot popularitet och tyckande.

Avancerad
13 min läsning
Artikel

Utforma agenter som inte fastnar i oändliga loopar

Det vanligaste agentfelet i produktion är oändliga eller skenbart oändliga loopar – agenter som försöker igen, förgrenar sig och förbrukar token utan att göra framsteg. Här är arkitekturmönstren som förhindrar detta och skapar agenter som slutför även svåra uppgifter.

Avancerad
12 min läsning
Artikel

Datoranvändning och webbläsaragenter i produktion

Datoranvändning och webbläsaragenter ger demonstrationer som blir virala. Produktionsdrift i stor skala ser annorlunda ut – snäv avgränsning, omfattande skyddsräcken och genomtänkt användarupplevelse. Här är mönstren som fungerar, felen vi ser gång på gång och den ärliga ekonomiska kalkylen.

Avancerad
12 min läsning
Artikel

Kontextutveckling: hantera fönster med 1 miljon token utan kontextförfall

Kontextfönster med 1 miljon token finns, men kvaliteten försämras långt före gränsen. Kontextutveckling är disciplinen att använda kontextfönster effektivt – vad som ska tas med, sammanfattas eller hämtas på nytt, samt mönstren som håller kvaliteten hög när kontexten växer.

Avancerad
12 min läsning
Artikel

Kostnadsoptimera inferens: promptcachning, routing och kontroll av utdata

Bygg en kostnadsmodell för inferens utifrån mätdata, optimera de största kostnadsposterna och visa att varje ändring bevarar kvaliteten i uppgiften.

Avancerad
13 min läsning
Artikel

Bygg utvärderingar som faktiskt upptäcker regressioner

De flesta utvärderingssviter ser imponerande ut men missar verkliga regressioner. För att bygga utvärderingar som upptäcker det viktiga krävs noggrann konstruktion av dataset, känsliga mätetal, kalibrering av bedömare och en tillitskultur. Här är mönstren från team som lyckas.

Avancerad
13 min läsning
Artikel

Finjustering 2026: ett evidensbaserat experiment med LoRA och QLoRA

Avgör om parametereffektiv finjustering är motiverad, styr datahanteringen, lås ett reproducerbart experiment, jämför resultat på undanhållna data och säkerhetstester samt mät serveringen före driftsättning.

Avancerad
14 min läsning
Artikel

MCP-serverdesign i TypeScript: från minimal server till produktionsgranskning

Bygg en minimal Model Context Protocol-server och granska sedan designen – scheman, behörighetskontroll, idempotens, observerbarhet, driftsättning och säkerhet – innan du kallar den produktionsklar.

Avancerad
12 min läsning
Artikel

Utforma MCP-verktyg som LLM-modeller faktiskt använder rätt

De flesta MCP-verktyg vi ser är tekniskt korrekta men praktiskt oanvändbara. LLM-modeller ignorerar dem, använder dem fel eller anropar dem på olämpliga sätt. Här är principerna för att utforma verktyg som LLM-modeller tar till sig naturligt, med exempel på vanliga fel och hur de åtgärdas.

Avancerad
12 min läsning
Artikel

Så bygger du minne för långvariga agenter

Långvariga agenter behöver en persistenslösning med tydligt ansvar: proveniens, bekräftelse, isolering mellan kundorganisationer, tester av informationshämtning, lagringstid, korrigering och verifierbar radering.

Avancerad
10 min läsning
Artikel

Flermodellsorkestrering: routning efter kostnad, latens och kvalitet

Att routa olika uppgifter till olika modeller kan minska kostnader eller svarstid, men bara en arbetsbelastningsspecifik utvärdering kan visa om den ökade komplexiteten lönar sig. Mönster, mätningar och felkällor.

Mellannivå
12 min läsning
Artikel

Observerbarhet för LLM-appar: spårning, kostnader, svarstid och kvalitetsdrift

Utöka vanlig observerbarhet med flerstegsspår, hänförbar kostnad, prompt- och modellversioner, utvärderade kvalitetssignaler, integritetskontroller och aviseringar som härleds från arbetsbelastningen.

Avancerad
12 min läsning
Artikel

Bygg ett produktionsklart RAG-system: inläsning, inbäddning, hämtning, omrangordning och utvärdering

En produktionsklar RAG-pipeline består av sex steg, vart och ett med specifika mönster som avgör kvaliteten. Arkitekturen, valen i varje steg och den iterativa utvärderingsdisciplin som skiljer ett fungerande RAG-system från ett som gör användarna besvikna.

Avancerad
14 min läsning
Artikel

Promptinjektion och LLM-säkerhet: hotmodeller och djupförsvar

Promptinjektion är en permanent säkerhetsriskklass för LLM-system, inte ett misstag i promptskrivningen. En produktionsguide till hotmodeller, datagränser, verktygsbehörigheter, regressionstester, övervakning och incidenthantering.

Avancerad
12 min läsning
Artikel

Välj mellan promptning, RAG och finjustering (och när de bör kombineras)

Promptning, RAG och finjustering är de tre stora verktygen för att anpassa LLM-modeller till ditt problem. Var och en passar vissa problem och är fel för andra. Ett ramverk för valet, de realistiska kostnaderna och de produktionsmönster där kombinationer ger bäst resultat.

Avancerad
13 min läsning
Artikel

LLM-produktens enhetsekonomi: ett underlagsbaserat arbetsblad för prissättning

Modellanvändningens fördelning, marginalbidrag, felhantering, support och kundbehållning innan du väljer pris. Arbetsbladet ersätter ogrundade marknadsintervall med granskningsbara indata.

Avancerad
13 min läsning
Artikel

Strukturerade utdata och funktionsanrop: produktionsmönstren

Strukturerade utdata och funktionsanrop är bron från ”en LLM som genererar text” till ”ett system som utför arbete”. I produktion handlar de viktiga mönstren om scheman, felhantering, idempotens och kontrollerad degradering – inte bara JSON-läge.

Avancerad
211 minuter
Video

Djupdykning i LLM:er som ChatGPT

Andrej Karpathy. Det här är YouTubes tydligaste heltäckande förklaring av vad en LLM faktiskt är – förträning, tokenisering, SFT, RLHF, resonemangsträning med förstärkningsinlärning, verktygsanvändning och hallucinationer – på den detaljnivå en ingenjör behöver för att kunna resonera om modellavvägningar. Se den en gång, så slutar artikelns beslut mellan ”modeller i GPT-klassen, modeller med öppna vikter och resonemangsmodeller” att kännas som varumärkesval och börjar kännas som val mellan träningsmetoder.

Avancerad
40 minuter
Video

Andrej Karpathy: mjukvara förändras (igen)

Y Combinator. I sitt huvudanförande på AI Startup School beskriver Karpathy LLM:er som en ny sorts dator – allmännyttig tjänst, fabrik och operativsystem i ett – och argumenterar för produkter med ”partiell autonomi” där människan håller systemet i strama tyglar. Det är den tydligaste formuleringen av den mentala modell på stacknivå som artikeln förutsätter: du väljer inferensleverantörer och verktyg för ett programmerbart fundament, inte för en chattbot.

Avancerad
9 minuter
Video

LangSmith på 10 minuter

LangChain. En av LangChains medgrundare ger en guidad rundtur i ett LLM-spår, ett projekt och en datamängd – tokenkostnad, latens, felfrekvens, aggregering av återkoppling och fördjupning i ett enskilt spann för ett hämtningssteg. Det är den närmaste visuella motsvarigheten till det artikeln beskriver med ”varje anrop är ett spann” och varför strukturerade spår är bättre än loggning med utskrifter.

Avancerad
154 minuter
Video

Instrumentering och utvärdering av LLM:er

Hamel Husain. Hamel Husain, Eugene Yan, Brian Bischof, Harrison Chase och Shreya Shankar arbetar med spårning, logganalys, LLM som bedömare och arbetsflödet för att granska verkliga produktionsdata. Ge den samma uppmärksamhet som en lång podd. Det är den bästa enskilda djupgående genomgången på YouTube av artikelns tes ”titta på dina spår”.

Avancerad
77 minuter
Video

Promptteknik för AI: en djupdykning

Anthropic. Fyra promptingenjörer på Anthropic – inom forskning, anpassning, tillämpning och utvecklarrelationer – talar utförligt om vad de faktiskt gör till vardags: hur de redigerar prompter under press, hur de ser på ”ärlighet” i instruktioner, när XML-strukturer hjälper och när de inte gör det. Artikelns lagermodell stämmer väl överens med hur de beskriver arbetet. Det här är det bästa sättet att höra den mentala modellen formuleras högt.

Avancerad
25 minuter
Video

Promptning 101 | Code w/ Claude

Anthropic. En direktsänd byggsession där Anthropics Applied AI-team arbetar med en prompt för försäkringsanspråk. De börjar med en vag instruktion och itererar fram något som en utvecklare faktiskt skulle driftsätta, vilket visar den typ av ändringar i system- och utvecklarlagren som artikeln beskriver. Se den innan du läser om artikelns checklista för exempel, utdatastruktur och hantering av vägran.

Avancerad
42 minuter
Video

Vertikala AI-agenter kan bli 10X större än SaaS

Y Combinator. Värdarna för Lightcone går igenom varför vertikala AI-agenter – inte horisontella omslagstjänster – är den försvarbara formen för företag i applikationslagret, med konkreta exempel och en nykter bedömning av vilka kategorier modelleverantörerna kommer att sluka. Det är den omvända vallgravsfälla som artikeln varnar för, uttryckt som en positiv spelplan.

Avancerad
34 minuter
Video

Så förändrar AI affärsmodellerna för programvara med Bret Taylor från Sierra

Sequoia Capital. Bret Taylor går igenom skiftet från SaaS-prissättning per användarplats till resultatbaserad prissättning – vilka mått man bör utgå från (lösningsgrad, CSAT och NPS), varför etablerade aktörer har svårt att följa efter och hur vertikal specialisering skapar prissättningskraft. Det speglar direkt artikelns avsnitt om prissättning och marginaler.

Avancerad
41 minuter
Video

OpenAI DevDay 2024 | Strukturerade utdata för tillförlitliga applikationer

OpenAI. Går igenom `strict: true`, skillnaden mot det gamla JSON-läget, hantering av vägran och hur funktionsanrop kombineras med scheman för svarsformat. Den är användbar just för att den beskriver det avtal som API:et ger dig, vilket är grunden för artikelns produktionsmönster.

Avancerad
18 minuter
Video

Pydantic är allt du behöver: Jason Liu

AI Engineer. Föredraget som utkristalliserade det moderna mönstret ”definiera en Pydantic-modell, ge den till LLM:en och låt valideringen sköta resten”, med konkreta exempel på nästlade objekt, validerare som upptäcker hallucinerade URL:er och Chain-of-Thought som ett typat fält. Se den innan du läser om artikelns avsnitt om validerare, så kommer du att känna igen varifrån reglerna för nya försök och vägran kommer.

Avancerad