7:56Chroma
Kelly Hong gennemgår Chromas research på 18 modeller — hvorfor needle-in-haystack-scores er misvisende, hvordan performance degraderer med ambiguitet og distractors, hvorfor selv simple string-repetition-opgaver degraderer forbi 500 tokens. Kort, evidensbaseret og præcis den sag, artiklen behøver, at du tager alvorligt, før du kommer til engineering-grebene.
Hvad du bør få ud af dette: Forstå, hvordan lang kontekst kan fejle under ambiguitet og distractors, og design derefter tests omkring den risiko.
Forudsætninger: Intet ud over grundlæggende LLM-vocabular — det er et kort research-talk.
Bemærkning fra AI Expert: Modelnavne, priser og kapaciteter ændrer sig hurtigt. Brug den til beslutningsmønsteret, og verificér derefter aktuel modeladfærd, før du adopterer det.
