Tilhørende videoer

Orkestrering af flere modeller: routing efter omkostninger, latenstid og kvalitet — ledsagende videoer

Artiklen argumenterer for, at det er et dårligt standardvalg at bruge GPT-5, Claude eller Gemini til alle opgaver. Når omkostninger og latenstid har betydning, kan en mindre model håndtere de enkle opgaver, mens større modeller reserveres til arbejde, der kræver dem. Den første video giver et mentalt kort over modellernes forskellige niveauer. Den anden viser routingmønstret i kode og dets forbindelse til et almindeligt API-kald.

Primært valg

19:01
Alle AI-modeller forklaret

Tina Huang

En overskuelig gennemgang af det aktuelle modellandskab opdelt i flagskibsmodeller, letvægtsmodeller, mellemklassen og specialiserede modeller med konkrete eksempler på, hvad hvert niveau egner sig til. Videoen dækker den del af artiklen, der handler om at kende mulighederne før routing, og Huang beskriver afvejningen mellem omkostning og kapacitet uden at gøre benchmarkresultater til hele beslutningsgrundlaget.

Hvad du bør få ud af dette: Sammenlign flagskibsmodeller, letvægtsmodeller, mellemklassen og specialiserede modeller, så routingbeslutninger bygger på opgaven, omkostningerne og latenstiden frem for et foretrukket brand.

Forudsætninger: Intet ud over artiklen. Videoen giver overblikket over mulighederne før det praktiske routingarbejde.

Bemærkning fra AI Expert: Modelnavne, priser og egenskaber ændrer sig hurtigt. Brug videoen til at forstå beslutningsmønstret, og kontrollér derefter den aktuelle modeladfærd, før det tages i brug.

Åbn videoside

Også værd at se

08:53
RouteLLM opnår 90% GPT-4o-kvalitet OG 80% BILLIGERE

Matthew Berman

Videoen gennemgår LMSYS' RouteLLM-artikel og kode. En lille klassifikator placeres foran et par af stærke og svage modeller og vælger, hvilken model der skal kaldes. I den viste evaluering nås omtrent 95% af den stærke models kvalitet til en brøkdel af omkostningen. Visningstallet ligger under den sædvanlige grænse på 100k, men videoen viser konkret modelrouting frem for blot at sammenligne modeller og passer derfor direkte til artiklens afvejning mellem kvalitet og omkostninger.

Hvad du bør få ud af dette: Evaluér afvejningerne mellem kvalitet, omkostninger og pålidelighed ved modelrouting, før du tilføjer kompleks orkestrering.

Forudsætninger: Fortrolig med at læse Python og kalde model-API'er; det primære valgs niveaukort hjælper.

Bemærkning fra AI Expert: Modelnavne, priser og egenskaber ændrer sig hurtigt. Brug videoen til at forstå beslutningsmønstret, og kontrollér derefter den aktuelle modeladfærd, før det tages i brug.

Åbn videoside