Tilhørende videoer

Vælg den rette model til opgaven — ledsagende videoer

Artiklen er en beslutningsguide: hvilken udbyder, hvilket niveau, hvilken "thinking"-kontakt til hvilken opgave. Valget nedenfor viser nogen, der faktisk skifter mellem de modeller på skærmen, så du kan se, hvorfor en praktiker i arbejdet ville række ud efter den ene frem for den anden i øjeblikket.

Primært valg

2:11:12
Sådan bruger jeg LLM'er

Andrej Karpathy

Karpathy bruger eksplicitte kapitler på "Be aware of the model you're using, pricing tiers" og "Thinking models and when to use them" og bliver ved med at skifte mellem ChatGPT, Claude, Gemini, Grok og Perplexity resten af gennemgangen. Det er det nærmeste, du kommer, til at se artiklens cheat sheet anvendt live af nogen med stærke holdninger til, hvornår hvert niveau gør sig fortjent.

Hvad du bør få ud af dette: Lær at route arbejde på tværs af hurtige, billige, dybt ræsonnerende og kildeforankrede værktøjer i stedet for at bruge én model til alt.

Forudsætninger: Fortrolig med mindst én mainstream-chatbot og med at sammenligne outputs på samme opgave.

Bemærkning fra AI Expert: Vanerne omkring modelvalg er værdifulde; præcise modelnavne, priser, kontekstgrænser og rangeringer er ikke stabile. Kør sammenligningen igen på dine egne opgaver, før du standardiserer en teamanbefaling.

Åbn videoside

Også værd at se

16:50
Den nye, klogeste AI: Claude 3 – testet mod Gemini 1.5 + GPT-4

AI Explained

Ældre end artiklen (marts 2024), men metoden er det nyttige: én omhyggelig anmelder kører de samme svære opgaver — OCR, theory of mind, instruktionsfølgning, matematik — gennem tre frontier-modeller side om side og viser præcis, hvor hver af dem knækker. Modelnavnene er forældede; rammen for at sammenligne modeller er det ikke.

Hvad du bør få ud af dette: Se en struktureret sammenligningsmetode, du kan genbruge, når du beslutter, hvilken model der er god nok til en opgave.

Forudsætninger: Vid, at Claude 3, Gemini 1.5 og GPT-4 ikke længere er frontier-baseline.

Bemærkning fra AI Expert: Behandl den som en video om testmetode, ikke en aktuel rangering. De konkrete vindere er historiske; det nyttige er at køre de samme eksempler, tjekke fejltilstande og modstå vage krav om "den bedste model".

Åbn videoside