Uitgezocht, gemeten en efficiënt ingericht.
Strix Halo is een chip van AMD waarmee één kleine computer grote AI-modellen kan draaien, zonder cloud. In mijn Strix Halo Guide ↗ staat hoe je zo'n computer kiest (koopgids), instelt en het juiste model kiest, met snelheden die ik zelf heb gemeten. De ruwe meetdata staan er openbaar bij, tien mensen uit de community deelden hun eigen metingen, en fouten corrigeer ik openlijk.
- Welke software het best draait. Ik vergeleek op dezelfde hardware ruim twintig versies van llama.cpp, vijf versies van Ollama en de Lemonade-server, met tests die per versie zijn vastgelegd.
- Sneller door te meten. Een versnellingstechniek maakte een middelgroot model (27 miljard parameters) ruim 75% sneller, gemeten in tien herhalingen; bij een ander model was de winst ongeveer 8%. Zo weet je vooraf wat iets oplevert, in plaats van het te beloven.
- Wat past, en wat het kost. Welke modellen op één computer met 128 GB geheugen draaien, hoe snel, en wat zo'n systeem kost.
- Pas in gebruik na een test. Ik ontdekte dat een oudere versie zonder foutmelding verkeerde antwoorden gaf bij lange teksten. Sindsdien gaat een model bij mij pas in gebruik na een vaste test.
- Verbetering overgenomen in llama.cpp, een van de bekendste programma's om AI lokaal te draaien (bijna 130.000 sterren).
Uitgezochtgemeteningerichtgetestgedeeld