Lokala AI-modeller i ingenjörsarbetsflöden

Under de första månaderna i år har vi fortsatt vårt tysta men stadiga arbete med att bygga och förfina ingenjörsagenter – sådana som styr komplexa projekterings- och analysarbetsflöden, kombinerar olika beräkningsverktyg och producerar resultat du kan lita på i verkliga projekt. En del av detta arbete har kretsat kring lokala AI-modeller.
Vi kör modeller lokalt främst av integritetsskäl. Kunddata kan ofta inte skickas till en moln-LLM, och även när det tekniskt sett skulle kunna göras, är det säkraste att behålla datan inom organisationen. Tack vare den senaste utvecklingen inom öppna modeller har detta inte inneburit lika stora kompromisser med kapaciteten som man kunde tro.
Nya modeller i vår stack
Två släpp stack ut i år:
- DeepSeek R1 (januari): en resonemangsfokuserad modell som är effektiv för ingenjörsagenter. Den hanterar beslutstunga arbetsflöden väl och håller stegkedjor sammanhängande och produktiva.
- Gemma 3 (mars): en kapabel, allmän modell från Google. En pålitlig allroundlösning för rutinmässiga och procedurella uppgifter.
Vi använder LangGraph som huvudsakligt styrningsbibliotek för våra agenter. I vår setup fungerar LLM:er som beslutsmotorer som avgör vilka verktyg som ska köras, när iteration ska ske och om resultat behöver omarbetas. Medan parametrisk data och vissa numeriska utvärderingar hanteras av traditionella ML-modeller, förblir LLM:en dirigenten för hela processen.
När en bättre modell gör gamla tricks föråldrade
En intressant upptäckt i våras kom när vi anslöt nyare modeller till äldre processer. I några fall var resultaten så mycket bättre att hela RAG-steg (Retrieval-Augmented Generation) blev onödiga för just den uppgiften. För mer komplexa uppgifter är RAG fortfarande ett värdefullt verktyg.
Till exempel, i ett gammalt arbetsflöde för tolkning av geotekniska undersökningar producerade den nya multimodala generiska modellen bättre sammanfattningar och slutsatser utan att behöva tillgång till referensdokument. Den gamla modellen behövde en detaljerad RAG-uppställning för att komma i närheten av den nivån. Naturligtvis är det inte alltid fallet – för komplexa eller mycket specialiserade uppgifter är RAG fortfarande meningsfullt – men det är en påminnelse om att modellförbättringar kan förenkla system.
Att köra lokalt är enklare än du tror
Du behöver inte exotisk hårdvara för att köra dessa modeller. Ett vanligt NVIDIA RTX 4080 – som finns i många avancerade speldatorer – kan hantera moderna LLM:er med 40–70 tokens per sekund, vilket är mer än tillräckligt för realtidsbaserade ingenjörsprocesser.
Våra arbetsflöden är ofta byggda för att ge live-feedback på iterativa parametrar, ibland med visuella uppdateringar under processen. Latens handlar inte bara om LLM-hastighet – det handlar om att hela systemet förblir responsivt – och moderna GPU:er gör detta praktiskt möjligt.
Varför vi fortsätter på detta sätt
Lokala modeller låter oss:
- Hålla kunddata helt privat
- Undvika leverantörsberoende av externa API:er
- Experimentera med mycket komplexa iterativa arbetsflöden utan extra kostnader för värdbaserade modeller
- Köra modeller säkert även när internet ligger nere
När ska man välja lokalt eller värdbaserat?
- Datakänslighet: reglerade eller konfidentiella dataset, lokala krav, eller kundkontrakt som begränsar externa AI-tjänster
- Latens och kontroll: interaktiva agentslingor, edge- eller offline-drift, eller när du behöver stark kontroll över exekvering
- Modellspecialisering: en värdbaserad modell överträffar tydligt tillgängliga öppna modeller för en specifik uppgift, eller en proprietär verktygskedja krävs
- Kostnad och skalning: stabil, förutsägbar användning där ägda GPU:er är kostnadseffektiva; ojämna arbetsbelastningar kan gynna värdbaserade lösningar
De är inte alltid rätt verktyg – det finns fortfarande fall där en specialiserad värdbaserad modell är värd integritetsavvägningen – men i standardiserade, upprepade arbetsflöden som består av enkla deluppgifter kan lokal-först-metoden vara särskilt effektiv.
Inom ingenjörsvetenskap är de bästa verktygen de som försvinner in i arbetsflödet – de som gör det lättare att fokusera på problemet, inte processen. Årets modelluppdateringar har gjort det lite enklare, och vi ser fram emot att se vad nästa släpp kommer att medföra.
Letar du efter expertlösningar? Upptäck Crestias professionella tjänster idag.