Hej @madsenandersc , jeg er nysgerrig på det her med at drive egne LLM'er.
-
@anderslund @LarsHenriksen @madsenandersc Er SkoleGPT ikke allerede defacto godkendt ordgenerator i skolerne?
@oldrup @anderslund @madsenandersc jo, men kan de hamle op med de store?
-
@LarsHenriksen @madsenandersc
Du kan evt tjekke om kommunen er med i OS2AI projektet. https://www.os2.eu/os2ai@benjaminlj @madsenandersc tak, det ser spændende ud.
-
Hej @madsenandersc , jeg er nysgerrig på det her med at drive egne LLM'er.
Hvad ville det kræve/koste at lave en lokal server til en skole med 1000 elever, hvor både lærere og elever kunne oprette og bruge agenter?
Det skulle helst være muligt at installere flere åbne modeller.
Eller måske burde det være en løsning til alle skoler i kongeriget?
Uha - det er et ret omfattende spørgsmål med en hel masse variabler, så det er ikke så let at svare på.
Der er to ressourcer, der er i spil: RAM og GPU-kraft.
RAM-mængden har indflydelse på kvaliteten af de svar, man kan få fra sin egen LLM. Jo større en LLM er, jo mere nuancerede og pålidelige svar kan man få, alt andet lige.
GPU-kraften har indflydelse på, hvor hurtigt, man kan få sine svar. Jo større din LLM er, jo flere kræfter skal der til for at lave et svar - igen, alt andet lige.
Udfordringen er altså at finde en LLM-model, der leverer svar, der er "gode nok" til at opfylde ens behov i forhold til kvalitet og hastighed, og så finde hardware, der passer til netop det behov.
Jeg ved på ingen måde nok til at kunne give råd om store implementeringer af LLM-løsninger, men jeg kan illustrere nogen af udfordringerne med min egen løsning.
Jeg bruger en lokal computer med Ollama til inferens og AnythingLLM som interface.
Hardwaren er en AMD Ryzen 7 8700G med en indbygget Radeon 780M GPU, som har fået tildelt 16GB dedikeret RAM i BIOS. Det er altså meget begrænset hardware, ikke ulig den, man kan finde i en kraftig bærbar computer.
1/2
-
Uha - det er et ret omfattende spørgsmål med en hel masse variabler, så det er ikke så let at svare på.
Der er to ressourcer, der er i spil: RAM og GPU-kraft.
RAM-mængden har indflydelse på kvaliteten af de svar, man kan få fra sin egen LLM. Jo større en LLM er, jo mere nuancerede og pålidelige svar kan man få, alt andet lige.
GPU-kraften har indflydelse på, hvor hurtigt, man kan få sine svar. Jo større din LLM er, jo flere kræfter skal der til for at lave et svar - igen, alt andet lige.
Udfordringen er altså at finde en LLM-model, der leverer svar, der er "gode nok" til at opfylde ens behov i forhold til kvalitet og hastighed, og så finde hardware, der passer til netop det behov.
Jeg ved på ingen måde nok til at kunne give råd om store implementeringer af LLM-løsninger, men jeg kan illustrere nogen af udfordringerne med min egen løsning.
Jeg bruger en lokal computer med Ollama til inferens og AnythingLLM som interface.
Hardwaren er en AMD Ryzen 7 8700G med en indbygget Radeon 780M GPU, som har fået tildelt 16GB dedikeret RAM i BIOS. Det er altså meget begrænset hardware, ikke ulig den, man kan finde i en kraftig bærbar computer.
1/2
På den hardware kører jeg primært 3 modeller:
Mistral-3:3B
Mistral-3:8B
Mistral-3:14BDen mindste model (3b) bruger jeg primært til hurtige opslag som jeg ikke skal bruge til noget vigtigt. Her får jeg omkring 18 tokens/sekund, og svaret starter med at komme stort set øjeblikkeligt og er færdigt på under et minut.
Den midterste model (8b) er den, jeg bruger når der skal laves en lidt mere omfattende indsamling af data fra flere kilder og holdes styr på dem, indtil de puttes i en sammenfattende tekst. Her får jeg omkring 8-10 tokens/sekund, hvilket giver mig et svar på 1-3 minutter.
Den største model (14b) bruger jeg, hvis der skal samles data fra flere kilder og laves en grundigere analyse af dem.
Her får jeg som regel 5 tokens/sekund, så et svar tager tit 5-10 minutter. Kvaliteten er ofte på et niveau, der ligger omkring eller lidt under kvaliteten på https://chat.mistral.ai/chatAlle svar kommer serielt, så ét svar skal være færdigt før det næste begynder at komme. Det vil være håbløst i et scenarie med 1000 elever, og det er derfor, jeg slet ikke tør sige noget om, hvordan det løses i praksis.

2/2
-
På den hardware kører jeg primært 3 modeller:
Mistral-3:3B
Mistral-3:8B
Mistral-3:14BDen mindste model (3b) bruger jeg primært til hurtige opslag som jeg ikke skal bruge til noget vigtigt. Her får jeg omkring 18 tokens/sekund, og svaret starter med at komme stort set øjeblikkeligt og er færdigt på under et minut.
Den midterste model (8b) er den, jeg bruger når der skal laves en lidt mere omfattende indsamling af data fra flere kilder og holdes styr på dem, indtil de puttes i en sammenfattende tekst. Her får jeg omkring 8-10 tokens/sekund, hvilket giver mig et svar på 1-3 minutter.
Den største model (14b) bruger jeg, hvis der skal samles data fra flere kilder og laves en grundigere analyse af dem.
Her får jeg som regel 5 tokens/sekund, så et svar tager tit 5-10 minutter. Kvaliteten er ofte på et niveau, der ligger omkring eller lidt under kvaliteten på https://chat.mistral.ai/chatAlle svar kommer serielt, så ét svar skal være færdigt før det næste begynder at komme. Det vil være håbløst i et scenarie med 1000 elever, og det er derfor, jeg slet ikke tør sige noget om, hvordan det løses i praksis.

2/2
@madsenandersc mange tak for udførligt svar

-
Hej @madsenandersc , jeg er nysgerrig på det her med at drive egne LLM'er.
Hvad ville det kræve/koste at lave en lokal server til en skole med 1000 elever, hvor både lærere og elever kunne oprette og bruge agenter?
Det skulle helst være muligt at installere flere åbne modeller.
Eller måske burde det være en løsning til alle skoler i kongeriget?
@LarsHenriksen @madsenandersc SkoleGPT er vel forsøget på at lave noget for alle på det grundlag.
-
@madsenandersc mange tak for udførligt svar

Ingen årsag.

Nu ved jeg ikke, hvor du er i forhold til selv at køre en LLM, men hvis du vil prøve at dyppe tæerne lidt i bassinet, kan jeg anbefale at installere AnythingLLM (https://anythingllm.com/download) på din lokale computer.
Det kører på Windows, Mac og Linux, og det har nået et niveau, hvor systemet selv kan finde ud af at gå på nettet og finde oplysninger, der er så opdaterede som muligt.
Selv på en relativ begrænset maskine (16 GB RAM er nok at foretrække) uden et dedikeret grafikkort, kan du komme afsted med at eksperimentere med mindre modeller som den ovennævnte Mistral-3:3b eller Gemma4-e2b (Gemma er Googles LLM, som ligger bag Gemini i en meget større udgave).
Personligt foretrækker jeg Mistral, da Gemma har det være lidt af et sludrechatol. Der kommer tit nogle meget lange svar på et simpelt spørgsmål.

-
Ingen årsag.

Nu ved jeg ikke, hvor du er i forhold til selv at køre en LLM, men hvis du vil prøve at dyppe tæerne lidt i bassinet, kan jeg anbefale at installere AnythingLLM (https://anythingllm.com/download) på din lokale computer.
Det kører på Windows, Mac og Linux, og det har nået et niveau, hvor systemet selv kan finde ud af at gå på nettet og finde oplysninger, der er så opdaterede som muligt.
Selv på en relativ begrænset maskine (16 GB RAM er nok at foretrække) uden et dedikeret grafikkort, kan du komme afsted med at eksperimentere med mindre modeller som den ovennævnte Mistral-3:3b eller Gemma4-e2b (Gemma er Googles LLM, som ligger bag Gemini i en meget større udgave).
Personligt foretrækker jeg Mistral, da Gemma har det være lidt af et sludrechatol. Der kommer tit nogle meget lange svar på et simpelt spørgsmål.

En hurtig opdatering: Jeg prøvede lige at installere AnythingLLM på en ældre HP ProBook med 8GB RAM, og det kunne godt installeres - det kunne bare ikke køre nogen form for modeller.

12 GB RAM er et absolut minimum, mens 16 GB RAM nok i praksis er den nedre grænse for noget, der kan bruges til noget.
-
En hurtig opdatering: Jeg prøvede lige at installere AnythingLLM på en ældre HP ProBook med 8GB RAM, og det kunne godt installeres - det kunne bare ikke køre nogen form for modeller.

12 GB RAM er et absolut minimum, mens 16 GB RAM nok i praksis er den nedre grænse for noget, der kan bruges til noget.
@madsenandersc Interessant jeg har selv rodet lidt med Ollama og LM studio:
-
@madsenandersc Interessant jeg har selv rodet lidt med Ollama og LM studio:
Ah - ja, det er meget i samme boldgade.
LM Studio er (så vidt jeg lige husker det, det er et stykke tid siden, jeg havde det installeret) ikke så omfattende, og er mest til at køre en ren chat.
AnythingLLM kan køre agenter lige ud af posen, og det gør den noget mere brugbar. Den er - igen, som jeg husker det - markant bedre til at finde informationer på internettet, og den kan udvides med ekstra tools og skills, hvis man vil arbejde med lidt mere avancerede ting.