llamafile.ai
Download der bin.
sudo chmod +x ./llamafile
Aufruf mit
./llamafile -m oss20b.gguf --gpu disable --server --host 192.168.0.666 --port 1234 --parallel 1 --threads 12 -c 8192 -n 4096
Erklärung:
Der Befehl startet das KI-Modell oss20b.gguf als lokalen Server auf der IP-Adresse 192.168.0.666 (hier die echte IP des verwendeten Servers eintragen) und Port 1234.
Die GPU-Nutzung wird mit –gpu disable vollständig deaktiviert, sodass sämtliche Berechnungen ausschließlich auf der CPU erfolgen (sinnvoll bei nur 16GB RAM und einer iGPU).
Mit –threads 12 wird festgelegt, wieviele Threads verwendet werden dürfen (abhängig von der CPU).
–parallel 1 erlaubt nur eine gleichzeitige Anfrage, was Speicher spart und die Stabilität erhöht (sinnvoll, wenn man die Software alleine nutzt).
Das Modell kann sich mit -c 8192 bis zu 8192 Tokens Gesprächskontext merken und mit -n 4096 maximal 4096 neue Tokens pro Antwort erzeugen. Dadurch sind längere Antworten möglich. Hier kann man mit den Werten etwas spielen, falls man mehr Ressourcen hat, oder das Modell abstürzt, weil man zu hohe Werte verwendet hat.
Beispiel für AMD Ryzen 7 PRO 6850U und 32GB Ram
>llamafile.exe -m oss20b.gguf --server --host 192.168.0.666 --port 1234 --parallel 1 --threads 16 -c 12288 -n 4096