Worum geht’s
Lokale Sprachmodelle (z. B. via Ollama) laufen auf deiner eigenen Hardware — datensparsam und ohne Cloud. Aber nicht jedes Modell läuft auf jedem Rechner. Entscheidend sind drei Zahlen: Parameterzahl, RAM-Bedarf und Kontextlänge. Dieses Modul zeigt, wie du aus der Vergleichstabelle das richtige Modell für eine gegebene Maschine und Aufgabe ablesest — reines Interpretieren, keine Modell-Theorie.
Konzept
Drei Größen steuern die Wahl:
- Parameter (z. B. 7B, 13B, 70B): „B” = Milliarden Parameter. Mehr Parameter = klüger, aber langsamer und speicherhungriger.
- RAM/VRAM-Bedarf: Hängt von Parameterzahl und Quantisierung ab. Faustregel für 4-Bit-quantisierte Modelle: grob ~0,7 GB pro Milliarde Parameter plus Overhead. Ein 7B-Modell braucht so ca. 5–6 GB, ein 13B-Modell ca. 9–10 GB. Ohne GPU läuft das im System-RAM, dann aber langsamer.
- Kontextlänge: Maximale Tokenzahl pro Anfrage (vgl. Modul „Tokens schätzen”). Lange Dokumente brauchen ein Modell mit großem Kontext.
Die Grundregel: Wähle das größte Modell, das sicher in deinen Speicher passt — und das genug Kontext für deine typische Eingabe bietet. Lieber ein flüssig laufendes 7B als ein 13B, das den Rechner ins Swappen treibt.
Grober RAM-Bedarf nach Modellgröße (4-Bit-quantisiert, ~0,7 GB je Milliarde Parameter):
Beispiel-Fall
Gegeben: Laptop mit 16 GB RAM, keine dedizierte GPU. Aufgabe: längere Logauszüge (ca. 6000 Tokens) zusammenfassen.
- Speicher-Budget: 16 GB RAM, davon braucht das OS ~4 GB. Bleiben ~12 GB fürs Modell.
- Kandidaten prüfen: Ein 7B-Modell (~6 GB) passt locker, ein 13B (~10 GB) gerade noch — aber eng. Ein 70B (~40 GB) ist ausgeschlossen.
- Kontext prüfen: 6000 Tokens Eingabe → ein Modell mit mindestens 8k Kontext wählen, damit Eingabe + Zusammenfassung passen.
- Verdikt: Ein 7B-Modell mit 8k+ Kontext ist die sichere, flüssige Wahl. 13B nur, wenn Geschwindigkeit zweitrangig ist.
So liest man die Tabelle: Speicher zuerst (harte Grenze), dann Kontext, dann Qualität.
Anwenden
Die Modell-Tabelle filtert nach RAM und Kontext — so siehst du sofort, was auf deiner Hardware realistisch läuft.
- Stelle den RAM-Filter auf den Wert deiner Maschine (z. B. 16 GB) ein.
- Vergleiche die verbleibenden Modelle nach Kontextlänge und Einsatzzweck.
- Wähle das größte Modell, das in dein Speicher-Budget passt und genug Kontext für deine typische Eingabe bietet.
Selbsttest
Praxis-Challenge
Nimm die RAM-Größe deines eigenen Rechners. Filtere die Modell-Tabelle danach und notiere die drei größten Modelle, die noch passen. Wähle für die Aufgabe „lange E-Mails zusammenfassen” das beste aus — und begründe in einem Satz, warum du Kontextlänge und Speicher gegeneinander abgewogen hast.