suche
ESC

Lokale LLM-Modelle wählen

Ein passendes Ollama-Modell nach RAM, Kontextlänge und Einsatzzweck auswählen.

Azubi KI 15 Min +100 XP

Worum geht’s

Lokale Sprachmodelle (z. B. via Ollama) laufen auf deiner eigenen Hardware — datensparsam und ohne Cloud. Aber nicht jedes Modell läuft auf jedem Rechner. Entscheidend sind drei Zahlen: Parameterzahl, RAM-Bedarf und Kontextlänge. Dieses Modul zeigt, wie du aus der Vergleichstabelle das richtige Modell für eine gegebene Maschine und Aufgabe ablesest — reines Interpretieren, keine Modell-Theorie.

Konzept

Drei Größen steuern die Wahl:

  • Parameter (z. B. 7B, 13B, 70B): „B” = Milliarden Parameter. Mehr Parameter = klüger, aber langsamer und speicherhungriger.
  • RAM/VRAM-Bedarf: Hängt von Parameterzahl und Quantisierung ab. Faustregel für 4-Bit-quantisierte Modelle: grob ~0,7 GB pro Milliarde Parameter plus Overhead. Ein 7B-Modell braucht so ca. 5–6 GB, ein 13B-Modell ca. 9–10 GB. Ohne GPU läuft das im System-RAM, dann aber langsamer.
  • Kontextlänge: Maximale Tokenzahl pro Anfrage (vgl. Modul „Tokens schätzen”). Lange Dokumente brauchen ein Modell mit großem Kontext.

Die Grundregel: Wähle das größte Modell, das sicher in deinen Speicher passt — und das genug Kontext für deine typische Eingabe bietet. Lieber ein flüssig laufendes 7B als ein 13B, das den Rechner ins Swappen treibt.

Grober RAM-Bedarf nach Modellgröße (4-Bit-quantisiert, ~0,7 GB je Milliarde Parameter):

Beispiel-Fall

Gegeben: Laptop mit 16 GB RAM, keine dedizierte GPU. Aufgabe: längere Logauszüge (ca. 6000 Tokens) zusammenfassen.

  1. Speicher-Budget: 16 GB RAM, davon braucht das OS ~4 GB. Bleiben ~12 GB fürs Modell.
  2. Kandidaten prüfen: Ein 7B-Modell (~6 GB) passt locker, ein 13B (~10 GB) gerade noch — aber eng. Ein 70B (~40 GB) ist ausgeschlossen.
  3. Kontext prüfen: 6000 Tokens Eingabe → ein Modell mit mindestens 8k Kontext wählen, damit Eingabe + Zusammenfassung passen.
  4. Verdikt: Ein 7B-Modell mit 8k+ Kontext ist die sichere, flüssige Wahl. 13B nur, wenn Geschwindigkeit zweitrangig ist.

So liest man die Tabelle: Speicher zuerst (harte Grenze), dann Kontext, dann Qualität.

Anwenden

▶ Am Tool ausprobieren

Die Modell-Tabelle filtert nach RAM und Kontext — so siehst du sofort, was auf deiner Hardware realistisch läuft.

  1. Stelle den RAM-Filter auf den Wert deiner Maschine (z. B. 16 GB) ein.
  2. Vergleiche die verbleibenden Modelle nach Kontextlänge und Einsatzzweck.
  3. Wähle das größte Modell, das in dein Speicher-Budget passt und genug Kontext für deine typische Eingabe bietet.
Tool öffnen: /ollama-modelle ↗

Selbsttest

Praxis-Challenge

⚑ Praxis-Challenge

Nimm die RAM-Größe deines eigenen Rechners. Filtere die Modell-Tabelle danach und notiere die drei größten Modelle, die noch passen. Wähle für die Aufgabe „lange E-Mails zusammenfassen” das beste aus — und begründe in einem Satz, warum du Kontextlänge und Speicher gegeneinander abgewogen hast.

Tool öffnen: /ollama-modelle ↗

Modul im Speedrun testen →