Was ein kleines Sprachmodell ist
Ein Sprachmodell wird nach der Zahl seiner Parameter eingeordnet, also der gelernten Gewichte. Die großen Modelle der bekannten Anbieter haben Hunderte Milliarden davon. Als klein gelten Modelle mit etwa einer bis rund vierzehn Milliarden Parametern. Eine feste Grenze gibt es nicht. Die praktische Abgrenzung ist: Ein kleines Modell läuft auf normaler Hardware, ohne Rechenzentrum.
Möglich macht das die Quantisierung. Dabei werden die Gewichte mit weniger Stellen gespeichert, zum Beispiel mit 4 statt 16 Bit. Der Speicherbedarf sinkt dadurch um etwa drei Viertel, die Qualität meist nur wenig.
Bekannte offene Modellfamilien in dieser Größe sind Phi (Microsoft), Gemma (Google), Llama (Meta), Qwen (Alibaba) und Mistral. Sie erscheinen in schneller Folge in neuen Fassungen. Welche gerade am besten passt, sollte je Aufgabe neu geprüft werden.
Wofür ein kleines Modell reicht
Kleine Modelle sind stark bei Aufgaben, die immer gleich ablaufen und ein klares Ergebnis haben:
- Sortieren und Einordnen: Ist diese Mail eine Rechnung, eine Reklamation oder eine Anfrage? Welche Abteilung ist zuständig?
- Zusammenfassen: ein langes Protokoll in fünf Sätzen, eine Mail-Kette in drei Punkten.
- Daten aus Text ziehen: Rechnungsnummer, Betrag und Datum aus einem Schreiben, Name und Telefonnummer aus einer Anfrage.
- Diktate glätten: einen gesprochenen und in Text umgewandelten Satz in eine saubere Meldung bringen.
- Vorschläge für Standardantworten nach Ihren eigenen Vorlagen.
Forscher von NVIDIA haben 2025 genau diesen Punkt beschrieben: In vielen KI-Abläufen erledigt das Modell wenige, eng umrissene Aufgaben immer wieder. Dafür sind kleine Modelle nach ihrer Einschätzung ausreichend, besser geeignet und deutlich günstiger. Große Modelle braucht es dann nur noch für die Schritte, die wirklich freies Formulieren oder breites Wissen verlangen.
Wo ein kleines Modell nicht reicht
- Breites Allgemeinwissen. Ein kleines Modell weiß weniger und erfindet eher etwas, wenn es eine Antwort nicht kennt.
- Lange, anspruchsvolle Texte wie ein Angebotstext oder ein Fachbeitrag.
- Mehrstufiges Denken, etwa eine Auswertung mit mehreren Bedingungen.
- Sehr lange Dokumente auf einmal. Der Arbeitsspeicher setzt hier eine Grenze.
Für solche Aufgaben ist ein großes Modell beim Anbieter oft die bessere Wahl, sofern die Daten das Haus verlassen dürfen.
Welche Hardware Sie brauchen
Als Faustwert gilt bei 4-Bit-Quantisierung ein gutes halbes Gigabyte Arbeitsspeicher je Milliarde Parameter. Dazu kommt Speicher für den Text, den das Modell gerade verarbeitet.
| Modellgröße | Speicher bei 4 Bit, etwa | Läuft auf |
|---|---|---|
| 1 bis 3 Milliarden | 1 bis 3 GB | Notebook, Mini-PC, auch ohne Grafikkarte |
| 7 bis 8 Milliarden | 4 bis 6 GB | Mini-PC oder Server, mit Grafikkarte deutlich schneller |
| 12 bis 14 Milliarden | 8 bis 10 GB | Server mit Grafikkarte |
Ohne Grafikkarte funktioniert ein kleines Modell auch, antwortet aber langsamer. Für eine Mail-Sortierung im Hintergrund reicht das oft. Für ein Eingabefeld, in dem jemand auf die Antwort wartet, eher nicht.
Was es kostet: lokal gegen Cloud rechnen
Beim Cloud-Dienst zahlen Sie je Anfrage, abgerechnet nach Textmenge. Beim eigenen Modell zahlen Sie einmal die Hardware und danach Strom und Pflege. Ein Vergleich gelingt nur mit echten Zahlen aus Ihrem Alltag:
- Menge: Wie viele Durchläufe fallen im Monat an, zum Beispiel Mails?
- Cloud-Kosten: einen typischen Durchlauf beim Anbieter messen und mit der Menge malnehmen.
- Lokale Kosten: Hardware auf drei bis fünf Jahre verteilen, dazu Strom (Leistung des Geräts mal Laufzeit mal Strompreis) und die Zeit für Updates.
- Qualität: dieselben fünfzig echten Fälle durch beide Modelle schicken und die Ergebnisse vergleichen. Ein günstiges Modell, das jede zehnte Mail falsch einsortiert, ist am Ende teuer.
Bei kleinen Mengen ist die Cloud meist günstiger. Bei großen, gleichförmigen Mengen oder bei Daten, die das Haus nicht verlassen dürfen, spricht vieles für das eigene Modell.
Lokal heißt nicht automatisch sicher
Ein Modell im eigenen Netz löst die Frage, wohin die Daten gehen. Andere Fragen bleiben:
- Wer darf zugreifen? Das Modell braucht eine Anmeldung wie jeder andere Dienst. Es gehört nicht offen ins Netz.
- Was wurde wann verarbeitet? Ein Protokoll zeigt, welche Daten an das Modell gingen.
- Untergeschobene Anweisungen. Liest das Modell Mails oder Webseiten, kann darin ein Text stehen, der es zu etwas anderem bringen soll. Das heißt Prompt Injection. Dagegen hilft, dem Modell nur die Rechte zu geben, die seine Aufgabe braucht, und Ergebnisse vor dem Weiterverarbeiten zu prüfen.
- Updates. Die Software, auf der das Modell läuft, braucht Pflege wie jedes andere Programm.
- Freigabe vor Wirkung. Was nach außen geht oder Geld betrifft, bestätigt ein Mensch.
Der Mittelweg: beides kombinieren
In der Praxis ist selten ein Modell für alles die beste Lösung. Bewährt hat sich eine Aufteilung: Das kleine Modell im eigenen Netz übernimmt die Masse der einfachen Aufgaben und alles mit sensiblen Daten. Das große Modell beim Anbieter bekommt nur die anspruchsvollen Aufgaben, und nur mit Daten, die dafür freigegeben sind.
Checkliste vor dem Start
- Welche Aufgabe soll das Modell übernehmen, und wie oft fällt sie an?
- Dürfen die Daten das Haus verlassen?
- Wie sieht ein gutes Ergebnis aus, und wer prüft das?
- Gibt es fünfzig echte Beispiele für einen Test?
- Wer kümmert sich um Updates und Zugriffsrechte?
Fazit
Ein kleines Modell lohnt sich, wenn die Aufgabe eng umrissen ist, oft vorkommt oder die Daten das Haus nicht verlassen dürfen. Ob es reicht, zeigt ein Test mit echten Beispielen, nicht das Datenblatt.
Quellen
- Peter Belcak u. a. (NVIDIA Research, Georgia Institute of Technology): Small Language Models are the Future of Agentic AI, 2. Juni 2025.
- Speicherwerte bei 4-Bit-Quantisierung: Faustwerte aus Praxisberichten zum lokalen Betrieb, zum Beispiel How much RAM to run an LLM locally. Der genaue Bedarf hängt von Modell, Format und Textlänge ab.