Spätestens seit der Veröffentlichung von ChatGPT im November 2022 sind Large Language Models (LLMs) in aller Munde.
Aber was ist ein LLM und was können diese „neuartigen Wundermaschinen“ überhaupt?
In diesem Lexikon-Eintrag erfährt du alles, was du als Anfänger über LLMs wissen musst:
1. Definition
Als Large Language Model (auf Deutsch: großes Sprachmodelle) oder kurz LLM bezeichnet man eine Software, die mit Methoden des maschinellen Lernens auf großen Textdatenmengen trainiert wurde.
Dadurch lernt es die Strukturen und Muster natürlicher Sprache und kann dann selbst sinnvolle, menschenähnliche Texte erzeugen.
Das Besondere an modernen LLMs ist, dass erzeugte Texte oft kaum von echtem, durch Menschen geschriebenen Text zu unterscheiden sind.
So ist es mit ChatGPT zum Beispiel möglich, lange und darüber hinaus auch gut gereimte Songtexte zu schreiben.
Bitte beachte:
ChatGPT und andere KI-Chatbots wie Claude, Microsoft Copilot oder Google Gemini sind selbst keine LLMs, sondern Tools. Sie basieren lediglich technisch auf einem oder mehreren LLMs.
ChatGPT basiert zum Beispiel auf der GPT-5-Reihe (GPT-5.5, GPT-5.4, GPT-5.3). Seit dem 09.07.2026 ist zusätzlich die GPT-5.6-Familie (Sol, Terra, Luna) allgemein verfügbar in ChatGPT, ChatGPT Work, Codex und der API. Google Gemini basiert auf „Gemini 3.1 Pro“ und „Gemini 3.5 Flash“. Die aktuelle Claude-Familie umfasst Claude Opus 5, Claude Sonnet 5 und Claude Haiku 4.5. Anthropic hat im Juni 2026 zusätzlich die Mythos-Klasse mit Claude Fable 5 und Claude Mythos 5 eingeführt. Fable 5 ist seit dem 01.07.2026 wieder allgemein verfügbar, Mythos 5 bleibt auf geprüfte Project-Glasswing-Partner beschränkt.
Leider kommt es da manchmal zu Verwechselungen, weil die Tools und die Modell gleich oder sehr ähnlich heißen.
2. Was können LLMs und wofür werden sie eingesetzt?
Large Language Models sind wahre Multitalente, wenn es um die Bearbeitung, Analyse und Erstellung von Texten geht.
Sie können viele Aufgaben erledigen, für die man früher spezialisierte Systeme gebraucht hätte oder die ohne LLMs schlichtweg unmöglich waren:
Texterstellung und -bearbeitung
- Zusammenfassen von Texten
- Übersetzen zwischen verschiedenen Sprachen
- Verfassen von Artikeln, Geschichten, Gedichten und vielen anderen Textarten
- Korrigieren von Rechtschreib- und Grammatikfehlern
- Paraphrasieren, also das Umschreiben von Text mit anderen Worten
Beantworten von Fragen und Führen von Dialogen
- Als Wissensdatenbank zu verschiedensten Themen
- Beantworten von Verständnisfragen zu einem Text oder Dokument
- Führen von Dialogen als interaktive Chatbots
Analysieren und Verstehen von Texten
- Textarten erkennen (Nachricht, Werbung, Fachtext etc.)
- Stimmung und Tonalität erkennen (positiv, negativ, formell, informell etc.)
- Identifikation von Personen, Organisationen, Orten etc. im Text
Programmieren
- Erklären von Code
- Generieren von Code
- Debugging (das Finden und Beheben von Fehlern und Sicherheitslücken im Code)
2.1 In welchen Tools werden sie eingesetzt?
LLMs kommen zum Beispiel in folgenden Tools zum Einsatz, entweder als Haupt- oder als Nebenfunktion:
- KI-Textgeneratoren
- KI-Chatbots
- KI-Sprachgeneratoren
- KI-Meeting-Assistenten
- KI-SEO-Tools
- KI-Avatargeneratoren
- KI-Videogeneratoren
3. Wie funktionieren LLMs?
LLMs basieren auf einer Technik namens „Deep Learning“. Dabei lernt ein neuronales Netzwerk anhand riesiger Textmengen, die Struktur und Logik von Sprache zu verstehen.
Es findet Muster und Zusammenhänge in den Daten, ohne dass diese explizit programmiert werden. Durch dieses Training entsteht ein statistisches Modell, das die Wahrscheinlichkeit von Wortfolgen abbildet.
Hier ein (stark vereinfachtes) Beispiel, wie ein LLM eine Antwort generiert:
1. Prompt: „Das Wetter heute ist sehr“
2. Das LLM schaut in seinem Modell nach den wahrscheinlichsten nächsten Worten
3. Basierend auf den gelernten Mustern ermittelt es folgende Wahrscheinlichkeiten:
- „gut“: 40 %
- „schlecht“: 30 %
- „wechselhaft“: 20 %
- usw.
4. Das LLM wählt das Wort „gut“ aus, weil es mit 40 % das wahrscheinlichste ist.
5. Das Sprachmodell wiederholt die Schritte 2 bis 4 für das nächste Wort: „Das Wetter heute ist gut und die Regenwahrscheinlichkeit sehr gering.“
6. Diese Schleife wiederholt das LLM, bis es ein Stoppkriterium erreicht (z. B. ein bestimmtes Satzzeichen kommt oder eine vorgegebene Menge generierte Zeichen oder Token erreicht ist)
4. Grenzen von LLMs
Durch ihren wahrscheinlichkeitsbasierten Ansatz können LLMs Texte generieren, die kaum von menschengemachten Texten zu unterscheiden sind.
Wichtig zu verstehen, ist jedoch, dass...
- LLMs kein echtes Verständnis von Konzepten oder Logik haben (sie reproduzieren nur Muster)
- kein Bewusstsein haben und nicht „lebendig“ sind (obwohl sie ziemlich gut darin sind, dir das vorzugaukeln)
- sie Fakten vermischen oder Dinge „halluzinieren“ (erfinden) können
- sie ein Knowledge Cutoff Date haben. Das heißt, nur Daten bis zu einem bestimmten Zeitpunkt berücksichtigten und es kann sein, dass sie veraltete Zahlen, Daten oder Fakten ausspucken.
- Antworten von LLMs variieren können (abhängig und unabhängig von den Befehlen oder Fragen, die man stellt)
- sie keine stabile Persönlichkeit oder ein konsistentes Wertesystem haben
Dazu kommt, dass die internen Abläufe von LLMs selbst für Experten und LLM-Entwickler eine Art „Blackbox“ sind.
Das heißt, obwohl man Input und Output kennt, kann man nicht genau nachvollziehen, wie der Output „zwischendrin“ zustande gekommen ist.
5. Risiken & Herausforderungen
So hilfreich und spannend LLMs auch sein mögen, bringen sie auch diverse Risiken und Herausforderungen mit, die hier nicht unerwähnt bleiben sollen.
Dazu gehören:
- Verbreitung von Fake News, Propaganda und Verschwörungstheorien
- Umgehen von internen Sicherheitsmechanismen von LLMs, z. B. durch Prompt Injections
- Missbrauch für Betrug, z. B. durch Imitieren von Personen und Generieren gefälschter Inhalte
- Verstärkung von Vorurteilen und Diskriminierung durch verzerrte Trainingsdaten
- Verletzung von Urheberrecht und Datenschutz durch Reproduzieren von Trainingsdaten (auch, wenn es durch die Arbeitsweise von LLMs eher selten dazu kommen)
- Ersetzung von menschlicher Arbeitskraft und Expertise in bestimmten Bereichen
Wichtig in dem Zusammenhang ist AI Governance, das heißt das Entwickeln von Prinzipien, Richtlinien und Prozessen, die sicherstellen, dass große Sprachmodelle und darauf basierende KI-Tools ethisch und verantwortungsvoll eingesetzt werden.
6. Liste bekannter LLMs und ihre Parameter
Die folgende interaktive Tabelle zeigt über 60 bekannte Large Language Models mit ihren Parameterzahlen. Du kannst nach Namen suchen, nach Entwickler, Größenkategorie oder Modelltyp filtern und die Spalten sortieren:
Legende:
Zeige 274 Modelle
Modell | Entwickler | Parameter |
|---|---|---|
MiniMax M2.7 MoE | MiniMax | Unbekannt |
MiniMax M2.5 MoE | MiniMax | Unbekannt |
GLM-4.7 MoE | Z.ai | Unbekannt |
GLM-4.7-Flash MoE | Z.ai | Unbekannt |
GLM-4.6V MoE | Z.ai | Unbekannt |
GPT-5.6 Sol | OpenAI | Unbekannt |
GPT-5.6 Terra | OpenAI | Unbekannt |
GPT-5.6 Luna | OpenAI | Unbekannt |
GPT-5.5 | OpenAI | Unbekannt |
GPT-5.5 Pro | OpenAI | Unbekannt |
GPT-5.5 Instant | OpenAI | Unbekannt |
ChatGPT chat-latest | OpenAI | Unbekannt |
GPT-5.4 | OpenAI | Unbekannt |
GPT-5.4 Pro | OpenAI | Unbekannt |
GPT-5.4 mini | OpenAI | Unbekannt |
GPT-5.4 nano | OpenAI | Unbekannt |
GPT-5.3-Codex | OpenAI | Unbekannt |
GPT-5.3 Instant | OpenAI | Unbekannt |
GPT-5.2 | OpenAI | Unbekannt |
GPT-5.1 Instant | OpenAI | Unbekannt |
GPT-5.1 Thinking | OpenAI | Unbekannt |
GPT-5 | OpenAI | Unbekannt |
GPT-5 pro | OpenAI | Unbekannt |
GPT-5 mini | OpenAI | Unbekannt |
GPT-5 nano | OpenAI | Unbekannt |
GPT-4 Turbo | OpenAI | Unbekannt |
GPT-4.1 | OpenAI | Unbekannt |
GPT-4.1 mini | OpenAI | Unbekannt |
GPT-4.1 nano | OpenAI | Unbekannt |
GPT-3.5 Turbo | OpenAI | Unbekannt |
o3 | OpenAI | Unbekannt |
o3-pro | OpenAI | Unbekannt |
o3-mini | OpenAI | Unbekannt |
o4-mini | OpenAI | Unbekannt |
o1 | OpenAI | Unbekannt |
o1-mini | OpenAI | Unbekannt |
Claude Fable 5 | Anthropic | Unbekannt |
Claude Mythos 5 | Anthropic | Unbekannt |
Claude Sonnet 5 | Anthropic | Unbekannt |
Claude Opus 5 | Anthropic | Unbekannt |
Claude Opus 4.8 | Anthropic | Unbekannt |
Claude Opus 4.7 | Anthropic | Unbekannt |
Claude Opus 4.6 | Anthropic | Unbekannt |
Claude Sonnet 4.6 | Anthropic | Unbekannt |
Claude Opus 4.5 | Anthropic | Unbekannt |
Claude Opus 4.1 | Anthropic | Unbekannt |
Claude Sonnet 4.5 | Anthropic | Unbekannt |
Claude Haiku 4.5 | Anthropic | Unbekannt |
Claude Sonnet 4 | Anthropic | Unbekannt |
Claude Opus 4 | Anthropic | Unbekannt |
Claude Sonnet 3.7 | Anthropic | Unbekannt |
Claude 3.5 Haiku | Anthropic | Unbekannt |
Gemini 3.7 Flash | Unbekannt | |
Gemini 3.6 Flash | Unbekannt | |
Gemini 3.5 Flash | Unbekannt | |
Gemini 3.1 Pro Preview | Unbekannt | |
Gemini 3 Flash MoE | Unbekannt | |
Gemini 3.5 Flash-Lite | Unbekannt | |
Gemini 3.1 Flash-Lite MoE | Unbekannt | |
Gemini 2.5 Pro MoE | Unbekannt | |
Gemini 2.5 Flash MoE | Unbekannt | |
Gemini 2.5 Flash-Lite MoE | Unbekannt | |
Gemini 3 Pro MoE | Unbekannt | |
Gemini 2.0 Flash MoE | Unbekannt | |
Gemini 1.5 Pro MoE | Unbekannt | |
Grok 4.6 | xAI | Unbekannt |
Grok 4.5 | xAI | Unbekannt |
Grok 4.3 | xAI | Unbekannt |
Grok 4.20 Reasoning | xAI | Unbekannt |
Grok 4.20 Multi-Agent | xAI | Unbekannt |
Grok Build 0.1 | xAI | Unbekannt |
Grok 4 | xAI | Unbekannt |
Grok 3 | xAI | Unbekannt |
Grok 2 | xAI | Unbekannt |
Mistral Medium 3.5 | Mistral AI | Unbekannt |
MiniMax M3 | MiniMax | Unbekannt |
Qwen 3.7 Max MoE | Alibaba | Unbekannt |
Seed 1.8 | ByteDance | Unbekannt |
Seed 2.0 Pro | ByteDance | Unbekannt |
Muse Spark 1.2 | Meta | Unbekannt |
KAT-Coder-Air V2.5 | Kuaishou | Unbekannt |
KAT-Coder-Pro V2.5 | Kuaishou | Unbekannt |
Seed 1.6 | ByteDance | Unbekannt |
Seed 1.6 Flash | ByteDance | Unbekannt |
Seed 2.0 Lite | ByteDance | Unbekannt |
Seed 2.0 Mini | ByteDance | Unbekannt |
Seed 2.0 Code | ByteDance | Unbekannt |
Seed 2.1 Turbo | ByteDance | Unbekannt |
Qwen 3.7 Flash | Alibaba | Unbekannt |
Qwen 3.7 Plus MoE | Alibaba | Unbekannt |
Nova 2 Lite | Amazon | Unbekannt |
Nova Premier 1.0 | Amazon | Unbekannt |
Nova Pro 1.0 | Amazon | Unbekannt |
Nova Lite 1.0 | Amazon | Unbekannt |
Nova Micro 1.0 | Amazon | Unbekannt |
Sonar | Perplexity | Unbekannt |
Sonar Pro | Perplexity | Unbekannt |
Sonar Reasoning Pro | Perplexity | Unbekannt |
Sonar Deep Research | Perplexity | Unbekannt |
MiMo-V2.5 MoE | Xiaomi | Unbekannt |
Solar Pro 4 | Upstage | Unbekannt |
Solar Mini | Upstage | Unbekannt |
Kimi K3 MoE(104 Mrd. aktiv) | Moonshot AI | 2,8 Billionen |
Qwen 3.8 2.4T A95B MoE(95 Mrd. aktiv) | Alibaba | 2,4 Billionen |
Qwen 3.8 Max MoE(95 Mrd. aktiv) | Alibaba | 2,4 Billionen |
Claude 3 Opus | Anthropic | 2 Billionen* |
Llama 4 Behemoth MoE(288 Mrd. aktiv) | Meta | 2 Billionen |
GPT-4 MoE(220 Mrd. aktiv) | OpenAI | 1,76 Billionen* |
DeepSeek-V4-Pro MoE(49 Mrd. aktiv) | DeepSeek | 1,6 Billionen |
LongCat 2.0 MoE(48 Mrd. aktiv) | Meituan | 1,6 Billionen |
Ring 2.6 1T MoE(63 Mrd. aktiv) | inclusionAI | 1 Billionen |
Kimi K2.5 MoE(32 Mrd. aktiv) | Moonshot AI | 1 Billionen |
Kimi K2 Thinking MoE(32 Mrd. aktiv) | Moonshot AI | 1 Billionen |
Kimi K2 0711 MoE(32 Mrd. aktiv) | Moonshot AI | 1 Billionen |
Kimi K2 0905 MoE(32 Mrd. aktiv) | Moonshot AI | 1 Billionen |
Kimi K2.6 MoE(32 Mrd. aktiv) | Moonshot AI | 1 Billionen |
Kimi K2.7 Code MoE(32 Mrd. aktiv) | Moonshot AI | 1 Billionen |
Qwen 3.6 Max-Preview MoE | Alibaba | 1 Billionen* |
Yi-Large MoE | 01.AI | 1 Billionen |
MiMo-V2.5-Pro MoE(42 Mrd. aktiv) | Xiaomi | 1 Billionen |
MiMo-V2.5-Pro-UltraSpeed MoE(42 Mrd. aktiv) | Xiaomi | 1 Billionen |
Inkling MoE(41 Mrd. aktiv) | Thinking Machines Lab | 975 Mrd. |
GLM-5.2 MoE(40 Mrd. aktiv) | Z.ai | 744 Mrd. |
GLM-5.3 MoE(40 Mrd. aktiv) | Z.ai | 744 Mrd. |
GLM-5.1 MoE(40 Mrd. aktiv) | Z.ai | 744 Mrd. |
GLM-5 MoE(40 Mrd. aktiv) | Z.ai | 744 Mrd. |
DeepSeek-V3 0324 MoE(37 Mrd. aktiv) | DeepSeek | 685 Mrd. |
DeepSeek-V3.2 Exp MoE(37 Mrd. aktiv) | DeepSeek | 685 Mrd. |
DeepSeek-V3.2 MoE(37 Mrd. aktiv) | DeepSeek | 685 Mrd. |
Mistral Large 3 MoE(41 Mrd. aktiv) | Mistral AI | 675 Mrd. |
DeepSeek-V3.1 Terminus MoE(37 Mrd. aktiv) | DeepSeek | 671 Mrd. |
DeepSeek-V3.1 MoE(37 Mrd. aktiv) | DeepSeek | 671 Mrd. |
DeepSeek-R1 0528 MoE(37 Mrd. aktiv) | DeepSeek | 671 Mrd. |
DeepSeek-V3 MoE(37 Mrd. aktiv) | DeepSeek | 671 Mrd. |
DeepSeek-R1 MoE(37 Mrd. aktiv) | DeepSeek | 671 Mrd. |
Nemotron 3 Ultra MoE(55 Mrd. aktiv) | NVIDIA | 550 Mrd. |
PaLM | 540 Mrd. | |
Megatron-Turing NLG | NVIDIA | 530 Mrd. |
Qwen 3 Coder 480B A35B MoE(35 Mrd. aktiv) | Alibaba | 480 Mrd. |
MiniMax M1 MoE(45,9 Mrd. aktiv) | MiniMax | 456 Mrd. |
MiniMax-01 MoE(45,9 Mrd. aktiv) | MiniMax | 456 Mrd. |
ERNIE 4.5 VL 424B A47B MoE(47 Mrd. aktiv) | Baidu | 424 Mrd. |
Hermes 4 405B | Nous Research | 405 Mrd. |
Llama 3.1 405B | Meta | 405 Mrd. |
Llama 4 Maverick MoE(17 Mrd. aktiv) | Meta | 400 Mrd. |
Trinity Large Thinking MoE(13 Mrd. aktiv) | Arcee AI | 398 Mrd. |
Nex-N2-Pro MoE(17 Mrd. aktiv) | Nex AGI | 397 Mrd. |
Qwen 3.5 397B A17B MoE(17 Mrd. aktiv) | Alibaba | 397 Mrd. |
GLM-4.6 MoE(32 Mrd. aktiv) | Z.ai | 355 Mrd. |
GLM-4.5 MoE(32 Mrd. aktiv) | Z.ai | 355 Mrd. |
Nemotron-4 340B | NVIDIA | 340 Mrd. |
PaLM 2 | 340 Mrd.* | |
Grok 1 MoE(86 Mrd. aktiv) | xAI | 314 Mrd. |
Hy3 MoE(21 Mrd. aktiv) | Tencent | 295 Mrd. |
DeepSeek-V4-Flash MoE(13 Mrd. aktiv) | DeepSeek | 284 Mrd. |
Inkling Small MoE(12 Mrd. aktiv) | Thinking Machines Lab | 276 Mrd. |
DeepSeek-V2 MoE(21 Mrd. aktiv) | DeepSeek | 236 Mrd. |
Qwen 3 235B A22B Instruct 2507 MoE(22 Mrd. aktiv) | Alibaba | 235 Mrd. |
Qwen 3 235B A22B MoE(22 Mrd. aktiv) | Alibaba | 235 Mrd. |
Qwen 3 235B A22B Thinking 2507 MoE(22 Mrd. aktiv) | Alibaba | 235 Mrd. |
Qwen 3 VL 235B A22B MoE(22 Mrd. aktiv) | Alibaba | 235 Mrd. |
Qwen 3 VL 235B A22B Thinking MoE(22 Mrd. aktiv) | Alibaba | 235 Mrd. |
MiniMax M2.1 MoE(10 Mrd. aktiv) | MiniMax | 230 Mrd. |
MiniMax M2 MoE(10 Mrd. aktiv) | MiniMax | 230 Mrd. |
GPT-4o | OpenAI | 200 Mrd.* |
Step 3.7 Flash MoE(11 Mrd. aktiv) | StepFun | 198 Mrd. |
Step 3.5 Flash MoE(11 Mrd. aktiv) | StepFun | 196,8 Mrd. |
Falcon 180B | TII | 180 Mrd. |
BLOOM | BigScience | 176 Mrd. |
GPT-3 | OpenAI | 175 Mrd. |
Claude 3.5 Sonnet | Anthropic | 175 Mrd.* |
OPT-175B | Meta | 175 Mrd. |
Mixtral 8x22B MoE(39 Mrd. aktiv) | Mistral AI | 141 Mrd. |
LaMDA | 137 Mrd. | |
DBRX MoE(36 Mrd. aktiv) | Databricks | 132 Mrd. |
Ling 3.0 Flash MoE(5,1 Mrd. aktiv) | inclusionAI | 124 Mrd. |
Mistral Large 2 | Mistral AI | 123 Mrd. |
Qwen 3.5 122B A10B MoE(10 Mrd. aktiv) | Alibaba | 122 Mrd. |
Nemotron 3 Super MoE(12 Mrd. aktiv) | NVIDIA | 120 Mrd. |
Mistral Small 4 MoE(6 Mrd. aktiv) | Mistral AI | 119 Mrd. |
Laguna S 2.1 MoE(8 Mrd. aktiv) | Poolside | 118 Mrd. |
GPT OSS 120B MoE(5,1 Mrd. aktiv) | OpenAI | 117 Mrd. |
Command A | Cohere | 111 Mrd. |
Llama 4 Scout MoE(17 Mrd. aktiv) | Meta | 109 Mrd. |
GLM-4.5 Air MoE(12 Mrd. aktiv) | Z.ai | 106 Mrd. |
GLM-4.5V MoE(12 Mrd. aktiv) | Z.ai | 106 Mrd. |
Command R+ | Cohere | 104 Mrd. |
Solar Pro 3 MoE | Upstage | 102 Mrd. |
Hunyuan A13B Instruct MoE(13 Mrd. aktiv) | Tencent | 80 Mrd. |
Qwen 3 Coder Next MoE(3 Mrd. aktiv) | Alibaba | 80 Mrd. |
Qwen 3 Next 80B A3B Instruct MoE(3 Mrd. aktiv) | Alibaba | 80 Mrd. |
Qwen 3 Next 80B A3B Thinking MoE(3 Mrd. aktiv) | Alibaba | 80 Mrd. |
Virtuoso Large | Arcee AI | 72 Mrd. |
Qwen 2.5 VL 72B | Alibaba | 72 Mrd. |
Qwen 2.5 72B | Alibaba | 72 Mrd. |
Hermes 4 70B | Nous Research | 70 Mrd. |
DeepSeek-R1 Distill Llama 70B | DeepSeek | 70 Mrd. |
Claude 3 Sonnet | Anthropic | 70 Mrd.* |
Llama 3.3 70B | Meta | 70 Mrd. |
Llama 3.1 70B | Meta | 70 Mrd. |
Llama 3 70B | Meta | 70 Mrd. |
Llama 2 70B | Meta | 70 Mrd. |
Mixtral 8x7B MoE(14 Mrd. aktiv) | Mistral AI | 56 Mrd. |
Falcon 40B | TII | 40 Mrd. |
Nex-N2-mini MoE(3 Mrd. aktiv) | Nex AGI | 35 Mrd. |
Qwen 3.6 35B A3B MoE(3 Mrd. aktiv) | Alibaba | 35 Mrd. |
Qwen 3.5 35B A3B MoE(3 Mrd. aktiv) | Alibaba | 35 Mrd. |
Yi-34B | 01.AI | 34 Mrd. |
Laguna XS 2.1 MoE(3 Mrd. aktiv) | Poolside | 33 Mrd. |
Qwen 3 32B | Alibaba | 32 Mrd. |
Qwen 2.5 Coder 32B | Alibaba | 32 Mrd. |
Qwen 3 VL 32B | Alibaba | 32 Mrd. |
Qwen 2.5 32B | Alibaba | 32 Mrd. |
Command R | Cohere | 32 Mrd. |
Gemma 4 31B | 31 Mrd. | |
Solar Pro 2 | Upstage | 31 Mrd. |
Nemotron 3 Nano MoE(3,5 Mrd. aktiv) | NVIDIA | 30 Mrd. |
Nemotron 3.5 Lightning MoE(3 Mrd. aktiv) | NVIDIA | 30 Mrd. |
Qwen 3 30B A3B Instruct 2507 MoE(3 Mrd. aktiv) | Alibaba | 30 Mrd. |
Qwen 3 Coder 30B A3B MoE(3 Mrd. aktiv) | Alibaba | 30 Mrd. |
Qwen 3 30B A3B MoE(3 Mrd. aktiv) | Alibaba | 30 Mrd. |
Qwen 3 30B A3B Thinking 2507 MoE(3 Mrd. aktiv) | Alibaba | 30 Mrd. |
Qwen 3 VL 30B A3B MoE(3 Mrd. aktiv) | Alibaba | 30 Mrd. |
Qwen 3 VL 30B A3B Thinking MoE(3 Mrd. aktiv) | Alibaba | 30 Mrd. |
Muse Glimmer 30B | Meta | 30 Mrd. |
Gemma 3 27B | 27 Mrd. | |
Qwen 3.8 27B | Alibaba | 27 Mrd. |
Qwen 3.5 27B | Alibaba | 27 Mrd. |
Qwen 3.6 27B | Alibaba | 27 Mrd. |
Gemma 2 27B | 27 Mrd. | |
Gemma 4 26B A4B MoE(4 Mrd. aktiv) | 26 Mrd. | |
Mistral Small 3.2 | Mistral AI | 24 Mrd. |
Mistral Small 3.1 | Mistral AI | 24 Mrd. |
Voxtral Small 24B | Mistral AI | 24 Mrd. |
Mistral Small 3 | Mistral AI | 24 Mrd. |
GPT OSS 20B MoE(3,6 Mrd. aktiv) | OpenAI | 21 Mrd. |
Claude 3 Haiku | Anthropic | 20 Mrd.* |
Ministral 3 14B | Mistral AI | 14 Mrd. |
Qwen 3 14B | Alibaba | 14 Mrd. |
Qwen 2.5 14B | Alibaba | 14 Mrd. |
Phi-4 | Microsoft | 14 Mrd. |
Gemma 3 12B | 12 Mrd. | |
Mistral Nemo | Mistral AI | 12 Mrd. |
Nemotron Nano 2 VL 12B | NVIDIA | 12 Mrd. |
Qwen 3.5 9B | Alibaba | 9 Mrd. |
Gemma 2 9B | 9 Mrd. | |
Nemotron Nano 2 9B | NVIDIA | 9 Mrd. |
Granite 4.1 8B | IBM | 8 Mrd. |
Gemma 3n E4B | 8 Mrd. | |
Ministral 3 8B | Mistral AI | 8 Mrd. |
Qwen 3 8B | Alibaba | 8 Mrd. |
Qwen 3 VL 8B | Alibaba | 8 Mrd. |
Qwen 3 VL 8B Thinking | Alibaba | 8 Mrd. |
GPT-4o mini | OpenAI | 8 Mrd.* |
Llama 3.1 8B | Meta | 8 Mrd. |
Llama 3 8B | Meta | 8 Mrd. |
Ministral 8B | Mistral AI | 8 Mrd. |
Mistral 7B | Mistral AI | 7 Mrd. |
Qwen 2.5 7B | Alibaba | 7 Mrd. |
Command R7B | Cohere | 7 Mrd. |
Phi-4 Multimodal | Microsoft | 5,6 Mrd. |
Gemma 3 4B | 4 Mrd. | |
Phi-4 mini | Microsoft | 3,8 Mrd. |
Phi-3 mini | Microsoft | 3,8 Mrd. |
Gemini Nano 2 | 3,3 Mrd. | |
Granite 4.0 H Micro | IBM | 3 Mrd. |
Llama 3.2 3B | Meta | 3 Mrd. |
Ministral 3 3B | Mistral AI | 3 Mrd. |
Ministral 3B | Mistral AI | 3 Mrd. |
Gemma 2 2B | 2 Mrd. | |
Gemini Nano 1 | 1,8 Mrd. | |
GPT-2 | OpenAI | 1,5 Mrd. |
Llama 3.2 1B | Meta | 1 Mrd. |
Qwen 2.5 0.5B | Alibaba | 0,5 Mrd. |
Parameter-Größen bekannter Large Language Models (Stand: August 2026)
