Open-Source-LLMs im Vergleich 2026 – 25+ Modelle, die du kennen solltest

    Open-Source-LLMs im Vergleich 2026 – 25+ Modelle, die du kennen solltest

    7. März 2026Aktualisiert: 13. April 202610 min LesezeitDeep Dive
    Till Freitag

    TL;DR:25+ Open-Source-LLMs im direkten Vergleich: Gemma 4 (26B, 85 t/s auf Consumer-Hardware), Hunter Alpha (1T), Llama 4, Qwen3.5, DeepSeek-R1, Nemotron Cascade 2, Mistral und viele mehr. Mit GitHub-Stats, Hardware-Anforderungen und Entscheidungshilfe für den richtigen Einsatz."

    Till Freitag

    Stand: April 2026 – GitHub-Stars und Modellversionen werden regelmäßig aktualisiert. Neu: Muse Spark Einordnung, Gemma 4, Nemotron Cascade 2 und Kimi K2.5.

    Warum Open Source bei LLMs jetzt zählt

    2025 war das Jahr, in dem Open-Source-LLMs die Lücke zu proprietären Modellen geschlossen haben. 2026 sind sie in vielen Bereichen gleichauf – oder besser. Für Unternehmen bedeutet das: Mehr Kontrolle, weniger Abhängigkeit, bessere DSGVO-Compliance.

    Dieser Artikel gibt dir einen vollständigen Überblick über die wichtigsten Open-Source-LLMs – mit echten GitHub-Daten, Hardware-Anforderungen und klaren Empfehlungen.

    Die große Übersichtstabelle

    ModellAnbieterParameterGitHub ⭐LizenzBesonderheit
    Gemma 4 🆕Google26B (MoE)8.500+Gemma License85 t/s auf Consumer-Hardware, 256K Kontext
    Nemotron Cascade 2 🆕NVIDIA30B3.500+NVIDIA Open~54 t/s lokal, optimiert für Inference
    Hunter AlphaAnonym (via OpenRouter)1T (~32B aktiv)UnbekanntGrößtes kostenloses Modell, 1M Kontext
    Kimi K2.5 🆕Moonshot AI1T (32B aktiv)5.000+Modified MITAgent Swarm (100 Sub-Agenten), multimodal
    Llama 4 ScoutMeta109B (17B aktiv)7.500+Llama License10M Token Kontext
    Llama 4 MaverickMeta400B (17B aktiv)7.500+Llama LicenseBestes MoE-Modell von Meta
    Qwen3.5-122BAlibaba122B (10B aktiv)27.000+Apache 2.0Schlägt GPT-5-mini
    Qwen3-235BAlibaba235B27.000+Apache 2.0Thinking-Modus
    DeepSeek-R1DeepSeek671B (37B aktiv)102.000+MITChain-of-Thought Reasoning
    DeepSeek-V3DeepSeek671B (37B aktiv)102.000+MITMulti-Token-Prediction
    Mistral Large 2Mistral123B10.700+Apache 2.0128k Kontext, 80+ Sprachen
    Mixtral 8x22BMistral141B (39B aktiv)10.700+Apache 2.0Sparse MoE Pioneer
    Gemma 3Google1B–27B6.800+Gemma LicenseMultimodal, on-device
    Phi-4Microsoft14B12.000+MITReasoning auf kleiner Hardware
    Phi-4-MiniMicrosoft3.8B12.000+MITSmartphone-tauglich
    Command R+Cohere104B3.200+CC-BY-NCRAG-optimiert, 10 Sprachen
    Yi-1.501.AI6B–34B7.800+Apache 2.0Starke Mehrsprachigkeit
    DBRXDatabricks132B (36B aktiv)3.200+Databricks OpenEnterprise MoE
    Falcon 3TII1B–10B2.000+Apache 2.0UAE-Forschungsprojekt
    StableLM 2Stability AI1.6B–12B8.500+Stability LicenseKompakt & effizient
    InternLM 3Shanghai AI Lab8B7.200+Apache 2.0Long Context bis 1M
    OLMo 2AI27B–13B6.400+Apache 2.0Vollständig offen (Daten + Code)
    Jamba 1.5AI21 Labs52B (12B aktiv)900+Apache 2.0Mamba-Transformer Hybrid
    StarCoder 2BigCode3B–15B2.000+BigCode OpenRAIL-MCode-Spezialist
    CodeLlamaMeta7B–70B16.400+Llama LicenseCode-Generierung & Infilling
    DeepSeek-Coder-V2DeepSeek236B (21B aktiv)12.000+MITCode + Math Spezialist
    Qwen2.5-CoderAlibaba0.5B–32B27.000+Apache 2.0Code-Completion, multi-lang

    Die Top-Modelle im Detail

    🔥 Gemma 4 (Google) 🆕

    Googles neues MoE-Flaggschiff: 26B Parameter, nur 14 GB groß, 85 Tokens pro Sekunde auf Consumer-Hardware. Das Modell, das die Grenze zwischen Cloud- und lokaler Intelligenz endgültig aufhebt. → Unser Deep-Dive zu Gemma 4

    Stärken:

    • 85 t/s auf einem AMD Ryzen AI MAX+ mit 128 GB RAM
    • 256K Kontextfenster für lange Dokument-Analyse
    • Function Calling funktioniert zuverlässig
    • GPT-4-Qualität bei komplexem Reasoning – lokal, ohne Cloud

    Schwächen:

    • Gemma License (nicht reines Apache 2.0)
    • MoE-Architektur – nicht alle Frameworks unterstützen das nativ
    • Noch kein Video-Input

    GitHub: github.com/google/gemma.cpp · 8.500+ ⭐


    🐉 Hunter Alpha → Xiaomi MiMo-V2-Pro (ehem. "vermutlich DeepSeek V4")

    Update April 2026: Hunter Alpha wurde am 18. März 2026 als Xiaomis MiMo-V2-Pro enttarnt – es war nie DeepSeek V4. Das Team wird von Luo Fuli geleitet, einem Ex-DeepSeek-Ingenieur. → Die vollständige Geschichte · → Chinas KI-Offensive: Die Analyse

    Das größte auf OpenRouter verfügbare KI-Modell: >1 Billion Parameter, mit ~42B aktiven Parametern pro Token. Ursprünglich anonym gelauncht am 11. März 2026, jetzt kommerziell unter Xiaomis MiMo-Brand.

    Stärken:

    • 1T Parameter mit ~42B aktiv (MoE) – größtes verfügbares Modell

    • 1M Token Kontextfenster
    • ClawEval 61.5 – starke Agentic-Performance
    • Bekannter Provider (Xiaomi, börsennotiert)
    • Open Source geplant nach Stabilisierung

    Schwächen:

    • Nicht mehr kostenlos ($1–2 / MTok Input, $3–6 / MTok Output)
    • Nicht lokal ausführbar (vorerst nur via OpenRouter API)
    • Datenschutz: OpenRouter-Logging-Policies gelten weiterhin

    Zugang: openrouter.ai/xiaomi/mimo-v2-pro


    🌙 Kimi K2.5 (Moonshot AI) 🆕

    Moonshot AIs Flaggschiff aus Peking: 1 Billion Parameter mit MoE (32B aktiv), 384 Experten und einer einzigartigen Agent-Swarm-Architektur. → Die Cursor-Kontroverse: Warum Composer 2 auf Kimi K2.5 läuft

    Stärken:

    • Agent Swarm: koordiniert bis zu 100 Sub-Agenten für komplexe Tasks
    • Multimodal (Text + Bild + Video)
    • AIME 2025: 96,1 % – schlägt alle Frontier-Modelle bei Math-Reasoning
    • Modified MIT – kommerziell frei unter 100M MAU

    Schwächen:

    • Sehr groß – lokaler Einsatz nur mit High-End-Hardware (128 GB+ RAM)
    • Chinesischer Anbieter – Compliance-Thema
    • Modified MIT erfordert Attribution ab bestimmten Schwellen

    GitHub: github.com/MoonshotAI/Kimi-K2.5 · 5.000+ ⭐


    ⚡ Nemotron Cascade 2 (NVIDIA) 🆕

    NVIDIAs neues Inference-optimiertes Modell: 30B Parameter, läuft mit ~54 t/s auf Projekt KNUT (RTX 4060 Ti + RTX 3060). Speziell für lokale, schnelle Inference konzipiert. → Projekt KNUT: Lokale KI-Infrastruktur

    Stärken:

    • 54 t/s auf Consumer-GPUs – 15x schneller als menschliche Sprache
    • Qualitativ vergleichbar mit GPT-4o mini
    • Optimiert für NVIDIA-Hardware (CUDA)

    Schwächen:

    • NVIDIA-Lizenz (nicht Apache 2.0)
    • Primär auf NVIDIA-GPUs ausgelegt
    • Noch relativ kleine Community

    🦙 Llama 4 (Meta)

    Metas neueste Generation bringt zwei Varianten: Scout (109B, 10M Kontext) und Maverick (400B, für Qualität). Beide nutzen Mixture-of-Experts – nur 17B Parameter sind pro Query aktiv.

    Stärken:

    • Größtes Kontextfenster aller Open-Source-Modelle (10M Tokens bei Scout)
    • Starke Community und Ecosystem
    • Multimodal (Text + Bild)

    Schwächen:

    • Llama License ist nicht "echtes" Open Source (kommerzielle Einschränkungen bei >700M MAU)
    • Große Modelle brauchen erhebliche Hardware

    GitHub: github.com/meta-llama/llama-models · 7.500+ ⭐


    ⚠️ Muse Spark (Meta) – Proprietäre Referenz

    Wichtig: Muse Spark ist kein Open-Source-Modell. Wir führen es hier als proprietäre Referenz auf, weil es Metas strategische Abkehr von Open Source markiert – und direkt zeigt, wo die offenen Alternativen bereits besser sind.

    Muse Spark ist das erste Modell der neuen Meta Superintelligence Labs (MSL) und seit April 2026 kostenlos für alle Meta-Nutzer verfügbar. → Unsere kritische Analyse zu Muse Spark

    Wo Muse Spark stark ist (und Open Source noch nicht):

    • HealthBench Hard: 42.8 – besser als GPT-5.4 (40.1), kein Open-Source-Modell kommt nah
    • Humanity's Last Exam: 50.2% – der Contemplating-Modus orchestriert mehrere Agenten parallel
    • Kostenlos für 3+ Milliarden Meta-Nutzer

    Wo Open Source Muse Spark schlägt:

    • Coding: Terminal-Bench 59.0 – selbst Qwen2.5-Coder-32B liefert für lokale Code-Tasks bessere Ergebnisse
    • Abstract Reasoning: ARC-AGI-2 42.5 vs. GPT-5.4 76.1 – ein massiver Rückstand
    • Agentic Tasks: Kimi K2.5 mit Agent Swarm ist für autonome Multi-Step-Workflows die bessere Wahl
    • Datenkontrolle: Muse Spark läuft in Metas Cloud – keine Self-Hosting-Option

    Der strategische Bruch: Meta hat jahrelang Open Source als Differenzierungsmerkmal positioniert. Muse Spark ist closed-source ohne Zeitplan für eine Weights-Veröffentlichung. Für die Open-Source-Community bedeutet das: Llama bleibt vorerst Metas offenes Standbein, aber das beste Modell des Unternehmens ist nicht mehr frei zugänglich.


    🌐 Qwen3.5 (Alibaba)

    Das aktuell stärkste Open-Source-MoE-Modell. 122B Parameter, davon nur 10B aktiv – läuft auf einem MacBook mit 64 GB RAM. → Unser Deep-Dive zu Qwen3.5

    Stärken:

    • Schlägt GPT-5-mini in den meisten Benchmarks
    • Apache 2.0 – echtes Open Source
    • 262k Kontextfenster (erweiterbar auf 1M)

    Schwächen:

    • Kein Multimodal (nur Text)
    • Chinesischer Anbieter – für manche Unternehmen ein Compliance-Thema

    GitHub: github.com/QwenLM/Qwen3 · 27.000+ ⭐


    🔬 DeepSeek-R1

    Das Modell, das Anfang 2025 die AI-Welt erschüttert hat. 671B Parameter mit MoE (37B aktiv), spezialisiert auf Chain-of-Thought Reasoning.

    Stärken:

    • Reasoning-Qualität auf GPT-o1-Niveau
    • MIT-Lizenz – maximale Freiheit
    • "Thinking"-Modus zeigt den Denkprozess

    Schwächen:

    • Sehr groß – lokal nur mit High-End-Hardware
    • Chinesischer Anbieter

    GitHub: github.com/deepseek-ai/DeepSeek-V3 · 102.000+ ⭐


    🌊 Mistral Large 2

    Mistrals Flaggschiff: 123B Parameter, 128k Kontext, über 80 Sprachen. Das europäische Gegengewicht zu den US- und China-Modellen.

    Stärken:

    • Europäischer Anbieter (Paris) – einfacheres DSGVO-Narrativ
    • Starke Mehrsprachigkeit
    • Apache 2.0

    Schwächen:

    • Kleinere Community als Llama oder Qwen
    • Weniger spezialisierte Varianten

    GitHub: github.com/mistralai/mistral-inference · 10.700+ ⭐


    💎 Gemma 3 (Google)

    Googles offene Modellreihe von 1B bis 27B – optimiert für On-Device-Nutzung. Multimodal ab 4B. Inzwischen Vorgänger von Gemma 4, aber weiterhin relevant für Edge-Deployments.

    Stärken:

    • Multimodal (Text + Bild) auch in kleinen Varianten
    • Läuft auf Smartphones und Raspberry Pi
    • ShieldGemma für Safety

    Schwächen:

    • Gemma License hat Nutzungsrichtlinien (kein reines Apache 2.0)
    • Maximale Größe nur 27B

    GitHub: github.com/google/gemma.cpp · 6.800+ ⭐


    🧠 Phi-4 (Microsoft)

    Microsofts "Small Language Model" mit 14B Parametern, das größere Modelle bei Reasoning-Tasks schlägt.

    Stärken:

    • Herausragende Qualität pro Parameter
    • MIT-Lizenz
    • Läuft auf Consumer-Hardware

    Schwächen:

    • Kein Multimodal in der Basis-Variante
    • Kleines Kontextfenster (16k)

    GitHub: github.com/microsoft/phi-4 · 12.000+ ⭐


    Coding-LLMs im Vergleich

    Für Entwickler gibt es spezialisierte Code-Modelle:

    ModellParameterSprachenBesonderheit
    StarCoder 23B–15B600+Trainiert auf The Stack v2
    CodeLlama7B–70B~20Infilling & lange Kontexte
    DeepSeek-Coder-V2236B (21B aktiv)300+Code + Math kombiniert
    Qwen2.5-Coder0.5B–32B90+Bestes Open-Source-Code-Modell pro Größe

    Unsere Empfehlung: Qwen2.5-Coder-32B für maximale Qualität, StarCoder 2-3B wenn es lokal auf dem Laptop laufen soll.

    Entscheidungsmatrix: Welches Modell für welchen Einsatz?

    Dein Use CaseEmpfohlenes ModellWarum
    Frontier-Qualität lokal🆕 Gemma 4 (26B)GPT-4-Niveau, 85 t/s, 14 GB
    Agentic Tasks & Multi-Step-WorkflowsHunter Alpha oder Kimi K2.51T Parameter, Agent Swarm
    DSGVO-sensible Dokumente analysierenQwen3.5-122B lokalBestes Verhältnis Qualität/Ressourcen
    Code-Generierung & RefactoringQwen2.5-Coder-32BSchlägt größere Modelle bei Code
    Komplexes ReasoningDeepSeek-R1Chain-of-Thought auf GPT-o1-Niveau
    Schnelle lokale Inference🆕 Nemotron Cascade 254 t/s auf Consumer-GPUs
    Auf Smartphone/Edge laufenGemma 3 (4B) oder Phi-4-MiniOptimiert für minimale Hardware
    RAG mit FirmendatenCommand R+Speziell für Retrieval-Augmented Generation
    Maximaler Kontext (lange Dokumente)Llama 4 Scout10M Token Kontextfenster
    Europäischer Anbieter gewünschtMistral Large 2Französisches Unternehmen, Apache 2.0
    Vollständig offene TrainingsdatenOLMo 2Einziges Modell mit komplett offenen Daten
    Multi-Agent-WorkflowsKimi K2.5 oder DeepSeek-V3Agent Swarm mit 100 Sub-Agenten (Kimi)

    Hardware-Guide: Was brauchst du wirklich?

    RAM / VRAMModelle (quantisiert, Q4)Beispiel-Hardware
    8 GBPhi-4-Mini, Gemma 3 (1B–4B)MacBook Air M3, RTX 3060
    16 GBPhi-4, Gemma 3 (12B), Gemma 4 (26B, Q4), Yi-1.5-9BMacBook Pro M3, RTX 4070
    32 GBMistral 7B, Llama 3.3-8B, Qwen2.5-14B, Nemotron Cascade 2MacBook Pro M4, RTX 4090
    64 GBQwen3.5-122B, Mixtral 8x22BMacBook Pro M4 Max
    128 GB+DeepSeek-R1, Llama 4 Maverick, Kimi K2.5, Gemma 4 (FP16)Multi-GPU Server, Mac Studio Ultra

    Lizenzen: Der Teufel im Detail

    Nicht jedes "Open-Source"-Modell ist gleich offen:

    LizenzModelleKommerzielle NutzungEinschränkungen
    Apache 2.0Qwen, Mistral, Yi, Falcon, OLMo✅ UneingeschränktKeine
    MITDeepSeek, Phi✅ UneingeschränktKeine
    Llama LicenseLlama 4, CodeLlama✅ Bis 700M MAUÜber 700M MAU: Meta-Lizenz nötig
    Gemma LicenseGemma 3, Gemma 4✅ Mit BedingungenNutzungsrichtlinien beachten
    CC-BY-NCCommand R+❌ Nicht-kommerziellNur Forschung & privat
    Modified MITKimi K2.5✅ Unter 100M MAUAttribution ab 100M MAU / 20M $ Umsatz
    NVIDIA OpenNemotron Cascade 2✅ Mit BedingungenNVIDIA-Nutzungsbedingungen

    Tipp: Für kommerzielle Projekte Apache 2.0 oder MIT bevorzugen. Bei Llama genau prüfen, ob die Nutzungsbedingungen passen.

    Wie du Open-Source-LLMs lokal nutzt

    Die einfachsten Wege, ein Open-Source-Modell auf deinem Rechner zu starten:

    1. Ollama – Ein Befehl: ollama run gemma4 – fertig
    2. LM Studio – GUI für Nicht-Entwickler, GGUF-Modelle per Drag & Drop
    3. vLLM – Für Production-Deployments mit hohem Throughput
    4. llama.cpp – C++ Runtime, maximale Performance auf CPU

    → Mehr über GGUF, GGML und Safetensors

    Unser Take

    Die Frage ist nicht mehr "Cloud oder lokal?" – sondern "Welches Modell für welche Aufgabe?". Mit Gemma 4 hat sich die Antwort nochmal verschoben: Frontier-Qualität ist jetzt laptop-sized. Und Metas Muse Spark zeigt: Selbst der lauteste Open-Source-Verfechter geht closed-source, wenn es um Frontier-Performance geht. Unsere Empfehlung:

    • Gemma 4 lokal als neuer Default für die meisten Aufgaben
    • Cloud-APIs für Kunden-Chatbots und kreative Aufgaben (Claude, GPT-5)
    • Open Source lokal für sensible Daten, Bulk-Processing und Prototyping
    • Hybride Architektur als Ziel: Das beste Modell für jeden Job, unabhängig vom Anbieter
    • Muse Spark als Warnsignal: Wenn proprietäre Modelle kostenlos werden, aber ohne Datenkontrolle – dann ist Open Source kein Nice-to-have, sondern Versicherung

    Die Zukunft gehört nicht einem Modell – sie gehört der Architektur, die flexibel genug ist, jedes Modell zu nutzen.


    → Unsere AI-Services → Meta Muse Spark: Kritische Analyse → Gemma 4: Frontier-Intelligenz auf dem Laptop → Projekt KNUT: Lokale KI-Infrastruktur mit 52 GB VRAM → Hunter Alpha: Das größte kostenlose KI-Modell der Welt → Kimi K2.5: Das Modell hinter Cursors Composer 2 → Qwen3.5 Deep-Dive: 122B Parameter auf deinem Laptop → KI-Agenten im Vergleich

    TeilenLinkedInWhatsAppE-Mail

    Verwandte Artikel

    122 Milliarden Parameter auf deinem Laptop – was Qwen3.5 für dein Business bedeutet
    28. Februar 20263 min

    122 Milliarden Parameter auf deinem Laptop – was Qwen3.5 für dein Business bedeutet

    Alibabas Qwen3.5 schlägt GPT-5-mini in fast allen Benchmarks – und läuft lokal auf einem Laptop. Was das für Unternehmen

    Weiterlesen
    Self-Hosted & Privacy-Layer 2026: Ontheia, Anything LLM & Privacy Router
    4. Juni 20263 min

    Self-Hosted & Privacy-Layer 2026: Ontheia, Anything LLM & Privacy Router

    Wer DSGVO ernst nimmt, kommt um Self-Hosting nicht herum. Ontheia, Anything LLM, NanoClaw und der Privacy Router im Verg

    Weiterlesen
    Projekt KNUT: 52 GB VRAM, null Cloud – lokale AI-Infrastruktur im Deep Dive
    10. April 20264 min

    Projekt KNUT: 52 GB VRAM, null Cloud – lokale AI-Infrastruktur im Deep Dive

    Ein Mac Mini M4, zwei NVIDIA-GPUs, 52 GB VRAM – Projekt KNUT vereint heterogene Hardware zu einer lokalen AI-Infrastrukt

    Weiterlesen
    Hunter Alpha enttarnt: Nicht DeepSeek V4, sondern Xiaomis MiMo-V2-Pro
    13. März 20264 min

    Hunter Alpha enttarnt: Nicht DeepSeek V4, sondern Xiaomis MiMo-V2-Pro

    Hunter Alpha war nicht DeepSeek V4 – sondern Xiaomis MiMo-V2-Pro. Wir korrigieren unsere Analyse, ordnen ein was passier

    Weiterlesen
    Gemma 4 12B Coder läuft lokal auf einem Entwickler-Laptop – Code-Symbole strömen aus einem 12B-Chip
    15. Juni 20264 min

    Gemma 4 12B Coder: Lokale Code-Generierung wird zum Default

    Google bringt mit dem Gemma 4 12B Coder die spezialisierte Coding-Variante des Gemma-4-Stacks. 12B Parameter im GGUF-For

    Weiterlesen
    Stilisierte Mistral-Flamme als Mixture-of-Experts-Netzwerk auf dunklem Hintergrund
    8. Juni 20265 min

    Mistral 3, Large 3 & Vibe: Warum das letzte Update Europas AI-Hoffnung zurück ins Spiel bringt

    Mistral hat in einem halben Jahr alles auf links gedreht: Mistral 3 mit Large 3 (675B MoE) als Open Weights, Medium 3.5

    Weiterlesen
    Visualisierung eines großen blassen Neural-Net-Spheres und eines kleineren, hellen Sphere mit Cyan/Gelb – die schrumpfende Frontier offener Modelle
    8. Juni 20265 min

    Nex-N2-Pro: Wie die Frontier der offenen Modelle in sechs Wochen um 75 % geschrumpft ist

    Vor sechs Wochen war DeepSeek-V4-Pro mit 1,6 Billionen Parametern das größte je veröffentlichte Open-Weight-Modell. Heut

    Weiterlesen
    Geopolitische KI-Landschaft zwischen westlicher und östlicher TechnologieDeep Dive
    13. April 20268 min

    Chinas KI-Offensive: Von Hunter Alpha bis DeepSeek V4 auf Huawei-Chips

    Ein anonymes 1T-Modell, eine Verwechslung mit DeepSeek, und die Enthüllung, dass Xiaomi dahintersteckt. Gleichzeitig ste

    Weiterlesen
    Gemma 4 KI-Modell läuft auf kompaktem Mini-PC – Frontier-Intelligenz wird lokal
    6. April 20264 min

    Gemma 4: Frontier-Intelligenz auf dem Laptop – der Hype ist real

    Googles Gemma 4 liefert GPT-4-Niveau in 14 GB. 85 Tokens pro Sekunde auf Consumer-Hardware, 256K Kontext, Function Calli

    Weiterlesen