OlympHill
O

OllamaOpen-Source-Große Sprachmodelle lokal auf Ihrem eigenen Rechner ausführen

4.4 (5)
Daniel NikulshynGeprüft von Daniel Nikulshyn·Aktualisiert Mai 2026

Übersicht

Ollama ist ein Open-Source‑Tool, das es Ihnen ermöglicht, große Sprachmodelle direkt auf Ihrem persönlichen Computer herunterzuladen, auszuführen und zu verwalten. Es unterstützt eine breite Palette beliebter Open‑Source‑Modelle, darunter Llama, Mistral, Gemma, Phi und DeepSeek, und kümmert sich über eine einfache Befehlszeilenschnittstelle um Verpackung, Gewichte und Konfigurationen. Entworfen für Entwickler, Forscher und datenschutzbewusste Nutzer, läuft Ollama vollständig offline, sobald Modelle heruntergeladen sind, sodass Eingaben und Daten auf Ihrer eigenen Hardware bleiben. Es bietet zudem eine lokale REST API und lässt sich mit populären Frameworks und Front‑End‑UIs integrieren, wodurch es eine praktikable Basis für den Bau lokaler AI‑Anwendungen, Chatbots und Code‑Assistenten bildet.

Hauptfunktionen

  • Ein Befehl zum Herunterladen und Ausführen von Modellen
  • Lokale REST API für App-Integration
  • Modellbibliothek mit quantisierten Versionen
  • Individuelles Modelfile für maßgeschneiderte Modelldaten
  • GPU‑Beschleunigung auf unterstützender Hardware
  • Arbeitet offline nach der initialen Einrichtung

Preise

Modell
Freemium
Bewertung
4.4 / 5 (5)

Anwendungsfälle

Privater Offline-LLM-Chat

Führen Sie Modelle wie Llama oder Mistral lokal aus, um mit einem KI-Assistenten zu chatten, ohne Eingaben oder Daten an externe Cloud‑Dienste zu senden.

Lokale AI-App-Entwicklung

Nutzen Sie die lokale REST API von Ollama, um Open‑Weight‑LLMs in benutzerdefinierte Anwendungen, Chatbots oder interne Werkzeuge zu integrieren – sowohl im Prototyping als auch in der Produktion.

Coding-Assistent auf Ihrem Gerät

Kombinieren Sie Ollama mit auf Code ausgerichteten Modellen, um Autovervollständigung, Refactoring und Erklärungen direkt auf Ihrem Laptop zu erhalten – auch ohne Internetverbindung.

Modellexperimentieren für Forscher

Laden Sie schnell verschiedene Open‑Models herunter, tauschen Sie sie aus und benchmarken Sie sie mit individuellen Modelfile-Konfigurationen, um die Leistung für Forschungs- oder Feintuning‑Workflows zu evaluieren.

Pro & Contra

Pro

  • Vollständig lokale Ausführung sorgt für Datensicherheit
  • Kostenlos und Open‑Source
  • Unterstützt viele beliebte Open‑Weight‑Modelle
  • Einfache CLI und lokale API für einfache Integration
  • Plattformübergreifend (macOS, Linux, Windows)

Contra

  • Benötigt leistungsfähige Hardware für größere Modelle
  • Kein integriertes grafisches Interface standardmäßig
  • Leistung hängt stark von lokaler GPU oder RAM ab
  • Begrenzt auf Open-Weight‑Modelle, nicht auf proprietäre

Schlacht-Bilanz

Aus 1 Schlacht im Pantheon.

0
1.
1
2.
0
3.

Last battle

Bewertungen

4.4

Durchschnitt aus 5 Bewertungen.

5
2
4
3
3
0
2
0
1
0

Melde dich an, um eine Bewertung abzugeben.

Aaliyah Johnson

Aaliyah Johnson

Mar 5, 2026

Years in this space

I've evaluated a lot of these over the years. What stands out here is works offline after initial setup — handled better than most — and free and open source. Requires capable hardware for larger models is my one real gripe. Worth the time if this is your use case.

Naomi Suzuki

Naomi Suzuki

Nov 19, 2025

Solid for our team

We rolled this out across the team last quarter and cross-platform (macOS, Linux, Windows). Works offline after initial setup fits neatly into how we already work, and works offline after initial setup removed a step we used to do by hand. No built-in graphical interface by default, which is the main caveat, but it has held up under daily use.

IB

Ingrid Bauer

Oct 15, 2025

Years in this space

I've evaluated a lot of these over the years. What stands out here is custom Modelfile for tailored model configs — handled better than most — and cross-platform (macOS, Linux, Windows). Limited to open-weight models, not proprietary ones is my one real gripe. Worth the time if this is your use case.

DF

Diego Fernández

Sep 30, 2025

Skeptical, then convinced

I went in skeptical — most tools in this space overpromise. It actually delivers on custom Modelfile for tailored model configs, and free and open source caught me off guard. No built-in graphical interface by default is why this isn't a perfect score, still, I'd recommend giving it a real trial.

Sofia Lindqvist

Sofia Lindqvist

Sep 17, 2025

Solid for our team

We rolled this out across the team last quarter and simple CLI and local API for easy integration. Local REST API for app integration fits neatly into how we already work, and works offline after initial setup removed a step we used to do by hand. but it has held up under daily use.

Fragen & Antworten

Wie funktioniert die Zusatznutzung?

Pro‑ und Max‑Nutzer können ein zusätzliches Nutzungsguthaben hinzufügen. Ollama nutzt zuerst die im Plan enthaltenen Limits und greift dann auf das Zusatzguthaben zurück. Der Team‑Nutzung wird aus einem von der Organisation geteilten Guthaben entnommen.

Asked by Ekaterina Orlova · Aug 26, 2025

Wie viel Nutzung verbraucht jedes Modell?

Modelle verbrauchen unterschiedlich viel Nutzung, abhängig von ihrer Komplexität. Um das Nutzungs‑Level eines Modells zu sehen, besuchen Sie die Modell‑Seite, wo das Level von kleinen, leichten Modellen (Level 1), wie gpt‑oss:20b, bis zu extra schweren Modellen (Level 4), wie deepseek‑v4‑pro, angezeigt wird.

Asked by Greta Nowak · Aug 21, 2025

Wie wird die Nutzung gemessen?

Einzelpläne haben Nutzungslimits, die vom Modell und der Anzahl der verarbeiteten Eingabe‑, gecachten Eingabe‑ und Ausgabetoken abhängen. Es gibt keine feste Token‑Obergrenze, weil verschiedene Modelle unterschiedliche Compute‑Mengen benötigen. Für Teams wird die Nutzung jedes Mitglieds zuerst von dem im jeweiligen Seat enthaltenen Kontingent abgezogen; danach wird weitere Nutzung vom gemeinsamen zusätzlichen Nutzungskontingent des Teams zum jeweiligen Token‑Tarif des Modells abgezogen.

Asked by Ravi Kapoor · Aug 16, 2025

Was sind die Nutzungslimits für jeden Plan?

Das Ausführen von Modellen auf Ihrer eigenen Hardware ist immer unbegrenzt. Die Cloud‑Nutzung variiert je nach Plan: **Free** – Leichte Nutzung: Chatten mit Modellen, Evaluieren größerer Modelle, Programmieren und KI‑Assistenten mit kleineren Modellen. **Pro** – Alltagstaugliche Arbeit: Größere Modelle, Automatisierung von Code, tiefgehende Forschung. **Max** – Schweres, dauerhaftes Arbeiten: Kontinuierliche Agenten‑Aufgaben, mehrere gleichzeitige Agenten, große Modelle über längere Sitzungen. Jeder Plan hat Sitzungs‑Limits, die alle 5 Stunden zurückgesetzt werden, sowie wöchentliche Limits, die alle 7 Tage zurückgesetzt werden.

Asked by Noor Siddiqui · Aug 12, 2025

Wie schnell ist Ollama?

Die Geschwindigkeit hängt von Modellgröße, Architektur und Hardware‑Optimierung ab. Wir zielen darauf ab und überwachen eine niedrige Time‑to‑First‑Token und hohen Durchsatz bei allen Cloud‑Modellen. Prioritäts‑Stufen mit schnellerer Performance könnten in Zukunft verfügbar sein.

Asked by Constantin Ionescu · Aug 11, 2025

Frage stellen

Alternativen zu Große Sprachmodelle (LLMs)