O

OllamaExécuter des modèles de langage de grande taille open‑source localement sur votre propre machine

4.4 (5)
Daniel NikulshynÉvalué par Daniel Nikulshyn·Mis à jour mai 2026

Aperçu

Il s’agit d’un outil open‑source qui vous permet de télécharger, exécuter et gérer des modèles de langage volumineux directement sur votre ordinateur personnel. Il prend en charge une large gamme de modèles open populaires, tels que Llama, Mistral, Gemma, Phi et DeepSeek, et gère le packaging, les poids et la configuration des modèles via une interface en ligne de commande simple. Conçu pour les développeurs, les chercheurs et les utilisateurs soucieux de la confidentialité, Ollama fonctionne entièrement hors ligne une fois les modèles téléchargés, gardant les invites et les données sur votre propre matériel. Il expose également une API REST locale et s’intègre aux cadres et interfaces frontales populaires, ce qui en fait une base pratique pour créer des applications IA locales, des chatbots et des assistants de codage.

Fonctionnalités clés

  • Téléchargement et exécution de modèles en une seule commande
  • API REST locale pour l’intégration d’applications
  • Bibliothèque de modèles avec versions quantifiées
  • Modelfile personnalisé pour des configurations de modèle sur mesure
  • Accélération GPU sur le matériel compatible
  • Fonctionne hors ligne après la configuration initiale

Tarifs

Modèle
Freemium
Note
4.4 / 5 (5)

Cas d’usage

Chat LLM privé hors ligne

Exécutez des modèles comme Llama ou Mistral localement pour discuter avec un assistant IA sans envoyer d'invites ou de données à des services cloud externes.

Développement d'applications IA locales

Utilisez l'API REST locale d'Ollama pour intégrer des LLM open-weight dans des applications personnalisées, chatbots ou outils internes lors du prototypage et de la production.

Assistant de codage sur votre machine

Associez Ollama à des modèles axés sur le code pour obtenir de l'autocomplétion, du refactoring et des explications directement sur votre ordinateur portable, même sans accès à Internet.

Expérimentation de modèles pour les chercheurs

Téléchargez, échangez et comparez rapidement différents modèles open avec des configurations Modelfile personnalisées pour évaluer les performances dans les workflows de recherche ou de fine‑tuning.

Pour & contre

Pour

  • Exécution entièrement locale, préserve la confidentialité des données
  • Gratuit et open‑source
  • Supporte de nombreux modèles open‑weight populaires
  • CLI simple et API locale pour une intégration aisée
  • Multi‑plateforme (macOS, Linux, Windows)

Contre

  • Nécessite un matériel performant pour les modèles plus volumineux
  • Aucune interface graphique intégrée par défaut
  • La performance dépend fortement du GPU ou de la RAM locale
  • Limité aux modèles open‑weight, pas aux modèles propriétaires

Palmarès des batailles

Sur 1 bataille dans le Panthéon.

0
1ᵉʳ
1
2ᵉ
0
3ᵉ

Last battle

Avis

4.4

Moyenne sur 5 avis.

5
2
4
3
3
0
2
0
1
0

Connecte-toi pour laisser un avis.

Aaliyah Johnson

Aaliyah Johnson

Mar 5, 2026

Years in this space

I've evaluated a lot of these over the years. What stands out here is works offline after initial setup — handled better than most — and free and open source. Requires capable hardware for larger models is my one real gripe. Worth the time if this is your use case.

Naomi Suzuki

Naomi Suzuki

Nov 19, 2025

Solid for our team

We rolled this out across the team last quarter and cross-platform (macOS, Linux, Windows). Works offline after initial setup fits neatly into how we already work, and works offline after initial setup removed a step we used to do by hand. No built-in graphical interface by default, which is the main caveat, but it has held up under daily use.

IB

Ingrid Bauer

Oct 15, 2025

Years in this space

I've evaluated a lot of these over the years. What stands out here is custom Modelfile for tailored model configs — handled better than most — and cross-platform (macOS, Linux, Windows). Limited to open-weight models, not proprietary ones is my one real gripe. Worth the time if this is your use case.

DF

Diego Fernández

Sep 30, 2025

Skeptical, then convinced

I went in skeptical — most tools in this space overpromise. It actually delivers on custom Modelfile for tailored model configs, and free and open source caught me off guard. No built-in graphical interface by default is why this isn't a perfect score, still, I'd recommend giving it a real trial.

Sofia Lindqvist

Sofia Lindqvist

Sep 17, 2025

Solid for our team

We rolled this out across the team last quarter and simple CLI and local API for easy integration. Local REST API for app integration fits neatly into how we already work, and works offline after initial setup removed a step we used to do by hand. but it has held up under daily use.

Questions & réponses

Comment fonctionne l'utilisation supplémentaire ?

Les utilisateurs Pro et Max peuvent ajouter une balance de ressources supplémentaires. Ollama utilise d'abord les limites de plan incluses, puis tire de la balance de ressources supplémentaires. La consommation du groupe tire de la balance partagée par l'organisation.

Asked by Ekaterina Orlova · Aug 26, 2025

Combien d'utilisation chaque modèle utilise-t-il ?

Les modèles consomment un montant différent de ressources en fonction de leur difficulté à exécuter. Pour consulter un niveau de ressource d'un modèle, rendez-vous sur la page du modèle, sur laquelle son niveau de ressource est indiqué, allant de petits modèles légers (niveau 1), comme gpt-oss :20b, à des modèles lourds extrêmes (niveau 4), comme deepseek-v4-pro.

Asked by Greta Nowak · Aug 21, 2025

Comment la fréquentation est-elle mesurée ?

Les plans individuels ont des limites de fréquentation basées sur le modèle et le nombre de tokens d'entrée, d'entrée en cache et de sortie traités. Ils n'enferment pas dans un nombre fixe de tokens car des modèles différents utilisent différents montants d'ordonnanceur. Pour les équipes, la fréquentation de chaque membre utilise d'abord la fréquentation incluse avec leur siège. Une fois qu'il est utilisé, la fréquentation ajoutée utilise ensuite l'équilibre de fréquentation partagée de la team au taux de token du modèle.

Asked by Ravi Kapoor · Aug 16, 2025

Quels sont les limites d'utilisation pour chaque plan?

La mise en route des modèles sur votre propre matériel est toujours illimitée. L'utilisation en nuage varie en fonction du plan : Plan Utilisation Exemples d'utilisation Étape Gratuite Utilisation légère Chat avec les modèles, évaluation de modèles plus grands, codage et assistants AI avec des modèles plus petits Pro Travail courant Modèles plus grands, automatisation du codage, recherche approfondie Max Lourd, utilisation soutenue Tâches d'agents continues, agents multiples simultanés, modèles importants pendant des sessions prolongées Chaque plan a des limites de sessions qui se réinitialisent tous les 5 heures et des limites hebdomadaires qui se réinitialisent tous les 7 jours.

Asked by Noor Siddiqui · Aug 12, 2025

Comment va vite Ollama?

La rapidité dépend de la taille du modèle, de l'architecture et de l'optimisation matérielle. Nous visons et suivons pour un temps de la première pièce de jet très bas et un débit élevé sur tous les modèles cloud. Des niveaux de priorité avec une plus grande rapidité peuvent être disponibles à l'avenir.

Asked by Constantin Ionescu · Aug 11, 2025

Poser une question

Alternatives à Modèles de Langue de Grande Échelle (LLM)