OllamaExécuter des modèles de langage de grande taille open‑source localement sur votre propre machine
Aperçu
Fonctionnalités clés
- Téléchargement et exécution de modèles en une seule commande
- API REST locale pour l’intégration d’applications
- Bibliothèque de modèles avec versions quantifiées
- Modelfile personnalisé pour des configurations de modèle sur mesure
- Accélération GPU sur le matériel compatible
- Fonctionne hors ligne après la configuration initiale
Tarifs
- Modèle
- Freemium
- Note
- 4.4 / 5 (5)
Cas d’usage
Chat LLM privé hors ligne
Exécutez des modèles comme Llama ou Mistral localement pour discuter avec un assistant IA sans envoyer d'invites ou de données à des services cloud externes.
Développement d'applications IA locales
Utilisez l'API REST locale d'Ollama pour intégrer des LLM open-weight dans des applications personnalisées, chatbots ou outils internes lors du prototypage et de la production.
Assistant de codage sur votre machine
Associez Ollama à des modèles axés sur le code pour obtenir de l'autocomplétion, du refactoring et des explications directement sur votre ordinateur portable, même sans accès à Internet.
Expérimentation de modèles pour les chercheurs
Téléchargez, échangez et comparez rapidement différents modèles open avec des configurations Modelfile personnalisées pour évaluer les performances dans les workflows de recherche ou de fine‑tuning.
Pour & contre
Pour
- Exécution entièrement locale, préserve la confidentialité des données
- Gratuit et open‑source
- Supporte de nombreux modèles open‑weight populaires
- CLI simple et API locale pour une intégration aisée
- Multi‑plateforme (macOS, Linux, Windows)
Contre
- Nécessite un matériel performant pour les modèles plus volumineux
- Aucune interface graphique intégrée par défaut
- La performance dépend fortement du GPU ou de la RAM locale
- Limité aux modèles open‑weight, pas aux modèles propriétaires
Palmarès des batailles
Sur 1 bataille dans le Panthéon.
Last battle
Avis
Moyenne sur 5 avis.
Connecte-toi pour laisser un avis.
Years in this space
I've evaluated a lot of these over the years. What stands out here is works offline after initial setup — handled better than most — and free and open source. Requires capable hardware for larger models is my one real gripe. Worth the time if this is your use case.
Solid for our team
We rolled this out across the team last quarter and cross-platform (macOS, Linux, Windows). Works offline after initial setup fits neatly into how we already work, and works offline after initial setup removed a step we used to do by hand. No built-in graphical interface by default, which is the main caveat, but it has held up under daily use.
Years in this space
I've evaluated a lot of these over the years. What stands out here is custom Modelfile for tailored model configs — handled better than most — and cross-platform (macOS, Linux, Windows). Limited to open-weight models, not proprietary ones is my one real gripe. Worth the time if this is your use case.
Skeptical, then convinced
I went in skeptical — most tools in this space overpromise. It actually delivers on custom Modelfile for tailored model configs, and free and open source caught me off guard. No built-in graphical interface by default is why this isn't a perfect score, still, I'd recommend giving it a real trial.
Solid for our team
We rolled this out across the team last quarter and simple CLI and local API for easy integration. Local REST API for app integration fits neatly into how we already work, and works offline after initial setup removed a step we used to do by hand. but it has held up under daily use.
Questions & réponses
Comment fonctionne l'utilisation supplémentaire ?
Les utilisateurs Pro et Max peuvent ajouter une balance de ressources supplémentaires. Ollama utilise d'abord les limites de plan incluses, puis tire de la balance de ressources supplémentaires. La consommation du groupe tire de la balance partagée par l'organisation.
Asked by Ekaterina Orlova · Aug 26, 2025
Combien d'utilisation chaque modèle utilise-t-il ?
Les modèles consomment un montant différent de ressources en fonction de leur difficulté à exécuter. Pour consulter un niveau de ressource d'un modèle, rendez-vous sur la page du modèle, sur laquelle son niveau de ressource est indiqué, allant de petits modèles légers (niveau 1), comme gpt-oss :20b, à des modèles lourds extrêmes (niveau 4), comme deepseek-v4-pro.
Asked by Greta Nowak · Aug 21, 2025
Comment la fréquentation est-elle mesurée ?
Les plans individuels ont des limites de fréquentation basées sur le modèle et le nombre de tokens d'entrée, d'entrée en cache et de sortie traités. Ils n'enferment pas dans un nombre fixe de tokens car des modèles différents utilisent différents montants d'ordonnanceur. Pour les équipes, la fréquentation de chaque membre utilise d'abord la fréquentation incluse avec leur siège. Une fois qu'il est utilisé, la fréquentation ajoutée utilise ensuite l'équilibre de fréquentation partagée de la team au taux de token du modèle.
Asked by Ravi Kapoor · Aug 16, 2025
Quels sont les limites d'utilisation pour chaque plan?
La mise en route des modèles sur votre propre matériel est toujours illimitée. L'utilisation en nuage varie en fonction du plan : Plan Utilisation Exemples d'utilisation Étape Gratuite Utilisation légère Chat avec les modèles, évaluation de modèles plus grands, codage et assistants AI avec des modèles plus petits Pro Travail courant Modèles plus grands, automatisation du codage, recherche approfondie Max Lourd, utilisation soutenue Tâches d'agents continues, agents multiples simultanés, modèles importants pendant des sessions prolongées Chaque plan a des limites de sessions qui se réinitialisent tous les 5 heures et des limites hebdomadaires qui se réinitialisent tous les 7 jours.
Asked by Noor Siddiqui · Aug 12, 2025
Comment va vite Ollama?
La rapidité dépend de la taille du modèle, de l'architecture et de l'optimisation matérielle. Nous visons et suivons pour un temps de la première pièce de jet très bas et un débit élevé sur tous les modèles cloud. Des niveaux de priorité avec une plus grande rapidité peuvent être disponibles à l'avenir.
Asked by Constantin Ionescu · Aug 11, 2025
Poser une question
Alternatives à Modèles de Langue de Grande Échelle (LLM)

Modèles de pointe à poids ouverts

Génération rapide d'images IA alimentée par Google Gemini 2.5 Flash pour le prototypage visuel rapide.

Une plateforme d'IA conversationnelle sans code permettant aux entreprises de construire et de déployer des assistants virtuels intelligents.

Fondations multimodales comprenant le texte, les images, le vidéo et l'audio.

WebVoyager, votre agent Web puissant propulsé par des modèles multimodales méthodes (LMM)

Plateforme d’écriture assistée par IA pour générer, rechercher et affiner du contenu de longue forme.

Outil de traduction automatique neuronale connu pour ses résultats précis et naturels dans les principales langues.

Assistant de navigation alimenté par IA qui transforme la recherche web en réponses instantanées.
Trending now

API d'intelligence de document qui parse, divise, reconnait les chars et extrait les données structurées de complexes PDF, diapositives et tableurs.

Reponses sponsorises, payées par clic.

Aide aux devoirs précise avec explications complètes

Modele multimodal 12B gérant des images et du texte interrompus avec une fenêtre de contexte de 128 K.
