L’entreprise qui a rendu trivial l’exécution d’un modèle d’IA sur son propre ordinateur portable est devenue un pari à l’échelle du capital-risque sur le coût de l’inférence. Ollama a indiqué le 9 juillet avoir levé une série B de 65 millions de dollars menée par Theory Ventures, avec la participation de Benchmark, 8VC, Y Combinator et Pace Capital. Le financement total atteint désormais 88 millions de dollars. Aucune valorisation n’a été divulguée.
Les chiffres derrière l’opération
Ollama fait état de 8,9 millions de développeurs mensuels — soit environ le double de son niveau en janvier — avec environ 1 million de nouvelles installations par semaine et 176 000 étoiles sur GitHub. L’outil serait utilisé au sein de 85 % du Fortune 500, y compris dans des secteurs réglementés où l’envoi de données vers une API tierce relève davantage d’un problème de conformité que d’une préférence. L’entreprise qui soutient l’ensemble de cette activité compte 14 employés.
Pourquoi maintenant
Les fondateurs Jeff Morgan et Michael Chiang ont auparavant créé Kitematic, l’interface graphique pour conteneurs qu’a acquise Docker avant de l’intégrer à Docker Desktop — la même approche appliquée deux fois, consistant à envelopper une chaîne d’outils locale hostile dans quelque chose qu’un développeur peut lancer en quelques minutes. « Les modèles ouverts ont commencé à sortir en 2023, mais ils étaient vraiment difficiles à utiliser », a déclaré Morgan. Le point d’inflexion de la croissance est survenu vers janvier, lorsque les modèles à poids ouverts sont devenus suffisamment performants pour des tâches de codage et des usages agentiques, au point que leur exécution locale a cessé d’être un exercice de passionnés.
L’argument économique
Telle est, clairement formulée, la thèse d’investissement de Peter Fenton, associé chez Benchmark, qui a mené la précédente série A de 15 millions de dollars d’Ollama et siège à son conseil d’administration. « Ce n’est pas l’un ou l’autre », a déclaré Fenton. Selon lui, toute entreprise confrontée à des coûts d’inférence élevés a un « projet vital et existentiel » qui la pousse vers des modèles à poids ouverts. Fenton a également qualifié de « extrêmement rare » la capacité à bâtir un produit qui atteigne l’ubiquité chez les développeurs. L’activité d’Ollama repose sur Ollama Cloud, avec des offres allant de 0 à 100 dollars par mois, facturées au temps GPU plutôt qu’aux jetons — un modèle de tarification qui ressemble à une réponse directe aux API facturées au jeton.
Le contexte concurrentiel
Cette levée intervient la même semaine où les laboratoires de pointe ont baissé leurs prix pour défendre les budgets des entreprises, Meta affichant son premier modèle payant à environ un quart des tarifs d’OpenAI et d’Anthropic. Le pari d’Ollama est qu’une partie de cette dépense n’atteint jamais une API : elle s’exécute sur du matériel que les entreprises possèdent déjà. La société n’a pas communiqué de valorisation pour cette opération, et ses 14 salariés sont à la fois la preuve d’un fort effet de levier et la question évidente : à cette échelle, la distribution finit par exiger du support, des revues de sécurité et des contrats entreprise, autant d’éléments qui ne reposent pas sur des étoiles GitHub.
