L’azienda che ha reso banale eseguire un modello di AI sul proprio laptop è diventata una scommessa da venture scale su ciò che costa l’inferenza. Ollama ha detto il 9 luglio di aver raccolto un round Serie B da 65 milioni di dollari guidato da Theory Ventures, con Benchmark, 8VC, Y Combinator e Pace Capital tra i partecipanti. Il finanziamento totale sale ora a 88 milioni di dollari. Non è stata comunicata alcuna valutazione.

I numeri dietro il round

Ollama dichiara 8,9 milioni di sviluppatori mensili — circa il doppio rispetto a gennaio — con circa 1 milione di nuove installazioni a settimana e 176.000 stelle su GitHub. Secondo l’azienda, lo strumento è usato all’interno dell’85% delle Fortune 500, comprese le industrie regolamentate in cui inviare dati a un’API di terze parti è un problema di compliance più che una preferenza. L’azienda che sostiene tutto questo ha 14 dipendenti.

Perché adesso

I fondatori Jeff Morgan e Michael Chiang avevano in precedenza costruito Kitematic, l’interfaccia grafica per container che Docker ha acquisito e poi integrato in Docker Desktop — lo stesso trucco applicato due volte, avvolgendo una toolchain locale ostile in qualcosa che uno sviluppatore può usare in pochi minuti. "I modelli open hanno iniziato a uscire nel 2023, ma erano davvero difficili da usare", ha detto Morgan. La svolta nella crescita è arrivata intorno a gennaio, quando i modelli open-weight hanno raggiunto un livello sufficiente nelle attività di coding e agentiche da rendere l’esecuzione locale non più un esercizio da appassionati.

L’argomento economico

Questa è, messa nero su bianco, la tesi d’investimento del partner di Benchmark Peter Fenton, che ha guidato il precedente round Serie A da 15 milioni di dollari di Ollama e siede nel suo consiglio. "Non è un aut-aut", ha detto Fenton. Secondo lui, ogni azienda con elevati costi di inferenza ha un "progetto vitale ed esistenziale" che la spinge verso i modelli open-weight. Fenton ha anche definito "estremamente raro" la capacità di costruire un prodotto che raggiunga l’ubiquità tra gli sviluppatori. Il business di Ollama è Ollama Cloud, con piani che vanno da 0 a 100 dollari al mese, fatturati in base al tempo GPU anziché ai token — un modello di pricing che suona come una replica diretta alle API a consumo per token.

Il quadro competitivo

Il round arriva nella stessa settimana in cui i laboratori frontier hanno tagliato i prezzi per difendere i budget enterprise, con Meta che ha fissato il prezzo del suo primo modello a pagamento a circa un quarto delle tariffe di OpenAI e Anthropic. La scommessa di Ollama è che una parte di quella spesa non arrivi mai a un’API: gira su hardware che le aziende possiedono già. La società non ha comunicato una valutazione per il round, e il team di 14 persone è al tempo stesso la prova della leva operativa e la domanda evidente: distribuire su questa scala richiede alla fine supporto, revisione della sicurezza e contratti enterprise, nessuno dei quali si regge sulle stelle di GitHub.