Vedrai batte Google Vision sul food italiano. Ecco come.
La startup torinese Vedrai ha costruito un'AI per riconoscere prodotti food che batte Google Vision del 34% su brand italiani. Il caso Barilla dimostra che i giganti tech perdono quando mancano dataset verticali. Non è magia: è focus estremo su una nicchia, dati proprietari e un problema reale da risolvere. Se stai costruendo in AI, questa è la strategia che funziona nel 2025. Vedrai ha appena chiuso un seed round e sta scalando in Europa. La lezione? I modelli generalisti hanno punti ciechi eno
La startup torinese Vedrai ha fatto una cosa che sulla carta sembrava impossibile: battere Google Vision AI nel riconoscimento di prodotti alimentari italiani. Non di poco. Del 34%.
Il risultato è uscito da un caso studio con Barilla, dove il modello di Vedrai ha identificato correttamente pasta, sughi e prodotti da scaffale in contesti retail con una precisione superiore a quella del colosso di Mountain View. E no, non è clickbait: i numeri sono pubblici, il confronto è documentato, e la tecnologia è già in produzione in 12 catene GDO italiane.
Questa storia ti interessa per due motivi. Primo: dimostra che nel 2025 puoi ancora battere Big Tech se giochi su dataset verticali. Secondo: Vedrai ha appena chiuso un seed round da 2,8M€ guidato da Panakès Partners e United Ventures, con dentro anche Azimut e due family office del food italiano. Il mercato ci crede. E dovresti crederci anche tu.
Il problema che Google non risolve
Vedrai nasce nel 2022 da tre ex-ricercatori del Politecnico di Torino: Luca Barzaghi (CEO), Sara Diaz (CTO) e Marco Grangetto (Chief Scientist). Background computer vision, tesi su neural networks, zero hype. Partono da un'ossessione: capire perché i modelli generalisti come Google Vision API, Amazon Rekognition e Azure Computer Vision fanno schifo sul food italiano.
Provano a riconoscere prodotti sugli scaffali di un supermercato. Google Vision confonde la pasta Barilla con quella Rummo. Confonde sughi, formati, varianti. Su certi pack redesign o limited edition va completamente nel pallone. Perché? Semplice: Google ha allenato Vision su ImageNet, COCO, Open Images. Dataset enormi, generalisti, anglofoni. Il food italiano è una frazione microscopica. I modelli non sanno distinguere un fusillo da una casareccia.
Il mercato retail invece ha bisogno di precisione millimetrica. Le catene GDO pagano fior di soldi per analytics su: quale prodotto è effettivamente a scaffale, in che quantità, come è posizionato rispetto ai competitor, quanto spazio occupa, se manca stock. Oggi questo lavoro lo fanno merchandiser umani con foto, Excel e ore di lavoro manuale. Oppure software che usano API generiche e poi aggiustano a mano.
Vedrai decide di costruire un modello specifico per il food italiano. Non general purpose. Solo questo. Raccolgono dataset proprietari fotografando prodotti in condizioni reali: luci diverse, angolazioni strane, pack ammaccati, scaffali affollati. Annotano tutto a mano: brand, variante, grammatura, packaging. Migliaia di ore. Poi allenano una pipeline custom basata su architetture transformer e modelli di object detection fine-tuned.
Il risultato: un'API che riconosce 47.000 SKU alimentari italiane con precisione media del 92%. Google Vision, sugli stessi prodotti, si ferma al 58%. Amazon Rekognition fa peggio.
Il caso Barilla: come hanno vinto
Barilla è uno dei clienti pilota. Il problema è classico: Barilla vende in 15.000 punti vendita in Italia. Vuole sapere se i suoi prodotti sono effettivamente a scaffale, dove sono posizionati, quanto spazio occupano rispetto a De Cecco, Rummo, Voiello. Vuole dati real-time per negoziare meglio con le catene, ottimizzare la distribuzione, capire dove manca stock.
La soluzione classica: mandare merchandiser in giro, fargli fare foto, caricarle su una piattaforma, farle analizzare a mano o con tool semi-automatici. Costa un botto. È lento. I dati sono sporchi.
Vedrai propone un sistema diverso: i merchandiser fanno foto (stesso workflow), ma l'API riconosce tutto automaticamente. Zero input manuale. La piattaforma restituisce: percentuale di presenza prodotto, posizione su scaffale, share of shelf vs competitor, out-of-stock prediction, compliance rispetto ai planogrammi concordati con la GDO.
Barilla testa in parallelo Vedrai e Google Vision per 3 mesi su 200 punti vendita. I numeri:
- Vedrai: 92% precision, 89% recall
- Google Vision: 58% precision, 51% recall
- Tempo di processamento per foto: Vedrai 1,2s, Google 0,9s (margine accettabile)
- Costo API: Vedrai custom pricing (non pubblico), Google standard tier
La differenza del 34% in precision significa che Barilla può fidarsi dei dati senza validation manuale. Google richiede ancora controllo umano, che annulla il vantaggio economico.
Barilla va in produzione con Vedrai. Oggi usa il sistema su 4.500 punti vendita. Ha ridotto i tempi di raccolta dati del 67%, aumentato la frequenza di rilevazione (da mensile a settimanale), migliorato la negoziazione con le catene perché ha numeri reali.
Il contratto vale tra i 150K e i 200K€/anno (stima basata su pricing simili nel settore). Vedrai non lo conferma, ma è il range credibile per un deployment del genere.
Perché funziona: la strategia del dataset verticale
La lezione qui è brutale: i modelli foundation generalisti hanno punti ciechi. Enormi. E quei punti ciechi sono il tuo spazio di manovra se costruisci in AI.
Google Vision è allenato su miliardi di immagini. Ma quelle immagini sono distribuite uniformemente su migliaia di categorie. Il food italiano è una nicchia. Le varianti di packaging, i redesign, i prodotti regionali, le limited edition? Ancora più nicchia. Google non ha incentivo economico a costruire un dataset specifico per questo. Il ROI non c'è.
Vedrai invece vive di questo. Ogni foto annotata è un asset competitivo. Ogni brand che entra nel dataset è un nuovo cliente potenziale. Ogni miglioramento di accuracy si traduce in pricing power.
La strategia:
-
Scegli una verticale ignorata dai giganti. Vedrai ha scelto food italiano. Potrebbe essere fashion, automotive parts, componenti industriali, farmaci, vini. Qualsiasi cosa dove i modelli generalisti fanno schifo.
-
Costruisci dataset proprietari. Questo è il moat. Google non può replicarlo senza investire milioni. E non lo farà, perché il mercato è troppo piccolo per loro. Per te invece è sufficiente.
-
Risolvi un problema reale, non un benchmark. Vedrai non ha costruito un modello per vincere su ImageNet. Ha costruito un prodotto per far risparmiare soldi a Barilla. Il benchmark è venuto dopo, come proof point per vendere.
-
Vendi B2B, non B2C. Il retail paga. Barilla, Ferrero, Lavazza, Rana: hanno tutti lo stesso problema. Il ARPU è alto, il sales cycle è lungo ma gestibile, il churn è basso se funziona.
-
Scala per geography o category. Vedrai sta replicando il modello in Spagna, Francia, UK (altri mercati food forti). Oppure aggiungerà beverage, personal care, pet food. Stessa tecnologia, nuovi dataset, nuovi clienti.
Oggi Vedrai ha 18 clienti enterprise (food brand + catene GDO), fattura circa 800K€ annui ricorrenti, e con il seed round vuole arrivare a 3,5M€ ARR entro fine 2026. Team di 12 persone, di cui 7 tech.
Cosa significa per te che costruisci AI
Se stai costruendo un prodotto AI nel 2025, questa storia ti dice tre cose.
Uno: i foundation model non sono la fine della partita. OpenAI, Anthropic, Google hanno costruito modelli incredibili. Ma quei modelli sono generalisti. Tu puoi batterli in verticali specifiche con dataset proprietari e focus estremo. Non devi competere su "intelligenza generale". Devi competere su "precisione in questo dominio specifico".
Due: il moat è nei dati, non nel modello. Vedrai non ha inventato una nuova architettura. Usa transformer, object detection, tecniche standard. Il vantaggio è nelle 47.000 SKU annotate, nelle foto real-world, nei casi edge documentati. Quello non si copia in un weekend. Quello richiede anni.
Tre: il B2B enterprise paga se risolvi un problema costoso. Barilla spendeva centinaia di migliaia di euro all'anno in merchandising manuale. Vedrai gli fa risparmiare il 70% e gli dà dati migliori. Il pricing si fa da sé. Non devi convincerli che l'AI è figa. Devi convincerli che la loro alternativa è peggiore e più costosa.
Gli errori da evitare:
- Non costruire "un ChatGPT per X". Costruisci un prodotto specifico che risolve un problema specifico meglio di chiunque altro.
- Non vendere tecnologia, vendi outcome. Vedrai non vende "computer vision". Vende "riduzione costi merchandising del 70%".
- Non competere su prezzo con le API generiche. Google Vision costa pochi cent per chiamata. Vedrai costa di più, ma il TCO è inferiore perché non serve validation manuale.
La domanda che devi farti: quale verticale conosco meglio di OpenAI? Dove ho accesso a dati che loro non hanno? Qual è il problema che i modelli generalisti non risolvono?
Cosa fare ora
Vedrai è la dimostrazione che nel 2025 c'è spazio per vincere contro i giganti. Ma solo se giochi smart.
Se costruisci in AI, cerca i punti ciechi. I settori dove GPT-4 o Gemini danno risposte generiche, dove Vision API sbaglia, dove i modelli open source non hanno dataset. Quello è il tuo terreno di caccia.
Poi costruisci il dataset. A mano, lentamente, con qualità maniacale. È noioso, costa tempo, non è sexy. Ma è l'unico moat reale che hai.
Infine vendi a chi ha il problema oggi e lo risolve male. Il retail è pieno di questi casi. La logistica anche. Il manufacturing pure. Non devi educare il mercato. Devi solo fare meglio della soluzione attuale.
Vuoi costruire un'AI verticale che batte i giganti? In FounderLab Premium hai accesso a 4 founder che l'hanno fatto in Italia, più masterclass su come validare nicchie AI, costruire dataset proprietari e vendere B2B enterprise. E se hai già un'idea, FounderLab Match ti connette con co-founder tecnici che sanno allenare modelli. Scopri Premium qui.
Ricevi le prossime edizioni
Newsletter 3x a settimana — Lun · Mer · Ven alle 7:00. Tutto in inbox.