Blog categories

Comments

Emotiva è il secondo modello al mondo per eye-tracking predittivo

 

In breve. A marzo 2026, Emotiva V2 è stata valutata sul MIT/Tübingen Saliency Benchmark ottenendo AUC 0.8755. È il secondo risultato al mondo tra tutti i modelli di saliency testati — dietro solo a DeepGaze MSDB del Bethge Lab dell’Università di Tübingen. Nessun altro modello commerciale prevede oggi l’attenzione visiva con la stessa accuratezza.

 

Cos’è il MIT/Tübingen Saliency Benchmark

 

Il MIT/Tübingen Saliency Benchmark è il principale standard internazionale per valutare i modelli di eye-tracking predittivo: algoritmi che prevedono dove l’occhio umano si fermerà osservando un’immagine, prima ancora che qualcuno la guardi.

Nato al MIT e oggi co-gestito dal Bethge Lab dell’Università di Tübingen, il benchmark confronta le predizioni di un modello con dati reali di eye-tracking raccolti su migliaia di partecipanti, su dataset standardizzati come CAT2000 e MIT300. Le metriche utilizzate includono AUC (Area Under Curve), NSS (Normalized Scanpath Saliency), CC (Correlation Coefficient) e Information Gain.

Per dare un’idea della severità del test: dei circa 35 modelli sottoposti alla valutazione sul dataset CAT2000, meno di dieci superano la soglia AUC 0.86. Il limite teorico — il Gold Standard, calcolato sui fissamenti umani reali — è 0.9159.

 

I risultati di Emotiva V2 (marzo 2026)

 

Emotiva V2 ha ottenuto i seguenti risultati (test del 5 marzo 2026):

Metrica Emotiva V2 DeepGaze MSDB (1°) Gold Standard
AUC 0.8755 0.8847 0.9159
NSS 2.3232 2.5127 2.7429
CC 0.8721 0.9155 0.9685
Information Gain 0.3526 0.4932 0.8026

 

Davanti a Emotiva V2 c’è un solo modello reale: DeepGaze MSDB, sviluppato da Matthias Kümmerer e dal suo team all’Università di Tübingen e presentato a ICCV 2025. È, peraltro, lo stesso gruppo di ricerca che gestisce il benchmark.

Dietro Emotiva V2 si posizionano DeepGaze IIE (AUC 0.8692), UNISAL (0.8607), DeepGaze II (0.8640), SALICON (0.8406) e tutte le altre architetture commerciali e accademiche concorrenti.

Fonte: Leaderboard ufficiale CAT2000, test del 5 marzo 2026.

 

Perché l’eye-tracking predittivo fa la differenza nel marketing

 

L’eye-tracking tradizionale richiede laboratori, partecipanti reclutati e settimane di setup. L’eye-tracking predittivo via AI restituisce gli stessi insight in secondi, su qualsiasi immagine, prima della produzione.

La differenza tra un modello con AUC 0.83, il range tipico delle soluzioni commerciali pre-2024, e uno con AUC 0.8755 non è una nota a piè di pagina in un paper tecnico. È la differenza tra una stima indicativa e una predizione operativa: su cui un brand può fondare decisioni da centinaia di migliaia di euro.

Le applicazioni concrete dove questo gap diventa misurabile:

  • Validazione di packaging prima della stampa. Il logo cattura l’occhio prima del claim di prodotto? Il badge di certificazione viene effettivamente registrato? Un modello con AUC 0.87+ dà una lettura affidabile prima che una singola unità vada in stampa.
  • Pre-test di scene video. Quali frame tengono l’attenzione, e quali la perdono? L’eye-tracking predittivo su scene chiave identifica i punti di calo prima che il montaggio sia definitivo.
  • Test di headline e layout. L’headline domina la composizione, o un elemento visivo concorrente ruba il focus? Lo sapete prima di comprare media.
  • A/B test su carta. Decine di varianti creative in pochi minuti, senza laboratorio, senza partecipanti, senza budget dedicato.
  • Revisione di compliance visiva. Il disclaimer è visibile? L’avvertenza obbligatoria cade nel percorso naturale di lettura? Verificabile con dati, non con supposizioni.

Il risultato di Emotiva V2 sul MIT/Tübingen Benchmark non è un’affermazione nostra. È un punteggio verificabile pubblicamente, su una leaderboard pubblica, prodotto da un istituto accademico indipendente.

 

Dalla visione alla conversione: la catena completa

 

Vedere dove guarda una persona è solo il primo anello. La catena completa è:

occhio → attenzione → emozione → decisione → conversione

Ogni anello dipende dalla precisione del precedente. Un modello più accurato nell’attenzione produce un’inferenza emotiva più affidabile, che a sua volta genera predizioni comportamentali più azionabili — fino all’ultimo miglio: la conversione.

Questo è il territorio esplorato nel nostro ultimo studio, Seeing Beyond: Unlocking Image Emotion with Contextual Depths, a firma di Federico Cozzi, Andrea D’Eusanio e Giuseppe Boccignone, pubblicato negli atti ICIAP 2025 Workshops (Lecture Notes in Computer Science, vol. 16169), Springer, Cham, 2026.

Il paper dimostra come l’integrazione di informazioni contestuali nella classificazione delle emozioni produca un miglioramento dell’accuratezza di quasi il 5%, anche con arricchimenti contestuali relativamente semplici. Il principio è netto: più è preciso il modello attentivo, più diventa robusto quello emotivo. Il salto da Emotiva V1 a V2 sul benchmark non è un risultato accademico isolato, è la base su cui poggiano tutti gli anelli successivi della pipeline.

 

Eye-tracking predittivo vs. eye-tracking tradizionale

 

La risposta onesta è: sono complementari, non alternativi.

L’eye-tracking tradizionale (hardware, in laboratorio) rimane il gold standard per ricerca accademica, studi clinici e validazione finale su stimoli specifici in contesti controllati. Cattura sequenze di scanpath, dilatazione pupillare, frequenza di ammiccamento, segnali comportamentali che i modelli predittivi non producono.

L’eye-tracking predittivo via AI è imbattibile nella fase di pre-produzione: testare decine di varianti senza laboratorio, scalare su mercati e formati, integrarsi in una pipeline creativa in tempo reale. Quando il modello sottostante raggiunge AUC sopra 0.87, le due metodologie convergono in modo sostanziale per la maggior parte delle applicazioni di marketing.

La scelta non è quale sia “migliore”. È quale sia quella giusta nel momento specifico del vostro flusso di lavoro.

 

Domande frequenti

 

Cos’è il MIT/Tübingen Saliency Benchmark?

Il MIT/Tübingen Saliency Benchmark è un test accademico indipendente che valuta la capacità dei modelli di intelligenza artificiale di prevedere dove l’occhio umano si fermerà osservando un’immagine. Confronta le predizioni dei modelli con dati reali di eye-tracking su dataset standardizzati come CAT2000 e MIT300. È il principale riferimento internazionale per classificare i modelli di visual saliency.

 

Qual è il modello di saliency più accurato al mondo nel 2026?

A maggio 2026, sul dataset CAT2000, il modello con il punteggio più alto è DeepGaze MSDB (AUC 0.8847), sviluppato all’Università di Tübingen. Emotiva V2 si classifica secondo (AUC 0.8755). Il Gold Standard teorico, ricavato dai fissamenti umani reali, è 0.9159.

 

Cosa misura la metrica AUC nel saliency?

AUC (Area Under Curve) misura quanto bene la mappa di salienza prevista da un modello distingue i punti effettivamente fissati da quelli non fissati. Un valore di 0.5 equivale al caso, 1.0 a una predizione perfetta. Sopra 0.85 si parla di livello state-of-the-art.

 

Posso verificare i risultati di Emotiva V2 sul benchmark?

Sì. La leaderboard è pubblica e consultabile su saliency.tuebingen.ai/results_CAT2000.html. Cercate la riga “Emotiva V2”, prima testata il 5 marzo 2026.

 

Eye-tracking predittivo o eye-tracking tradizionale: quale scegliere?

Dipende dalla fase del vostro lavoro. L’eye-tracking tradizionale resta il gold standard per ricerca e validazione finale. L’eye-tracking predittivo via AI è la scelta giusta nella pre-produzione: testa decine di varianti in minuti, senza laboratorio. Quando il modello AI ha un AUC sopra 0.87, le due metodologie sono ampiamente intercambiabili per le applicazioni di marketing.

 

Cosa dimostra lo studio pubblicato su Springer Nature?

Lo studio Seeing Beyond: Unlocking Image Emotion with Contextual Depths (Cozzi, D’Eusanio, Boccignone, ICIAP 2025 Workshops, Springer 2026) dimostra che arricchire un modello visivo con descrizioni testuali contestuali migliora l’accuratezza nella classificazione delle emozioni di quasi il 5%. Il risultato evidenzia il valore degli input multimodali per comprendere il contenuto affettivo delle immagini, e il legame diretto con le decisioni d’acquisto.

 

Volete vedere Emotiva V2 applicato a un vostro asset?

PRENOTA UNA DEMO
div#stuning-header .dfd-stuning-header-bg-container {background-image: url(https://emotiva.it/wp-content/uploads/2026/05/Emotiva-MIT-2026.png);background-color: #002f52;background-size: cover;background-position: top center;background-attachment: initial;background-repeat: no-repeat;}#stuning-header div.page-title-inner {min-height: 400px;}#main-content .dfd-content-wrap {margin: 0px;} #main-content .dfd-content-wrap > article {padding: 0px;}@media only screen and (min-width: 1101px) {#layout.dfd-portfolio-loop > .row.full-width > .blog-section.no-sidebars,#layout.dfd-gallery-loop > .row.full-width > .blog-section.no-sidebars {padding: 0 0px;}#layout.dfd-portfolio-loop > .row.full-width > .blog-section.no-sidebars > #main-content > .dfd-content-wrap:first-child,#layout.dfd-gallery-loop > .row.full-width > .blog-section.no-sidebars > #main-content > .dfd-content-wrap:first-child {border-top: 0px solid transparent; border-bottom: 0px solid transparent;}#layout.dfd-portfolio-loop > .row.full-width #right-sidebar,#layout.dfd-gallery-loop > .row.full-width #right-sidebar {padding-top: 0px;padding-bottom: 0px;}#layout.dfd-portfolio-loop > .row.full-width > .blog-section.no-sidebars .sort-panel,#layout.dfd-gallery-loop > .row.full-width > .blog-section.no-sidebars .sort-panel {margin-left: -0px;margin-right: -0px;}}#layout .dfd-content-wrap.layout-side-image,#layout > .row.full-width .dfd-content-wrap.layout-side-image {margin-left: 0;margin-right: 0;}