Ciao Maurizio, grazie per il dettaglio - la distinzione presente/storico/futuro l'ho capita bene, e ha senso come logica.
Ho fatto una cosa che mi sembrava interessante: ho confrontato i tuoi 5 report con un test che ho fatto io in parallelo sulle stesse 5 novine (train/test su piu' finestre temporali, verificando se il punteggio storico regge su dati mai visti). Il risultato piu' curioso: la novina 11-39-40-42-60-64-72-79-80 risulta la migliore per entrambi, indipendentemente - un bel segnale di conferma incrociata.
Ma c'e' una novina dove i nostri due metodi vanno in direzioni completamente opposte: la 4-12-17-49-58-59-73-81-89. Nel mio test e' la PEGGIORE delle 5 (il punteggio storico crolla quasi sempre nelle finestre piu' recenti), mentre nella tua Affidabilita' e' la 3ª migliore su 5 (60,8%). Prima di pensare che uno dei due metodi sia "sbagliato", mi chiedevo se dipende da differenze più semplici: il tuo archivio parte da dicembre 2021 giusto? Il mio parte dal 2009 per la ventina (l'Extra invece dal 2020/2021 come il tuo). Con una finestra storica cosi' diversa (quasi 15 anni contro meno di 5), le due probabilita' stimate potrebbero riflettere periodi diversi.
Un'altra cosa che mi chiedevo: nel calcolo di P usi anche L6 come indicatore, o ti basi solo su L7+/L8? Se pesa parecchio l'L6 (che essendo piu' frequente da' un campione piu' solido rispetto a L7+ che e' raro), potrebbe spiegare risultati diversi dai miei che si basano solo su L7+/E7+. Sono curioso di capire se e' solo una questione di dati diversi o se c'e' anche una differenza di metodo nel calcolo di P.