38 - Fermarsi quando sei avanti: una regola di stop crea valore atteso?
19-09-2026
Probabilità e combinatoria nei giochi
MATH
19-09-2026
Probabilità e combinatoria nei giochi
Negli articoli 35–37 abbiamo costruito tre pezzi dello stesso problema:
una random walk evolve nel tempo
una barriera può terminare il processo
una regola di stop deve usare solo informazioni già osservate
Ora affrontiamo una frase molto naturale:
Gioco finché non sono in guadagno, poi mi fermo.
Sembra che questa regola debba aiutare.
Dopotutto, se appena il saldo diventa positivo smettiamo di esporci a nuovi rischi, dovremmo ottenere più sessioni vincenti.
Questo è vero.
Ma la domanda importante è un'altra:
più sessioni vincenti
=
valore atteso positivo?
No.
Per vederlo senza nasconderci dietro un teorema, costruiamo prima un caso che possiamo enumerare completamente.
A ogni turno:
+1 con probabilità 1/2
-1 con probabilità 1/2
Il saldo parte da:
$$ S_0 = 0 $$
Ogni turno è indipendente e il valore atteso di un singolo passo è:
$$ E[X]=0 $$
È quindi lo stesso gioco equo usato per la random walk dell'articolo 35.
Aggiungiamo però un orizzonte massimo di quattro turni.
La regola è:
mi fermo appena il saldo diventa positivo;
se non succede, mi fermo comunque dopo il turno 4
Indichiamo con T il momento in cui ci fermiamo.
Formalmente:
T = min(primo n con S_n > 0, 4)
Questa è una regola valida nel senso dell'articolo 37:
T è un tempo di arresto
perché a ogni turno possiamo decidere usando soltanto il saldo già osservato.
Inoltre:
$$ T \le 4 $$
sempre.
Questa limitazione sarà importante quando parleremo del teorema di arresto opzionale.
Senza alcuna regola di stop, dopo quattro passi la distribuzione è quella già nota dalla binomiale:
| Saldo dopo 4 turni | Sequenze | Probabilità |
|---|---|---|
| $+4$ | 1 | $1/16$ |
| $+2$ | 4 | $4/16$ |
| $0$ | 6 | $6/16$ |
| $-2$ | 4 | $4/16$ |
| $-4$ | 1 | $1/16$ |
Le sequenze totali sono:
$$ 2^4 = 16 $$
Quindi:
P(saldo > 0)
=
(1+4)/16
=
5/16
=
31,25%
analogamente:
P(saldo < 0)=5/16
P(saldo = 0)=6/16
Il valore atteso è:
E[S_4]
=
(1·4 + 4·2 + 6·0 + 4·(-2) + 1·(-4))/16
=
0
Niente di sorprendente: quattro passi equi hanno ancora valore atteso zero.
flowchart TD
A["Dopo il turno n"] --> B{"Sₙ > 0?"}
B -->|Sì| C["Stop"]
B -->|No e n < 4| D["Gioca un altro turno"]
D --> A
B -->|No e n = 4| C
La regola cambia quando osserviamo il saldo finale; non cambia le probabilità del singolo passo.
Per confrontare correttamente le due strategie manteniamo lo stesso spazio campionario di 16 sequenze complete di quattro lanci.
Se una sequenza raggiunge prima un saldo positivo, ignoriamo semplicemente ciò che sarebbe accaduto dopo lo stop.
Per esempio:
++++
+---
+-+-
hanno tutte la stessa decisione reale:
primo passo = +1
-> saldo positivo
-> stop immediato a +1
Le continuazioni teoriche dopo quel momento non influenzano più il risultato della sessione.
Enumerando tutte le 16 sequenze otteniamo:
| Saldo allo stop | Sequenze | Probabilità |
|---|---|---|
| $+1$ | 10 | $10/16$ |
| $0$ | 2 | $2/16$ |
| $-2$ | 3 | $3/16$ |
| $-4$ | 1 | $1/16$ |
Controllo:
$$ 10 + 2 + 3 + 1 = 16 $$
Ora le sessioni positive sono:
10/16
=
5/8
=
62,5%
Prima erano soltanto:
5/16
=
31,25%
La regola di stop ha quindi raddoppiato la frequenza delle sessioni positive in questo piccolo esempio.
Quando la regola riesce a fermarci in guadagno, il risultato è sempre:
+1
I risultati negativi, invece, possono essere:
-2
-4
Quindi il valore atteso finale è:
$$ E[S_T] = (10\cdot 1 + 2\cdot 0 + 3\cdot (-2) + 1\cdot (-4))/16 $$
ossia:
E[S_T]
=
(10 - 6 - 4)/16
=
0
Abbiamo quindi contemporaneamente:
P(sessione positiva) = 62,5%
E[risultato finale] = 0
Non c'è contraddizione.
La regola produce molte piccole vittorie e meno sconfitte, ma più grandi.
È lo stesso tipo di distinzione introdotta nell'articolo 12:
vincere spesso
!=
avere valore atteso positivo
Qui però la distribuzione non è stata scelta all'inizio: è la regola di arresto a trasformarla.
Senza stop:
+4 1/16
+2 4/16
0 6/16
-2 4/16
-4 1/16
Con stop al primo saldo positivo:
+1 10/16
0 2/16
-2 3/16
-4 1/16
Le due distribuzioni sono molto diverse.
Quello che non cambia, nel nostro caso equo e limitato, è il loro valore atteso:
0
Questo è il punto che una semplice percentuale di sessioni vinte non riesce a mostrare.
Per la random walk equa, conoscendo tutta la storia fino al tempo n, il passo successivo resta:
+1 con probabilità 1/2
-1 con probabilità 1/2
Quindi:
E[S_(n+1) | storia fino a n]
=
S_n
L'espressione a sinistra è un valore atteso condizionato: la media teorica del prossimo saldo calcolata usando tutto ciò che sappiamo fino al passo n. Un processo con questa proprietà è chiamato martingala.
Nel linguaggio dei giochi significa, in modo molto intuitivo:
con le informazioni disponibili adesso,
il saldo futuro immediato non ha deriva media positiva né negativa
Non significa che ogni traiettoria rimanga vicina a zero.
Non significa che non possiamo avere lunghe serie positive o negative.
Significa che il processo non possiede un vantaggio medio condizionato nascosto.
Esistono teoremi di arresto opzionale che permettono, sotto determinate condizioni, di confrontare il valore atteso di una martingala prima e dopo un tempo di arresto.
Nel nostro esempio la situazione è particolarmente semplice perché:
$$ T \le 4 $$
Il tempo di arresto è quindi limitato.
Per una martingala e un tempo di arresto limitato, possiamo concludere:
$$ E[S_T] = E[S_0] $$
e siccome:
$$ S_0=0 $$
ritroviamo:
$$ E[S_T]=0 $$
Ma è importante osservare l'ordine didattico:
prima abbiamo enumerato tutte le 16 sequenze
poi abbiamo verificato EV = 0
solo dopo abbiamo riconosciuto il teorema generale che spiega il risultato
Il teorema non sostituisce il modello.
Da questo esempio non possiamo concludere:
Qualunque regola di stop lascia sempre invariato il valore atteso.
Questa frase è falsa.
I teoremi di arresto opzionale hanno ipotesi precise.
A seconda della formulazione possono entrare condizioni come:
tempo di arresto limitato
integrabilità
valore atteso finito del tempo di arresto
incrementi controllati
uniforme integrabilità del processo arrestato
Non servono tutte contemporaneamente in ogni versione del teorema, ma serve qualche insieme di condizioni sufficiente.
Per questo abbiamo scelto apposta un caso con:
$$ T \le 4 $$
Non c'è alcun passaggio al limite nascosto.
La frase:
continuo finché il saldo arriva a +1
sembra quasi identica alla nostra regola.
Ma ora il tempo di arresto non è più limitato.
Per una random walk semplice e simmetrica, il livello +1 viene raggiunto con probabilità 1, ma il tempo medio necessario non è finito.
Quindi non possiamo prendere il risultato del caso T<=4 e applicarlo automaticamente alla nuova situazione.
Questo è un ottimo esempio del motivo per cui le ipotesi del teorema contano.
La versione illimitata non è una strategia pratica per ottenere un guadagno certo: può richiedere un'attesa arbitrariamente lunga e durante il percorso il saldo può scendere molto sotto zero.
Il nostro messaggio non è:
"fermarsi non serve mai"
ma:
una regola di stop cambia la distribuzione;
per sapere che cosa succede al valore atteso
serve analizzare il modello e verificare le condizioni corrette
Per questo articolo il controllo più forte è l'enumerazione completa.
Il programma genera tutte le:
$$ 2^4 = 16 $$
sequenze di quattro passi e calcola per ciascuna:
saldo dopo quattro turni senza stop
tempo di arresto T
saldo al momento dello stop
Deve ricostruire esattamente:
senza stop:
+4 -> 1
+2 -> 4
0 -> 6
-2 -> 4
-4 -> 1
con stop:
+1 -> 10
0 -> 2
-2 -> 3
-4 -> 1
oltre ai gate:
P(positivo senza stop) = 5/16
P(positivo con stop) = 10/16
EV senza stop = 0
EV con stop = 0
Lo standalone C# associato a questo articolo è:
FermarsiQuandoSeiAvanti.cs
La simulazione inclusa nel file usa un seed fisso ed è secondaria rispetto all'enumerazione esatta.
Una strategia può cambiare ciò che vediamo più spesso senza cambiare ciò che guadagniamo in media.
Nel nostro caso:
sessioni positive:
31,25% -> 62,5%
valore atteso:
0 -> 0
Quindi la domanda corretta non è soltanto:
quanto spesso termino in vantaggio?
ma anche:
quanto valgono tutti i possibili risultati,
pesati per le loro probabilità?
Con questo articolo abbiamo introdotto la martingala soltanto quanto basta per interpretare un gioco equo fermato a un tempo limitato.
Nel prossimo articolo cambieremo meccanismo: con l'urna di Pólya il passato modifica realmente le probabilità future attraverso un rinforzo del colore appena osservato.