Lezione 9 · Canale 1 · giovedì 8 ottobre 2026
Continuità, limiti e Perceptron
Programmazione Matematica
Continuità Lipschitz
Sia . La continuità si studia in un punto e su un insieme . La continuità Lipschitz è una condizione più forte e ha senso solo su un insieme, perché mette in gioco due punti arbitrari.
In una variabile, la retta per e è
Il coefficiente angolare dipende dalla coppia scelta. Può però accadere che per ogni coppia di punti, cioè
In questo caso è Lipschitz continua. Su un dominio la definizione richiede che esista tale che
Geometricamente, il grafico sta, in ogni suo punto, dentro il cono di pendenza che ha il vertice in quel punto.
Il cono e il rettangolo di Lipschitz
Cono
- pendenza
- pendenza
Rettangolo
- rettangolo di lati e
Lipschitz, continuità uniforme, continuità
Una funzione Lipschitz continua è continua. Si fissano ed : per ogni con
Il raggio è e non dipende da né da . Nella continuità in un punto, invece, il raggio può dipendere dal punto. Questa proprietà è la continuità uniforme: fissato , un solo raggio vale per tutte le coppie di punti.
Con , e si indicano le funzioni continue, uniformemente continue e Lipschitz continue su . Le proprietà formano una catena
La Lipschitz continuità è la più forte delle tre. L'implicazione opposta non vale: una funzione continua può non essere Lipschitz continua.
Teorema di Heine–Cantor (senza dimostrazione). In un insieme è compatto se è chiuso e limitato.
La compattezza è una condizione sufficiente per la continuità uniforme, non necessaria. Allo stesso modo, per una funzione derivabile, è necessaria per un minimo relativo in un punto interno al dominio, ma non sufficiente: la derivata può annullarsi senza che il punto sia un minimo.
La proprietà Lipschitz ricompare negli algoritmi di ottimizzazione. Se il gradiente di è Lipschitz continuo di costante , un passo garantisce la convergenza del metodo del gradiente.
Restrizioni e limiti in più variabili
Sia . La restrizione di ad è la funzione
Per esempio, ha dominio . Su , dove ,
Teorema (senza dimostrazione, analogo del teorema ponte per le successioni). Sia un punto di accumulazione per . Con , cioè finito, o ,
Poiché la condizione vale per ogni , basta trovare due restrizioni con limiti diversi per concludere che il limite non esiste.
Esempio. Sia su . L'origine non sta in ma è punto di accumulazione, quindi il limite ha senso.
- Su il numeratore è identicamente nullo, non solo infinitesimo: e il limite è .
- Su si ha , che tende a perché .
I due limiti sono diversi, quindi il limite in non esiste.
Il Perceptron
Il Perceptron è un modello di neurone artificiale, ispirato al neurone biologico. Il neurone riceve segnali dagli altri neuroni, ognuno pesato da un peso sinaptico, e si attiva se la somma pesata supera una soglia. Ogni neurone è un'unità molto semplice: la forza sta nel metterne insieme moltissimi.
Gli ingressi sono , i pesi sinaptici e la soglia è . L'uscita è
dove è la funzione di attivazione, il gradino:
Il neurone si attiva quando e resta spento altrimenti.
Con l'insieme dei punti con è una retta. Divide il piano in due semipiani: nel primo l'uscita è , nell'altro . Un neurone è quindi un classificatore lineare: ha una superficie di separazione lineare.
Addestrare un neurone
Ogni paziente è descritto da due caratteristiche cliniche, la pressione arteriosa e la fluidità del sangue. Dopo cinque anni si verifica chi ha avuto un evento ischemico: etichetta a chi l'ha avuto, agli altri. Con questi dati storici si vuole prevedere il rischio dei nuovi pazienti.
In generale il training set è
dove è il vettore delle caratteristiche e l'etichetta nota. Si indica con l'uscita del neurone, con il vettore dei pesi. I dati sono noti, le incognite sono e : vanno scelti in modo che il neurone classifichi correttamente i dati, per . Si misura l'errore sul campione e si minimizza la somma:
Un algoritmo di minimizzazione richiede che la funzione sia continua e derivabile, e qui non lo è per due motivi.
Il gradino non è continuo. Quindi neppure e l'errore lo sono rispetto a e . Lo si sostituisce con la funzione logistica, che ha andamento simile al gradino ma è continua e derivabile, e l'uscita diventa :
Il valore assoluto non è derivabile in . Lo si sostituisce con il quadrato, che misura ancora lo scarto fra uscita ed etichetta:
Ora esistono le derivate rispetto ai pesi e alla soglia, e il problema si può trattare con un algoritmo.
Lo XOR e le reti di neuroni
Il problema XOR assegna le etichette
Un singolo neurone non può classificarli: non esiste una retta con e da una parte e e dall'altra.
Un neurone sui punti dello XOR
- retta di separazione
- verso l'uscita
Si collegano allora più neuroni in una rete. Due neuroni e ricevono gli ingressi e con i loro pesi sinaptici, e le loro uscite sono gli ingressi di un terzo neurone . Con pesi e soglie adatti questa rete di tre neuroni realizza la classificazione dello XOR: lo si verifica provando i quattro ingressi.
Pesi e soglie non si possono assegnare dall'alto: li sceglie un algoritmo, a partire dai dati storici. In questa rete le variabili sono nove, sei pesi e tre soglie, e l'algoritmo minimizza l'errore, una funzione di nove variabili: è l'estensione del metodo del gradiente alle reti neurali, che richiede le derivate parziali e la differenziazione in .
Formulario
Continuità Lipschitz
Raggio uniforme
Catena delle classi
Heine–Cantor
Restrizione
Limite e restrizioni
per ogni con di accumulazione per
Perceptron
Frontiera con
Errore da minimizzare
Logistica