Lezione 3 · Canale 1 · venerdì 25 settembre 2026

Prodotto scalare, norme e funzioni in ℝⁿ

Programmazione Matematica

La retta reale estesa

Si aggiungono a R\mathbb R due elementi, −∞-\infty e +∞+\infty, collocati in modo che stiano oltre ogni reale:

R∗=R∪{−∞}∪{+∞},∀x∈R: −∞<x<+∞\mathbb R^*=\mathbb R\cup\{-\infty\}\cup\{+\infty\},\qquad \forall x\in\mathbb R:\ -\infty<x<+\infty

Per parlare di intorni di questi due elementi si usa una soglia M∈RM\in\mathbb R:

I(−∞)={x∈R: x<M}I(+∞)={x∈R: x>M}\begin{gathered} I(-\infty)=\{x\in\mathbb R:\ x<M\}\\ I(+\infty)=\{x\in\mathbb R:\ x>M\} \end{gathered}

Poiché il punto di accumulazione si definisce con gli intorni, anche ±∞\pm\infty possono esserlo. Serve per i limiti con x→±∞x\to\pm\infty.

Lo spazio ℝⁿ

Il prodotto cartesiano di due insiemi è fatto di coppie ordinate: A×B≠B×AA\times B\neq B\times A, a meno che A=BA=B, caso in cui si scrive A×A=A2A\times A=A^2. Con più insiemi:

A1×⋯×An={(a1,…,an):ai∈Ai, i=1,…,n}\begin{aligned} A_1\times\dots\times A_n=\{&(a_1,\dots,a_n):\\ &a_i\in A_i,\ i=1,\dots,n\} \end{aligned}

Con i reali si ottengono R2={(x,y):x∈R, y∈R}\mathbb R^2=\{(x,y):x\in\mathbb R,\,y\in\mathbb R\} e R3={(x,y,z):x,y,z∈R}\mathbb R^3=\{(x,y,z):x,y,z\in\mathbb R\}. In generale:

Rn={(x1,x2,…,xn): xi∈R}\mathbb R^n=\{(x_1,x_2,\dots,x_n):\ x_i\in\mathbb R\}

Per convenzione un elemento di Rn\mathbb R^n è un vettore colonna:

x∈Rn,x=(x1⋮xn)x\in\mathbb R^n,\qquad x=\begin{pmatrix}x_1\\ \vdots\\ x_n\end{pmatrix}

Ordine in ℝⁿ

R\mathbb R è totalmente ordinato. Rn\mathbb R^n con n>1n>1 è ordinato, ma non totalmente. Si confrontano due vettori componente per componente:

x≤y  ⟺  xi≤yiper ogni i=1,…,nx\le y\iff x_i\le y_i\quad\text{per ogni }i=1,\dots,n

La relazione è riflessiva, antisimmetrica e transitiva, ma non totale. In R5\mathbb R^5:

(2−1341)≤(20442)(2−1341) ? (−10442)\begin{gathered} \begin{pmatrix}2\\-1\\3\\4\\1\end{pmatrix}\le \begin{pmatrix}2\\0\\4\\4\\2\end{pmatrix}\\[0.8em] \begin{pmatrix}2\\-1\\3\\4\\1\end{pmatrix}\ ?\ \begin{pmatrix}-1\\0\\4\\4\\2\end{pmatrix} \end{gathered}

Nel primo confronto ogni componente di sinistra è minore o uguale a quella di destra. Nel secondo la prima componente è maggiore (2>−12>-1) e la seconda minore (−1<0-1<0): nessuno dei due vettori è minore o uguale all'altro.

Quali vettori si confrontano con

−3−2,5−2−1,5−1−0,500,511,522,53−3−2,5−2−1,5−1−0,500,511,522,53
  • comparabili con
  • non comparabili con
Sono comparabili con i vettori nei due quadranti con vertice in ; negli altri due una componente cresce e l'altra diminuisce. Trascina .

Per questo i concetti di estremo superiore, estremo inferiore, massimo e minimo, che poggiano sull'ordine totale, non si trasferiscono direttamente agli insiemi di vettori. Vanno distinti dalla minimizzazione o massimizzazione di funzioni che restituiscono un numero reale.

Funzioni a valori scalari e vettoriali

Una funzione associa a ogni elemento dello spazio di partenza un elemento dello spazio di arrivo:

f:Rn→R,g:Rn→Rm(m>1)f:\mathbb R^n\to\mathbb R,\qquad g:\mathbb R^n\to\mathbb R^m\quad(m>1)

I valori di ff sono reali, quindi hanno un ordine e ha senso cercarne minimi e massimi. gg restituisce un vettore: al posto di un singolo minimo o massimo si parla di ottimo di Pareto.

Un problema di investimento con dieci titoli, in cui si vuole minimizzare il rischio e massimizzare il rendimento, è una funzione da R10\mathbb R^{10} a R2\mathbb R^2. Anche una funzione di una sola variabile può avere valori vettoriali, per esempio quella che a xx associa la coppia (x2,x)(x^2,x).

Operazioni in ℝⁿ

Somma e prodotto per uno scalare α∈R\alpha\in\mathbb R si fanno componente per componente e restituiscono un vettore dello stesso spazio. La somma di vettori di dimensioni diverse non è definita.

x+y=(x1+y1,…,xn+yn)αx=(αx1,…,αxn)\begin{gathered} x+y=(x_1+y_1,\dots,x_n+y_n)\\ \alpha x=(\alpha x_1,\dots,\alpha x_n) \end{gathered}

Con le usuali proprietà algebriche, Rn\mathbb R^n è uno spazio vettoriale. Fra due vettori si definiscono anche tre prodotti, con risultati in spazi diversi:

x∘y=(x1y1,…,xnyn)in Rnx⊤y=∑i=1nxiyiin Rxy⊤in Rn×n\begin{aligned} x\circ y&=(x_1y_1,\dots,x_ny_n)&&\text{in }\mathbb R^n\\ x^\top y&=\textstyle\sum_{i=1}^n x_iy_i&&\text{in }\mathbb R\\ xy^\top&&&\text{in }\mathbb R^{n\times n} \end{aligned}

Il primo è componente per componente, il secondo è il prodotto scalare, il terzo il prodotto esterno, una matrice. Interessa soprattutto il prodotto scalare.

Prodotto scalare

Il prodotto di un vettore per sé stesso è una somma di quadrati, quindi non è negativo, e vale zero solo per il vettore nullo. È lineare e simmetrico:

x⊤x=∑i=1nxi2≥0,x⊤x=0  ⟺  x=0x^\top x=\sum_{i=1}^n x_i^2\ge0,\qquad x^\top x=0\iff x=0

Si astrae così: un prodotto scalare è una funzione che a due vettori di Rn\mathbb R^n associa un reale, indicato ⟨x,y⟩\langle x,y\rangle, con queste proprietà, per α∈R\alpha\in\mathbb R:

⟨x,x⟩≥0,⟨x,x⟩=0  ⟺  x=0⟨αx,y⟩=α⟨x,y⟩⟨x+y,z⟩=⟨x,z⟩+⟨y,z⟩⟨x,y⟩=⟨y,x⟩\begin{aligned} \langle x,x\rangle&\ge0,\quad \langle x,x\rangle=0\iff x=0\\ \langle\alpha x,y\rangle&=\alpha\langle x,y\rangle\\ \langle x+y,z\rangle&=\langle x,z\rangle+\langle y,z\rangle\\ \langle x,y\rangle&=\langle y,x\rangle \end{aligned}

Si parte dunque dal prodotto concreto x⊤yx^\top y e si generalizza a partire dalle sue proprietà.

Norme

Il valore assoluto di un reale è la sua distanza dall'origine: non è negativo, si annulla solo in zero, vale ∣αx∣=∣α∣ ∣x∣|\alpha x|=|\alpha|\,|x| e soddisfa la disuguaglianza triangolare. Nel piano la distanza di (x,y)(x,y) dall'origine è x2+y2\sqrt{x^2+y^2}. In Rn\mathbb R^n la stessa idea dà la norma euclidea:

∥x∥2=∑i=1nxi2\|x\|_2=\sqrt{\sum_{i=1}^n x_i^2}

Una norma è una funzione da Rn\mathbb R^n a R≥0\mathbb R_{\ge0} con queste quattro proprietà, per α∈R\alpha\in\mathbb R:

∥x∥≥0∥x∥=0  ⟺  x=0∥αx∥=∣α∣ ∥x∥∥x+y∥≤∥x∥+∥y∥\begin{aligned} &\|x\|\ge0\\ &\|x\|=0\iff x=0\\ &\|\alpha x\|=|\alpha|\,\|x\|\\ &\|x+y\|\le\|x\|+\|y\| \end{aligned}

Qualunque funzione con queste proprietà è una norma. Oltre alla euclidea, che si indica anche L2L^2, si usano molto nella pratica la norma L1L^1 e la norma L∞L^\infty:

∥x∥1=∑i=1n∣xi∣,∥x∥∞=max⁡1≤i≤n∣xi∣\|x\|_1=\sum_{i=1}^n|x_i|,\qquad \|x\|_\infty=\max_{1\le i\le n}|x_i|

Il concetto di norma è generale; quasi sempre si userà la euclidea, ma quanto si dice vale per qualsiasi norma.

Stessa norma di in

−2−1,5−1−0,500,511,52−2−1,5−1−0,500,511,52
  • norma
  • norma
  • norma
Ogni curva raccoglie i punti con la stessa norma di : rombo per , cerchio per , quadrato per .

La funzione «norma zero»

La funzione ∥x∥0\|x\|_0 conta le componenti diverse da zero:

∥x∥0=#{i: xi≠0}\|x\|_0=\#\{i:\ x_i\neq0\}

Un vettore di R7\mathbb R^7 con quattro componenti non nulle ha ∥x∥0=4\|x\|_0=4. Non è una norma, perché viola la terza proprietà: per α≠0\alpha\neq0, ∥αx∥0=∥x∥0\|\alpha x\|_0=\|x\|_0, non ∣α∣ ∥x∥0|\alpha|\,\|x\|_0. Si usa comunque per descrivere la sparsità: se si vuole una soluzione con pochi elementi non nulli, si cerca di rendere ∥x∥0\|x\|_0 il più piccolo possibile.

Norma, prodotto scalare e angolo

Per la norma euclidea il prodotto scalare di un vettore per sé stesso è il quadrato della norma:

x⊤x=∥x∥22x^\top x=\|x\|_2^2

La disuguaglianza di Cauchy–Schwarz limita il prodotto scalare con le norme, e l'uguaglianza vale solo se i due vettori sono paralleli:

∣x⊤y∣≤∥x∥2 ∥y∥2|x^\top y|\le\|x\|_2\,\|y\|_2

Dividendo per il prodotto delle norme, il rapporto sta fra −1-1 e 11. Questo permette di definire l'angolo fra due vettori non nulli come l'unico θ∈[0,π]\theta\in[0,\pi] tale che

cos⁡θ=x⊤y∥x∥2 ∥y∥2\cos\theta=\frac{x^\top y}{\|x\|_2\,\|y\|_2}

Due vettori sono ortogonali quando cos⁡θ=0\cos\theta=0, cioè quando x⊤y=0x^\top y=0.

Il prodotto scalare di con un vettore che ruota

−2,5−2−1,5−1−0,500,511,522,5−2,5−2−1,5−1−0,500,511,522,5
  • ortogonali a
0123456−2−1012ortogonali
Il prodotto scalare resta fra e e si annulla quando è ortogonale a .

Dal problema al modello: la parabola migliore

Si hanno quattro punti (x1,y1),…,(x4,y4)(x_1,y_1),\dots,(x_4,y_4) del piano e nessuna parabola passa per tutti. Si cerca la «migliore» parabola rispetto a essi: il problema, posto a parole, va tradotto in un modello di programmazione matematica.

  • Variabili di decisione. La parabola è y=ax2+bx+cy=ax^2+bx+c, quindi sono i tre coefficienti a,b,ca,b,c.
  • Funzione obiettivo. Si misura l'errore ei(a,b,c)e_i(a,b,c) che la parabola commette sul punto ii: con quattro punti ci sono quattro errori. Si sceglie la parabola che rende minima la loro somma:
min⁡a,b,c f(a,b,c)=∑i=14ei(a,b,c)\min_{a,b,c}\ f(a,b,c)=\sum_{i=1}^4 e_i(a,b,c)

L'addestramento di una rete neurale ha la stessa impostazione. La parabola è sostituita da una funzione molto più complessa, che dipende da un numero enorme di parametri, e la funzione da minimizzare è costruita su una grande quantità di dati osservati.

Formulario

Retta estesa

R∗=R∪{±∞}\mathbb R^*=\mathbb R\cup\{\pm\infty\}

Intorni di ±∞\pm\infty

I(−∞)={x<M}I(+∞)={x>M}\begin{aligned} I(-\infty)&=\{x<M\}\\ I(+\infty)&=\{x>M\} \end{aligned}

Prodotto cartesiano

A1×⋯×An={(a1,…,an):ai∈Ai}\begin{aligned} A_1\times\dots\times A_n=\{&(a_1,\dots,a_n):\\ &a_i\in A_i\} \end{aligned}

Ordine in Rn\mathbb R^n

x≤y  ⟺  xi≤yi ∀ix\le y\iff x_i\le y_i\ \forall i

Non è totale per n>1n>1.

Funzioni

f:Rn→Rg:Rn→Rm, m>1\begin{aligned} f&:\mathbb R^n\to\mathbb R\\ g&:\mathbb R^n\to\mathbb R^m,\ m>1 \end{aligned}

Prodotto scalare

x⊤y=∑i=1nxiyix^\top y=\sum_{i=1}^n x_iy_i x⊤x=∥x∥22x^\top x=\|x\|_2^2

Proprietà della norma

∥x∥≥0∥x∥=0  ⟺  x=0∥αx∥=∣α∣ ∥x∥∥x+y∥≤∥x∥+∥y∥\begin{aligned} &\|x\|\ge0\\ &\|x\|=0\iff x=0\\ &\|\alpha x\|=|\alpha|\,\|x\|\\ &\|x+y\|\le\|x\|+\|y\| \end{aligned}

Norme

∥x∥2=∑xi2∥x∥1=∑∣xi∣∥x∥∞=max⁡∣xi∣∥x∥0=#{i:xi≠0}\begin{aligned} \|x\|_2&=\sqrt{\textstyle\sum x_i^2}\\ \|x\|_1&=\textstyle\sum|x_i|\\ \|x\|_\infty&=\max|x_i|\\ \|x\|_0&=\#\{i:x_i\neq0\} \end{aligned}

∥x∥0\|x\|_0 non è una norma.

Cauchy–Schwarz

∣x⊤y∣≤∥x∥2 ∥y∥2|x^\top y|\le\|x\|_2\,\|y\|_2

Angolo e ortogonalità

cos⁡θ=x⊤y∥x∥2∥y∥2\cos\theta=\frac{x^\top y}{\|x\|_2\|y\|_2} x⊥y  ⟺  x⊤y=0x\perp y\iff x^\top y=0

Parabola migliore

min⁡a,b,c ∑i=14ei(a,b,c)\min_{a,b,c}\ \sum_{i=1}^4 e_i(a,b,c)