
Corso di Statistica per Data Science
Padroneggi le basi statistiche che alimentano la moderna data science, dalla teoria della probabilità e i test di ipotesi alla regressione, all'ANOVA e all'inferenza bayesiana. Questo corso Le fornisce il bagaglio di strumenti rigoroso e pratico che i datori di lavoro si aspettano dai professionisti seri dei dati. Ogni concetto è radicato in flussi di lavoro analitici reali, in modo che possa applicare immediatamente ciò che impara.
Cosa imparerai:
Acquisirà una comprensione completa della statistica così come viene effettivamente praticata nella data science. Il corso tratta la statistica descrittiva, le distribuzioni di probabilità, gli intervalli di confidenza e i test di ipotesi, per poi passare alla regressione lineare e logistica, all'analisi dei dati categorici e al disegno sperimentale. Esplorerà inoltre i metodi bayesiani, i test non parametrici, la previsione di serie temporali, l'inferenza causale e la riduzione della dimensionalità. Ogni argomento è collegato direttamente alle decisioni e ai modelli che incontrerà nel lavoro professionale con i dati. Alla fine, sarà in grado di selezionare il metodo statistico appropriato, convalidare le proprie assunzioni e comunicare i risultati con precisione e sicurezza.
Come studi in modo pratico Corso di Statistica per Data Science
Come metti in pratica Corso di Statistica per Data Science
Per te che sei un'azienda e vuoi formare il tuo team
Su Dedika per aziende, il corso include esercizi ed esempi personalizzati sul tuo business e secondo le esigenze della tua azienda.
Contenuto del corso
8 Capitoli • 39 LezioniDurata tra 4 e 360 ore (decidi tu)
Capitolo 1NascondiNascondi dettagliVedi dettagliFondamenti del Pensiero Statistico
Fondamenti del Pensiero Statistico
Lezione 1 • Elementi Essenziali di Statistica Descrittiva
Riassume i dataset utilizzando misure di centro, dispersione e forma. Questi riassunti costituiscono la base per tutto il lavoro inferenziale e predittivo nei capitoli successivi.
Lezione 2 • Visualizzazione delle Distribuzioni
Traduce i dati grezzi in istogrammi, box plot e curve di densità per rivelare forma e valori anomali. Le competenze di visualizzazione costituiscono la base di ogni analisi esplorativa nel corso.
Lezione 3 • Tipi e Strutture dei Dati
Distingue scale nominali, ordinali, a intervalli e di rapporto e le loro implicazioni analitiche. Una corretta classificazione dei dati evita l'applicazione errata dei metodi statistici nelle fasi successive.
Lezione 4 • Popolazioni, Campioni e Distorsione
Definisce popolazioni, schemi di campionamento e fonti comuni di distorsione che alterano l'inferenza. La comprensione della distorsione è un prerequisito per la validità dei test di ipotesi introdotti successivamente.
Capitolo 2NascondiNascondi dettagliVedi dettagliTeoria della Probabilità per Data Scientist
Teoria della Probabilità per Data Scientist
Lezione 1 • Probabilità Condizionata e Indipendenza
Calcola probabilità condizionate e verifica l'indipendenza statistica tra eventi. Le assunzioni di indipendenza guidano molte scelte di modello nella regressione e nella classificazione.
Lezione 2 • Variabili Aleatorie e Valore Atteso
Formalizza le variabili aleatorie, calcola i valori attesi e deriva la varianza algebricamente. La padronanza di questi concetti consente un trattamento rigoroso degli stimatori nel prossimo capitolo.
Lezione 3 • Distribuzioni Discrete di Probabilità
Modella risultati basati su conteggi utilizzando le distribuzioni binomiale, di Poisson e geometrica. Riconoscere il modello discreto corretto previene errori sistematici di previsione.
Lezione 4 • Regole Fondamentali della Probabilità
Definisce spazi campionari, eventi e gli assiomi che governano l'assegnazione delle probabilità. Queste regole sono il fondamento logico per tutti i modelli distribuzionali trattati in seguito.
Lezione 5 • Distribuzioni Continue di Probabilità
Applica le distribuzioni normale, esponenziale e uniforme a misurazioni continue. Queste distribuzioni compaiono in tutto il corso: regressione, test di ipotesi e simulazione.
Capitolo 3NascondiNascondi dettagliVedi dettagliStima Statistica e Campionamento
Stima Statistica e Campionamento
Lezione 1 • Intervalli di Confidenza per le Medie
Costruisce intervalli di confidenza basati su Z e su t per le medie della popolazione. L'interpretazione corretta dell'intervallo previene l'equivoco comune di fare affermazioni probabilistiche su parametri fissi.
Lezione 2 • Metodi Bootstrap e di Ricampionamento
Genera distribuzioni campionarie empiriche tramite ricampionamento bootstrap senza assunzioni distribuzionali. I metodi bootstrap estendono la stima intervallare a statistiche complesse prive di soluzioni in forma chiusa.
Lezione 3 • Il Teorema Centrale del Limite in Pratica
Dimostra come le medie campionarie convergano alla normalità indipendentemente dalla forma della popolazione. Questo teorema giustifica i metodi di inferenza basati sulla normale utilizzati in tutto il corso.
Lezione 4 • Metodi di Stima Puntuale
Deriva stimatori utilizzando il metodo dei momenti e la stima di massima verosimiglianza. La comprensione della derivazione degli stimatori prepara gli studenti a valutare gli output dei parametri del modello.
Lezione 5 • Intervalli di Confidenza per Proporzioni
Costruisce intervalli per proporzioni di popolazione usando l'approssimazione normale e metodi esatti. Gli intervalli per proporzioni sono essenziali per i test A/B e l'analisi dei sondaggi trattati in seguito.
Capitolo 4NascondiNascondi dettagliVedi dettagliFondamenti di Verifica delle Ipotesi
Fondamenti di Verifica delle Ipotesi
Lezione 1 • Logica della Verifica delle Ipotesi
Definisce ipotesi nulla e alternativa, livelli di significatività e lo schema decisionale. Questa logica è alla base di ogni test formale introdotto in questo e nei prossimi capitoli.
Lezione 2 • Test per Proporzioni e Varianze
Conduce test z per proporzioni e test chi-quadrato e F per confronti di varianza. Questi test estendono la verifica delle ipotesi a risultati categorici e a verifiche di uguaglianza della varianza.
Lezione 3 • Test Multipli e Correzioni
Controlla il tasso di errore familiare e il tasso di false scoperte quando si conducono molti test simultanei. Le correzioni per test multipli sono obbligatorie in genomica, test A/B e selezione delle feature.
Lezione 4 • Errori, Potenza e Dimensione Campionaria
Quantifica l'errore di I tipo, l'errore di II tipo e la potenza statistica per progettare studi adeguatamente potenti. L'analisi della potenza determina i requisiti di dimensione campionaria prima della raccolta dei dati.
Lezione 5 • Test t a un Campione e a Due Campioni
Applica i test t per confrontare la media di un campione con un valore target o le medie di due gruppi tra loro. Questi test sono gli strumenti inferenziali più comuni nei progetti applicati di data science.
Capitolo 5NascondiNascondi dettagliVedi dettagliCorrelazione, Regressione e Predizione
Correlazione, Regressione e Predizione
Lezione 1 • Diagnostica e Assunzioni della Regressione
Verifica linearità, omoschedasticità, normalità dei residui e indipendenza attraverso grafici diagnostici. Le violazioni non rilevate invalidano l'inferenza e riducono l'accuratezza della previsione.
Lezione 2 • Regressione Lineare Semplice
Stima pendenza e intercetta con il metodo dei minimi quadrati ordinari e interpreta i coefficienti. La regressione semplice stabilisce il quadro geometrico e algebrico esteso ai predittori multipli.
Lezione 3 • Misurazione dell'Associazione tra Variabili
Calcola le correlazioni di Pearson e Spearman e testa la loro significatività. L'analisi di correlazione motiva la modellazione di regressione e rivela i rischi di multicollinearità.
Lezione 4 • Regolarizzazione e Selezione delle Variabili
Applica Ridge, Lasso e selezione stepwise per gestire l'overfitting e scegliere i predittori. La regolarizzazione fa da ponte tra la regressione classica e la costruzione di modelli di machine learning.
Lezione 5 • Regressione Lineare Multipla
Estende gli OLS a predittori multipli, interpreta i coefficienti di regressione parziale e valuta l'adattamento del modello. La regressione multipla è la spina dorsale della modellazione esplicativa in ambito aziendale e scientifico.
Capitolo 6NascondiNascondi dettagliVedi dettagliAnalisi dei Dati Categorici
Analisi dei Dati Categorici
Lezione 1 • Tabelle di Contingenza e Test Chi-Quadrato
Costruisce tabelle a doppia entrata e verifica l'indipendenza con la statistica chi-quadrato. L'analisi di contingenza è fondamentale per i dati di sondaggio, i test A/B e lo screening dell'associazione tra feature.
Lezione 2 • Regressione Multinomiale e Ordinale
Estende la regressione logistica a risultati con più di due categorie non ordinate o ordinate. Questi modelli gestiscono valutazioni di sondaggi, livelli di prodotto e compiti di classificazione multi-classe.
Lezione 3 • Valutazione del Modello per la Classificazione
Valuta le prestazioni della regressione logistica usando matrici di confusione, curve ROC e AUC. Metriche di valutazione appropriate prevengono affermazioni fuorvianti sull'accuratezza in set di dati sbilanciati.
Lezione 4 • Regressione Logistica Binaria
Modella risultati binari usando il legame logit, la massima verosimiglianza e l'interpretazione dei log-odds. La regressione logistica è il punto di partenza principale per la classificazione nei flussi di lavoro di data science.
Lezione 5 • Misure di Associazione per Dati Categorici
Quantifica la forza dell'associazione usando odds ratio, rischio relativo e coefficienti phi. Queste misure traducono la significatività statistica in stime dell'effetto praticamente significative.
Capitolo 7NascondiNascondi dettagliVedi dettagliAnalisi della Varianza e Disegno Sperimentale
Analisi della Varianza e Disegno Sperimentale
Lezione 1 • Confronti Multipli Post-Hoc
Identifica quali coppie di gruppi differiscono dopo un'ANOVA significativa utilizzando procedure di confronto controllate. I test post-hoc prevengono tassi di errore gonfiati derivanti da confronti a coppie non pianificati.
Lezione 2 • Principi del Disegno Sperimentale
Applica randomizzazione, replicazione e blocchi per eliminare i fattori confondenti e massimizzare la precisione. Un buon disegno è più potente di qualsiasi aggiustamento statistico post-hoc.
Lezione 3 • Misure Ripetute e Disegni Misti
Tiene conto della correlazione intra-soggetto in esperimenti longitudinali e crossover. I disegni a misure ripetute aumentano la potenza rimuovendo la varianza dovuta alle differenze individuali.
Lezione 4 • ANOVA a Due Vie e Fattoriale
Analizza gli effetti principali e le interazioni tra due o più fattori categorici simultaneamente. I disegni fattoriali rivelano effetti sinergici invisibili agli esperimenti a un fattore per volta.
Lezione 5 • ANOVA a Una Via
Scompone la varianza totale in componenti tra gruppi ed entro i gruppi per testare l'uguaglianza delle medie dei gruppi. L'ANOVA generalizza il test t a due campioni a un numero qualsiasi di gruppi indipendenti.
Capitolo 8NascondiNascondi dettagliVedi dettagliStatistica Bayesiana e Inferenza Avanzata
Statistica Bayesiana e Inferenza Avanzata
Lezione 1 • Metodi Monte Carlo a Catena di Markov
Campiona da posteriori intrattabili usando gli algoritmi di Metropolis-Hastings e Gibbs sampling. L'MCMC abilita l'inferenza bayesiana per modelli gerarchici complessi e non coniugati.
Lezione 2 • Confronto tra Modelli Bayesiani
Confronta i modelli usando i fattori di Bayes, WAIC e la cross-validazione leave-one-out. La selezione bayesiana dei modelli penalizza la complessità senza richiedere una soglia di significatività fissa.
Lezione 3 • Quadro dell'Inferenza Bayesiana
Formalizza la distribuzione a priori, la verosimiglianza e la distribuzione a posteriori e contrappone la logica bayesiana a quella frequentista. Questo quadro consente affermazioni probabilistiche sui parametri piuttosto che sui dati.
Lezione 4 • Stima Bayesiana e Intervalli di Credibilità
Riassume le distribuzioni a posteriori usando stime MAP, medie a posteriori e intervalli di credibilità. Gli intervalli di credibilità hanno l'interpretazione probabilistica diretta che manca agli intervalli di confidenza.
Lezione 5 • Modelli Gerarchici e Multilivello
Modella dati raggruppati con pooling parziale per prendere forza in prestito tra le unità. I modelli gerarchici superano sia le strategie di pooling completo che quelle senza pooling nei dati nidificati.
Il tuo certificato valido di completamento
Questo corso è per te:
Aspiranti data scientist: necessitano di una profondità statistica che vada oltre le basi dei bootcamp di programmazione.
Analisti aziendali: desiderano passare dai riepiloghi in Excel a metodi inferenziali rigorosi.
Ingegneri del software: in transizione verso ruoli di machine learning che richiedono ragionamento probabilistico.
Studenti di dottorato: necessitano di un riferimento pratico di statistica a integrazione dei corsi di ricerca.
Analisti di marketing: pronti a eseguire test A/B validi e a interpretare i risultati in autonomia.
Ricercatori accademici: cercano di rafforzare i metodi quantitativi prima di pubblicare i risultati.
Cosa dicono i nostri studenti
Le sue lezioni sono perfette. Ho acquistato il pacchetto annuale e finalmente ho l'opportunità di seguire diversi argomenti di mio interesse senza dover cambiare piattaforma... vi ringrazio per tutto quello che fate, vi ho già raccomandati ad altre persone...

Mi piace come le lezioni vanno dritte al punto e come riesco a cambiare capitoli e saltare contenuti di cui non ho bisogno.

Mi piace il contenuto e il modo di presentazione e trascrizione dei video, che accelera il processo!

La piattaforma è veloce, semplice da usare. La diversità dei contenuti e i video complementari aiutano molto nell'apprendimento.

Principali percorsi formativi
FAQ
Chi è Dedika?
Il certificato è valido in Italia?
I corsi sono gratuiti?
Qual è il carico di lavoro del corso?
Come sono strutturati i corsi?
Come funzionano i corsi?
Qual è la durata dei corsi?
Qual è il costo o il prezzo dei corsi?
Cos’è un corso EAD o online e come funziona?
Corso PDF




















