DataScienceSeed#6 – Stock Market Machine Learning & Caffè con Pandas

23 Maggio 2019, Digital Tree, Genova, ore 18

DataScienceSeed meetup 23 maggio 2019

Se hai partecipato a questo evento, lasciaci un feedback!

Ecco l’agenda del sesto incontro, a cavallo tra la frontiera della ricerca e la didattica sui nostri dataset.

Merello e Finanza

Mercati Finanziari: affrontare con il Machine Learning un un problema davvero complesso

Simone Merello, specialista in AI for Finance presso Nanyang Technological University of Singapore

Simone Merello a DatasScienceSeed
Simone Merello a DatasScienceSeed

Predire l’andamento del mercato finanziario è un problema complesso, al punto che non ne è ancora chiara la fattibilità stessa. Sono state tentate tutte le tecniche di Machine Learning ed ogni sorta di reti naurali, ma i problemi sono tanti ed a tanti livelli. Simone ci ha spiegato come ha affrontato questo problema, presentandoci le tecniche usate nelle ultime ricerche, in un percorso tra le difficoltà e le opportunità valido per molte classi di problemi.

Ecco le slides di Simone, sotto forma di Google Doc

Attenzione! Audio Challenge!

L’audio del talk è molto disturbato a causa di un problema tecnico al sistema della sala nel giorno della ripresa. Ce ne scusiamo… nonostante gli sforzi in post produzione dei ragazzi del service la qualità audio è molto inferiore al livello che vorremmo tenere. Ma possiamo trasformare questo problema in opportunità!! Siamo certi che con il Machine Learning / Deep Learning si può ulteriormente ripulire questo audio. Chi vuole tantare? I tentativi più o meno riusciti saranno presentati in un meetup!

 


 

Morchio Marcello Andrea Boero DataScienceSeed 23 maggio 2018

Caffè con Pandas: cosa abbiamo imparato dal Coffe Machines Dataset

Marcello Morchio, Andrea Boero – DataScienceSeeed team

Marcello Morchio DataScienceSeed
Marcello Morchio alle prese con il LightGBM

A Febbraio i ragazzi di Flairbit ci hanno offerto un problema di manutenzione predittiva su una flotta di macchine del caffè professionali.  Ci abbiamo lavorato e siamo pronti a mostrarne i risultati alla community. Marcello ha parlato di Pandas, la libreria Python che non può mancare nella cassetta degli attrezzi del data scientist, per passare da un dataset selvaggio ad un docile datasetche daremo in pasto ad un modello di machine learning di tipo “classico” ma per niente banale, il LightGBM, Andrea  ha poi mostrato come costruire ed addestrare una rete neurale feed forward per lo stesso dataset, ottimizzandone gli iperparametri fino ad identificare la configurazione ottimale.

Riusciremo a prevenire i guasti ed a meritarci un buon caffè?

 

Flairbit Challange - pdf slides
Flairbit Challange – pdf slides

 

Github Repository del codice (Pandas, LightGBM e SHAP)
La descrizione è nel README del repo.

Google Drive link dello Zip file (55M) dell’approccio Neural Networks

Relazione (PDF 1MB)  Neural Networks

Andrea Boero eSimone Merello
Andrea Boero eSimone Merello discutono di architetture neurali mentre gli altri si mangiano la focaccia

 

 

 


Deep Learning Group

Abbiamo presentato nel meetup il Learning Group su Deep Learning che partirà con la prima sessione l’11 Giugno, alle 18.30 presso Digital Tree.

Seguiremo il corso Practical Deep Learning for coders, di Fast.ai, e ci incontreremo ogni due settimane per discutere delle lezioni seguite online, del codice presentato, delle difficoltà incontrate e magariper provare a cimentarci con qualche progetto reale.

Il progetto del learning group segue il percorso tracciato dai gruppi di studio TVML di IAML

Per accedere al gruppo, usa il form di feedback dell’evento.


Il meetup DataScienceSeed fa parte delle iniziatove dell’associazione  IAML, Italian Association for Machine Learning

Questo incontro è possibile anche grazie al supporto di

Wonder Talent Investor

Gruppo IB

Dataset Challenge Hands-On #1 – Flairbit coffee machines, Rulex churn service

DataScienceSeed Hands-ON #1

Il Dataset Hands-On è dedicato alla presentazione di problemi concreti di aziende o di ricerca, da affrontare con tecniche di data science a scopo didattico. Non c’è niente come un problema vero per imparare!

L’obiettivo è presentare dataset e relative sfide da parte di aziende o istituzioni, a sviluppatori, data scientists, machine learning engineers, esperti o in corso di formazione. Lo scopo degli incontri e delle sfide è didattico, ma non si esclude che ne possa uscire qualcosa di buono, sia per l’azienda che propone il challenge sia per chi lo affronta. Non si può perdere: o si ha successo o si impara…e le due cose non si escludono!

Ecco quello di cui abbiamo parlato nel primo incontro dedicato ai Dataset:

Internet of Professional Coffee Machines

FlairBit, software house che fornisce prodotti software proprietari e servizi di consulenza per aiutare le aziende nel processo di trasformazione digitale e innovazione, ha presentato un dataset contenente dati di funzionamento, manutenzione e guasti relativi a macchine per l’erogazione di bevande. Luca Bixio e Matteo Rulli hanno raccontato il contesto in cui il dataset è stato raccolto, spiegato il contenuto del dataset nei dettagli e lanciato alcune sfide ai partecipanti che vorranno cimentarsi con l’analisi dei dati. Sarà possibile prevedere il funzionamento delle macchine nel prossimo futuro sulla base dei dati a disposizione? Sarà possibile determinare le cause di un fermo macchina o di un guasto? Sarà possibile prevedere un fermo macchina? La sfida è lanciata!

Click per scaricare il pdf che descrive il dataset

Rulex Dataset Challenge
Presentazione dei risultati di Giorgio Garziano

Rulex propne uno speciale tipo di piattaforma AI, che si distingue per creare modelli comprensibili e facilmente implementabili, per consentire agli esperti di business e di processo di creare e distribuire rapidamente applicazioni AI senza bisogno di competenze matematiche o di programmazione.

Andrea Caridi, Business Development Manager di Rulex, aveva presentato nel primo incontro DataScienceSeed un dataset relativo al churn di un servizio di musica online, ovvero all’analisi ed alla predizione dell’abbandono della piattaforma da parte degli utenti, per poter consentire di prendere azioni mirate per prevenirlo.

Click per aprire la pagina che descrive il dataset. Per avere una copia del dataset usate il modulo in fondo al post.

Durante il nostro incontro, Giorgio Garziano,  senior software developer ed autore in datascienceplus.com, ha descritto la sua analisi eseguita in linguaggio R, con un notebook molto sostanzioso:

Click per scaricare il file .zip con il notebook R mostrato da Giorgio.

 

Il dataset fornito da Rulex deriva dal dataset della Kaggle Competition WSDM – KKBox’s Churn Prediction Challenge.

Per  sperimentare l’analisi usando il tool Rulex Analytics, usate il modulo qui sotto,