Forum |  HardWare.fr | News | Articles | PC | S'identifier | S'inscrire | Shop Recherche
3086 connectés 

 


Utilisez-vous du machine learning dans votre job ?




Attention si vous cliquez sur "voir les résultats" vous ne pourrez plus voter

 Mot :   Pseudo :  
  Aller à la page :
 
 Page :   1  2  3  4  5  ..  72  73  74  ..  133  134  135  136  137  138
Auteur Sujet :

[Topic Unique] Machine Learning & Data Science

n°32865
joe bonann​o
Bananas
Posté le 20-11-2019 à 20:10:24  profilanswer
 

Reprise du message précédent :
Quelqu’un du forum a l’ODSC cette semaine, conférence à Londres?

n°32866
Rasthor
Posté le 20-11-2019 à 20:26:51  profilanswer
 

alkin31 a écrit :

Merci pour vos réponses, je vais aviser en fonction :)
J'ai aussi entendu parler d'un master en Data science à l'EPFL. Elle est apparemment plutôt reconnu comme école d'ingénieur. Savez-vous si l'admission se tente en master après une L3 de maths (sachant que les candidatures ferment le 15 décembre pour le master et que je n'aurai aucun -ou très peu- résultat de la licence d'ici là).


78eme meilleure uni au monde, selon le classement Shangai. Devant l'ENS-Paris. :D
http://www.shanghairanking.com/ARWU2019.html

n°32867
Jadha
Next one's coming faster
Posté le 20-11-2019 à 20:54:41  profilanswer
 

jyllano a écrit :


 
Peut-être en IDF, et encore, c'est pas ce que les recruteurs parisiens m'ont dit. En province, il y a vraiment très peu d'offres, les seules qui restent demandent au moins 2 ans d'XP.  
En tant que jeune diplômé c'est chaud de trouver un poste pour débutant. Et pourtant je sors d'une école A, cursus stats, stage data scientist, mais c'est impossible de trouver un poste convenable (sur Lyon).


 
Un peu HS mais t'a essayé les boites de conseil spécialisées genre TeamWork, Datalyo, Datagenius ?

n°32868
Fido_
Posté le 20-11-2019 à 21:34:29  profilanswer
 

alkin31 a écrit :

Merci pour vos réponses, je vais aviser en fonction :)
J'ai aussi entendu parler d'un master en Data science à l'EPFL. Elle est apparemment plutôt reconnu comme école d'ingénieur. Savez-vous si l'admission se tente en master après une L3 de maths (sachant que les candidatures ferment le 15 décembre pour le master et que je n'aurai aucun -ou très peu- résultat de la licence d'ici là).


 
Le MVA accepte des gens en sortie d'école aussi en poussant ta licence et ta volonté de te spécialiser t'as tes chances.

n°32869
rokhlan
Posté le 20-11-2019 à 22:17:30  profilanswer
 

Fido_ a écrit :

Le MVA accepte des gens en sortie d'école aussi en poussant ta licence et ta volonté de te spécialiser t'as tes chances.


Pour quelles raisons le MVA prendrait un EDHEC à la place d'un groupe A ? [:transparency]

n°32870
jyllano
Posté le 20-11-2019 à 22:18:55  profilanswer
 

Jadha a écrit :

Un peu HS mais t'a essayé les boites de conseil spécialisées genre TeamWork, Datalyo, Datagenius ?


 
J'avais postulé chez DataGenius mais aucun retour... Par contre je ne connaissais pas les autres, merci ! :)

n°32871
blixow
Posté le 21-11-2019 à 00:10:33  profilanswer
 

Fido_ a écrit :


 
Le MVA accepte des gens en sortie d'école aussi en poussant ta licence et ta volonté de te spécialiser t'as tes chances.


 
 
Euh

n°32872
Fido_
Posté le 21-11-2019 à 02:26:54  profilanswer
 


rokhlan a écrit :


Pour quelles raisons le MVA prendrait un EDHEC à la place d'un groupe A ? [:transparency]


 
Ils ne regardent pas que l'école pour les cas particulier la motivation de l'élève et le projet compte et il a déjà un stage dans ça.  
Le fait que ce soit après le diplôme aussi, dans ce cas ils prennent des groupes B/C plus facilement par exemple.
Cette année y'a plus de 200 élèves dont quelques parcours atypiques, y'a aussi le parcours startup pour quelques uns.
La chances sont maigres mais si tu demande pas tu seras pas pris c'est sur  :)


Message édité par Fido_ le 21-11-2019 à 02:41:56
n°32873
Kayou
Posté le 21-11-2019 à 09:15:24  profilanswer
 

giorno_gio75 a écrit :


 
Oui bien sur je parle en IDF où ça représente je pense 80% de l'offre DS en France sans exagérer.
 
@Kayou: Un vrai data scientist ? Car y'a des faux data scientist ? On va partir en sketch des Inconnus là :D
 
Un data ingénieur c'est bien beau mais y'a deux traitements des données à prendre en compte: le traitement de la donnée "universel" où le daté ingénieur va avoir pour mission de maintenir un datamart à flot et il y a la phase de traitement spécifique à un projet qui reste toujours importante. Après si tu es une plus petite boite, tu peux te permettre sur un seul projet d'avoir tout le maillon de la chaîne mais globalement ça reste rare.
 
Là où je bosse, on a un datamart spécifique à notre direction et pourtant y'a toujours des recoupages, des traitements à faire etc., le data ingénieur c'est pas Dieu :D
 
Et donc c'est comme je disais, si le data scientist ça le fait chier que 80% de son taf soit du traitement/qualité de données, bah qu'il se spécialise car le travail d'un data scientist business (pas r&d), la modélisation ça sera 20-30% du taf, c'est une réalité. Pour faire des choses axés modélisations, il faut aller sur des postes très très précis d'ingénieur machine learning qui commencent à fleurir.
 
Je trouve ça pas du tout ambitieux de vouloir être DS avec une licence de maths, n'importe quelle boite de conseil acceptera ton profil sans broncher si tu es un bon candidat sur d'autres aspects (communication notamment).
 
@Rick_C137: Tu serais étonné du nombre de gens qui veulent faire que ça, des modèles des modèles des modèles, perso je comprends pas trop mais chacun a ses goûts.


 
Bah disons que t'en a qui se disent DS alors qu'en fait leur boulot c'est +/- faire du SQL sans vraiment lancer de modèle ou alors 1 fois par mois
Un DS qui va passer 80% de son temps à travailler les données alors que ça pourrait être fait par un Data Analyst, je ne vois pas l'intérêt en fait de payer si cher des compétences si pointues et difficiles à trouver pour faire ce genre de boulot.
 
Pour moi un "vrai" DS a un niveau élevé niveau maths et je doute que ça soit à la sortie d'une licence qu'on puisse y prétendre en fait.
Après je me trompe peut être mais dans ma boîte, aucun DS n'a un niveau inférieur à Bac+5 et si une boîte de service me "vend" une ressource DS avec un niveau Bac+3 en maths, je vais tousser et même pas le prendre en entretien.
 
Quand je vois des jeunes diplômés (2 ans d'exp), qui veulent quitter la mission chez nous car ils veulent "faire du Big Data", je rigole car quand on voit le niveau en SQL/bon sens, c'est à pleurer.
Alors de la à vouloir faire du Big Data... Et puis bon je pense qu'en bossant sur des tables à plus de 100M de lignes on fait déjà du Big Data chez nous :o

n°32874
rokhlan
Posté le 21-11-2019 à 10:50:34  profilanswer
 

Fido_ a écrit :

 

Ils ne regardent pas que l'école pour les cas particulier la motivation de l'élève et le projet compte et il a déjà un stage dans ça.
Le fait que ce soit après le diplôme aussi, dans ce cas ils prennent des groupes B/C plus facilement par exemple.
Cette année y'a plus de 200 élèves dont quelques parcours atypiques, y'a aussi le parcours startup pour quelques uns.
La chances sont maigres mais si tu demande pas tu seras pas pris c'est sur :)


C'est bon à savoir :jap:

n°32875
giorno_gio​75
Posté le 21-11-2019 à 18:58:47  profilanswer
 

Kayou a écrit :

 

Bah disons que t'en a qui se disent DS alors qu'en fait leur boulot c'est +/- faire du SQL sans vraiment lancer de modèle ou alors 1 fois par mois
Un DS qui va passer 80% de son temps à travailler les données alors que ça pourrait être fait par un Data Analyst, je ne vois pas l'intérêt en fait de payer si cher des compétences si pointues et difficiles à trouver pour faire ce genre de boulot.

 

Pour moi un "vrai" DS a un niveau élevé niveau maths et je doute que ça soit à la sortie d'une licence qu'on puisse y prétendre en fait.
Après je me trompe peut être mais dans ma boîte, aucun DS n'a un niveau inférieur à Bac+5 et si une boîte de service me "vend" une ressource DS avec un niveau Bac+3 en maths, je vais tousser et même pas le prendre en entretien.

 

Quand je vois des jeunes diplômés (2 ans d'exp), qui veulent quitter la mission chez nous car ils veulent "faire du Big Data", je rigole car quand on voit le niveau en SQL/bon sens, c'est à pleurer.
Alors de la à vouloir faire du Big Data... Et puis bon je pense qu'en bossant sur des tables à plus de 100M de lignes on fait déjà du Big Data chez nous :o

 

Pour moi le travail data je le divise en deux champs : reporting et analytics.

 

Le reporting c'est l'extraction des données pour mise en forme derrière excel/ppt qu'un data analyst va faire au quotidien, fournir des chiffres à des entités qui savent pas utiliser SQL. Il va surtout s'assurer que les chiffres sont bons et les consolider.

 

L'analytics ça relève du data scientist. Il va au-delà du reporting, il développe des insights pour l'entreprise avec l'analyse des données et pour cela il a tout une panoplie d'outils allant des statistiques à la modélisation ... suivant ce qu'il trouve, la question métier, la qualité des data etc... il va décider le niveau de complexité que son insight a.

 

Faut juste arrêter de penser que data scientist = modéliastion, que si tu fais pas de modélisation tu n'es pas un data scientist, c'est complètement débile. Un data scientist DOIT savoir faire de la modélisation statistique mais s'il arrive à te filer de la plus-value avec tes data en restant simple dans ses insights, à quoi bon ? Pour moi ça restera toujours un meilleur data scientist qu'un mec qui s'amuse à faire des modèles comme un bourrin à la première opportunité.


Message édité par giorno_gio75 le 21-11-2019 à 18:59:37
n°32876
Rontgen
Posté le 21-11-2019 à 19:34:05  profilanswer
 

Et encore, ça c'est juste lorsque l'on parle de "business intelligence", mais il y a un autre type de job, lorsque qu'il fait partie vraiment du coeur de métier (par exemple un certain algo qui apporte de la valeur ajoutée au produit)
Dans ces cas, ca a du sens de tester plein de modèles et d'être solide du point de vue statistiques

n°32877
giorno_gio​75
Posté le 21-11-2019 à 19:42:27  profilanswer
 

Rontgen a écrit :

Et encore, ça c'est juste lorsque l'on parle de "business intelligence", mais il y a un autre type de job, lorsque qu'il fait partie vraiment du coeur de métier (par exemple un certain algo qui apporte de la valeur ajoutée au produit)
Dans ces cas, ca a du sens de tester plein de modèles et d'être solide du point de vue statistiques


 
Bien sûr mais je ne remets pas en cause que le data scientist doit avoir des compétences de modélisation mais pour moi ça reste un outil et non une nécessité à son boulot. Pour moi ça n'a aucun sens de dire "si tu fais pas un modèle statistiques par mois t'es pas data scientist".
 
Pour le niveau requis, je suis de moins en moins convaincu que déjà un niveau élevé en mathématiques est obligatoire et encore moins statistiques. D'un point de vue vitrine pour le recruteur, évidemment mais dans la vie de tous les jours, ça ressemble de plus en plus à de l'algorithmie au final et ton réseaux de neurones pour le faire, faut juste rentrer trois lignes de commandes quoi ...
 
Pour moi en data science, les mecs qui m'ont le plus impressionné, s'pas des mecs qui sont hyper stateux car apprendre comment marche un modèle statistique il suffit de lire un bouquin pendant 1 semaine et t'as compris si t'as un niveau de base mais par contre savoir apprendre des données et en dégager des insights avec de simples outils, c'est ouf.
 
Lors de mon stage, un DS qui me supervisait me demander de lire un histogramme d'une distribution de consommations et je lui ais fait une analyse une dimension plutôt basique .. quand il m'a sorti son analyse avec son expérience de la donnée en se prenant trois fois moins la tête que moi, j'ai compris que y'avait une ligue d'écart entre nous et pas d'un point de vue statistique mais data.
 
On appelle ça data science d'ailleurs, pas statistic mathematics modelisation data science. :o


Message édité par giorno_gio75 le 21-11-2019 à 19:43:11
n°32878
Filob
Posté le 24-11-2019 à 08:36:48  profilanswer
 

Kayou a écrit :

 

Bah disons que t'en a qui se disent DS alors qu'en fait leur boulot c'est +/- faire du SQL sans vraiment lancer de modèle ou alors 1 fois par mois
Un DS qui va passer 80% de son temps à travailler les données alors que ça pourrait être fait par un Data Analyst, je ne vois pas l'intérêt en fait de payer si cher des compétences si pointues et difficiles à trouver pour faire ce genre de boulot.

 

Pour moi un "vrai" DS a un niveau élevé niveau maths et je doute que ça soit à la sortie d'une licence qu'on puisse y prétendre en fait.
Après je me trompe peut être mais dans ma boîte, aucun DS n'a un niveau inférieur à Bac+5 et si une boîte de service me "vend" une ressource DS avec un niveau Bac+3 en maths, je vais tousser et même pas le prendre en entretien.

 

Quand je vois des jeunes diplômés (2 ans d'exp), qui veulent quitter la mission chez nous car ils veulent "faire du Big Data", je rigole car quand on voit le niveau en SQL/bon sens, c'est à pleurer.
Alors de la à vouloir faire du Big Data... Et puis bon je pense qu'en bossant sur des tables à plus de 100M de lignes on fait déjà du Big Data chez nous :o

 

Un DS devrait pas travailler les données ?
Pour moi c'est l'essence du truc, les appréhender, les comprendre, les vérifier, les choisir.

 

J'ai pas compris ton parallèle avec le data analysts, chez vous ils servent à préparer les données pour les DS?


Message édité par Filob le 24-11-2019 à 08:42:08

---------------
Ma capacité de concentration est si courte que... Oh, regarde, un pigeon!
n°32879
Filob
Posté le 24-11-2019 à 08:41:28  profilanswer
 

giorno_gio75 a écrit :


 
Pour moi le travail data je le divise en deux champs : reporting et analytics.
 
Le reporting c'est l'extraction des données pour mise en forme derrière excel/ppt qu'un data analyst va faire au quotidien, fournir des chiffres à des entités qui savent pas utiliser SQL. Il va surtout s'assurer que les chiffres sont bons et les consolider.
 
L'analytics ça relève du data scientist. Il va au-delà du reporting, il développe des insights pour l'entreprise avec l'analyse des données et pour cela il a tout une panoplie d'outils allant des statistiques à la modélisation ... suivant ce qu'il trouve, la question métier, la qualité des data etc... il va décider le niveau de complexité que son insight a.
 
Faut juste arrêter de penser que data scientist = modéliastion, que si tu fais pas de modélisation tu n'es pas un data scientist, c'est complètement débile. Un data scientist DOIT savoir faire de la modélisation statistique mais s'il arrive à te filer de la plus-value avec tes data en restant simple dans ses insights, à quoi bon ? Pour moi ça restera toujours un meilleur data scientist qu'un mec qui s'amuse à faire des modèles comme un bourrin à la première opportunité.


 
J'ai pas du tout la même vision et expérience.
L'analytics qui ne relève pas du data analyst, c'est drôle :D
 
Chez nous les DS sont a la DSI et bossent sur des projets transverses "fonctionnels" (algorithmes, segmentations...) qui sont mis en prod et utilisés par le marketing.
 
Les DA sont au marketing et manipulent la donnée pour en tirer des insights marketing.
 
Les reporting chiants sont faits par la BI :D


---------------
Ma capacité de concentration est si courte que... Oh, regarde, un pigeon!
n°32880
Kayou
Posté le 25-11-2019 à 07:32:02  profilanswer
 

Filob a écrit :

 

J'ai pas du tout la même vision et expérience.
L'analytics qui ne relève pas du data analyst, c'est drôle :D

 

Chez nous les DS sont a la DSI et bossent sur des projets transverses "fonctionnels" (algorithmes, segmentations...) qui sont mis en prod et utilisés par le marketing.

 

Les DA sont au marketing et manipulent la donnée pour en tirer des insights marketing.

 

Les reporting chiants sont faits par la BI :D


Oui c'est un peu pareil ici

 

Si les DS bossent les donnés mais c'est pas le but et ça ne doit pas être leur tâche principale en principe car c'est pas le but non plus

 

C'est comme si tu avais un médecin qui faisait le boulot d'une infirmière, c'est pas adapté en fait.
Le boulot d'un DA c'est de préparer les donnés et son client peut très bien être un DS qui va comprendre les donnés mais pas forcément passer la majorité de son Temps à mettre les mains dans le camboui.
Un médecin sait faire une prise de sang mais sa plus value va être d'analyser les résultats, pas de les produire.
De même il va prescrire des examens pour avoir plus de données pour analyser le problème global

n°32881
Rontgen
Posté le 25-11-2019 à 08:23:56  profilanswer
 

Après, je pense qu'il y a pas mal de petites structures où les rôles ne sont pas séparés

n°32882
Kayou
Posté le 25-11-2019 à 08:28:34  profilanswer
 

Oui c'est certain.
Et puis je pense aussi que "ça fait mieux" de dire que tu es DS que développeur SQL :o

 

Même si je pense qu'au final on a perdu en compétences avec cette mode des data car tout le monde recherche des "data xx" sans vraiment savoir ce dont ils ont besoin, ce qu'ils vont faire et si c'est vraiment adapté à leurs besoins.

 

La BI, les tableurs Excel sont encore la meilleure réponse à bon nombres de cas d'usage mais c'est moins à la mode

n°32883
mystiko
Posté le 25-11-2019 à 11:12:53  profilanswer
 

https://www.dell.com/fr-fr/shop/ord [...] igurations
https://www.dell.com/fr-fr/shop/ord [...] op/cn35930
https://www.dell.com/fr-fr/shop/ord [...] op/cn35904
 
Des avis sur ces trois PC?
le inspiron est à 882€
le G3 à 1119€ pour 16go de ram ou 1062€pour 8go de ram
 
J'ai l'impression de 57€pour passer de 8go à 16go de ram ça vaut le coup.
Par contre passer du inspiron au g3 avec "juste" un processeur différent? J'ai du mal à comparer les processeurs, y'a vraiment une grosse différence?
 
:jap:

n°32884
Filob
Posté le 25-11-2019 à 14:17:47  profilanswer
 

Kayou a écrit :


Oui c'est un peu pareil ici
 
Si les DS bossent les donnés mais c'est pas le but et ça ne doit pas être leur tâche principale en principe car c'est pas le but non plus
 
C'est comme si tu avais un médecin qui faisait le boulot d'une infirmière, c'est pas adapté en fait.
Le boulot d'un DA c'est de préparer les donnés et son client peut très bien être un DS qui va comprendre les donnés mais pas forcément passer la majorité de son Temps à mettre les mains dans le camboui.
Un médecin sait faire une prise de sang mais sa plus value va être d'analyser les résultats, pas de les produire.
De même il va prescrire des examens pour avoir plus de données pour analyser le problème global


 
Non.
Enfin de les préparer pour ses propres analyses oui, tout comme un DS prépare ses données pour ses propres analyses.
Jamais vu cette orga dans ma carrière en tout cas. T'es dans quel genre de structure?


---------------
Ma capacité de concentration est si courte que... Oh, regarde, un pigeon!
n°32885
Rontgen
Posté le 25-11-2019 à 14:25:03  profilanswer
 

mystiko a écrit :

https://www.dell.com/fr-fr/shop/ord [...] igurations
https://www.dell.com/fr-fr/shop/ord [...] op/cn35930
https://www.dell.com/fr-fr/shop/ord [...] op/cn35904
 
Des avis sur ces trois PC?
le inspiron est à 882€
le G3 à 1119€ pour 16go de ram ou 1062€pour 8go de ram
 
J'ai l'impression de 57€pour passer de 8go à 16go de ram ça vaut le coup.
Par contre passer du inspiron au g3 avec "juste" un processeur différent? J'ai du mal à comparer les processeurs, y'a vraiment une grosse différence?
 
:jap:


Comme on l'a déjà dit, les portables, c'est vraiment pas le top pour faire du ML
Après, ca dépend des utilisations - tu veux faire quoi exactement avec? des random forests? du deep learning? sur quel type/taille de données?
 
Enfin bon, dans tous les cas, pour moi 16GO de ram c'est vraiment le minimum

n°32886
Kayou
Posté le 25-11-2019 à 15:31:58  profilanswer
 

Filob a écrit :


 
Non.
Enfin de les préparer pour ses propres analyses oui, tout comme un DS prépare ses données pour ses propres analyses.
Jamais vu cette orga dans ma carrière en tout cas. T'es dans quel genre de structure?


 
J'en ai parlé avec d'autres DS, notamment un qui donne des cours sur le ML, DL... Il nous disait que les DA pouvaient avoir dans leurs "clients" des DS qui ne vont pas passer des jours à aller récupérer des données éparpillées parmi des dizaines de tables et des centaines de colonnes.
 
Alors oui il va aussi préparer ses données, mais ces dernières auront déjà été extraites par d'autres personnes qui sauront où les chercher et les agréger.
Si un DS passe 80% de son temps à bosser les données, c'est du budget dépenser à un mauvais endroit.
 
 
 

n°32887
Filob
Posté le 25-11-2019 à 16:03:37  profilanswer
 

Kayou a écrit :


 
J'en ai parlé avec d'autres DS, notamment un qui donne des cours sur le ML, DL... Il nous disait que les DA pouvaient avoir dans leurs "clients" des DS qui ne vont pas passer des jours à aller récupérer des données éparpillées parmi des dizaines de tables et des centaines de colonnes.
 
Alors oui il va aussi préparer ses données, mais ces dernières auront déjà été extraites par d'autres personnes qui sauront où les chercher et les agréger.
Si un DS passe 80% de son temps à bosser les données, c'est du budget dépenser à un mauvais endroit.
 


 
Dans quel type de boite?
 
Ça ne se passe pas comme ça chez moi, c'est les data engeneer qui brouttent la donnée pour la rendre utilisable par les DS.
 
Mais globalement les 3 métier ont des salaires élevés et proche, du coup je comprends pas trop le point budget dans ton post :D


---------------
Ma capacité de concentration est si courte que... Oh, regarde, un pigeon!
n°32888
Kayou
Posté le 25-11-2019 à 16:11:22  profilanswer
 

Filob a écrit :


 
Dans quel type de boite?
 
Ça ne se passe pas comme ça chez moi, c'est les data engeneer qui brouttent la donnée pour la rendre utilisable par les DS.
 
Mais globalement les 3 métier ont des salaires élevés et proche, du coup je comprends pas trop le point budget dans ton post :D


Pas chez nous en interne
Pas le même tarif niveau facturation
Pas les mêmes CV
 

n°32889
Filob
Posté le 25-11-2019 à 16:19:51  profilanswer
 

Kayou a écrit :


Pas chez nous en interne
Pas le même tarif niveau facturation
Pas les mêmes CV
 


 
Du coup c'est ta seule expérience de l'articulation de ces métiers?
 
Perso j'en ai vu plusieurs et c'est la première fois que j'entends ça, + je suis pas mal le marché et j'ai une assez bonne idée des salaires, donc je pense que tu généralise juste le structure de ta boite :D
 
 


---------------
Ma capacité de concentration est si courte que... Oh, regarde, un pigeon!
n°32890
giorno_gio​75
Posté le 25-11-2019 à 19:40:41  profilanswer
 

Filob a écrit :


 
Non.
Enfin de les préparer pour ses propres analyses oui, tout comme un DS prépare ses données pour ses propres analyses.
Jamais vu cette orga dans ma carrière en tout cas. T'es dans quel genre de structure?


 
Bah on est d'accord finalement.
 
Mais on s'entend ptet pas sur la préparation des données qui englobe tout le process juqsu'à soit a/ la modélisation ou b/ l'analyse métier.
 
Les DS qui font des projets transverses à base de "je créais une segmentation/score etc. pour tout le monde", bah dans n'importe quel de ces projets, tout bon DS te diras que c'est 70-80% de préparation de data et 30-20% de modélisation :o

n°32891
Filob
Posté le 25-11-2019 à 22:06:13  profilanswer
 

giorno_gio75 a écrit :


 
Bah on est d'accord finalement.
 
Mais on s'entend ptet pas sur la préparation des données qui englobe tout le process juqsu'à soit a/ la modélisation ou b/ l'analyse métier.
 
Les DS qui font des projets transverses à base de "je créais une segmentation/score etc. pour tout le monde", bah dans n'importe quel de ces projets, tout bon DS te diras que c'est 70-80% de préparation de data et 30-20% de modélisation :o


 
Je partage en effet cette vision/expérience :jap:


---------------
Ma capacité de concentration est si courte que... Oh, regarde, un pigeon!
n°32892
Bébé Yoda
Posté le 25-11-2019 à 22:10:48  profilanswer
 

giorno_gio75 a écrit :

 

Bah on est d'accord finalement.

 

Mais on s'entend ptet pas sur la préparation des données qui englobe tout le process juqsu'à soit a/ la modélisation ou b/ l'analyse métier.

 

Les DS qui font des projets transverses à base de "je créais une segmentation/score etc. pour tout le monde", bah dans n'importe quel de ces projets, tout bon DS te diras que c'est 70-80% de préparation de data et 30-20% de modélisation :o

 

Et 0% d'analyse et restitution :o

n°32893
giorno_gio​75
Posté le 25-11-2019 à 22:28:29  profilanswer
 

Bébé Yoda a écrit :

 

Et 0% d'analyse et restitution :o

 

C'était dans le package :D

 

C'est la partie la plus délaissée mais la plus importante, je suis content d'avoir progressé dans ce domaine plus que dans des domaines python & cie. :o

 

Je suis pas encore au top mais arriver à convaincre un CEO qui pèse, j'étais plutôt fier. 6 mois de projet qui rentrent enfin en production, je me barre pendant 1 mois en vacances ...

 

Des gens sont familiers avec le field à la mode "Interpretable ML" ? https://christophm.github.io/interpretable-ml-book/

 

J'ai pas encore trop approfondi le sujet mais j'ai quelques doutes sur la performance des méthodes quand tu veux t'intéresser à l'interprétabilité de ton modèle, j'aimerais savoir si des gens ont de l'expérience dans le  domaine ?

 

Du genre si on vous demande un modèle performant mais interprétable, quel choix vous utilisez ? decision tree, logistic des enfers, rulefit, deux modèles, autres ?


Message édité par giorno_gio75 le 25-11-2019 à 22:29:27
n°32894
flyingchai​r
Posté le 25-11-2019 à 22:52:10  profilanswer
 

Prolog :o

n°32895
Kayou
Posté le 25-11-2019 à 23:09:59  profilanswer
 

Filob a écrit :


 
Du coup c'est ta seule expérience de l'articulation de ces métiers?
 
Perso j'en ai vu plusieurs et c'est la première fois que j'entends ça, + je suis pas mal le marché et j'ai une assez bonne idée des salaires, donc je pense que tu généralise juste le structure de ta boite :D
 
 


Disons qu'on a plusieurs axes de travail :
.on prépare un peu les données pour les mettre à disposition en open data. Du coup le boulot des DS (qui ne sont pas de ma boîte) va quand même être pas mal mâché car ils n'aurons pas besoin d'aller rechercher toutes les données, les agréger...
.on va aussi mettre à dispositions des données pour des thésards qui vont bosser sur un sujet proche/propre à notre secteur avec aussi nos outils internes si besoin
.des partenariats avec les écoles aussi qui sont friandes de nos données
.en interne on a plusieurs façons d'utiliser les données, on a des DS qui vont bosser pas mal sur des algos de recommandation/prédiction/identification de fraude, métrologie... et ça c'est quand même beaucoup de taf sur les algos en tant que tel car les données sont quand même bien connues et pas mal maîtrisées sachant qu'on a pas mal de personnes en charge de les déverser dans le lac en amont et ensuite de les agréger, travailler un peu.
On a des dicos de données qui nous permettent d'aller rechercher les données car sinon c'est quand même pas simple vu la diversité et la quantité de données qu'on a  
 
Donc il est assez fréquent d'avoir un couple DS+dév/DA/DE qui vont bosser ensembles pour justement que chacun soit le plus efficace possible dans son taf.
Tu ne vas pas demander à un DS de coder des interfaces pour se connecter à une BD bien spécifique ou bien de faire des traitements de données afin qu'elles soient exploitables. L'objectif étant vraiment que chacun fasse au plus le boulot qu'il connait/maîtrise pour justement être le plus efficace possible.
 
On est plusieurs dizaines à bosser sur les données, donc on peut effectivement commencer à se spécialiser en fonction des compétences, de la connaissance métier, des appétences...
 
Alors certes ça n'est que ma vision mais de part la provenance des différents protagonistes, ça permet de balayer assez large et de confronter nos idées/point de vue.
Et n'en déplaisent à certains, le niveau est plutôt Bac+5/+8 que licence  [:spamafote]

n°32896
The An$wer
Posté le 25-11-2019 à 23:54:02  profilanswer
 

giorno_gio75 a écrit :

Des gens sont familiers avec le field à la mode "Interpretable ML" ? https://christophm.github.io/interpretable-ml-book/

 

J'ai pas encore trop approfondi le sujet mais j'ai quelques doutes sur la performance des méthodes quand tu veux t'intéresser à l'interprétabilité de ton modèle, j'aimerais savoir si des gens ont de l'expérience dans le domaine ?

 

Du genre si on vous demande un modèle performant mais interprétable, quel choix vous utilisez ? decision tree, logistic des enfers, rulefit, deux modèles, autres ?


Tout dépend de la performance que tu veux et du type d'explication/interprétation que tu souhaites obtenir.

 

Pour faire simple, si tu veux de la perf, tu vas utiliser des méthodes a posteriori type LIME ou valeurs de Shapley. En général ça te donne des indications sur les features qui ont beaucoup contribué à la sortie de ton modèle. L'avantage c'est que ça ne nuit pas aux performances du modèle, mais la contrepartie c'est que les informations que tu obtiens sont limitées.

 

L'autre solution c'est d'utiliser un modèle plus transparent, type arbre de décision ou base de règles (en évitant d'avoir trop de nœuds/règles). Le raisonnement est plus clair mais tu vas probablement perdre en perf.

 

Il y a d'autres critères à prendre en compte tels que local/global ou model-agnostic/model-specific. Le livre de Christoph Molnar (cf. le lien que tu as donné) donne un bon aperçu du domaine, mais il n'est pas encore fini et est donc un peu trop succinct sur certaines choses (évaluations des explications notamment, certaines méthodes intéressantes sont en cours de rédaction ou manquantes).


Message édité par The An$wer le 25-11-2019 à 23:56:12
n°32897
Chou Andy
Would you know my nem
Posté le 26-11-2019 à 00:39:00  profilanswer
 

Kayou a écrit :


On est plusieurs dizaines à bosser sur les données, donc on peut effectivement commencer à se spécialiser en fonction des compétences, de la connaissance métier, des appétences...


 
Ah ouais, c'est surtout ça, nous on est 12, sur des use cases assez variés niveau métier, on est tous obligés d'être un peu touche à tout :D


---------------
J'aurais voulu être un businessman
n°32898
Filob
Posté le 26-11-2019 à 07:04:27  profilanswer
 

Kayou a écrit :


Disons qu'on a plusieurs axes de travail :
.on prépare un peu les données pour les mettre à disposition en open data. Du coup le boulot des DS (qui ne sont pas de ma boîte) va quand même être pas mal mâché car ils n'aurons pas besoin d'aller rechercher toutes les données, les agréger...
.on va aussi mettre à dispositions des données pour des thésards qui vont bosser sur un sujet proche/propre à notre secteur avec aussi nos outils internes si besoin
.des partenariats avec les écoles aussi qui sont friandes de nos données
.en interne on a plusieurs façons d'utiliser les données, on a des DS qui vont bosser pas mal sur des algos de recommandation/prédiction/identification de fraude, métrologie... et ça c'est quand même beaucoup de taf sur les algos en tant que tel car les données sont quand même bien connues et pas mal maîtrisées sachant qu'on a pas mal de personnes en charge de les déverser dans le lac en amont et ensuite de les agréger, travailler un peu.
On a des dicos de données qui nous permettent d'aller rechercher les données car sinon c'est quand même pas simple vu la diversité et la quantité de données qu'on a  
 
Donc il est assez fréquent d'avoir un couple DS+dév/DA/DE qui vont bosser ensembles pour justement que chacun soit le plus efficace possible dans son taf.
Tu ne vas pas demander à un DS de coder des interfaces pour se connecter à une BD bien spécifique ou bien de faire des traitements de données afin qu'elles soient exploitables. L'objectif étant vraiment que chacun fasse au plus le boulot qu'il connait/maîtrise pour justement être le plus efficace possible.
 
On est plusieurs dizaines à bosser sur les données, donc on peut effectivement commencer à se spécialiser en fonction des compétences, de la connaissance métier, des appétences...
 
Alors certes ça n'est que ma vision mais de part la provenance des différents protagonistes, ça permet de balayer assez large et de confronter nos idées/point de vue.
Et n'en déplaisent à certains, le niveau est plutôt Bac+5/+8 que licence  [:spamafote]


 
C'est globalement ce que je vois, sauf que les DS travaillent avec des data engeneer et des archi pour la dispo des données, ce qui ne leur enlève pas une part de manip de données.
 
Jamais vu un data analyst faire juste de la manipulation de donnée pour premacher le taf des DS et aucune analyse, ça doit être spécifique a ta boîte ce point.
 
En tout cas ça montre bien que le titre du poste ne veut rien dire et qu'il faut être méfiant :D


---------------
Ma capacité de concentration est si courte que... Oh, regarde, un pigeon!
n°32899
Kayou
Posté le 26-11-2019 à 07:14:42  profilanswer
 

Bah oui c'est bien ça le problème, DS ça ne veut rien dire mais le titre est sacrément ronflant.
Ça fait plus classe de dire que tu es DS alors que tu fais le boulot d'un développeur SQL

 

Mais ça permet aïs SSII de facturer plus cher en remplacent le terme SQL par data dans les CV !
Mais bon la situation fait sourire pas mal d'anciens quand ils voient les outils utilisés car c'est quand même des stats enseignées/analyse de données pendant leurs années d'études qui retrouvent une seconde jeunesse en fait et considérées comme "nouvelles".

n°32900
Filob
Posté le 26-11-2019 à 07:22:18  profilanswer
 

Je parlais plutôt de DA là, vu la différence de contenu de poste entre ta boîte et ce que je connais :D  
 
Après si des boîtes sont assez nouilles pour payer plus cher un prestataire juste au nom et ne pas savoir qu'un DS c'est plus que du dev SQL j'ai envie de dire tant pis pour elles, faut sortir le dimanche :o


---------------
Ma capacité de concentration est si courte que... Oh, regarde, un pigeon!
n°32901
Kayou
Posté le 26-11-2019 à 07:51:11  profilanswer
 

Filob a écrit :

Je parlais plutôt de DA là, vu la différence de contenu de poste entre ta boîte et ce que je connais :D

 

Après si des boîtes sont assez nouilles pour payer plus cher un prestataire juste au nom et ne pas savoir qu'un DS c'est plus que du dev SQL j'ai envie de dire tant pis pour elles, faut sortir le dimanche :o


Oui enfin toi tu fais la différence mais tu penses vraiment qu'à un plus haut niveau ils sont capables de réellement faire la différence ?
Je ne parle pas de responsables vraiment data mais à un niveau directeur où ils ont entendu parler des data sans vraiment savoir ce que ça implique.

 

On parle d'IA alors qu'en pratique qui en fait vraiment ?

 


Et puis tu semblais dire que toi même tu n'utilisais pas forcément toutes tes compétences au service de ton poste alors que tu es correctement payée

n°32902
solal94
Ars longa, vita brevis
Posté le 26-11-2019 à 09:41:42  profilanswer
 

Bonjour à tous :)  
Comme promis je reviens avec des questions  :hello:  
 
Je me suis mis en tête de faire un challenge proposé par Natixis ici : https://challengedata.ens.fr "Exotic pricing with multidimensional non-linear interpolation"    
       
Ma principale source de stress est que le challenge doit être résolu avec des ANN d'ici fin décembre.Or la petite formation que je suis actuellement n'abordera les ANN qu'à mi-décembre...=> j'ai donc commencé par mes propres moyens.
On dirait que ce challenge est au départ fait pour des élèves de l'ENS et quand je vois les scores qu'ils arrivent à obtenir, je suis  :kaola:  
 
Les données  
Il s'agit d'un million de pricing d'options exotiques, sur 23 paramètres.

Citation :


 ID: unique sample identifier  
 S1: Underlying 1  
 S2: Underlying 2  
 S3: Underlying 3  
 
 mu1: Average drift of the underlying 1  
 mu2: Average drift of the underlying 2  
 mu3: Average drift of the underlying 3  
 
 sigma1: Volatility of the underlying 1  
 sigma2: Volatility of the underlying 2  
 sigma3: Volatility of the underlying 3  
 
 rho12: Correlation underlying 1 - underlying 2  
 rho13: Correlation underlying 1 - underlying 3  
 rho23: Correlation underlying 2 - underlying 3  
 
 Bonus: Coupon paid at the end of every period until the deal is either terminated or recalled  
 
 YetiBarrier: Barrier on the worst of the three underlyings above which we Yeti coupon is paid  
 YetiCoupon: Yeti coupon  
 
 PhoenixBarrier: Barrier on the worst of the three underlyings which triggers the recall of the deal  
 PhoenixCoupon: Coupon paid when the recall happens to compensate for the lost Yeti and Bonus coupons  
 
 PDIBarrier: Barrier of put down and in (PDI) options at maturity if no recall has happened  
 PDIGearing: Number of PDI options for 1 unit of notional of the deal PDIStrike: Strike of PDI  
 PDIType: Coefficient inside the option pay-off , -1 for a put and +1 for a call  
 
 Maturity: Maturity of the deal  
 NbDates: Number of reset dates of the autocall  


 
Ensuite en observant les données, je m'aperçois qu'ils ont fait varier tous les paramètres entre 0 et 1, de manière à remplir tout l'espace.
Ce que j'ai fait jusqu'ici
J'ai commencé par travailler avec des arbres (xgboost, lgbm).En poussant au max (temps de calcul, paramétrages), j'arrive à un score (MSE) à 4.80.
Problème : le benchmark à battre est de 0.1146
 
J'ai donc  commencé à lire la doc sur TensorFlow / Keras, j'ai un peu galéré pour faire fonctionner mon GPU et j'ai construis le meilleur réseau que je pouvais imaginer avec ce que j'ai compris...Ne rigolez pas, ça donne ça :  

Spoiler :

def my_big_model(input_dim):
    model = tf.keras.Sequential()
    model.add(layers.Dense(8000,  
                           input_dim=input_dim,  
                           activation='relu'))
    model.add(LeakyReLU())
    model.add(Dropout(0.25))
                   
    model.add(layers.Dense(5000,activation='relu'))
    model.add(Dropout(0.25))
               
    model.add(layers.Dense(2000,activation='relu'))
    model.add(Dropout(0.25))
               
    model.add(layers.Dense(800,activation='relu'))
    model.add(Dropout(0.25))
             
    model.add(layers.Dense(500,activation='relu'))
    model.add(Dropout(0.25))
               
    model.add(layers.Dense(200,activation='relu'))
    model.add(Dropout(0.25))
               
    model.add(layers.Dense(50,activation='relu'))
    model.add(Dropout(0.25))
               
    model.add(layers.Dense(1))
#     model.add(layers.Activation(custom_activation))
    model.add(layers.Activation('exponential'))
     
    model.compile(loss='mean_squared_error',
                  # metrics=['cosine_proximity'],
                  optimizer='adam')
 
    return model
 


 
Avec cette chose, j'ai cru que je tenais le bon bout quand j'ai pu sortir ce plot :
 
https://i.ibb.co/Qk1vqcp/2019-11-25-18-43-41-Jupyter-Lab.png
 
 
Malheureusement, en soumettant mon résultat, j'arrive à un MSE pire qu'avec les arbres : 15 !
 
 
 
 
 
Si vous auriez des pistes pour m'améliorer, je suis tout ouï !
Merci !


Message édité par solal94 le 26-11-2019 à 09:42:27
n°32903
Filob
Posté le 26-11-2019 à 10:16:17  profilanswer
 

Kayou a écrit :


Oui enfin toi tu fais la différence mais tu penses vraiment qu'à un plus haut niveau ils sont capables de réellement faire la différence ?
Je ne parle pas de responsables vraiment data mais à un niveau directeur où ils ont entendu parler des data sans vraiment savoir ce que ça implique.  
 
On parle d'IA alors qu'en pratique qui en fait vraiment ?  
 
 
Et puis tu semblais dire que toi même tu n'utilisais pas forcément toutes tes compétences au service de ton poste alors que tu es correctement payée


 
Je ne comprends pas ta question.
 
Si un mec propose un poste de DA "préparateur de données pour DS" à 30K ben il trouvera surement quelqu'un pour le faire et ça ne m’empêchera pas de dormir :D


---------------
Ma capacité de concentration est si courte que... Oh, regarde, un pigeon!
n°32904
Rontgen
Posté le 26-11-2019 à 10:33:20  profilanswer
 

solal94 a écrit :


Avec cette chose, j'ai cru que je tenais le bon bout quand j'ai pu sortir ce plot :
 
https://i.ibb.co/Qk1vqcp/2019-11-25 [...] er-Lab.png
 
 
Malheureusement, en soumettant mon résultat, j'arrive à un MSE pire qu'avec les arbres : 15 !
 
 
Si vous auriez des pistes pour m'améliorer, je suis tout ouï !
Merci !


Ca représente quoi exactement ton graph (quelles données)? Est-ce que tu as bien séparé ta base de données en training/validation?
Peut-être que ton modèle a complètement overfitté sur les données d'apprentissage

n°32905
solal94
Ars longa, vita brevis
Posté le 26-11-2019 à 10:50:48  profilanswer
 

Rontgen a écrit :


Ca représente quoi exactement ton graph (quelles données)? Est-ce que tu as bien séparé ta base de données en training/validation?
Peut-être que ton modèle a complètement overfitté sur les données d'apprentissage


 
 
C'est une comparaison entre le y_test et le yp qui sort du modèle.

 Page :   1  2  3  4  5  ..  72  73  74  ..  133  134  135  136  137  138

Aller à :
Ajouter une réponse
 

Sujets relatifs
[Topic unique] Veille IA - Actu, lectures, podcasts & documentaires[Topic Unique] Claude by Anthropic
[Topic unique] IA générative de texte, ChatGPT, Copilot, Gemini & co 
Plus de sujets relatifs à : [Topic Unique] Machine Learning & Data Science


Copyright © 1997-2025 Groupe LDLC (Signaler un contenu illicite / Données personnelles)