Forum |  HardWare.fr | News | Articles | PC | S'identifier | S'inscrire | Shop Recherche
3603 connectés 

 


Utilisez-vous du machine learning dans votre job ?




Attention si vous cliquez sur "voir les résultats" vous ne pourrez plus voter

 Mot :   Pseudo :  
  Aller à la page :
 
 Page :   1  2  3  4  5  ..  53  54  55  ..  133  134  135  136  137  138
Auteur Sujet :

[Topic Unique] Machine Learning & Data Science

n°32105
o_BlastaaM​oof_o
Posté le 25-02-2019 à 14:58:09  profilanswer
 

Reprise du message précédent :
 
Critique mais à la criticité pas encore vraiment reconnue (ça commence à venir ceci dit).
 
Après, le data engineering, faut aimer. C'est vraiment un job très technique à la limite du développement pur et dur.

n°32106
Profil sup​primé
Posté le 25-02-2019 à 18:30:43  answer
 

o_BlastaaMoof_o a écrit :


Critique mais à la criticité pas encore vraiment reconnue (ça commence à venir ceci dit).

 

Après, le data engineering, faut aimer. C'est vraiment un job très technique à la limite du développement pur et dur.


Je pense que c'est pas à la limite :o
C'est un nouveau nom pour dev python/sql :o

n°32107
alpachinoi​s
Posté le 26-02-2019 à 10:34:22  profilanswer
 

C'est quoi la différence entre un data engineer et un architecte big data ? :o

n°32108
TiDom
Posté le 26-02-2019 à 10:39:51  profilanswer
 

alpachinois a écrit :

C'est quoi la différence entre un data engineer et un architecte big data ? :o


 
https://dataanalyticspost.com/metier

n°32109
Profil sup​primé
Posté le 26-02-2019 à 13:50:01  answer
 

alpachinois a écrit :

C'est quoi la différence entre un data engineer et un architecte big data ? :o


T'as rarement une équipe assez grosse pour avoir 14 type de poste différents. Tout ces termes c'est en général pas mal de bs marketing

n°32110
o_BlastaaM​oof_o
Posté le 01-03-2019 à 23:19:51  profilanswer
 

Tu peux poser tes questions d'ordre technique mais attends toi à te faire tailler :o

n°32111
mathsdauph
Posté le 02-03-2019 à 22:28:41  profilanswer
 

titubant a écrit :

Nous verrons, c'est technique sans l'être, c'est plus pour demander l'avis de connaisseurs sur une problématique.  
 
Imaginons que je veuille extraire de l'information d'un document non structuré, par exemple je souhaite savoir quelle couleur doit prendre un fil électrique sur une instruction de cablage à travers un document de spécifications au format pdf. Cette information n'est pas formulée de façon structurée, mais on compte nombre de documents de spécifications où la couleur d'un fil électrique est mentionné.  
 
J'ai déjà touché du doigt du ML pour une autre problématique, où pour une spécification donnée je retrouvais la réglemation en vigueur, à partir d'une base de connaissances.
Dans ce cas : ligne de spécification détectée => réglementation.  
 
C'est là que je m'y perds. Comment je peux arriver à extraire des couples {variable : valeur} depuis un paragraphe de texte ? Je dois créer aussi une base de connaissance ? Mais ce sera plus du 1 pour 1 mais du 1 pour un couple...
 
Si quelqu'un perçoit une esquisse de solution, je prends.
 [:le_chien:4]


 
mais on se sent DATA SCIENTIST  [:s@ms:2]

n°32112
Rasthor
Posté le 04-03-2019 à 14:44:11  profilanswer
 

titubant a écrit :

Nous verrons, c'est technique sans l'être, c'est plus pour demander l'avis de connaisseurs sur une problématique.  
 
Imaginons que je veuille extraire de l'information d'un document non structuré, par exemple je souhaite savoir quelle couleur doit prendre un fil électrique sur une instruction de cablage à travers un document de spécifications au format pdf. Cette information n'est pas formulée de façon structurée, mais on compte nombre de documents de spécifications où la couleur d'un fil électrique est mentionné.  
 
J'ai déjà touché du doigt du ML pour une autre problématique, où pour une spécification donnée je retrouvais la réglemation en vigueur, à partir d'une base de connaissances.
Dans ce cas : ligne de spécification détectée => réglementation.  
 
C'est là que je m'y perds. Comment je peux arriver à extraire des couples {variable : valeur} depuis un paragraphe de texte ? Je dois créer aussi une base de connaissance ? Mais ce sera plus du 1 pour 1 mais du 1 pour un couple...
 
Si quelqu'un perçoit une esquisse de solution, je prends.
 [:le_chien:4]


 
Je ne sais pas si ca peut aider, mais regarder du cote des outils de NLP.
 
https://en.wikipedia.org/wiki/Natur [...] processing
https://fr.wikipedia.org/wiki/Trait [...] ge_naturel
 
Tu devras sûrement construire un dictionnaire contenant les termes clés (base de connaissance comme tu dis).

n°32113
Bébé Yoda
Posté le 04-03-2019 à 19:29:15  profilanswer
 

Je vais peut être dire une bêtise, mais on ne pourrait pas simplement faire un tf-idf tout bête ? Compter le nombre de fois que "rouge", "bleu" etc apparaissent dans un texte donné ?

n°32114
zywiec
Posté le 04-03-2019 à 20:42:05  profilanswer
 

J'aimerais faire des tutos avec tensorflow mais c'est impossible d'installer ce truc  :(

n°32115
Profil sup​primé
Posté le 04-03-2019 à 21:24:21  answer
 

zywiec a écrit :

J'aimerais faire des tutos avec tensorflow mais c'est impossible d'installer ce truc  :(

 

T'installes anaconda https://www.anaconda.com/distribution/

 

Ensuite tu cliques sur anaconda prompt et tu c/c : conda install -c conda-forge tensorflow https://anaconda.org/conda-forge/tensorflow

 

Si tu veux que ça marche avec ton GPU plutôt faut suivre ce tuto https://anaconda.org/anaconda/tensorflow-gpu https://stackoverflow.com/questions [...] del-on-gpu


Message édité par Profil supprimé le 04-03-2019 à 21:25:56
n°32116
Profil sup​primé
Posté le 08-03-2019 à 12:56:19  answer
 

zywiec a écrit :

J'aimerais faire des tutos avec tensorflow mais c'est impossible d'installer ce truc :(


Pip! Ou tu pull le docker direct

n°32117
mystiko
Posté le 09-03-2019 à 08:48:46  profilanswer
 

Je vois souvent du Java et/ou Scala dans les offres (qui touchent un peu au côté data engineer). Je vais commencer à en apprendre un des deux. Lequel est le plus adaptés aux techno hadoop ?
J'aurais dit Scala mais je voulais confirmation :o


Message édité par mystiko le 09-03-2019 à 09:05:42
n°32118
Profil sup​primé
Posté le 09-03-2019 à 13:13:27  answer
 

Hadoop Map Reduce plutôt Java
 
Spark pyspark est assez mature sinon Scala

n°32119
o_BlastaaM​oof_o
Posté le 09-03-2019 à 15:51:50  profilanswer
 

Scala c'est sur le déclin. Trop spécifique, tout le monde s'en balance à part quelques start-ups qui veulent se la jouer high-tech.
Sur Hadoop, le framework à maîtriser, c'est Spark. La plupart des gens l'utilisent au travers de Python, Java aussi c'est has been (trop lourd, trop verbeux).
 
De manière globale, si tu veux faire du data engineering propre, il te faut un langage qui ne va généralement pas servir à faire le processing directement mais à interagir avec des systèmes de stockage/traitement (pour des questions de localité de la donnée, de gestion de la mémoire, etc.). En gros, il faut un truc capable d'interagir avec des bases de données relationnelles, des bases NoSQL et des clusters Hadoop, tout cela soit via des API soit des drivers. A mon sens, Python répond bien à ce besoin.
 
MATLAB aussi d'ailleurs :o :D

n°32120
Bébé Yoda
Posté le 09-03-2019 à 16:09:23  profilanswer
 

PySpark FTW

n°32121
mystiko
Posté le 09-03-2019 à 16:19:29  profilanswer
 

J'avai vu une offre qui demandait "spark- java/Scala" et je fais plutôt du pyspark effectivement

 

Bon oser, je dirai au boss que c'est has been :o


Message édité par mystiko le 09-03-2019 à 16:29:32
n°32122
o_BlastaaM​oof_o
Posté le 09-03-2019 à 16:57:00  profilanswer
 

L'argument serait plutôt de dire que dans la mesure où tu fais déjà du PySpark, tu ne devrais avoir aucune difficulté à passer à du Spark/Java/Scala. Les frameworks sont proches, il n'y a guère que la syntaxe qui change.

n°32123
giorno_gio​75
Posté le 13-03-2019 à 20:43:05  profilanswer
 

mathsdauph a écrit :


 
Et dans le conseil  (EY, CapGemini, Deloitte..) t'as une idée?


 
Etant junior et ayant eu pas mal d'offres, que ça soit boite de conseil ou interne. Si je vais moyenner, le conseil tu tournes à 39k en cabinet, ça peut etre un peu moins en SSII genre 36K et ensuite en interne là ça varie énormément selon le secteur mais une moyenne de 41-42k me parait raisonnable en virant les trucs un peu extrêmes genre pharma (j'ai eu une offre à 55k en tant que juju no exp).
 
Après le marché reste quand meme hyper ouvert sur les 5 prochaines années, donc y'a encore un fort pouvoir de négociation.  
 
Perso si j'avais à donner un advice, faire du conseil. Tout d'abord la montée en compétence sur des logiciels, meilleure possibilité de rester à jour sur tout, evolution rapide du salaire, diversité des domaines et surtout la possibilité d'accrocher des gros noms sur son CV.

n°32124
Profil sup​primé
Posté le 20-03-2019 à 17:01:32  answer
 

Drap  
 
J'ai une question pour vous :
 
Je veux utiliser deepwalk pour apprendre un embedding à partir d'une liste d'arrêtes https://github.com/phanein/deepwalk [...] ple_graphs
 
J'ai 100 000 fichiers contenant ces listes pour chaque graphe, visiblement le truc s'utilise en ligne de commande (dans une cellule python notebook) genre :  
 

Code :
  1. !deepwalk --format edgelist  --input "D:/Scolaire/Code/Python/Machine Learning/Kaggle Challenges M2/Altegrad - Graphs HAN/data/edge_lists/1.txt" --output "./embeddings/emb_1.embeddings"


 
ça marche pour un fichier en particulier mais j'aimerai tout calculer dans une boucle for et là ça marche plus :
 

Code :
  1. for i in range(0, 100000):
  2.     input_dest = "D:/Scolaire/Code/Python/Machine Learning/Kaggle Challenges M2/Altegrad - Graphs HAN/data/edge_lists/" + str(i) + ".txt"
  3.     output_dest = "./embeddings/test" + str(i) + ".embeddings"
  4.     print(input_dest)
  5.     !deepwalk --format edgelist --workers 20 --input input_dest --output output_dest


 
là ça marche pas car il pense que input_dest c'est le nom du fichier et il prends pas en compte que c'est une variable contenant le path
 
Any idea ???
 
J'ai lu des trucs sur argparse mais pas compris comment ça s'utiliserait dans ce cas là  :(

n°32125
Rasthor
Posté le 20-03-2019 à 17:17:37  profilanswer
 

Il te met quoi comme erreur concrètement ?

 

Edit: Windows....  [:cacatomique:1]


Message édité par Rasthor le 20-03-2019 à 17:22:59
n°32126
Rasthor
Posté le 20-03-2019 à 17:22:48  profilanswer
 

Ah, j'ai compris le probleme, je crois! Dans ta premiere cellule, il le voit comme une commande unix, donc l'interprete direct. Par contre dans le deuxieme, c'est une commande python.
 
 
Essaye ca:

Code :
  1. for i in range(0, 100000):
  2.         input_dest = "D:/Scolaire/Code/Python/Machine Learning/Kaggle Challenges M2/Altegrad - Graphs HAN/data/edge_lists/" + str(i) + ".txt"
  3.         output_dest = "./embeddings/test" + str(i) + ".embeddings"
  4.         print(input_dest)
  5.         os.system("deepwalk --format edgelist --workers 20 --input "+input_dest+" --output "+output_dest)


Message édité par Rasthor le 20-03-2019 à 17:24:52
n°32127
Profil sup​primé
Posté le 20-03-2019 à 17:23:48  answer
 

Rasthor a écrit :

Ah, j'ai compris le probleme, je crois! Dans ta premiere cellule, il le voit comme une commande unix, donc l'interprete direct. Par contre dans le deuxieme, c'est une commande python.
 
 
Essaye ca:
 

Citation :

   for i in range(0, 100000):
        input_dest = "D:/Scolaire/Code/Python/Machine Learning/Kaggle Challenges M2/Altegrad - Graphs HAN/data/edge_lists/" + str(i) + ".txt"
        output_dest = "./embeddings/test" + str(i) + ".embeddings"
        print(input_dest)
        os.system("deepwalk --format edgelist --workers 20 --input "+input_dest+" --output "+output_dest)


 
 


 
Ouaip c'est un problème du genre, j'essaie. Merci :jap:
 
EDIT : ça marche, merci beaucoup  :D


Message édité par Profil supprimé le 20-03-2019 à 17:31:10
n°32128
draculax
Posté le 20-03-2019 à 19:05:01  profilanswer
 

Hello,
 
J'ai fait un peu de Deep y'a environ 1 an. J'aimerai me perfectionner, vous avez des ressources un peu technique (matheuses). Quand j'en faisais c'était assez rare, les NNs ça va pas très loin de maths.
A part lire des papiers et jouer avec les implémentations je vois pas trop quoi faire.
 
Sinon comme IDE vous utilisez quoi ? J'utilise Pyzo mais ça manque de fonctionnalité je trouve :o

n°32129
Rasthor
Posté le 20-03-2019 à 19:49:48  profilanswer
 


De rien!  [:cerveau charlest]  

draculax a écrit :


Sinon comme IDE vous utilisez quoi ? J'utilise Pyzo mais ça manque de fonctionnalité je trouve :o

PyCharm.
 

n°32130
Profil sup​primé
Posté le 20-03-2019 à 19:54:08  answer
 

draculax a écrit :

Hello,
 
J'ai fait un peu de Deep y'a environ 1 an. J'aimerai me perfectionner, vous avez des ressources un peu technique (matheuses). Quand j'en faisais c'était assez rare, les NNs ça va pas très loin de maths.
A part lire des papiers et jouer avec les implémentations je vois pas trop quoi faire.
 
Sinon comme IDE vous utilisez quoi ? J'utilise Pyzo mais ça manque de fonctionnalité je trouve :o


 
T'as ça comme ressources qui sont bien :  
 
https://github.com/m2dsupsdlclass/lectures-labs
 
https://www.deeplearningbook.org/
 
Fais des notebooks si tu veux te sentir data scientist  [:vc4fun:5]

n°32131
Bébé Yoda
Posté le 20-03-2019 à 19:57:41  profilanswer
 

+1 pour pycharm..

 

n°32132
Alicanto
アリカント
Posté le 20-03-2019 à 20:20:28  profilanswer
 

D'ailleurs pourquoi Pycharm et pas Spyder ?

n°32133
o_BlastaaM​oof_o
Posté le 20-03-2019 à 20:24:08  profilanswer
 

Pourquoi Eclipse et pas NetBeans ?
Pourquoi C et pas FORTRAN ?
Pourquoi Linux et pas Windows ?

n°32134
Oceanborn
Posté le 20-03-2019 à 23:42:53  profilanswer
 

Yo,
Je train un NN sur ~3000 features pour predict une variable quantitative. J'utilise Keras/TF/python.
Avec ~50 epoch, vu que mon reseau est assez simple (Sequential/20 neurons first layer/dropout/20 neuron 2nd layer, 1 output), ca va super vite. Genre quelques minutes pour train le truc.
 
J'ai enleve 2 features de mon dataset pour test combien je perdait en prediction. Ces deux features expliquent une grande partie de mon Y (~35%). J'attends donc un R2 beaucoup plus bas. Je train donc mon NN sur ~3000 - 2 neurons dans mon input layer.
 
Et la catastrophe. La vitesse d'exec chute drastiquement. Au lieu de ~20us par step, je passe a 11ms! C'est normal ce genre de baisse de perfo selon les features feed en input ? (Je travaille sur un cluster avec node reserve pour mon job et cartes Volta dediees, donc aucun changement cote materiel ou I/O).


Message édité par Oceanborn le 21-03-2019 à 04:09:13
n°32135
o_BlastaaM​oof_o
Posté le 21-03-2019 à 03:19:54  profilanswer
 

Le FR dans HFR, ça veut bien dire France non ?

n°32136
Bébé Yoda
Posté le 21-03-2019 à 07:24:48  profilanswer
 

Alicanto a écrit :

D'ailleurs pourquoi Pycharm et pas Spyder ?

 

Pycharm est plus un vrai IDE, plus complet.
Tu as des outils de debug et de test unitaire absents de Spyder il me semble

n°32137
Rasthor
Posté le 21-03-2019 à 08:35:54  profilanswer
 

Bébé Yoda a écrit :


 
Pycharm est plus un vrai IDE, plus complet.
Tu as des outils de debug et de test unitaire absents de Spyder il me semble


https://github.com/spyder-ide/spyder-unittest
 
:o

n°32138
Bébé Yoda
Posté le 21-03-2019 à 08:43:52  profilanswer
 

Intéressant.
Après à titre personnel je suis plutôt habitué à Spyder, surtout pour l'intégration native du notebook, et la visualisation des données sous forme de table (je ne sais plus comment s'appelle cette fonctionnalité).
Les tests unitaires c'est pour les dev :o

n°32139
o_BlastaaM​oof_o
Posté le 21-03-2019 à 14:31:52  profilanswer
 

Bébé Yoda a écrit :

Intéressant.
Après à titre personnel je suis plutôt habitué à Spyder, surtout pour l'intégration native du notebook, et la visualisation des données sous forme de table (je ne sais plus comment s'appelle cette fonctionnalité).
Les tests unitaires c'est pour les dev :o


J'espère que tous les data scientists ne pensent pas comme toi.
 
Du code sans test (unitaire au moins), c'est du code qui n'est pas adapté à de la production, c'est donc du code qui ne sert à rien.

n°32140
Profil sup​primé
Posté le 21-03-2019 à 17:02:22  answer
 
n°32141
giorno_gio​75
Posté le 21-03-2019 à 21:27:28  profilanswer
 

Oceanborn a écrit :

Yo,
Je train un NN sur ~3000 features pour predict une variable quantitative. J'utilise Keras/TF/python.
Avec ~50 epoch, vu que mon reseau est assez simple (Sequential/20 neurons first layer/dropout/20 neuron 2nd layer, 1 output), ca va super vite. Genre quelques minutes pour train le truc.

 

J'ai enleve 2 features de mon dataset pour test combien je perdait en prediction. Ces deux features expliquent une grande partie de mon Y (~35%). J'attends donc un R2 beaucoup plus bas. Je train donc mon NN sur ~3000 - 2 neurons dans mon input layer.

 

Et la catastrophe. La vitesse d'exec chute drastiquement. Au lieu de ~20us par step, je passe a 11ms! C'est normal ce genre de baisse de perfo selon les features feed en input ? (Je travaille sur un cluster avec node reserve pour mon job et cartes Volta dediees, donc aucun changement cote materiel ou I/O).

 

Déjà le R², en 2019, il faut arrêter de l'utiliser, un R² ajusté au moins si ça te tiens à coeur mais bon ...

 

Ensuite je veux bien que tu parles en franglais mais de mon point de vue, c'est bien de parler français, si ton temps passe de 20us à 11ms, la vitesse d'exec chute pas, elle augmente.

 

Bon de là à parler de catastrophe, je sais pas dans quel domaine tu travailles mais à moins de trade sur le forex, je vois pas trop le soucis.

 

Maintenant si le temps augmente, et que ces deux prédicteurs sont importants vis-à-vis de ta variable cible, c'est plutôt logique.

 

Si je devais vulgariser, c'est un peu comme si tu enlevais tes lunettes pour lire un texte, tu vas mettre plus de temps à lire, là les lunettes c'est tes deux variables.


Message édité par giorno_gio75 le 21-03-2019 à 21:27:57
n°32142
Rasthor
Posté le 21-03-2019 à 21:31:10  profilanswer
 

giorno_gio75 a écrit :

 

Déjà le R², en 2019, il faut arrêter de l'utiliser, un R² ajusté au moins si ça te tiens à coeur mais bon ...

 

Ensuite je veux bien que tu parles en franglais mais de mon point de vue, c'est bien de parler français, si ton temps passe de 20us à 11ms, la vitesse d'exec chute pas, elle augmente.

 

Bon de là à parler de catastrophe, je sais pas dans quel domaine tu travailles mais à moins de trade sur le forex, je vois pas trop le soucis.

 

Maintenant si le temps augmente, et que ces deux prédicteurs sont importants vis-à-vis de ta variable cible, c'est plutôt logique.

 

Si je devais vulgariser, c'est un peu comme si tu enlevais tes lunettes pour lire un texte, tu vas mettre plus de temps à lire, là les lunettes c'est tes deux variables.


Le temps augmente pour faire le même nombre d’opérations, c'est plus lent, donc la vitesse chute bel et bien. [:aloy]


Message édité par Rasthor le 21-03-2019 à 21:32:15
n°32143
giorno_gio​75
Posté le 21-03-2019 à 21:51:34  profilanswer
 

Rasthor a écrit :


Le temps augmente pour faire le même nombre d’opérations, c'est plus lent, donc la vitesse chute bel et bien. [:aloy]


 
Qui te dis qu'il fait le même nombre d'opérations, peut-être que le nombre d'itérations a augmenté ? [:aloy]

n°32144
Oceanborn
Posté le 22-03-2019 à 04:03:13  profilanswer
 

Peut etre que je l'aurais precise si j'avais modifie un parametre autre que le nombre de features ? [:aloy]
 
Ca m'interesse aussi que tu me dises comment tu calcules un R² ajusté en utilisant un reseau de neurones.

n°32145
Rasthor
Posté le 22-03-2019 à 11:19:33  profilanswer
 

What is the Difference Between R-squared and Adjusted R-squared?
https://www.investopedia.com/ask/an [...] quared.asp

 Page :   1  2  3  4  5  ..  53  54  55  ..  133  134  135  136  137  138

Aller à :
Ajouter une réponse
 

Sujets relatifs
[Topic unique] Veille IA - Actu, lectures, podcasts & documentaires[Topic Unique] Claude by Anthropic
[Topic unique] IA générative de texte, ChatGPT, Copilot, Gemini & co 
Plus de sujets relatifs à : [Topic Unique] Machine Learning & Data Science


Copyright © 1997-2025 Groupe LDLC (Signaler un contenu illicite / Données personnelles)