Forum |  HardWare.fr | News | Articles | PC | S'identifier | S'inscrire | Shop Recherche
1785 connectés 

 


Utilisez-vous du machine learning dans votre job ?




Attention si vous cliquez sur "voir les résultats" vous ne pourrez plus voter

 Mot :   Pseudo :  
  Aller à la page :
 
 Page :   1  2  3  4  5  ..  73  74  75  ..  133  134  135  136  137  138
Auteur Sujet :

[Topic Unique] Machine Learning & Data Science

n°32905
solal94
Ars longa, vita brevis
Posté le 26-11-2019 à 10:50:48  profilanswer
 

Reprise du message précédent :

Rontgen a écrit :


Ca représente quoi exactement ton graph (quelles données)? Est-ce que tu as bien séparé ta base de données en training/validation?
Peut-être que ton modèle a complètement overfitté sur les données d'apprentissage


 
 
C'est une comparaison entre le y_test et le yp qui sort du modèle.

n°32906
Rontgen
Posté le 26-11-2019 à 11:01:37  profilanswer
 

C'est pas ca la question, la question c'est quelles données tu as utilisées pour tracer ce graph: est-ce que c'est les mêmes que tu as utilisées pour fitter ton modèle?

n°32907
solal94
Ars longa, vita brevis
Posté le 26-11-2019 à 11:12:28  profilanswer
 

Rontgen a écrit :

C'est pas ca la question, la question c'est quelles données tu as utilisées pour tracer ce graph: est-ce que c'est les mêmes que tu as utilisées pour fitter ton modèle?


non, j'ai mis 20% de coté pour valider mon modèle.

n°32908
Rick_C137
Posté le 26-11-2019 à 15:14:02  profilanswer
 

solal94 a écrit :

Bonjour à tous :)
Comme promis je reviens avec des questions  :hello:

 

Je me suis mis en tête de faire un challenge proposé par Natixis ici : https://challengedata.ens.fr "Exotic pricing with multidimensional non-linear interpolation"  
     
Ma principale source de stress est que le challenge doit être résolu avec des ANN d'ici fin décembre.Or la petite formation que je suis actuellement n'abordera les ANN qu'à mi-décembre...=> j'ai donc commencé par mes propres moyens.
On dirait que ce challenge est au départ fait pour des élèves de l'ENS et quand je vois les scores qu'ils arrivent à obtenir, je suis  :kaola:

 

Merci !

 

Tu enchaines des layers dense avec plusieurs miliers de neurons, rien qu'entre tes deux premières chouches tu as 5000x8000 = 30 millions de paramètres. Comment tu veux faire pour fitter ce genre de modèle à moins d'avoir un dataset énorme ?

 

J'ai pas trop le temps de regarder en détail tes résultats, mais déjà la ya un prob. T'as l'air d'avoir des (trops) bons résultats sur ton test de validation, je pense qu'il a été probablement construit n'importe comment et qu'il y a des grosses corrélations entre ton validation et training donc même si ils sont séparés c'est comme si tu entrainais dessus.


Message édité par Rick_C137 le 26-11-2019 à 15:15:59
n°32909
solal94
Ars longa, vita brevis
Posté le 26-11-2019 à 16:03:33  profilanswer
 

Merci de ce premier retour.
Je vais réduire le nombre de neurones et jeter un oeil à cet histoire de jeu de test.
 

n°32910
Shadoko
Et ça pompait ...
Posté le 27-11-2019 à 12:12:03  profilanswer
 

Drap


---------------
Pourquoi faire simple quand on peut faire compliqué ?
n°32911
chocolathe
Posté le 01-12-2019 à 12:34:14  profilanswer
 

Hello
 
Je suis ponctuellement le topic ; ça parle un peu trop de salaire de jeune dip et pas assez de ML&DS à mon gout par contre :o
 
Un peu de contexte pour introduire mes réactions aux posts précédents
 
Je travaille dans une boite qui a ouvert un département Innovation en parallèle de l'IT classique.  
Je suis côté IT, manager de plusieurs équipes (compétences mixtes: orga/process, moa, moe), je me retrouve donc confronté à
1/ le fait que ce sujet soit pris en chare par eux et pas par moi  [:jabbernaute]  
2/ pris en care par des profils qui ont une expérience limitée et ne se projettent pas dans le futur mode RUN/maintenance qui les concernera ; ils essaient de livrer tout azimuths
3/ pas de vision archi ; ils font des trucs dans leurs coin mal intérés avec  
 
Dans ce contexte je remarque beaucoup de "repackaging" de concepts classiques (datawarehouse>datalake ; bi>analytics; ETL>panda,frame & co) pour vendre des suites d'outils dont beaucoup des fonctions s'avèrent en doublon avec des solutions existantes, mais dénigrés car libellées "IT" traditionnelle
 
Et parallèlement on s'adresse à une population différente de profils, qui fait de l'IT sans le savoir ( [:maestro] ) et qui représente donc l'opportunité de leur vendre ces concepts repackagés pour banker $$$
 

o_BlastaaMoof_o a écrit :


Je connais cet article, j'aurais pu l'écrire moi-même... Il se base quasi exclusivement sur le fait de remplacer les strings par des valeurs catégorielles, ce qui effectivement convient dans beaucoup de cas. Mais si ta donnée n'est pas catégorielle (des adresses par exemple), il n'y a tout simplement pas de solution en Python, tu te retrouves avec une conso mémoire déraisonnable.
 
Pour le data engineering, il existe des outils qui sont faits pour ça. C'est bête à dire mais le langage SQL est un bon exemple, il n'a aucun des inconvénients que j'ai cités ci-dessus. Sinon il y a une palanquée d'outils ETL, souvent propriétaires. Pour les gens sans le sou, la meilleure option reste sans doute Talend. Entendons-nous bien, de mon point de vue Talend est une sombre merde... Mais toujours est-il que le code Java généré par Talend défonce du pandas dans les grandes largeurs tout en ne présentant pas la plupart de ses inconvénients.


 
Je m'étonne d'un avis si tranché
Qu'est-ce qui t'amène à cette conclusion ? Pour quel besoin ? Sur quels aspect ?  
On peut supposer de ton commentaire qu'il y a un ou plusieurs autres outils payant que tu trouves meilleurs ?
 
Ca m'intéresse car en interne, faute de gouvernance on a mixte de SSIS, Talend (version free), et deux outils .NET qui sont des sur-couches au moteur SSIS. Suite au rachat d'une société on va hériter de leur Talend version Entreprise  
 
De mon point de vue Talend offre la meilleure versatilité, ergonomie/efficacité de dev, lisibilité. Le point noir est la performance à l'écriture dans nos bases SQL Server (en comparaison avec SSIS)
 
 

Rasthor a écrit :

Ouais, ca depend de la taille du dataset bien sur. :jap:
 
Pandas a l'avantage de l'integration dans Python, donc accessible a toutes les transformations possibles et imaginables. (SQL aussi bien sur, meme si les requêtes sont plus complexe). C'est pas le meme usage je pense.


 
 
Sur le dataprocessing, je ne vois pas la +value de faire du code (python ou autre langage) alors que cela fait des années que le problème a été "résolu" par l'industrie par la mise au point d'outils ETL dont la vocation est précisemment d'optimiser/faciliter/accélérer ce type de travaux, compatibles avec tous types de format, prise en main très rapide, etc
 
De fait l'intégration avec Python peut tout simplement passer par une couche de donnée persistée (base SQL ou graph ou autre) pour laquelle python dispose  
 
D'un point de vue architecture cela fait aussi plus de sens de séparer les enjeux de la préparation et de l'application des algo et que l'ensemble soit maintenable par + qu'une seule personne
 
 
Pour le quote : pourquoi les transformations seraient plus complexes en SQL ?


---------------
NOUVEAU! à vendre : Rolleiflex SL66
n°32912
chocolathe
Posté le 01-12-2019 à 12:37:59  profilanswer
 

Kayou a écrit :

Oui c'est certain.
Et puis je pense aussi que "ça fait mieux" de dire que tu es DS que développeur SQL :o
 
Même si je pense qu'au final on a perdu en compétences avec cette mode des data car tout le monde recherche des "data xx" sans vraiment savoir ce dont ils ont besoin, ce qu'ils vont faire et si c'est vraiment adapté à leurs besoins.
 
La BI, les tableurs Excel sont encore la meilleure réponse à bon nombres de cas d'usage mais c'est moins à la mode


je plussoie :)


---------------
NOUVEAU! à vendre : Rolleiflex SL66
n°32913
giorno_gio​75
Posté le 01-12-2019 à 15:06:02  profilanswer
 

chocolathe a écrit :

Hello
 
Je suis ponctuellement le topic ; ça parle un peu trop de salaire de jeune dip et pas assez de ML&DS à mon gout par contre :o
 
Un peu de contexte pour introduire mes réactions aux posts précédents
 
Je travaille dans une boite qui a ouvert un département Innovation en parallèle de l'IT classique.  
Je suis côté IT, manager de plusieurs équipes (compétences mixtes: orga/process, moa, moe), je me retrouve donc confronté à
1/ le fait que ce sujet soit pris en chare par eux et pas par moi  [:jabbernaute]  
2/ pris en care par des profils qui ont une expérience limitée et ne se projettent pas dans le futur mode RUN/maintenance qui les concernera ; ils essaient de livrer tout azimuths
3/ pas de vision archi ; ils font des trucs dans leurs coin mal intérés avec  
 
Dans ce contexte je remarque beaucoup de "repackaging" de concepts classiques (datawarehouse>datalake ; bi>analytics; ETL>panda,frame & co) pour vendre des suites d'outils dont beaucoup des fonctions s'avèrent en doublon avec des solutions existantes, mais dénigrés car libellées "IT" traditionnelle
 
Et parallèlement on s'adresse à une population différente de profils, qui fait de l'IT sans le savoir ( [:maestro] ) et qui représente donc l'opportunité de leur vendre ces concepts repackagés pour banker $$$
 


 

chocolathe a écrit :


 
Je m'étonne d'un avis si tranché
Qu'est-ce qui t'amène à cette conclusion ? Pour quel besoin ? Sur quels aspect ?  
On peut supposer de ton commentaire qu'il y a un ou plusieurs autres outils payant que tu trouves meilleurs ?
 
Ca m'intéresse car en interne, faute de gouvernance on a mixte de SSIS, Talend (version free), et deux outils .NET qui sont des sur-couches au moteur SSIS. Suite au rachat d'une société on va hériter de leur Talend version Entreprise  
 
De mon point de vue Talend offre la meilleure versatilité, ergonomie/efficacité de dev, lisibilité. Le point noir est la performance à l'écriture dans nos bases SQL Server (en comparaison avec SSIS)
 
 


 

chocolathe a écrit :


 
 
Sur le dataprocessing, je ne vois pas la +value de faire du code (python ou autre langage) alors que cela fait des années que le problème a été "résolu" par l'industrie par la mise au point d'outils ETL dont la vocation est précisemment d'optimiser/faciliter/accélérer ce type de travaux, compatibles avec tous types de format, prise en main très rapide, etc
 
De fait l'intégration avec Python peut tout simplement passer par une couche de donnée persistée (base SQL ou graph ou autre) pour laquelle python dispose  
 
D'un point de vue architecture cela fait aussi plus de sens de séparer les enjeux de la préparation et de l'application des algo et que l'ensemble soit maintenable par + qu'une seule personne
 
 
Pour le quote : pourquoi les transformations seraient plus complexes en SQL ?


 
Tu parles de quel type de transformation ? Le SQL a ses limites quand même...

n°32914
o_BlastaaM​oof_o
Posté le 01-12-2019 à 19:57:04  profilanswer
 

chocolathe a écrit :

Hello
 
Je suis ponctuellement le topic ; ça parle un peu trop de salaire de jeune dip et pas assez de ML&DS à mon gout par contre :o
 
Un peu de contexte pour introduire mes réactions aux posts précédents
 
Je travaille dans une boite qui a ouvert un département Innovation en parallèle de l'IT classique.  
Je suis côté IT, manager de plusieurs équipes (compétences mixtes: orga/process, moa, moe), je me retrouve donc confronté à
1/ le fait que ce sujet soit pris en chare par eux et pas par moi  [:jabbernaute]  
2/ pris en care par des profils qui ont une expérience limitée et ne se projettent pas dans le futur mode RUN/maintenance qui les concernera ; ils essaient de livrer tout azimuths
3/ pas de vision archi ; ils font des trucs dans leurs coin mal intérés avec  
 
Dans ce contexte je remarque beaucoup de "repackaging" de concepts classiques (datawarehouse>datalake ; bi>analytics; ETL>panda,frame & co) pour vendre des suites d'outils dont beaucoup des fonctions s'avèrent en doublon avec des solutions existantes, mais dénigrés car libellées "IT" traditionnelle
 
Et parallèlement on s'adresse à une population différente de profils, qui fait de l'IT sans le savoir ( [:maestro] ) et qui représente donc l'opportunité de leur vendre ces concepts repackagés pour banker $$$
 


Ah ben tiens donc, j'ai l'impression de revoir ce que j'ai vécu :o

chocolathe a écrit :


 
Je m'étonne d'un avis si tranché
Qu'est-ce qui t'amène à cette conclusion ? Pour quel besoin ? Sur quels aspect ?  
On peut supposer de ton commentaire qu'il y a un ou plusieurs autres outils payant que tu trouves meilleurs ?
 
Ca m'intéresse car en interne, faute de gouvernance on a mixte de SSIS, Talend (version free), et deux outils .NET qui sont des sur-couches au moteur SSIS. Suite au rachat d'une société on va hériter de leur Talend version Entreprise  
 
De mon point de vue Talend offre la meilleure versatilité, ergonomie/efficacité de dev, lisibilité. Le point noir est la performance à l'écriture dans nos bases SQL Server (en comparaison avec SSIS)
 
 


Je trouve justement Talend très peu ergonomique et la productivité des consultants que j'ai vu travailler avec cet outil semble me donner raison :o
Ceci étant dit, je ne te cacherai pas que je travaille pour un éditeur dont Talend est un concurrent sur le volet ETL, j'ai donc une opinion un peu biaisée... Je trouve néanmoins que notre outil, bien qu'un peu old school, est bien plus ergonomique que Talend. Et je ne parle même pas des performances...  
 
Talend devient aussi extrêmement cher dès qu'on doit utiliser la version payante à grande échelle.

chocolathe a écrit :


Sur le dataprocessing, je ne vois pas la +value de faire du code (python ou autre langage) alors que cela fait des années que le problème a été "résolu" par l'industrie par la mise au point d'outils ETL dont la vocation est précisemment d'optimiser/faciliter/accélérer ce type de travaux, compatibles avec tous types de format, prise en main très rapide, etc
 
De fait l'intégration avec Python peut tout simplement passer par une couche de donnée persistée (base SQL ou graph ou autre) pour laquelle python dispose  
 
D'un point de vue architecture cela fait aussi plus de sens de séparer les enjeux de la préparation et de l'application des algo et que l'ensemble soit maintenable par + qu'une seule personne
 
 
Pour le quote : pourquoi les transformations seraient plus complexes en SQL ?


Tout à fait d'accord là-dessus, Python pour du "data engineering", c'est une connerie sans nom. C'est lent, l'architecture laisse à désirer (y a pas d'architecture en fait) et il n'y a aucune gestion des méta-données. Python doit son succès au fait qu'il donne accès "gratuitement" et de manière plus ou moins facilitée à des fonctions qui s'apparentent à de l'ETL à une population vaste mais au final, le résultat est souvent peu convaincant.

n°32915
Jadha
Next one's coming faster
Posté le 01-12-2019 à 21:31:53  profilanswer
 


o_BlastaaMoof_o a écrit :


Tout à fait d'accord là-dessus, Python pour du "data engineering", c'est une connerie sans nom. C'est lent, l'architecture laisse à désirer (y a pas d'architecture en fait) et il n'y a aucune gestion des méta-données. Python doit son succès au fait qu'il donne accès "gratuitement" et de manière plus ou moins facilitée à des fonctions qui s'apparentent à de l'ETL à une population vaste mais au final, le résultat est souvent peu convaincant.

 

Tu verrais quoi comme solution valable pour faire de l'etl à grande échelle ?

n°32916
o_BlastaaM​oof_o
Posté le 02-12-2019 à 20:24:19  profilanswer
 

Jadha a écrit :


 
Tu verrais quoi comme solution valable pour faire de l'etl à grande échelle ?


Il y a à mon sens :
- Talend
- Informatica ETL
- IBM InfoSphere DataStage
- et la plateforme développée par l'éditeur pour qui je travaille (que je ne citerai pas ici) qui est évidemment la meilleure des 4 :o
 
MP si tu veux des détails :jap:

n°32917
chocolathe
Posté le 03-12-2019 à 00:18:44  profilanswer
 

giorno_gio75 a écrit :


 
 
 
 
 
Tu parles de quel type de transformation ? Le SQL a ses limites quand même...


les classiques: transco, filtre ligne, filtre colonne, mapping 1-1, 1-n, calculs, aggrégation (fonctions à fenêtre :love: )
 
par contre pour manipuler des matrices mathématiques, là je dis pas [:elessar53]  
 

o_BlastaaMoof_o a écrit :


Ah ben tiens donc, j'ai l'impression de revoir ce que j'ai vécu :o


je suis sûr que ça arrive partout  [:yiipaa:4]  
 
alors qu'ils suffisait d'augmenter le budget de l'IT pour une solution innovante et pérenne :o
 

o_BlastaaMoof_o a écrit :


Je trouve justement Talend très peu ergonomique et la productivité des consultants que j'ai vu travailler avec cet outil semble me donner raison :o
Ceci étant dit, je ne te cacherai pas que je travaille pour un éditeur dont Talend est un concurrent sur le volet ETL, j'ai donc une opinion un peu biaisée... Je trouve néanmoins que notre outil, bien qu'un peu old school, est bien plus ergonomique que Talend. Et je ne parle même pas des performances...  


ils étaient tout simplement pas bon :o
balance le nom de ta boite en MP  [:shimay]  
 

o_BlastaaMoof_o a écrit :


Talend devient aussi extrêmement cher dès qu'on doit utiliser la version payante à grande échelle.


quel ordre de grandeur pour quel dimensionnement ?
 

o_BlastaaMoof_o a écrit :


Tout à fait d'accord là-dessus, Python pour du "data engineering", c'est une connerie sans nom. C'est lent, l'architecture laisse à désirer (y a pas d'architecture en fait) et il n'y a aucune gestion des méta-données. Python doit son succès au fait qu'il donne accès "gratuitement" et de manière plus ou moins facilitée à des fonctions qui s'apparentent à de l'ETL à une population vaste mais au final, le résultat est souvent peu convaincant.


 [:shimay:1]


---------------
NOUVEAU! à vendre : Rolleiflex SL66
n°32918
chocolathe
Posté le 03-12-2019 à 00:23:39  profilanswer
 

Sinon pour du ML facile à prendre en main, avec une démarche pédagogique, KNIME Analytics (https://www.knime.com/knime-analytics-platform) est bien pensé je trouve
 
L'approche éditeur ETL graphique a tout son sens, parfait pour éduquer sur la conception/archi d'un traitement
 
(sans considération de perfs ou autre enjeux de la "vraie vie", je n'ai pas encore eu l'occasion de tester)
 
 
 
Pour les puristes parmi vous, est-ce qu'assembler des briques restent de la data science à vos yeux ? [:maestro]


---------------
NOUVEAU! à vendre : Rolleiflex SL66
n°32919
Profil sup​primé
Posté le 03-12-2019 à 00:41:54  answer
 

Putain de toute les platforme Deep qu'on a testé j'ai rien vue de mature perso :o

n°32920
Kayou
Posté le 03-12-2019 à 07:06:29  profilanswer
 

o_BlastaaMoof_o a écrit :


Il y a à mon sens :
- Talend
- Informatica ETL
- IBM InfoSphere DataStage
- et la plateforme développée par l'éditeur pour qui je travaille (que je ne citerai pas ici) qui est évidemment la meilleure des 4 :o

 

MP si tu veux des détails :jap:


Dataiku ?

n°32921
o_BlastaaM​oof_o
Posté le 03-12-2019 à 09:46:12  profilanswer
 

chocolathe a écrit :


quel ordre de grandeur pour quel dimensionnement ?


A ma connaissance, il faut compter 10 k€ par an et par développeur.
 
C'est un point sur lequel Talend se différencie des autres éditeurs. Talend ne licencie que l'environnement de développement et non celui d'exécution (forcément puisque Talend génère du code Java ou Spark) alors que les autres éditeurs licencient la puissance de l'environnement d'exécution (les outils de développement aussi mais dans une bien moindre mesure).
 
En fonction de la cible (sizing et nombre de développeurs), l'une des deux approches peut s'avérer complètement déraisonnable sur le plan financier.
 
Pour info, dans de grosses organisations, les développeurs ETL se comptent par milliers.

n°32922
o_BlastaaM​oof_o
Posté le 03-12-2019 à 09:52:30  profilanswer
 

Kayou a écrit :


Dataiku ?


Non, Dataiku n'est pas un ETL. Dataiku, à l'instar d'outils tels que Alteryx ou KNIME, est un outil de préparation de données. C'est adapté à des populations métiers d'analystes ou de data scientists qui exécutent des traitements de préparation de données de petite envergure pour répondre à leurs besoins propres à l'extrémité du pipeline de transformation.
 
En matière de pur ETL, Dataiku est catastrophique. C'est extrêmement lent et la méta-donnée est traitée par-dessus la jambe, quand elle n'est pas détruite (!).

n°32923
o_BlastaaM​oof_o
Posté le 03-12-2019 à 10:05:18  profilanswer
 


MATLAB :o :D

n°32924
o_BlastaaM​oof_o
Posté le 03-12-2019 à 19:08:54  profilanswer
 

Y a des gens qui font l'Advent of Code cette année ?
https://adventofcode.com/

 

Je serais curieux de voir si c'est à la portée d'un data scientist :o


Message édité par o_BlastaaMoof_o le 03-12-2019 à 19:09:16
n°32925
Profil sup​primé
Posté le 03-12-2019 à 19:18:35  answer
 


Eu.... Encore une fois personne ne fais de deep learning avec matlab

n°32926
o_BlastaaM​oof_o
Posté le 03-12-2019 à 19:24:29  profilanswer
 


Encore une fois, tu te trompes lourdement.
 
Il y a peu de gens qui entraînent des réseaux sous MATLAB, là-dessus je suis d'accord. Mais MATLAB a depuis belle lurette un support étendu du standard ONNX et peut donc importer la plupart des modèles créés via d'autres frameworks. Après, j'ignore quel est le domaine d'activité de ta boîte. Dans l'industrie, là où les modèles de DL doivent faire de l'inférence sur de l'embarqué, MATLAB est utilisé massivement. En revanche, si le but est de faire du NLP sur une instance AWS pour faire un chatbot, là oui OK, c'est pas l'outil que tu rencontreras le plus souvent.

n°32927
ptimeno
Posté le 03-12-2019 à 20:42:15  profilanswer
 

J'ai une question de gros noob qui galère.
Je bidouille Skorch, je cherche à trouver les images sur lesquelles il y a des avions.
 
J'ai entraîné un réseau de neurones sur un train dataset de (45000,64,64,3), je l'ai testé sur un test dataset de (15000,64,64,3) et j'aimerais maintenant le tester sur un dataset de (30,512,512,3).
 
Du coup j'ai chopé une fonction sliding_window avec laquelle je divise une image en mini-images de 64*64, mais je n'arrive pas à trouver le moyen d'appliquer la méthode model.predict sur ce nouveau set de 30 images chacune divisée en 64 images.
J'ai l'impression que c'est très con mais je bug complètement
 
Le code de sliding_window :

Code :
  1. def sliding_window(image, stepSize, windowSize):
  2. # slide a window across the image
  3. for y in range(0, image.shape[0], stepSize):
  4.  for x in range(0, image.shape[1], stepSize):
  5.   # yield the current window
  6.   yield (x, y, image[y:y + windowSize[1], x:x + windowSize[0]])


 
Le code avec lequel j'affiche l'image divisée en 64 images :

Code :
  1. example_img = eval_tiles[0]
  2. n = 64
  3. grid_size = int(512/n)
  4. grid = np.zeros((grid_size * n, grid_size * n, 3)).astype(np.uint8)
  5. for img in sliding_window(example_img,n,[n,n])
  6.         tile = np.copy(img[2])
  7.         color = (255, 255, 255)
  8.         tile = cv2.rectangle(tile, (0, 0), (n, n), color, thickness=1)
  9.         grid[img[1]:img[1]+n,img[0]:img[0]+n,:] = tile
  10. fig = plt.figure(figsize=(15, 15))
  11. ax = fig.add_subplot(1, 1, 1)
  12. ax.imshow(grid)
  13. plt.show()


 
J'ai pensé à appliquer model.predict à chaque image de 64 dans ma boucle for mais la méthode attend un argument de taille (size_set,64,64,3) et pas seulement une image de taille (64,64,3)

n°32928
-Meringue-
Posté le 03-12-2019 à 22:32:33  profilanswer
 

Question con:
T’as testé avec (1, 64, 64, 3)?  :o

n°32929
Profil sup​primé
Posté le 04-12-2019 à 10:28:58  answer
 

o_BlastaaMoof_o a écrit :


Encore une fois, tu te trompes lourdement.

 

Il y a peu de gens qui entraînent des réseaux sous MATLAB, là-dessus je suis d'accord. Mais MATLAB a depuis belle lurette un support étendu du standard ONNX et peut donc importer la plupart des modèles créés via d'autres frameworks. Après, j'ignore quel est le domaine d'activité de ta boîte. Dans l'industrie, là où les modèles de DL doivent faire de l'inférence sur de l'embarqué, MATLAB est utilisé massivement. En revanche, si le but est de faire du NLP sur une instance AWS pour faire un chatbot, là oui OK, c'est pas l'outil que tu rencontreras le plus souvent.


Ok pour l'inférence je savais pas :o
Mais bon du coup si tu train pas de modèles c'c'est pas très marrant :o

n°32930
ptimeno
Posté le 04-12-2019 à 10:33:22  profilanswer
 

-Meringue- a écrit :

Question con:
T’as testé avec (1, 64, 64, 3)?  :o


 
Merde, question con. Et c'est ainsi qu'il découvra np.exapnd_dims
Merci !

n°32931
o_BlastaaM​oof_o
Posté le 04-12-2019 à 10:44:24  profilanswer
 


Tu peux aussi entraîner des modèles, c'est juste que MATLAB n'est effectivement pas la plateforme la plus utilisée pour ça (encore qu'elle semble avoir refait son retard en termes de fonctionnalités par rapport aux frameworks concurrents, d'après ce que j'ai lu récemment).
 
Et puis au fond, l'entraînement c'est cool mais c'est a priori quelque chose de ponctuel. Le volet inférence est plus sexy, c'est là qu'arrivent tous les problèmes d'industrialisation et de mise en conditions opérationnelles.

n°32932
solal94
Ars longa, vita brevis
Posté le 04-12-2019 à 14:52:43  profilanswer
 

Hello les copains.
 
Ca vous parle, une méthode qui consiste à ajouter des neurones dans un ANN, en cours d'apprentissage ?
 
Je cite :  
"The idea is that when you are stuck at a local minimum, you add a small bubble of additional neurons to the network, keeping the benefit of the calibration and relaunching the optimization hoping that the additional freedom brought by the bubble will change the gradient structure enough. The structure of the bubble can be analyzed in term of a resolution spectrum. It is therefore a good idea take profit of the past results of the bubble additions to orient the bubble generation. It is also a good idea to start with a small initial network to profit of the bubble mechanism"


Message édité par solal94 le 04-12-2019 à 14:54:19
n°32933
Rontgen
Posté le 04-12-2019 à 18:13:08  profilanswer
 

Tiens, ca parlait justement de Dataiku ici il y a quelques posts :o
https://www.lemonde.fr/economie/art [...] _3234.html

n°32934
Fido_
Posté le 04-12-2019 à 19:33:07  profilanswer
 

solal94 a écrit :

Hello les copains.
 
Ca vous parle, une méthode qui consiste à ajouter des neurones dans un ANN, en cours d'apprentissage ?
 
Je cite :  
"The idea is that when you are stuck at a local minimum, you add a small bubble of additional neurons to the network, keeping the benefit of the calibration and relaunching the optimization hoping that the additional freedom brought by the bubble will change the gradient structure enough. The structure of the bubble can be analyzed in term of a resolution spectrum. It is therefore a good idea take profit of the past results of the bubble additions to orient the bubble generation. It is also a good idea to start with a small initial network to profit of the bubble mechanism"


 
 
Pas exactement mais dans le même esprit: Progressive Growing of GANs for Improved Quality, Stability, and Variation https://arxiv.org/abs/1710.10196
https://adriancolyer.files.wordpress.com/2018/05/progressive-gans-fig-1.jpeg?w=640&zoom=1

n°32935
giorno_gio​75
Posté le 04-12-2019 à 19:35:47  profilanswer
 

Rontgen a écrit :

Tiens, ca parlait justement de Dataiku ici il y a quelques posts :o
https://www.lemonde.fr/economie/art [...] _3234.html


 
C'est mérité :o
 
J'ai pu la tester pour un projet et je trouve ça vraiment bien foutu.
 
Outre l'interface léchée, les outils mise à disposition notamment pour le data management est juste un bonheur.
 
Le seul hic c'est que je trouve ça plutôt lent dans l'éxécution et y'a quelques trucs qui sont quand meme très très énervants ... comme le fait que la construction des flux est trop rigide et puis la récursivité des actions très relou.

n°32936
o_BlastaaM​oof_o
Posté le 05-12-2019 à 09:48:23  profilanswer
 

giorno_gio75 a écrit :


 
C'est mérité :o
 
J'ai pu la tester pour un projet et je trouve ça vraiment bien foutu.
 
Outre l'interface léchée, les outils mise à disposition notamment pour le data management est juste un bonheur.
 
Le seul hic c'est que je trouve ça plutôt lent dans l'éxécution et y'a quelques trucs qui sont quand meme très très énervants ... comme le fait que la construction des flux est trop rigide et puis la récursivité des actions très relou.


Je serais un peu plus mesuré. Je suis d'accord sur l'interface, très bien fichue avec notamment beaucoup de possibilités en termes de visualisation.
 
En pratique cependant, j'ai fait le constat suivant.

  • Les data scientists se lassent rapidement du côté clicodrome de l'outil et veulent revenir à du code, a fortiori s'ils ont rencontré une limitation de l'interface.
  • Les analystes ou les utilisateurs métiers ne sont quant à eux jamais parvenus à s'approprier l'outil, trop complexe pour eux.


Je pondère ce constat par le fait que j'ai travaillé avec des équipes de bras cassés, ceci explique sans doute cela.
 
Au niveau du moteur d'exécution, je suis d'accord avec toi également, il y a de grosses lacunes et les performances s'en ressentent nettement. La solution a peut-être progressé depuis que je l'ai utilisée ceci dit.

n°32937
giorno_gio​75
Posté le 05-12-2019 à 19:58:11  profilanswer
 

o_BlastaaMoof_o a écrit :


Je serais un peu plus mesuré. Je suis d'accord sur l'interface, très bien fichue avec notamment beaucoup de possibilités en termes de visualisation.
 
En pratique cependant, j'ai fait le constat suivant.

  • Les data scientists se lassent rapidement du côté clicodrome de l'outil et veulent revenir à du code, a fortiori s'ils ont rencontré une limitation de l'interface.
  • Les analystes ou les utilisateurs métiers ne sont quant à eux jamais parvenus à s'approprier l'outil, trop complexe pour eux.


Je pondère ce constat par le fait que j'ai travaillé avec des équipes de bras cassés, ceci explique sans doute cela.
 
Au niveau du moteur d'exécution, je suis d'accord avec toi également, il y a de grosses lacunes et les performances s'en ressentent nettement. La solution a peut-être progressé depuis que je l'ai utilisée ceci dit.


 
Bah tu peux coder en Python et en R sous Dataiku sans problème, c'est ça que j'aime, c'est les solutions hybrides qui offrent le meilleur des 2 mondes, pouvoir gérer le data management en clic bouton ou faire l'exploration des data visuellement tout en pouvant basculer sur du code pour des opérations plus complexes.
 
Après oui ça demande un certain niveau d'expertise pour être pris en main, ça fait très usine à gaz par moment mais l'idée d'avoir tout un pipe de l'import des data jusqu'à la restitution de celles-ci sous dashboard, c'est parfait :o
 
D'ailleurs tout l'aspect machine learning est vraiment incroyablement bien foutu.
 
Le dernier défaut, c'est la fin de chaîne où le dashboard est plutôt limité et fait vraiment ajouté de dernière minute mais dès qu'ils auront corrigé ça, ça en fera vraiment une solution puissante.
 
J'ai pu benchmarker IBM Watson qui est pas mal aussi et SAS Viya qui est un produit de luxe bien foutu mais les dashboard sont puants.

n°32938
Rontgen
Posté le 05-12-2019 à 20:37:10  profilanswer
 

Par curiosité, ça vaut combien environ (ordre de grandeur) une licence d'un logiciel comme ça?

n°32939
o_BlastaaM​oof_o
Posté le 06-12-2019 à 01:12:32  profilanswer
 

giorno_gio75 a écrit :


 
Bah tu peux coder en Python et en R sous Dataiku sans problème, c'est ça que j'aime, c'est les solutions hybrides qui offrent le meilleur des 2 mondes, pouvoir gérer le data management en clic bouton ou faire l'exploration des data visuellement tout en pouvant basculer sur du code pour des opérations plus complexes.
 
Après oui ça demande un certain niveau d'expertise pour être pris en main, ça fait très usine à gaz par moment mais l'idée d'avoir tout un pipe de l'import des data jusqu'à la restitution de celles-ci sous dashboard, c'est parfait :o
 
D'ailleurs tout l'aspect machine learning est vraiment incroyablement bien foutu.
 
Le dernier défaut, c'est la fin de chaîne où le dashboard est plutôt limité et fait vraiment ajouté de dernière minute mais dès qu'ils auront corrigé ça, ça en fera vraiment une solution puissante.
 
J'ai pu benchmarker IBM Watson qui est pas mal aussi et SAS Viya qui est un produit de luxe bien foutu mais les dashboard sont puants.


Sur le volet ML, c’est très bien mais je garde une petite préférence pour H2O.

Rontgen a écrit :

Par curiosité, ça vaut combien environ (ordre de grandeur) une licence d'un logiciel comme ça?


Dataiku, c’est 80k par an pour le serveur + 3k par an et par utilisateur profil data scientist de mémoire.
En prix liste, après ça se négocie...

n°32940
Rick_C137
Posté le 06-12-2019 à 08:51:59  profilanswer
 

o_BlastaaMoof_o a écrit :


Dataiku, c’est 80k par an pour le serveur + 3k par an et par utilisateur profil data scientist de mémoire.
En prix liste, après ça se négocie...


 
Ah ouais quand même, si t'as pas une très grosse équipe data-science ca fait super cher non ?  
 
C'est bizarre car j'aurai plutot tendance à penser que ce genre d'outils serviraient surtout aux petites équipes qui ont pas les ressources ou compétences ou développer leurs outils in-house ?

n°32941
Profil sup​primé
Posté le 06-12-2019 à 09:07:22  answer
 

Rick_C137 a écrit :

 

Ah ouais quand même, si t'as pas une très grosse équipe data-science ca fait super cher non ?

 

C'est bizarre car j'aurai plutot tendance à penser que ce genre d'outils serviraient surtout aux petites équipes qui ont pas les ressources ou compétences ou développer leurs outils in-house ?


C'est un outil grosse boite. Ca reste en plus pour faire des trucs simple (données tabulée et co...).

n°32942
o_BlastaaM​oof_o
Posté le 06-12-2019 à 09:22:26  profilanswer
 

Rick_C137 a écrit :


 
Ah ouais quand même, si t'as pas une très grosse équipe data-science ca fait super cher non ?  
 
C'est bizarre car j'aurai plutot tendance à penser que ce genre d'outils serviraient surtout aux petites équipes qui ont pas les ressources ou compétences ou développer leurs outils in-house ?


Tout est relatif... C'est pas donné mais c'est dans les mêmes ordres de grandeur que les concurrents.
 
D'un autre côté, si une boîte est capable de claquer 200 à 300k par an pour quelques data scientists (salaires + charges) mais se refuse à investir une fraction de ce montant pour outiller l'équipe, il y a comme un problème à mon sens.
 
Sinon, si tu veux un outil professionnel, supporté et pas cher, MATLAB c'est 2500 balles par an et par tête de pipe + 5000 balles par an pour les outils de compilation :o
 
Faut pas exagérer non plus, on peut faire des choses relativement complexes avec Dataiku...
 
Et perso, je n'ai jamais vu le moindre exemple de donnée non tabulée dans toutes les boîtes avec lesquelles j'ai travaillé :spamafote:

n°32943
Profil sup​primé
Posté le 06-12-2019 à 09:36:00  answer
 

o_BlastaaMoof_o a écrit :


Faut pas exagérer non plus, on peut faire des choses relativement complexes avec Dataiku...

 

Et perso, je n'ai jamais vu le moindre exemple de donnée non tabulée dans toutes les boîtes avec lesquelles j'ai travaillé :spamafote:


Déjà simplement les images

n°32944
o_BlastaaM​oof_o
Posté le 06-12-2019 à 10:00:03  profilanswer
 


Typiquement l'exemple que j'attendais :D
 
Les images dont on extrait généralement... des features, qui sont au format tabulaire, badaboum.

n°32945
Profil sup​primé
Posté le 06-12-2019 à 10:05:57  answer
 

o_BlastaaMoof_o a écrit :


Typiquement l'exemple que j'attendais :D

 

Les images dont on extrait généralement... des features, qui sont au format tabulaire, badaboum.


Et t'extrais comment tous ca :D
Nous on passe images puis sur des données vecteur (format géographique) puis donné tabulaire. Le truc complexe c'est de passer sur image => vecteur. Detecter des objets, des contextes etc... C'est là où on fait de l'ia. Après c'est des plots


Message édité par Profil supprimé le 06-12-2019 à 10:06:42
 Page :   1  2  3  4  5  ..  73  74  75  ..  133  134  135  136  137  138

Aller à :
Ajouter une réponse
 

Sujets relatifs
[Topic unique] Veille IA - Actu, lectures, podcasts & documentaires[Topic Unique] Claude by Anthropic
[Topic unique] IA générative de texte, ChatGPT, Copilot, Gemini & co 
Plus de sujets relatifs à : [Topic Unique] Machine Learning & Data Science


Copyright © 1997-2025 Groupe LDLC (Signaler un contenu illicite / Données personnelles)