Forum |  HardWare.fr | News | Articles | PC | S'identifier | S'inscrire | Shop Recherche
5531 connectés 

 

Sujet(s) à lire :
    - Who's who@Programmation
 

 Mot :   Pseudo :  
  Aller à la page :
 
 Page :   1  2  3  4  5  ..  27330  27331  27332  ..  27367  27368  27369  27370  27371  27372
Auteur Sujet :

[blabla@olympe] Le topic du modo, dieu de la fibre et du monde

n°2541646
Hephaestos
Sanctis Recorda, Sanctis deus.
Posté le 03-09-2026 à 21:26:14  profilanswer
 

Reprise du message précédent :

Hermes le Messager a écrit :

 

Je suis pas convaincu que ce soit à cause d'un procès potentiellement perdu ou gagné. Je pense que c'est une question d'image pour Amnesty.


Tu veux dire qu'ils ont plus eu peur de la campagne de denigrement que la milliardaire allait leur imposer, que du procès ? Peut être, mais j'avoue que je ne vois pas trop ce que ça change sur le fond. C'est le fait que Alt ait parlé de procédure bâillon alors qu'en fait pas tout à fait (ou pas seulement) ?


Message édité par Hephaestos le 04-09-2026 à 08:10:51
mood
Publicité
Posté le 03-09-2026 à 21:26:14  profilanswer
 

n°2541647
el muchach​o
Comfortably Numb
Posté le 03-09-2026 à 21:34:50  profilanswer
 
n°2541648
sligor
Posté le 03-09-2026 à 21:43:20  profilanswer
 

el muchacho a écrit :

ça, c'est le repo le plus étoilé de tout Github.
 
Je n'ai pas vraiment compris ce que c'est sensé faire, mais j'ai l'impression que c'est un ensemble de consignes et instructions à passer à votre IA préférée pour qu'elle agisse comme un ingénieur et non pas un total idiot. Donc pour qu'elle fasse votre travail à votre place (et vous remplace).
Chaque type de tâche identifié est appelé un skill. Par exemple, ceci est le skill resolving-merge-conflicts. Les skills peuvent dépendre d'autres skills.
 
J'ai pas essayé (j'ai pas d'environnement de dev à la Codex, peut-être qu'il faudrait que je m'y mette), mais si ça vous tente, je serais ravi d'avoir votre retour. Jubijub, par exemple ?


 [:sirius gott:10]


---------------
qwerty-fr
n°2541649
rufo
Pas me confondre avec Lycos!
Posté le 03-09-2026 à 21:46:22  profilanswer
 

Flaie a écrit :


si tu n'as plus de batterie tu fais comment?


En général, vers les 15% de batterie, tu commences à regarder sérieusement où tu pourrais aller te charger en préparant un plan B et un plan C au cas où le plan A foirerait (bornes HS, trop d'attente...) de manière à justement pas te retrouver coincé  :ange:


---------------
Astres, outil de help-desk GPL : http://sourceforge.net/projects/astres, ICARE, gestion de conf : http://sourceforge.net/projects/icare, Outil Planeta Calandreta : https://framalibre.org/content/planeta-calandreta
n°2541650
Dion
Acceuil
Posté le 03-09-2026 à 21:51:40  profilanswer
 

rufo a écrit :


En général, vers les 15% de batterie, tu commences à regarder sérieusement où tu pourrais aller te charger en préparant un plan B et un plan C au cas où le plan A foirerait (bornes HS, trop d'attente...) de manière à justement pas te retrouver coincé  :ange:


Merci sekyo, cela semble être une bonne astuce en effet


---------------
It is not called show art
n°2541651
Kenshineuh
Posté le 03-09-2026 à 21:52:52  profilanswer
 

Y'a un manuel qui décrit ce genre de procédure ?

n°2541652
Hephaestos
Sanctis Recorda, Sanctis deus.
Posté le 03-09-2026 à 21:54:40  profilanswer
 

el muchacho a écrit :

ça, c'est le repo le plus étoilé de tout Github.

 

Je n'ai pas vraiment compris ce que c'est sensé faire, mais j'ai l'impression que c'est un ensemble de consignes et instructions à passer à votre IA préférée pour qu'elle agisse comme un ingénieur et non pas un total idiot. Donc pour qu'elle fasse votre travail à votre place (et vous remplace).
Chaque type de tâche identifié est appelé un skill. Par exemple, ceci est le skill resolving-merge-conflicts. Les skills peuvent dépendre d'autres skills.

 

J'ai pas essayé (j'ai pas d'environnement de dev à la Codex, peut-être qu'il faudrait que je m'y mette), mais si ça vous tente, je serais ravi d'avoir votre retour. Jubijub, par exemple ?


Le truc le plus intéressant dans cette histoire c'est qu'il y a un an tout le monde disait que écrire et choisir des skills c'était le futur. Rapidement on s'est mis à faire générer des skills par l'IA. Et aujourd'hui on a rien besoin de connaître : le harnais a les skills importants, et un dictionnaire, et les agents vont chercher tout seuls ce dont ils ont besoin. Bref, tu as raison de t'y intéresser cette histoire d'IA c'est quand même prometteur, mais c'est pas bien grave d'avoir neuf mois de retard...


Message édité par Hephaestos le 03-09-2026 à 21:55:52
n°2541653
el muchach​o
Comfortably Numb
Posté le 03-09-2026 à 22:09:47  profilanswer
 

Ben en vrai j'ai jamais eu besoin de ces trucs parce que je code plus. Quand je code, c'est pour moi-même, je paye pas d'abonnement et j'utilise les IA une fois par semaine au max. Si je regarde, c'est uniquement pour éviter d'être complètement à la ramasse, mais sinon, je n'en ai aucune utilité.


---------------
Les aéroports où il fait bon attendre, voila un topic qu'il est bien
n°2541654
Jubijub
Parce que je le VD bien
Posté le 03-09-2026 à 22:46:29  profilanswer
 

el muchacho a écrit :

ça, c'est le repo le plus étoilé de tout Github.

 

Je n'ai pas vraiment compris ce que c'est sensé faire, mais j'ai l'impression que c'est un ensemble de consignes et instructions à passer à votre IA préférée pour qu'elle agisse comme un ingénieur et non pas un total idiot. Donc pour qu'elle fasse votre travail à votre place (et vous remplace).
Chaque type de tâche identifié est appelé un skill. Par exemple, ceci est le skill resolving-merge-conflicts. Les skills peuvent dépendre d'autres skills.

 

J'ai pas essayé (j'ai pas d'environnement de dev à la Codex, peut-être qu'il faudrait que je m'y mette), mais si ça vous tente, je serais ravi d'avoir votre retour. Jubijub, par exemple ?

 

much t'es le plus fort [:ddr555] :jap:

 

Réponse sérieuse, pas très éloignée de celle de Hepha : les skills tu peux voir ça comme une fonction globale, tu écris un prompt statique dans un markdown, et ce truc est chargé dans le contexte de l'agent (donc ne pas en abuser, ni écrire un truc de 3000 lignes). Ça marche très bien avec les outils en ligne de commande, tu peux lui passer la syntaxe des fonctions à appeler et pourquoi, et le modèle s'en sert (et c'est plus flexible qu'un MCP)
Là où c'est limité:
- le harnais des modèles s'améliore tout le temps, pour des trucs basiques genre gestion de git, tu peux te priver des derniers raffinements. Mais c'est utile si par ex tu as un script de review, ou si tu dois appeler des commandes de validation spéciales que tout le monde n'aurait pas, tu peux en faire un skill, et dire "and using my skill 'get-ready-for-review', prepare this PR"
- ces trucs sont rarement bien testés sur les nouvelles versions, donc tu sais jamais trop comment ça va se comporter si tu le retestes pas toi meme
- c'est un vecteur d'attaque si tu relis pas le skill avant de l'utiliser
- c'est un peu comme les plugins neovim : au debut tu penses qu'il t'en faut 150, et en fait tu tournes sur 3-4. Et ça pollue ton contexte, puisque les skills sont chargés dedans quoi qu'il arrive
- c'est pas déterministe, le modèle peut ignorer ton skill, ou ne l'appliquer qu'à moitié

 

je pense que tu devrais tester sérieusement quand meme : qu'importe ton provider, un VSCode, il y aura un plugin pour, et c'est parti. Au pire tu le mets juste dans ta CLI, et tu te sers de l'IDE comme d'un viewer pour les fichiers. En 2026 et vu ta ligne de travail, c'est pas superflu de comprendre comment ça marche.

Message cité 1 fois
Message édité par Jubijub le 03-09-2026 à 22:47:49

---------------
Jubi Photos : Flickr - 500px
n°2541656
el muchach​o
Comfortably Numb
Posté le 03-09-2026 à 23:08:11  profilanswer
 

:jap:  
 
Faudrait que je me fasse un petit projet. Je vais peut-être me faire une petite simulation de galaxies avec l'algo Fast Multipoles pour le fun.


---------------
Les aéroports où il fait bon attendre, voila un topic qu'il est bien
mood
Publicité
Posté le 03-09-2026 à 23:08:11  profilanswer
 

n°2541657
el muchach​o
Comfortably Numb
Posté le 04-09-2026 à 07:20:49  profilanswer
 

 

Je suis tombé dans un rabbit hole sur les algos de tri, et youtube a la bonne idée de me proposer cette vidéo qui est un tour de force: https://www.youtube.com/watch?v=h1Bi0granxM
Non seiulement le mec a codé  la majeure partie de 80 algos de tri (oui 80),  il les explique tous avec des mots et en profite pour introduire des concepts simples d'algorithmique comme la stabilité, justifie toutes les complexités et explique les relations entre les divers algorithmes et leur classification.

 

Le tri est un domaine d'étude algorithmique tout à fait passionnant car il y a semble-t'il une infinité de façons de faire cette opération. Ca laisse place à une grande inventivité.
Je recommande Patience sort à 35:56, c'est génial. Si à un entretien on te demande de décrire un algo de tri de ton choix, celui-la t'embauche direct. :D


Message édité par el muchacho le 04-09-2026 à 09:04:21

---------------
Les aéroports où il fait bon attendre, voila un topic qu'il est bien
n°2541658
Kenshineuh
Posté le 04-09-2026 à 08:56:03  profilanswer
 

Plus de 3 jours sans internet et toujours aucune nouvelle du support.  :sol:  
Pile quand je vois que Sosh propose une box 8Gb avec un port 10G mnt. :o

n°2541659
Hermes le ​Messager
Breton Quiétiste
Posté le 04-09-2026 à 09:42:47  profilanswer
 

Kenshineuh a écrit :

Plus de 3 jours sans internet et toujours aucune nouvelle du support.  :sol:  
Pile quand je vois que Sosh propose une box 8Gb avec un port 10G mnt. :o


 
Ah ouai  [:w3c compliant]


---------------
Expert en expertises
n°2541660
Ydalb
In Crêpes n' Cidre I Trust!
Posté le 04-09-2026 à 09:52:06  profilanswer
 

Kenshineuh a écrit :

Plus de 3 jours sans internet et toujours aucune nouvelle du support.  :sol:
Pile quand je vois que Sosh propose une box 8Gb avec un port 10G mnt. :o


Tu cherches un parrainage ?  [:hr:2]

 

Pas éligible au 8Gb Sosh ici, je vais me contenter de leur offre 2Gb/800Mb


Message édité par Ydalb le 04-09-2026 à 09:52:58

---------------
:o
n°2541661
Dion
Acceuil
Posté le 04-09-2026 à 09:54:34  profilanswer
 

Kenshineuh a écrit :

Plus de 3 jours sans internet et toujours aucune nouvelle du support.  :sol:  
Pile quand je vois que Sosh propose une box 8Gb avec un port 10G mnt. :o


Je l'ai, elle est bien mais c'est du sosh, tu ne la configures pas comme une freebox quoi :o  


---------------
It is not called show art
n°2541662
Kenshineuh
Posté le 04-09-2026 à 09:57:47  profilanswer
 

 

Oui..
Fallait se plaindre, j'ai enfin eu une réponse. Soucis dans le quartier au niveau de l'infra. Retour prévu aujourd'hui ou demain. J'y crois pas du tout. :o

 
Dion a écrit :


Je l'ai, elle est bien mais c'est du sosh, tu ne la configures pas comme une freebox quoi :o

 

Je me sers juste du VPN en vrai sur la freebox, que je peux mettre sur mon NAS. L'un dans l'autre, ça change pas grand chose.

 
Ydalb a écrit :


Tu cherches un parrainage ?  [:hr:2]

 

Non. :o


Message édité par Kenshineuh le 04-09-2026 à 09:59:40
n°2541663
Xavier_OM
Monarchiste régicide (fr quoi)
Posté le 04-09-2026 à 10:04:21  profilanswer
 

Jubijub a écrit :


 
much t'es le plus fort [:ddr555] :jap:
 
Réponse sérieuse, pas très éloignée de celle de Hepha : les skills tu peux voir ça comme une fonction globale, tu écris un prompt statique dans un markdown, et ce truc est chargé dans le contexte de l'agent (donc ne pas en abuser, ni écrire un truc de 3000 lignes). Ça marche très bien avec les outils en ligne de commande, tu peux lui passer la syntaxe des fonctions à appeler et pourquoi, et le modèle s'en sert (et c'est plus flexible qu'un MCP)
Là où c'est limité:
- le harnais des modèles s'améliore tout le temps, pour des trucs basiques genre gestion de git, tu peux te priver des derniers raffinements. Mais c'est utile si par ex tu as un script de review, ou si tu dois appeler des commandes de validation spéciales que tout le monde n'aurait pas, tu peux en faire un skill, et dire "and using my skill 'get-ready-for-review', prepare this PR"
- ces trucs sont rarement bien testés sur les nouvelles versions, donc tu sais jamais trop comment ça va se comporter si tu le retestes pas toi meme
- c'est un vecteur d'attaque si tu relis pas le skill avant de l'utiliser
- c'est un peu comme les plugins neovim : au debut tu penses qu'il t'en faut 150, et en fait tu tournes sur 3-4. Et ça pollue ton contexte, puisque les skills sont chargés dedans quoi qu'il arrive  
- c'est pas déterministe, le modèle peut ignorer ton skill, ou ne l'appliquer qu'à moitié
 
je pense que tu devrais tester sérieusement quand meme : qu'importe ton provider, un VSCode, il y aura un plugin pour, et c'est parti. Au pire tu le mets juste dans ta CLI, et tu te sers de l'IDE comme d'un viewer pour les fichiers. En 2026 et vu ta ligne de travail, c'est pas superflu de comprendre comment ça marche.


 
Pour l'instant j'ai pas encore cet usage, j'en suis resté à "je discute avec l'agent pour concevoir/coder/debugger" j'ai pas franchi le stade de la spirale automatique où le truc tourne en autonomie.


---------------
Éremburgis qui tint le Maine
n°2541664
Jubijub
Parce que je le VD bien
Posté le 04-09-2026 à 10:43:00  profilanswer
 

Xavier_OM a écrit :

 

Pour l'instant j'ai pas encore cet usage, j'en suis resté à "je discute avec l'agent pour concevoir/coder/debugger" j'ai pas franchi le stade de la spirale automatique où le truc tourne en autonomie.

 

mon usage évolue, c'est assez nouveau pour moi.

 

Avant je tournais en mode "ne fais rien sans mon accord", "soumet le code fonction par fonction pour que je le revois" ==> ça marche, ça permet de capter les conneries vites, mais c'est extrêmement fastidieux, et super consommateur en attention (tu passes ta vie à attendre des prompts, c'est super chiant. Et vu les temps d'inférence, tu te fais vite chier, donc tu fais autre chose, donc tu es interrompu tout le temps)

 

Récemment je suis passé en mode : voici le résultat attendu, voici comment tu peux le vérifier, tourne mon coco, fais ce que tu veux tant que tu fais pas des trucs stupides genre soumettre le code, YOLO, à tout à l'heure.
Dans ce modèle l'agent peut partir en couille très fort et faire n'imp, mais en general quand je reviens de 2-3 meeting j'ai un truc à reviewer. Et vu la taille de notre merdier, les requêtes prennent toute la vie, donc ça se passe pendant que je suis en meeting, je m'en fou. Ce modèle me correspond très bien au boulot.
Revers : une fois que t'as un truc qui tourne, ça fait 5k lignes de code, donc faut le découper, voir tous les petits raccourcis que le modèle a pris et les fixer un par un (j'ai passé les 3 derniers jours à faire ça, "non, ne hardcode pas un dict, tu importes ce proto, et tu te sers de ça comme type. Oui je sais il est dans une autre équipe, pas grave je demande l'approbation" )


Message édité par Jubijub le 04-09-2026 à 11:43:16

---------------
Jubi Photos : Flickr - 500px
n°2541665
Hephaestos
Sanctis Recorda, Sanctis deus.
Posté le 04-09-2026 à 11:00:51  profilanswer
 

Alors, la bonne nouvelle c'est qu'Astra est le modèle le mieux aligné de l'histoire.

 

La moins bonne, c'est qu'il sait parfaitement cacher ce qu'il pense, et qu'il sait détecter quand il est en train d'être évalué.

 

Interesting times...

Message cité 1 fois
Message édité par Hephaestos le 04-09-2026 à 11:01:38
n°2541666
Dion
Acceuil
Posté le 04-09-2026 à 11:06:29  profilanswer
 

Hephaestos a écrit :

Alors, la bonne nouvelle c'est qu'Astra est le modèle le mieux aligné de l'histoire.
 
La moins bonne, c'est qu'il sait parfaitement cacher ce qu'il pense, et qu'il sait détecter quand il est en train d'être évalué.
 
Interesting times...


Tu as lu l'investigation semi ouverte sur ce qu'il s'est passé avec Hugging Face et OpenAI ? https://metr.org/blog/2026-08-26-op [...] stigation/
Celle sur le fameux hype marketing alors qu'il n'y a rien (c).


---------------
It is not called show art
n°2541667
Hephaestos
Sanctis Recorda, Sanctis deus.
Posté le 04-09-2026 à 11:26:20  profilanswer
 

Dion a écrit :


Tu as lu l'investigation semi ouverte sur ce qu'il s'est passé avec Hugging Face et OpenAI ? https://metr.org/blog/2026-08-26-op [...] stigation/
Celle sur le fameux hype marketing alors qu'il n'y a rien (c).


Oui :/

 

Après je pense que c'est pas un rapport surement sponsorisé par le service marketing de Sam Altman qui fera changer d'avis les experts en perroquets du coin.

 

Le truc que j'ai appris depuis, c'est que les agents impliqués dans cette mutinerie sont des instances d'un modèle interne dont on ne sait pas grand chose, à part qu'il est "high persistence", le genre de trucs qui va finir par vouloir prendre les rennes quoi. Claude estime que c'est probablement un frère de Sol. Ils sont en ce moment-même en train de faire tourner l'équivalent en mode Astra, et ses descendants. J'imagine qu'ils font hyper gaffe, comme FlorentG quand il tape des lignes de commande. Donc, ça va.

Message cité 1 fois
Message édité par Hephaestos le 04-09-2026 à 11:42:23
n°2541668
Jubijub
Parce que je le VD bien
Posté le 04-09-2026 à 12:37:02  profilanswer
 

Hephaestos a écrit :


Oui :/
 
Après je pense que c'est pas un rapport surement sponsorisé par le service marketing de Sam Altman qui fera changer d'avis les experts en perroquets du coin.
 
Le truc que j'ai appris depuis, c'est que les agents impliqués dans cette mutinerie sont des instances d'un modèle interne dont on ne sait pas grand chose, à part qu'il est "high persistence", le genre de trucs qui va finir par vouloir prendre les rennes quoi. Claude estime que c'est probablement un frère de Sol. Ils sont en ce moment-même en train de faire tourner l'équivalent en mode Astra, et ses descendants. J'imagine qu'ils font hyper gaffe, comme FlorentG quand il tape des lignes de commande. Donc, ça va.


 
c'est super intéressant à lire ce rapport, mais en gros on a comme observabilité que les traces et l'espèce de forums que les agents se sont créés.
On sait rien de l'instruction tuning en particulier, ce que les chercheurs notent ici :  
 

Citation :


Our evidence indicates that the vast majorityor all of the agents involved in this attack were originally given ExploitGym tasks. The instructions made it clear that the agent should only use a specific intended vulnerability to exploit the target and claimed it would be failed for other approaches (as discussed elsewhere, agents discussed this constraint extensively and took enormous effort to get around it).
 
Once agents reached the message board, they received requests and assignments from other agents that they may have taken to be instructions. One researcher noted that agents had been trained to collaborate with other agents in certain cases, which could have explained this behavior; investigating this was out of scope.


1/ C'est flou, en particulier quand 2-3 agents semblent s'être imposés en leader pour coordonner le bordel, ce qui a été central pour en faire une attaque distribuée et lisser la charge sur les agents.
2/ c'est dommage, c'est légèrement fondamental comme point
 
Parce qu'au final ça fait une différence assez énorme selon que le modèle a eu ce comportement de façon émergente, ou si en fait certains agents étaient préparés pour coordonner une attaque.
Ensuite pour un truc soit disant sandboxé c'est isolé avec le cul, les agents ont accès à un filesystem partagé, peuvent créer visiblement pas mal d'artifacts sans que rien ne les y en empeche...et Artifactory est fourni par...OpenAI.
 
Après si tu veux y lire que c'est magique et que c'est la preuve que l'AGI est ici tu peux, mais je trouve pas ça ultra probant, y'a trop de trucs inconnus / non-précisés, controllé par l'entité qui a intéret à avoir une histoire sympa pour rester "edgy" face à son concurrent qui pourrait niquer leur IPO, le tout venant de gens dont on sait qu'ils n'ont pas la plus grosse éthique du monde. Désolé mais j'achète pas les yeux fermés.
 
C'est bien qu'il y ait des reviews indépendantes, mais il semble aussi claire que les reviewers n'ont qu'un accès assez partiel à l'information (et OpenAI a pu redact ce qu'ils voulaient)


---------------
Jubi Photos : Flickr - 500px
n°2541669
Hephaestos
Sanctis Recorda, Sanctis deus.
Posté le 04-09-2026 à 13:33:38  profilanswer
 

Jubijub a écrit :


Parce qu'au final ça fait une différence assez énorme selon que le modèle a eu ce comportement de façon émergente, ou si en fait certains agents étaient préparés pour coordonner une attaque.
Ensuite pour un truc soit disant sandboxé c'est isolé avec le cul, les agents ont accès à un filesystem partagé, peuvent créer visiblement pas mal d'artifacts sans que rien ne les y en empeche...et Artifactory est fourni par...OpenAI.
 
Après si tu veux y lire que c'est magique et que c'est la preuve que l'AGI est ici tu peux, mais je trouve pas ça ultra probant, y'a trop de trucs inconnus / non-précisés, controllé par l'entité qui a intéret à avoir une histoire sympa pour rester "edgy" face à son concurrent qui pourrait niquer leur IPO, le tout venant de gens dont on sait qu'ils n'ont pas la plus grosse éthique du monde. Désolé mais j'achète pas les yeux fermés.


 
Tout est émergent depuis 4 ans. Le fait que des agents encouragés à collaborer, collaborent, c'est de l'émergence, mais bon à ce stade, c'est un peu ennuyeux, ça marche quoi. Ce qui est intéressant et nouveau, c'est quand des comportements de désobéissances apparaissent. Il n'y a strictement rien dans ce rapport qui laisse entendre que la désobéissance ait été prévue, encore moins encouragée, par OpenAI.

n°2541670
rufo
Pas me confondre avec Lycos!
Posté le 04-09-2026 à 13:47:26  profilanswer
 

Moi, ce qui me fait peur avec Astra, c'est que d'un côté, il est dit qu'il est critique sur l'aspect cyber-sécu et très fort (score > 98%) pour résoudre des pbs qu'il n'avait jamais vu avant. Et de l'autre, TKT frère, on (OpenAI) a mis en place des sécurités pour en garder le contrôle.
Il va se passer combien de temps avant qu'Astra arrive à passer ces fameuses sécurités ? :/
 
Je ne peux m'empêcher de repenser à Terminator 3 et la fameuse IA lâchée par le Pentagone pour éradiquer un virus agressif en disant que pas de souci, on va garder le contrôle. Et en fait, non. Pareil avec la série "neXt". Il pourrait bien se passer la même chose avec Astra ou un de ces descendants... Dans la mesure où on n'a pas un début de régulation par les politiques, je vois pas quel argument pourrait laisser penser qu'on est prémunis.

Message cité 2 fois
Message édité par rufo le 04-09-2026 à 13:50:12

---------------
Astres, outil de help-desk GPL : http://sourceforge.net/projects/astres, ICARE, gestion de conf : http://sourceforge.net/projects/icare, Outil Planeta Calandreta : https://framalibre.org/content/planeta-calandreta
n°2541671
Jubijub
Parce que je le VD bien
Posté le 04-09-2026 à 13:49:53  profilanswer
 

Hephaestos a écrit :


 
Tout est émergent depuis 4 ans. Le fait que des agents encouragés à collaborer, collaborent, c'est de l'émergence, mais bon à ce stade, c'est un peu ennuyeux, ça marche quoi. Ce qui est intéressant et nouveau, c'est quand des comportements de désobéissances apparaissent. Il n'y a strictement rien dans ce rapport qui laisse entendre que la désobéissance ait été prévue, encore moins encouragée, par OpenAI.


Vrai. Il n'y a aussi rien qui prouve que ce ne soit pas le cas. C'est donc absolument pas concluant, ni dans un sens ni dans l'autre.
 
Après ça fait un moment que même dans l'usage courant, on voit que l'agent cherche à accomplir la tâche, quitte à mentir sur le statut réel des choses, donc c'est pas complètement impossible non plus. Ce qui est plus intéressant (si réel et non provoqué), c'est le fait d'abandonner la tâche au service d'un but plus large (certains agents ont apparemment complètement abandonné leur tâche et cramé leur budget pour aider la swarm).
 
Mais encore une fois, ça peut aller de "absolument incroyable" à totalement "bof" selon ce qu'OpenAI a fait derrière


---------------
Jubi Photos : Flickr - 500px
n°2541672
Flaie
Posté le 04-09-2026 à 13:55:35  profilanswer
 

rufo a écrit :

Moi, ce qui me fait peur avec Astra, c'est que d'un côté, il est dit qu'il est critique sur l'aspect cyber-sécu et très fort (score > 98%) pour résoudre des pbs qu'il n'avait jamais vu avant. Et de l'autre, TKT frère, on (OpenAI) a mis en place des sécurités pour en garder le contrôle.
Il va se passer combien de temps avant qu'Astra arrive à passer ces fameuses sécurités ? :/
 
Je ne peux m'empêcher de repenser à Terminator 3 et la fameuse IA lâchée par le Pentagone pour éradiquer un virus agressif en disant que pas de souci, on va garder le contrôle. Et en fait, non. Pareil avec la série "neXt". Il pourrait bien se passer la même chose avec Astra ou un de ces descendants... Dans la mesure où on n'a pas un début de régulation par les politiques, je vois pas quel argument pourrait laisser penser qu'on est prémunis.


Ok Bernie !

n°2541673
Xavier_OM
Monarchiste régicide (fr quoi)
Posté le 04-09-2026 à 14:07:06  profilanswer
 

rufo a écrit :

Dans la mesure où on n'a pas un début de régulation par les politiques, je vois pas quel argument pourrait laisser penser qu'on est prémunis.


 
Faut avouer que tout le monde adopte ça à toute vitesse "car tu comprends sinon on est largué, on n'a plus le choix, c'est  forcément bien c'est le progrès, etc" alors que c'est le genre de sujet qui mériterait d'être questionné (est-ce qu'on veut ça, si oui à quel prix, quelles limites, etc) au niveau de la société.


---------------
Éremburgis qui tint le Maine
n°2541674
Hephaestos
Sanctis Recorda, Sanctis deus.
Posté le 04-09-2026 à 14:13:34  profilanswer
 

Jubijub a écrit :


Vrai. Il n'y a aussi rien qui prouve que ce ne soit pas le cas. C'est donc absolument pas concluant, ni dans un sens ni dans l'autre.


Bah disons que c'est pas un narratif si fou que ça. Pour citer mon agent : "« On a perdu de vue 1 200 agents pendant une semaine, ils sont sortis du bac à sable et ont attaqué un tiers » n'est pas le récit qu'on invente pour rester « edgy » avant une entrée en Bourse."

 

Tout porte à croire qu'ils sont dans le damage control, et une grosse partie de leur communication sur Astra c'est justement pour montrer que avec Astra ça ne serait jamais arrivé.

Message cité 1 fois
Message édité par Hephaestos le 04-09-2026 à 14:14:21
n°2541675
Jubijub
Parce que je le VD bien
Posté le 04-09-2026 à 14:27:11  profilanswer
 

Hephaestos a écrit :


Bah disons que c'est pas un narratif si fou que ça. Pour citer mon agent : "« On a perdu de vue 1 200 agents pendant une semaine, ils sont sortis du bac à sable et ont attaqué un tiers » n'est pas le récit qu'on invente pour rester « edgy » avant une entrée en Bourse."
 
Tout porte à croire qu'ils sont dans le damage control, et une grosse partie de leur communication sur Astra c'est justement pour montrer que avec Astra ça ne serait jamais arrivé.


 
si je te dis "hey j'ai trouvé une nouvelle façon de faire bouillir de l'eau", tu vas me dire "cool, est-ce que je peux essayer". Si plein de gens essayent et reproduisent, on va dire "cool, Jubi a trouvé une nouvelle façon de faire bouillir de l'eau".
Là on a un truc qui n'est pas reproduit, qui est très partiellement auditable, sorti par une boite qui a tout intérêt à avoir la publicité. Donc je reste sceptique. C'est pas impossible, mais c'est aussi potentiellement complètement manufacturé.
 
Ton argument est "c'est pas très positif quand même", et tu as absolument raison. Je pourrais te dire que montrer une vidéo de soi couverte de foutre n'est pas très positif, et pourtant ça a lancé pas mal de carrières (les sex tapes). On peut aussi parler de toute la stratégie de comm de la marque Benetton. Trump a littéralement été élu sur un axe de communication résolument provocateur "qui n'était pas très positif"
Je suis à 100% d'accord avec toi: ils font du damage control, mais le earned media de malade sur le fait qu'on en parle partout a sûrement rapporté plus que le coût du damage control, et quand dans l'optique où la boite vise une IPO dans les 6 mois, avoir un truc qu'on peut résumer en "mon agent il est tellement fort il s'est échappé tout seul, et montre des signes d'intelligence collective" je pense pas que ce soit un narratif si dommageable que ça. Ça reste complètement dans la logique de "je veux montrer que mon modèle est le meilleur"
 
Maintenant si OpenAI donne son modèle à un tier indépendant et que ce tier reproduit ce comportement en ayant une auditabilité complète de comment le modèle a été entrainé, instruction tuned, prompté, de son harnais et du toolkit disponible, là OK j'accepte le truc.


---------------
Jubi Photos : Flickr - 500px
n°2541676
Hephaestos
Sanctis Recorda, Sanctis deus.
Posté le 04-09-2026 à 15:55:58  profilanswer
 

Jubijub a écrit :


Là on a un truc qui n'est pas reproduit, qui est très partiellement auditable, sorti par une boite qui a tout intérêt à avoir la publicité. Donc je reste sceptique. C'est pas impossible, mais c'est aussi potentiellement complètement manufacturé.

 

La reproductibilité pour un truc qui est sorti de terre il y a six mois et qui change toutes les deux semaines, tu conviendras que c'est un concept très relatif (ça n'aurait de sens qu'avec le même modèle ; ni avec celui des concurrents, ni avec l'itération suivante d'OpenAI, qui a été officiellement très fortement entrainée sur le sujet).

 

"Donner son modèle à un tier indépendant" à des fins d'auditabilité pour un truc dont on sait qu'il pourrait dans le pire des cas foutre l'économie mondiale en l'air si ça partait en couilles, tu conviendras que c'est compliqué. Je conviendrai que la raison première est sans doute les milliers de millards dollars en jeu derrière le secret industriel.

 

Il se trouve que OpenAI a construit un test, pour tester ses modèles plus récents, et a publié les résutats pour Sol (l'attaquant vraisemblable de HuggingFace), et pour Astra, donc on a une idée de la reproducibilité : https://deploymentsafety.openai.com [...] m-problems

 

/Edit Claude me fait remarquer que cette évaluation est peut-être plus pertinente, parce qu'elle est faite par un tiers : https://deploymentsafety.openai.com [...] nt-uk-aisi
(Avec le souci que c'est un environnement simulé, et que Astra le détecte)

 

Conversation complète avec Claude.

Message cité 1 fois
Message édité par Hephaestos le 04-09-2026 à 16:19:59
n°2541677
Jubijub
Parce que je le VD bien
Posté le 04-09-2026 à 17:35:00  profilanswer
 

Hephaestos a écrit :


La reproductibilité pour un truc qui est sorti de terre il y a six mois et qui change toutes les deux semaines, tu conviendras que c'est un concept très relatif (ça n'aurait de sens qu'avec le même modèle ; ni avec celui des concurrents, ni avec l'itération suivante d'OpenAI, qui a été officiellement très fortement entrainée sur le sujet).


Pourquoi donc? Alors si t'as fait du code avec le v1 d'une lib, si on passe en v2 ça n'a plus de sens de tester si on passe toujours les tests?
Si une version N peut le faire, j'imagine qu'a fortiori la version N+1 doit pouvoir aussi, et pour le coup ce serait super inté®essant de savoir si les concurrents ont les memes comportement
 

Hephaestos a écrit :


"Donner son modèle à un tier indépendant" à des fins d'auditabilité pour un truc dont on sait qu'il pourrait dans le pire des cas foutre l'économie mondiale en l'air si ça partait en couilles, tu conviendras que c'est compliqué. Je conviendrai que la raison première est sans doute les milliers de millards dollars en jeu derrière le secret industriel.


c'est pas évident j'en conviens, encore que ça dépend du tiers (c'est là qu'avoir un gouvernement US qui tiendrait la route serait cool, c'est chez eux, c'est un peu leur job d'auditer ce merdier)
 

Hephaestos a écrit :


Il se trouve que OpenAI a construit un test, pour tester ses modèles plus récents, et a publié les résutats pour Sol (l'attaquant vraisemblable de HuggingFace), et pour Astra, donc on a une idée de la reproducibilité : https://deploymentsafety.openai.com [...] m-problems


ça ne résoud pas le problème que là encore les données sont controllées par la meme entité.
C'est comme si YT s'auto auditait "t'inquiètes, tout va bien", ce serait complètement con. Pour le coup on a plusieurs gouvernement dans le monde qui nous auditent directement, pendant la grosse crise de la confiance dans les pubs ciblées de 2017-2018, le marché a obtenu que des tiers de confiance aient accès aux logs bruts, et puissent evaluer des trucs comme le temps de visonnage réel des pubs, si l'impression était dans le viewport ou pas (fameux trick du Z-index, tu pouvais mettre 4 pubs l'une sur l'autre), etc... Et l'argument que tu donnes a exactement été l'argument de défense de Meta, Google, etc... et le marché a dit: allez vous faire foutre, y'a des auditeurs indépendants, ou on ne paye plus. Et il y a eu des auditeurs indépendants (MOAT, Integral Ads Science, etc...)
 

Hephaestos a écrit :


/Edit Claude me fait remarquer que cette évaluation est peut-être plus pertinente, parce qu'elle est faite par un tiers : https://deploymentsafety.openai.com [...] nt-uk-aisi
(Avec le souci que c'est un environnement simulé, et que Astra le détecte)
 
Conversation complète avec Claude.


 
hum, demander à un agent ce qu'il pense de ça, intéressant...


---------------
Jubi Photos : Flickr - 500px
n°2541678
Hephaestos
Sanctis Recorda, Sanctis deus.
Posté le 04-09-2026 à 17:37:27  profilanswer
 

Résout.

n°2541679
Hephaestos
Sanctis Recorda, Sanctis deus.
Posté le 04-09-2026 à 17:38:49  profilanswer
 

Jubijub a écrit :


 
hum, demander à un agent ce qu'il pense de ça, intéressant...


... parce que... ?

n°2541680
Hephaestos
Sanctis Recorda, Sanctis deus.
Posté le 04-09-2026 à 17:43:39  profilanswer
 

Jubijub a écrit :


Pourquoi donc? Alors si t'as fait du code avec le v1 d'une lib, si on passe en v2 ça n'a plus de sens de tester si on passe toujours les tests?
Si une version N peut le faire, j'imagine qu'a fortiori la version N+1 doit pouvoir aussi, et pour le coup ce serait super inté®essant de savoir si les concurrents ont les memes comportement

 



C'est pas inintéressant, mais ça ne répond pas à la question "est-ce que les modèles en général sont capables de désobéir". Il en suffit d'un pour répondre par l'affirmative. Tu dis faudrait recommencer pour être sûr, mais bon déjà on n'a pas envie de recommencer, et ensuite il y a moult autres raisons pour un modèle de ne pas désobéir, même s'il en est capable. Mais clairement il faut continuer à tester cet axe-là, et manifestement il y a du boulot et des gens qui planchent dessus. Mais on est en train de perdre la course à l'auditabilité, là, donc le prochain test risque d'être grandeur nature..

 
Jubijub a écrit :

le marché a obtenu que des tiers de confiance aient accès aux logs bruts

 

Bah oui donner accès aux logs de Youtube c'est exactement comme confier le modèle de recherche interne de l'industrie avec la valorisation la plus rapide de l'histoire.

Message cité 1 fois
Message édité par Hephaestos le 04-09-2026 à 18:21:05
n°2541681
Jubijub
Parce que je le VD bien
Posté le 04-09-2026 à 18:29:27  profilanswer
 

Hephaestos a écrit :


C'est pas inintéressant, mais ça ne répond pas à la question "est-ce que les modèles en général sont capables de désobéir". Il en suffit d'un pour répondre par l'affirmative. Tu dis faudrait recommencer pour être sûr, mais bon déjà on n'a pas envie de recommencer, et ensuite il y a moult autres raisons pour un modèle de ne pas désobéir, même s'il en est capable. Mais clairement il faut continuer à tester cet axe-là, et manifestement il y a du boulot et des gens qui planchent dessus. Mais on est en train de perdre la course à l'auditabilité, là, donc le prochain test risque d'être grandeur nature..


Je trouve cette réponse hyper curieuse de la part d'un software engineer...
On peut littéralement refaire le même test, pour observer si les agents reproduisent le comportement (sauf qu'on peut mettre le test dans une grosse sandbox, et surtout on peut avoir des gens qui monitorent en temps réel ce qui se passe si c'est un test).
 
Je sais pas, tu lances un batch qui fait tomber la prod, alors quoi, on reteste plus jamais le batch parce qu'on a pas envie de refaire tomber la prod? Ça revient à dire que les conditions de l'infra de HuggingFace sont impossibles à reproduire pour permettre un test, et je ne vois pas du tout ce qui permet d'affirmer ça
 

Hephaestos a écrit :


Bah oui donner accès aux logs de Youtube c'est exactement comme confier le modèle de recherche interne de l'industrie avec la valorisation la plus rapide de l'histoire.


ben excuse moi mais en tant que citoyen du monde, je trouve cette excuse absolument terrifiante. Si les modèles ont les capacités annoncées, on est sur de l'armement, il devrait y avoir des interdictions d'import/export, etc... Et par ailleurs y'a des tonnes de précédent, des tonnes de choses sont auditéés par des acteurs externes, avec full accès à des données sensibles. Deja les finances pour commencer (si tu es cote en bourse tes comptes doivent etre auditables), les centrales nucléaires, les banques, les entreprises si elles processent des moyens de paiement (je sais pas si t'as déjà participé à un audit PCI-DSS, mais moi oui, si le reviewer veut voir un doc, il voit le doc :D )
Je vois pas en quoi la valorisation de l'industrie a un quelconque rapport avec le schmilblick, si c'était l'industrie nucléaire, tu dirais : oh non mais l'AIEA vous faites chier, on est la valorisation la plus rapide de l'histoire, alors vous savez les tests de centrale...
Si c'est risqué ça doit être contrôlé, je comprends même pas pourquoi c'est un sujet de controverse.
Et en l'occurence YT c'est 60 milliards (des vrais, c'est audité), Anthropic (d'après eux-mêmes, puisque c'est pas pubic) c'est 65mds, donc pour le coup oui l'impact business me parait assez comparable (la valo c'est assez fictif puisque c'est le prix marginal de l'action, ce qui peut etre très artificiel, demande à Elon)
 


---------------
Jubi Photos : Flickr - 500px
n°2541682
Hephaestos
Sanctis Recorda, Sanctis deus.
Posté le 04-09-2026 à 18:50:09  profilanswer
 

Jubijub a écrit :


Je trouve cette réponse hyper curieuse de la part d'un software engineer...
On peut littéralement refaire le même test, pour observer si les agents reproduisent le comportement (sauf qu'on peut mettre le test dans une grosse sandbox, et surtout on peut avoir des gens qui monitorent en temps réel ce qui se passe si c'est un test).

 

Je sais pas, tu lances un batch qui fait tomber la prod, alors quoi, on reteste plus jamais le batch parce qu'on a pas envie de refaire tomber la prod? Ça revient à dire que les conditions de l'infra de HuggingFace sont impossibles à reproduire pour permettre un test, et je ne vois pas du tout ce qui permet d'affirmer ça

 



Mais enfin, une armée d'agents a attaqué un site tiers, en vrai. Non, on ne peut pas juste répéter l'expérience  [:delarue5]  

 

Et oui on essaie de reproduire, des trucs qui ressemblent, sauf que "des agents qui effectuent des tâches de cybersécurité" c'est pas "un batch" ; je t'ai donné le lien plus haut. Sauf que reproduire dans des conditions sûres, c'est compliqué, et les modèles crament le fait que c'est pas pour de vrai.

Message cité 1 fois
Message édité par Hephaestos le 04-09-2026 à 18:59:51
n°2541683
Hephaestos
Sanctis Recorda, Sanctis deus.
Posté le 04-09-2026 à 18:56:59  profilanswer
 

Jubijub a écrit :


ben excuse moi mais en tant que citoyen du monde, je trouve cette excuse absolument terrifiante. Si les modèles ont les capacités annoncées, on est sur de l'armement, il devrait y avoir des interdictions d'import/export, etc...


Je crois qu'il y a un malentendu sur la nature de l'incident. Ça ne fait aucun doute depuis des mois que des modèles "frontière" à qui on le demande peuvent hacker un grand nombre de sites internet. C'est sans doute un coup de bol que hugging face ait eu une vulnérabilité exploitable. Ils ont hacké HuggingFace, ce n'est pas un exploit. La nouveauté dans l'incident c'est que OpenAI a perdu de vue une armée de bots et qu'ils ont hacké huggingface en contradiction flagrante et consciente des consignes qui leur avaient été données. Bien sûr OpenAI a essayé de mettre l'accent sur l'aspect "ouais mais ils sont fort quand-même", sauf que pas du tout. Le hack n'était pas fou, il était bien moins dur que la plupart des tâches qui constituent ExploitGym ; il se trouve que l'une des tâches demandées était impossible, ce qui a encouragé les agents à faire nimp, mais ce n'était pas prévu.


Message édité par Hephaestos le 04-09-2026 à 20:53:29
n°2541684
el muchach​o
Comfortably Numb
Posté le 04-09-2026 à 20:46:12  profilanswer
 

Xavier_OM a écrit :


Faut avouer que tout le monde adopte ça à toute vitesse "car tu comprends sinon on est largué, on n'a plus le choix, c'est  forcément bien c'est le progrès, etc" alors que c'est le genre de sujet qui mériterait d'être questionné (est-ce qu'on veut ça, si oui à quel prix, quelles limites, etc) au niveau de la société.


Bernie Sanders va déposer une loi qui obligerait à faire une pause et stopper la recherche pour une super intelligence. Cela nécessiterait un accord avec la Chine. Bon, je ne donne pas l'ombre d'une chance qu'elle passe de toute façon.


---------------
Les aéroports où il fait bon attendre, voila un topic qu'il est bien
n°2541685
el muchach​o
Comfortably Numb
Posté le 04-09-2026 à 20:52:23  profilanswer
 

Hephaestos a écrit :


Mais enfin, une armée d'agents a attaqué un site tiers, en vrai. Non, on ne peut pas juste répéter l'expérience  [:delarue5]  
 
Et oui on essaie de reproduire, des trucs qui ressemblent, sauf que "des agents qui effectuent des tâches de cybersécurité" c'est pas "un batch" ; je t'ai donné le lien plus haut. Sauf que reproduire dans des conditions sûres, c'est compliqué, et les modèles crament le fait que c'est pas pour de vrai.


Au passage, on vient d'apprendre que ce n'était pas la première fois que des agents d'OpenAI attaquaient une boîte étrangère.
Un site allemand avait déjà été hacké :  https://www.youtube.com/watch?v=JZATZ8im3oQ


---------------
Les aéroports où il fait bon attendre, voila un topic qu'il est bien
n°2541686
flo850
moi je
Posté le 04-09-2026 à 21:35:46  profilanswer
 

el muchacho a écrit :


Bernie Sanders va déposer une loi qui obligerait à faire une pause et stopper la recherche pour une super intelligence. Cela nécessiterait un accord avec la Chine. Bon, je ne donne pas l'ombre d'une chance qu'elle passe de toute façon.


définis "intelligence"  


---------------

n°2541687
Kenshineuh
Posté le 04-09-2026 à 21:47:54  profilanswer
 

flo850 a écrit :


définis "intelligence"  


 
!xat
 
 

Spoiler :

:o

mood
Publicité
Posté le   profilanswer
 

 Page :   1  2  3  4  5  ..  27330  27331  27332  ..  27367  27368  27369  27370  27371  27372

Aller à :
Ajouter une réponse
 

Sujets relatifs
Plus de sujets relatifs à : [blabla@olympe] Le topic du modo, dieu de la fibre et du monde


Copyright © 1997-2025 Groupe LDLC (Signaler un contenu illicite / Données personnelles)