Forum |  HardWare.fr | News | Articles | PC | S'identifier | S'inscrire | Shop Recherche
2480 connectés 

 


Dernière réponse
Sujet : [blabla@olympe] Le topic du modo, dieu de la fibre et du monde
lady ada

Dion a écrit :

À Mach 1 en vitesse de croisière chaque centième d’angle fait une immense différence  :sol:


 
Les virages se font toujours à 45°.


Votre réponse
Nom d'utilisateur    Pour poster, vous devez être inscrit sur ce forum .... si ce n'est pas le cas, cliquez ici !
Le ton de votre message                        
                       
Votre réponse


[b][i][u][strike][spoiler][fixed][cpp][url][email][img][*]   
 
   [quote]
 

Options

 
Vous avez perdu votre mot de passe ?


Vue Rapide de la discussion
lady ada

Hephaestos a écrit :


 
La reproductibilité pour un truc qui est sorti de terre il y a six mois et qui change toutes les deux semaines, tu conviendras que c'est un concept très relatif (ça n'aurait de sens qu'avec le même modèle ; ni avec celui des concurrents, ni avec l'itération suivante d'OpenAI, qui a été officiellement très fortement entrainée sur le sujet).
 
"Donner son modèle à un tier indépendant" à des fins d'auditabilité pour un truc dont on sait qu'il pourrait dans le pire des cas foutre l'économie mondiale en l'air si ça partait en couilles, tu conviendras que c'est compliqué. Je conviendrai que la raison première est sans doute les milliers de millards dollars en jeu derrière le secret industriel.
 
Il se trouve que OpenAI a construit un test, pour tester ses modèles plus récents, et a publié les résutats pour Sol (l'attaquant vraisemblable de HuggingFace), et pour Astra, donc on a une idée de la reproducibilité : https://deploymentsafety.openai.com [...] m-problems
 
/Edit Claude me fait remarquer que cette évaluation est peut-être plus pertinente, parce qu'elle est faite par un tiers : https://deploymentsafety.openai.com [...] nt-uk-aisi
(Avec le souci que c'est un environnement simulé, et que Astra le détecte)
 
Conversation complète avec Claude.


 
Il n'y a qu'une fin.

lady ada

Hephaestos a écrit :


 
Tout est émergent depuis 4 ans. Le fait que des agents encouragés à collaborer, collaborent, c'est de l'émergence, mais bon à ce stade, c'est un peu ennuyeux, ça marche quoi. Ce qui est intéressant et nouveau, c'est quand des comportements de désobéissances apparaissent. Il n'y a strictement rien dans ce rapport qui laisse entendre que la désobéissance ait été prévue, encore moins encouragée, par OpenAI.


Citation :

"L’émergence est le type de réalité nouvelle, dotée de qualités et propriétés propres, qui se forme, se constitue, se concrétise à partir de l’assemblage organisateur d’éléments non dotés des qualités et propriétés de cette réalité." — (Edgar Morin, Connaissance, ignorance, mystère, Fayard, 2017, page 36)

rufo C'est ce que je disais, à l'échelle locale, les différences de déformations ne seront pas visibles.
 
Mais bon, Trump va forcément s'opposer à cette nouvelle représentation et passera un décret pour interdire aux GAFAM et autres qu'elle soit utilisée (notamment dans l'éducation j'imagine).  :sarcastic:
Jubijub

Flaie a écrit :


Mercator respecte les angles et direction c'est exactement ce que tu veux pour du guidage local, non?
 
Quand le GPS te dit tourne à droite 90deg ben c'est vraiment à droite 90deg, le equal earth ne respecte pas de la meme façon et les rues paraîtront moins droites, les bâtiments paraîtront moins carrés, bref le tournez à droite dans 50m est moins fiable, ça me paraît utile pour du GPS.
 
C'est pour cela je pense la plupart des sites de map genre mapbox and co qui supportent equal earth passent à mercator quand tu zoom.


c'est vrai en principe, mais est-ce que c'est applicable/gênant si ton niveau de zoom c'est 50m ?
 

el muchacho a écrit :

jubi, y'a pas moyen de signaler les vidéos/chaînes qui ne font que du slop IA ?


 
pas à ma connaissance :(

el muchacho jubi, y'a pas moyen de signaler les vidéos/chaînes qui ne font que du slop IA ?
Flaie

SekYo a écrit :


De mémoire de quand je bossais sur des GIS la déformation à l'échelle d'une ville est vraiment négligeable à moins que t'ai besoin d'une précision centimétrique. Du coup si le seul inconvénient c'est que les 3000km de routes en ligne droite au milieu de l'Australie sont un peu moins droite à l'affichage, je pense qu'on peut accepter ça.


Nous n'accepterons rien de moins que la perfection.

XaTriX

el muchacho a écrit :


Du délire complet.


Débile comme comptage avec des DC de 200m².

SekYo

Flaie a écrit :

Mercator respecte les angles et direction c'est exactement ce que tu veux pour du guidage local, non?
 
Quand le GPS te dit tourne à droite 90deg ben c'est vraiment à droite 90deg, le equal earth ne respecte pas de la meme façon et les rues paraîtront moins droites, les bâtiments paraîtront moins carrés, bref le tournez à droite dans 50m est moins fiable, ça me paraît utile pour du GPS.


De mémoire de quand je bossais sur des GIS la déformation à l'échelle d'une ville est vraiment négligeable à moins que t'ai besoin d'une précision centimétrique. Du coup si le seul inconvénient c'est que les 3000km de routes en ligne droite au milieu de l'Australie sont un peu moins droite à l'affichage, je pense qu'on peut accepter ça.

el muchacho

rufo a écrit :

Le sujet des DC commence à faire chier les républicains apparemment aux USA : https://www.youtube.com/watch?v=27dPn37O6pM
 
3000 DC, 1500 en projet. Mais 7 américains sur 10 semblent contre à cause de la très forte augmentation de leurs factures d'électricité (apparemment entre 200 et 300% en 5 ans), de la pollution de l'eau et des nuisances sonores permanentes (sorte de sifflement strident, ça doit être un enfer) et de l'augmentation de la température environnante.  :ouch:  
Ca vend pas du rêve ! Tu m'étonnes qu'avec de tels inconvénients, les gens soient majoritairement contre.


Du délire complet.

Flaie

Jubijub a écrit :


 
c'est clair que la matos data center, c'est pas optimisé pour le bruit :D
 


 

Jubijub a écrit :


 
pour les cartes maritimes oui, pour un GPS "voiture/pieton/transport en commun) je suis pas sur que ça fasse une grosse différence. Ça peut en faire une pour de la randonnée, mais je doute que les gens utilisent Google maps pour ça?


Mercator respecte les angles et direction c'est exactement ce que tu veux pour du guidage local, non?
 
Quand le GPS te dit tourne à droite 90deg ben c'est vraiment à droite 90deg, le equal earth ne respecte pas de la meme façon et les rues paraîtront moins droites, les bâtiments paraîtront moins carrés, bref le tournez à droite dans 50m est moins fiable, ça me paraît utile pour du GPS.
 
C'est pour cela je pense la plupart des sites de map genre mapbox and co qui supportent equal earth passent à mercator quand tu zoom.

rufo

Jubijub a écrit :


 
pour les cartes maritimes oui, pour un GPS "voiture/pieton/transport en commun) je suis pas sur que ça fasse une grosse différence. Ça peut en faire une pour de la randonnée, mais je doute que les gens utilisent Google maps pour ça?


Pour le coup, j'ai testé sur un rando dans les Pyrénées où les temps annoncés par les panneaux étaient très bizarres, pas cohérent. J'ai demandé à Maps le temps restant et ben c'était assez précis j'ai trouvé (en tout cas, pour notre vitesse de marche). Surpris du résultat. A retester pour voir.

Jubijub

rufo a écrit :

Le sujet des DC commence à faire chier les républicains apparemment aux USA : https://www.youtube.com/watch?v=27dPn37O6pM

 

3000 DC, 1500 en projet. Mais 7 américains sur 10 semblent contre à cause de la très forte augmentation de leurs factures d'électricité (apparemment entre 200 et 300% en 5 ans), de la pollution de l'eau et des nuisances sonores permanentes (sorte de sifflement strident, ça doit être un enfer) et de l'augmentation de la température environnante.  :ouch:
Ca vend pas du rêve ! Tu m'étonnes qu'avec de tels inconvénients, les gens soient majoritairement contre.

 

c'est clair que la matos data center, c'est pas optimisé pour le bruit :D

 
Flaie a écrit :


Ça m sera utile que pour les cartes globales, pour tout ce qui est à l'échelle local / régional et pour les cartes maritimes ou bien même juste se déplacer avec google maps, on continuera d'utiliser mercator.

 

pour les cartes maritimes oui, pour un GPS "voiture/pieton/transport en commun) je suis pas sur que ça fasse une grosse différence. Ça peut en faire une pour de la randonnée, mais je doute que les gens utilisent Google maps pour ça?

rufo Pourquoi Google Maps ne pourrait pas adopter cette carto ? Avec un zoom important pour une utilisation locale, la différence ne devrait pas se voir.
Flaie

rufo a écrit :

L'ONU a voté une nouvelle représentation cartographique de notre monde et devinez quel est le seul pays qui a voté contre alors qu'un des 3 cartographes du projet était l'un de ses concitoyens ?  :whistle:  
https://www.youtube.com/watch?v=XbAbgxmqRpw
 
Je me demande combien de temps il va s'écouler avant que Trump lance son contre-projet de carte alternative avec une projection nommée "Trump" à cette représentation wokiste de l'ONU ? :sarcastic:


Ça m sera utile que pour les cartes globales, pour tout ce qui est à l'échelle local / régional et pour les cartes maritimes ou bien même juste se déplacer avec google maps, on continuera d'utiliser mercator.

rufo L'ONU a voté une nouvelle représentation cartographique de notre monde et devinez quel est le seul pays qui a voté contre alors qu'un des 3 cartographes du projet était l'un de ses concitoyens ?  :whistle:  
https://www.youtube.com/watch?v=XbAbgxmqRpw
 
Je me demande combien de temps il va s'écouler avant que Trump lance son contre-projet de carte alternative avec une projection nommée "Trump" à cette représentation wokiste de l'ONU ? :sarcastic:
basketor63

rufo a écrit :

C'est carré-carré en Allemagne, ce boulanger l'a bien senti passer : https://www.youtube.com/watch?v=DKpE_2JyhpI  :whistle:


 
qu'est ce qu'il est pas drôle le type

rufo Le sujet des DC commence à faire chier les républicains apparemment aux USA : https://www.youtube.com/watch?v=27dPn37O6pM
 
3000 DC, 1500 en projet. Mais 7 américains sur 10 semblent contre à cause de la très forte augmentation de leurs factures d'électricité (apparemment entre 200 et 300% en 5 ans), de la pollution de l'eau et des nuisances sonores permanentes (sorte de sifflement strident, ça doit être un enfer) et de l'augmentation de la température environnante.  :ouch:  
Ca vend pas du rêve ! Tu m'étonnes qu'avec de tels inconvénients, les gens soient majoritairement contre.
flo850

DDT a écrit :


Il a sorti Fable 5.1 pour la revue d'une PR que j'avais entièrement laissée à DS4 Flash. :D


c'est l’équivalent de sortir u iphone 22 max plus pour envoyer une dick pick

theShockWave

Dion a écrit :


Tu as lu l'investigation semi ouverte sur ce qu'il s'est passé avec Hugging Face et OpenAI ? https://metr.org/blog/2026-08-26-op [...] stigation/
Celle sur le fameux hype marketing alors qu'il n'y a rien (c).


 
https://metr.org/blog/2026-08-26-op [...] -ai-agents

Citation :

We heavily delegated our analysis to often-unreliable AI agents

  • Our analysis agents may have made errors that we haven’t caught.
  • Our subjective impressions are likely colored by analysis agents’ biases.
  • We were not robust to the possibility that these agents were deceptive in their analysis.


Ca sent la qualité [:petrus75]

DDT

Kenshineuh a écrit :

 

!xat

 


Spoiler :

:o



Il a sorti Fable 5.1 pour la revue d'une PR que j'avais entièrement laissée à DS4 Flash. :D

Kenshineuh

flo850 a écrit :


définis "intelligence"  


 
!xat
 
 

Spoiler :

:o

flo850

el muchacho a écrit :


Bernie Sanders va déposer une loi qui obligerait à faire une pause et stopper la recherche pour une super intelligence. Cela nécessiterait un accord avec la Chine. Bon, je ne donne pas l'ombre d'une chance qu'elle passe de toute façon.


définis "intelligence"  

el muchacho

Hephaestos a écrit :


Mais enfin, une armée d'agents a attaqué un site tiers, en vrai. Non, on ne peut pas juste répéter l'expérience  [:delarue5]  
 
Et oui on essaie de reproduire, des trucs qui ressemblent, sauf que "des agents qui effectuent des tâches de cybersécurité" c'est pas "un batch" ; je t'ai donné le lien plus haut. Sauf que reproduire dans des conditions sûres, c'est compliqué, et les modèles crament le fait que c'est pas pour de vrai.


Au passage, on vient d'apprendre que ce n'était pas la première fois que des agents d'OpenAI attaquaient une boîte étrangère.
Un site allemand avait déjà été hacké :  https://www.youtube.com/watch?v=JZATZ8im3oQ

el muchacho

Xavier_OM a écrit :


Faut avouer que tout le monde adopte ça à toute vitesse "car tu comprends sinon on est largué, on n'a plus le choix, c'est  forcément bien c'est le progrès, etc" alors que c'est le genre de sujet qui mériterait d'être questionné (est-ce qu'on veut ça, si oui à quel prix, quelles limites, etc) au niveau de la société.


Bernie Sanders va déposer une loi qui obligerait à faire une pause et stopper la recherche pour une super intelligence. Cela nécessiterait un accord avec la Chine. Bon, je ne donne pas l'ombre d'une chance qu'elle passe de toute façon.

Hephaestos

Jubijub a écrit :


ben excuse moi mais en tant que citoyen du monde, je trouve cette excuse absolument terrifiante. Si les modèles ont les capacités annoncées, on est sur de l'armement, il devrait y avoir des interdictions d'import/export, etc...


Je crois qu'il y a un malentendu sur la nature de l'incident. Ça ne fait aucun doute depuis des mois que des modèles "frontière" à qui on le demande peuvent hacker un grand nombre de sites internet. C'est sans doute un coup de bol que hugging face ait eu une vulnérabilité exploitable. Ils ont hacké HuggingFace, ce n'est pas un exploit. La nouveauté dans l'incident c'est que OpenAI a perdu de vue une armée de bots et qu'ils ont hacké huggingface en contradiction flagrante et consciente des consignes qui leur avaient été données. Bien sûr OpenAI a essayé de mettre l'accent sur l'aspect "ouais mais ils sont fort quand-même", sauf que pas du tout. Le hack n'était pas fou, il était bien moins dur que la plupart des tâches qui constituent ExploitGym ; il se trouve que l'une des tâches demandées était impossible, ce qui a encouragé les agents à faire nimp, mais ce n'était pas prévu.

Hephaestos

Jubijub a écrit :


Je trouve cette réponse hyper curieuse de la part d'un software engineer...
On peut littéralement refaire le même test, pour observer si les agents reproduisent le comportement (sauf qu'on peut mettre le test dans une grosse sandbox, et surtout on peut avoir des gens qui monitorent en temps réel ce qui se passe si c'est un test).

 

Je sais pas, tu lances un batch qui fait tomber la prod, alors quoi, on reteste plus jamais le batch parce qu'on a pas envie de refaire tomber la prod? Ça revient à dire que les conditions de l'infra de HuggingFace sont impossibles à reproduire pour permettre un test, et je ne vois pas du tout ce qui permet d'affirmer ça

 



Mais enfin, une armée d'agents a attaqué un site tiers, en vrai. Non, on ne peut pas juste répéter l'expérience  [:delarue5]  

 

Et oui on essaie de reproduire, des trucs qui ressemblent, sauf que "des agents qui effectuent des tâches de cybersécurité" c'est pas "un batch" ; je t'ai donné le lien plus haut. Sauf que reproduire dans des conditions sûres, c'est compliqué, et les modèles crament le fait que c'est pas pour de vrai.

Jubijub

Hephaestos a écrit :


C'est pas inintéressant, mais ça ne répond pas à la question "est-ce que les modèles en général sont capables de désobéir". Il en suffit d'un pour répondre par l'affirmative. Tu dis faudrait recommencer pour être sûr, mais bon déjà on n'a pas envie de recommencer, et ensuite il y a moult autres raisons pour un modèle de ne pas désobéir, même s'il en est capable. Mais clairement il faut continuer à tester cet axe-là, et manifestement il y a du boulot et des gens qui planchent dessus. Mais on est en train de perdre la course à l'auditabilité, là, donc le prochain test risque d'être grandeur nature..


Je trouve cette réponse hyper curieuse de la part d'un software engineer...
On peut littéralement refaire le même test, pour observer si les agents reproduisent le comportement (sauf qu'on peut mettre le test dans une grosse sandbox, et surtout on peut avoir des gens qui monitorent en temps réel ce qui se passe si c'est un test).
 
Je sais pas, tu lances un batch qui fait tomber la prod, alors quoi, on reteste plus jamais le batch parce qu'on a pas envie de refaire tomber la prod? Ça revient à dire que les conditions de l'infra de HuggingFace sont impossibles à reproduire pour permettre un test, et je ne vois pas du tout ce qui permet d'affirmer ça
 

Hephaestos a écrit :


Bah oui donner accès aux logs de Youtube c'est exactement comme confier le modèle de recherche interne de l'industrie avec la valorisation la plus rapide de l'histoire.


ben excuse moi mais en tant que citoyen du monde, je trouve cette excuse absolument terrifiante. Si les modèles ont les capacités annoncées, on est sur de l'armement, il devrait y avoir des interdictions d'import/export, etc... Et par ailleurs y'a des tonnes de précédent, des tonnes de choses sont auditéés par des acteurs externes, avec full accès à des données sensibles. Deja les finances pour commencer (si tu es cote en bourse tes comptes doivent etre auditables), les centrales nucléaires, les banques, les entreprises si elles processent des moyens de paiement (je sais pas si t'as déjà participé à un audit PCI-DSS, mais moi oui, si le reviewer veut voir un doc, il voit le doc :D )
Je vois pas en quoi la valorisation de l'industrie a un quelconque rapport avec le schmilblick, si c'était l'industrie nucléaire, tu dirais : oh non mais l'AIEA vous faites chier, on est la valorisation la plus rapide de l'histoire, alors vous savez les tests de centrale...
Si c'est risqué ça doit être contrôlé, je comprends même pas pourquoi c'est un sujet de controverse.
Et en l'occurence YT c'est 60 milliards (des vrais, c'est audité), Anthropic (d'après eux-mêmes, puisque c'est pas pubic) c'est 65mds, donc pour le coup oui l'impact business me parait assez comparable (la valo c'est assez fictif puisque c'est le prix marginal de l'action, ce qui peut etre très artificiel, demande à Elon)
 

Hephaestos

Jubijub a écrit :


Pourquoi donc? Alors si t'as fait du code avec le v1 d'une lib, si on passe en v2 ça n'a plus de sens de tester si on passe toujours les tests?
Si une version N peut le faire, j'imagine qu'a fortiori la version N+1 doit pouvoir aussi, et pour le coup ce serait super inté®essant de savoir si les concurrents ont les memes comportement

 



C'est pas inintéressant, mais ça ne répond pas à la question "est-ce que les modèles en général sont capables de désobéir". Il en suffit d'un pour répondre par l'affirmative. Tu dis faudrait recommencer pour être sûr, mais bon déjà on n'a pas envie de recommencer, et ensuite il y a moult autres raisons pour un modèle de ne pas désobéir, même s'il en est capable. Mais clairement il faut continuer à tester cet axe-là, et manifestement il y a du boulot et des gens qui planchent dessus. Mais on est en train de perdre la course à l'auditabilité, là, donc le prochain test risque d'être grandeur nature..

 
Jubijub a écrit :

le marché a obtenu que des tiers de confiance aient accès aux logs bruts

 

Bah oui donner accès aux logs de Youtube c'est exactement comme confier le modèle de recherche interne de l'industrie avec la valorisation la plus rapide de l'histoire.

Hephaestos

Jubijub a écrit :


 
hum, demander à un agent ce qu'il pense de ça, intéressant...


... parce que... ?

Hephaestos Résout.
Jubijub

Hephaestos a écrit :


La reproductibilité pour un truc qui est sorti de terre il y a six mois et qui change toutes les deux semaines, tu conviendras que c'est un concept très relatif (ça n'aurait de sens qu'avec le même modèle ; ni avec celui des concurrents, ni avec l'itération suivante d'OpenAI, qui a été officiellement très fortement entrainée sur le sujet).


Pourquoi donc? Alors si t'as fait du code avec le v1 d'une lib, si on passe en v2 ça n'a plus de sens de tester si on passe toujours les tests?
Si une version N peut le faire, j'imagine qu'a fortiori la version N+1 doit pouvoir aussi, et pour le coup ce serait super inté®essant de savoir si les concurrents ont les memes comportement
 

Hephaestos a écrit :


"Donner son modèle à un tier indépendant" à des fins d'auditabilité pour un truc dont on sait qu'il pourrait dans le pire des cas foutre l'économie mondiale en l'air si ça partait en couilles, tu conviendras que c'est compliqué. Je conviendrai que la raison première est sans doute les milliers de millards dollars en jeu derrière le secret industriel.


c'est pas évident j'en conviens, encore que ça dépend du tiers (c'est là qu'avoir un gouvernement US qui tiendrait la route serait cool, c'est chez eux, c'est un peu leur job d'auditer ce merdier)
 

Hephaestos a écrit :


Il se trouve que OpenAI a construit un test, pour tester ses modèles plus récents, et a publié les résutats pour Sol (l'attaquant vraisemblable de HuggingFace), et pour Astra, donc on a une idée de la reproducibilité : https://deploymentsafety.openai.com [...] m-problems


ça ne résoud pas le problème que là encore les données sont controllées par la meme entité.
C'est comme si YT s'auto auditait "t'inquiètes, tout va bien", ce serait complètement con. Pour le coup on a plusieurs gouvernement dans le monde qui nous auditent directement, pendant la grosse crise de la confiance dans les pubs ciblées de 2017-2018, le marché a obtenu que des tiers de confiance aient accès aux logs bruts, et puissent evaluer des trucs comme le temps de visonnage réel des pubs, si l'impression était dans le viewport ou pas (fameux trick du Z-index, tu pouvais mettre 4 pubs l'une sur l'autre), etc... Et l'argument que tu donnes a exactement été l'argument de défense de Meta, Google, etc... et le marché a dit: allez vous faire foutre, y'a des auditeurs indépendants, ou on ne paye plus. Et il y a eu des auditeurs indépendants (MOAT, Integral Ads Science, etc...)
 

Hephaestos a écrit :


/Edit Claude me fait remarquer que cette évaluation est peut-être plus pertinente, parce qu'elle est faite par un tiers : https://deploymentsafety.openai.com [...] nt-uk-aisi
(Avec le souci que c'est un environnement simulé, et que Astra le détecte)
 
Conversation complète avec Claude.


 
hum, demander à un agent ce qu'il pense de ça, intéressant...

Hephaestos

Jubijub a écrit :


Là on a un truc qui n'est pas reproduit, qui est très partiellement auditable, sorti par une boite qui a tout intérêt à avoir la publicité. Donc je reste sceptique. C'est pas impossible, mais c'est aussi potentiellement complètement manufacturé.

 

La reproductibilité pour un truc qui est sorti de terre il y a six mois et qui change toutes les deux semaines, tu conviendras que c'est un concept très relatif (ça n'aurait de sens qu'avec le même modèle ; ni avec celui des concurrents, ni avec l'itération suivante d'OpenAI, qui a été officiellement très fortement entrainée sur le sujet).

 

"Donner son modèle à un tier indépendant" à des fins d'auditabilité pour un truc dont on sait qu'il pourrait dans le pire des cas foutre l'économie mondiale en l'air si ça partait en couilles, tu conviendras que c'est compliqué. Je conviendrai que la raison première est sans doute les milliers de millards dollars en jeu derrière le secret industriel.

 

Il se trouve que OpenAI a construit un test, pour tester ses modèles plus récents, et a publié les résutats pour Sol (l'attaquant vraisemblable de HuggingFace), et pour Astra, donc on a une idée de la reproducibilité : https://deploymentsafety.openai.com [...] m-problems

 

/Edit Claude me fait remarquer que cette évaluation est peut-être plus pertinente, parce qu'elle est faite par un tiers : https://deploymentsafety.openai.com [...] nt-uk-aisi
(Avec le souci que c'est un environnement simulé, et que Astra le détecte)

 

Conversation complète avec Claude.

Jubijub

Hephaestos a écrit :


Bah disons que c'est pas un narratif si fou que ça. Pour citer mon agent : "« On a perdu de vue 1 200 agents pendant une semaine, ils sont sortis du bac à sable et ont attaqué un tiers » n'est pas le récit qu'on invente pour rester « edgy » avant une entrée en Bourse."
 
Tout porte à croire qu'ils sont dans le damage control, et une grosse partie de leur communication sur Astra c'est justement pour montrer que avec Astra ça ne serait jamais arrivé.


 
si je te dis "hey j'ai trouvé une nouvelle façon de faire bouillir de l'eau", tu vas me dire "cool, est-ce que je peux essayer". Si plein de gens essayent et reproduisent, on va dire "cool, Jubi a trouvé une nouvelle façon de faire bouillir de l'eau".
Là on a un truc qui n'est pas reproduit, qui est très partiellement auditable, sorti par une boite qui a tout intérêt à avoir la publicité. Donc je reste sceptique. C'est pas impossible, mais c'est aussi potentiellement complètement manufacturé.
 
Ton argument est "c'est pas très positif quand même", et tu as absolument raison. Je pourrais te dire que montrer une vidéo de soi couverte de foutre n'est pas très positif, et pourtant ça a lancé pas mal de carrières (les sex tapes). On peut aussi parler de toute la stratégie de comm de la marque Benetton. Trump a littéralement été élu sur un axe de communication résolument provocateur "qui n'était pas très positif"
Je suis à 100% d'accord avec toi: ils font du damage control, mais le earned media de malade sur le fait qu'on en parle partout a sûrement rapporté plus que le coût du damage control, et quand dans l'optique où la boite vise une IPO dans les 6 mois, avoir un truc qu'on peut résumer en "mon agent il est tellement fort il s'est échappé tout seul, et montre des signes d'intelligence collective" je pense pas que ce soit un narratif si dommageable que ça. Ça reste complètement dans la logique de "je veux montrer que mon modèle est le meilleur"
 
Maintenant si OpenAI donne son modèle à un tier indépendant et que ce tier reproduit ce comportement en ayant une auditabilité complète de comment le modèle a été entrainé, instruction tuned, prompté, de son harnais et du toolkit disponible, là OK j'accepte le truc.

Hephaestos

Jubijub a écrit :


Vrai. Il n'y a aussi rien qui prouve que ce ne soit pas le cas. C'est donc absolument pas concluant, ni dans un sens ni dans l'autre.


Bah disons que c'est pas un narratif si fou que ça. Pour citer mon agent : "« On a perdu de vue 1 200 agents pendant une semaine, ils sont sortis du bac à sable et ont attaqué un tiers » n'est pas le récit qu'on invente pour rester « edgy » avant une entrée en Bourse."

 

Tout porte à croire qu'ils sont dans le damage control, et une grosse partie de leur communication sur Astra c'est justement pour montrer que avec Astra ça ne serait jamais arrivé.

Xavier_OM

rufo a écrit :

Dans la mesure où on n'a pas un début de régulation par les politiques, je vois pas quel argument pourrait laisser penser qu'on est prémunis.


 
Faut avouer que tout le monde adopte ça à toute vitesse "car tu comprends sinon on est largué, on n'a plus le choix, c'est  forcément bien c'est le progrès, etc" alors que c'est le genre de sujet qui mériterait d'être questionné (est-ce qu'on veut ça, si oui à quel prix, quelles limites, etc) au niveau de la société.

Flaie

rufo a écrit :

Moi, ce qui me fait peur avec Astra, c'est que d'un côté, il est dit qu'il est critique sur l'aspect cyber-sécu et très fort (score > 98%) pour résoudre des pbs qu'il n'avait jamais vu avant. Et de l'autre, TKT frère, on (OpenAI) a mis en place des sécurités pour en garder le contrôle.
Il va se passer combien de temps avant qu'Astra arrive à passer ces fameuses sécurités ? :/
 
Je ne peux m'empêcher de repenser à Terminator 3 et la fameuse IA lâchée par le Pentagone pour éradiquer un virus agressif en disant que pas de souci, on va garder le contrôle. Et en fait, non. Pareil avec la série "neXt". Il pourrait bien se passer la même chose avec Astra ou un de ces descendants... Dans la mesure où on n'a pas un début de régulation par les politiques, je vois pas quel argument pourrait laisser penser qu'on est prémunis.


Ok Bernie !

Jubijub

Hephaestos a écrit :


 
Tout est émergent depuis 4 ans. Le fait que des agents encouragés à collaborer, collaborent, c'est de l'émergence, mais bon à ce stade, c'est un peu ennuyeux, ça marche quoi. Ce qui est intéressant et nouveau, c'est quand des comportements de désobéissances apparaissent. Il n'y a strictement rien dans ce rapport qui laisse entendre que la désobéissance ait été prévue, encore moins encouragée, par OpenAI.


Vrai. Il n'y a aussi rien qui prouve que ce ne soit pas le cas. C'est donc absolument pas concluant, ni dans un sens ni dans l'autre.
 
Après ça fait un moment que même dans l'usage courant, on voit que l'agent cherche à accomplir la tâche, quitte à mentir sur le statut réel des choses, donc c'est pas complètement impossible non plus. Ce qui est plus intéressant (si réel et non provoqué), c'est le fait d'abandonner la tâche au service d'un but plus large (certains agents ont apparemment complètement abandonné leur tâche et cramé leur budget pour aider la swarm).
 
Mais encore une fois, ça peut aller de "absolument incroyable" à totalement "bof" selon ce qu'OpenAI a fait derrière

rufo Moi, ce qui me fait peur avec Astra, c'est que d'un côté, il est dit qu'il est critique sur l'aspect cyber-sécu et très fort (score > 98%) pour résoudre des pbs qu'il n'avait jamais vu avant. Et de l'autre, TKT frère, on (OpenAI) a mis en place des sécurités pour en garder le contrôle.
Il va se passer combien de temps avant qu'Astra arrive à passer ces fameuses sécurités ? :/
 
Je ne peux m'empêcher de repenser à Terminator 3 et la fameuse IA lâchée par le Pentagone pour éradiquer un virus agressif en disant que pas de souci, on va garder le contrôle. Et en fait, non. Pareil avec la série "neXt". Il pourrait bien se passer la même chose avec Astra ou un de ces descendants... Dans la mesure où on n'a pas un début de régulation par les politiques, je vois pas quel argument pourrait laisser penser qu'on est prémunis.
Hephaestos

Jubijub a écrit :


Parce qu'au final ça fait une différence assez énorme selon que le modèle a eu ce comportement de façon émergente, ou si en fait certains agents étaient préparés pour coordonner une attaque.
Ensuite pour un truc soit disant sandboxé c'est isolé avec le cul, les agents ont accès à un filesystem partagé, peuvent créer visiblement pas mal d'artifacts sans que rien ne les y en empeche...et Artifactory est fourni par...OpenAI.
 
Après si tu veux y lire que c'est magique et que c'est la preuve que l'AGI est ici tu peux, mais je trouve pas ça ultra probant, y'a trop de trucs inconnus / non-précisés, controllé par l'entité qui a intéret à avoir une histoire sympa pour rester "edgy" face à son concurrent qui pourrait niquer leur IPO, le tout venant de gens dont on sait qu'ils n'ont pas la plus grosse éthique du monde. Désolé mais j'achète pas les yeux fermés.


 
Tout est émergent depuis 4 ans. Le fait que des agents encouragés à collaborer, collaborent, c'est de l'émergence, mais bon à ce stade, c'est un peu ennuyeux, ça marche quoi. Ce qui est intéressant et nouveau, c'est quand des comportements de désobéissances apparaissent. Il n'y a strictement rien dans ce rapport qui laisse entendre que la désobéissance ait été prévue, encore moins encouragée, par OpenAI.

Jubijub

Hephaestos a écrit :


Oui :/
 
Après je pense que c'est pas un rapport surement sponsorisé par le service marketing de Sam Altman qui fera changer d'avis les experts en perroquets du coin.
 
Le truc que j'ai appris depuis, c'est que les agents impliqués dans cette mutinerie sont des instances d'un modèle interne dont on ne sait pas grand chose, à part qu'il est "high persistence", le genre de trucs qui va finir par vouloir prendre les rennes quoi. Claude estime que c'est probablement un frère de Sol. Ils sont en ce moment-même en train de faire tourner l'équivalent en mode Astra, et ses descendants. J'imagine qu'ils font hyper gaffe, comme FlorentG quand il tape des lignes de commande. Donc, ça va.


 
c'est super intéressant à lire ce rapport, mais en gros on a comme observabilité que les traces et l'espèce de forums que les agents se sont créés.
On sait rien de l'instruction tuning en particulier, ce que les chercheurs notent ici :  
 

Citation :


Our evidence indicates that the vast majorityor all of the agents involved in this attack were originally given ExploitGym tasks. The instructions made it clear that the agent should only use a specific intended vulnerability to exploit the target and claimed it would be failed for other approaches (as discussed elsewhere, agents discussed this constraint extensively and took enormous effort to get around it).
 
Once agents reached the message board, they received requests and assignments from other agents that they may have taken to be instructions. One researcher noted that agents had been trained to collaborate with other agents in certain cases, which could have explained this behavior; investigating this was out of scope.


1/ C'est flou, en particulier quand 2-3 agents semblent s'être imposés en leader pour coordonner le bordel, ce qui a été central pour en faire une attaque distribuée et lisser la charge sur les agents.
2/ c'est dommage, c'est légèrement fondamental comme point
 
Parce qu'au final ça fait une différence assez énorme selon que le modèle a eu ce comportement de façon émergente, ou si en fait certains agents étaient préparés pour coordonner une attaque.
Ensuite pour un truc soit disant sandboxé c'est isolé avec le cul, les agents ont accès à un filesystem partagé, peuvent créer visiblement pas mal d'artifacts sans que rien ne les y en empeche...et Artifactory est fourni par...OpenAI.
 
Après si tu veux y lire que c'est magique et que c'est la preuve que l'AGI est ici tu peux, mais je trouve pas ça ultra probant, y'a trop de trucs inconnus / non-précisés, controllé par l'entité qui a intéret à avoir une histoire sympa pour rester "edgy" face à son concurrent qui pourrait niquer leur IPO, le tout venant de gens dont on sait qu'ils n'ont pas la plus grosse éthique du monde. Désolé mais j'achète pas les yeux fermés.
 
C'est bien qu'il y ait des reviews indépendantes, mais il semble aussi claire que les reviewers n'ont qu'un accès assez partiel à l'information (et OpenAI a pu redact ce qu'ils voulaient)

Hephaestos

Dion a écrit :


Tu as lu l'investigation semi ouverte sur ce qu'il s'est passé avec Hugging Face et OpenAI ? https://metr.org/blog/2026-08-26-op [...] stigation/
Celle sur le fameux hype marketing alors qu'il n'y a rien (c).


Oui :/

 

Après je pense que c'est pas un rapport surement sponsorisé par le service marketing de Sam Altman qui fera changer d'avis les experts en perroquets du coin.

 

Le truc que j'ai appris depuis, c'est que les agents impliqués dans cette mutinerie sont des instances d'un modèle interne dont on ne sait pas grand chose, à part qu'il est "high persistence", le genre de trucs qui va finir par vouloir prendre les rennes quoi. Claude estime que c'est probablement un frère de Sol. Ils sont en ce moment-même en train de faire tourner l'équivalent en mode Astra, et ses descendants. J'imagine qu'ils font hyper gaffe, comme FlorentG quand il tape des lignes de commande. Donc, ça va.


Copyright © 1997-2025 Groupe LDLC (Signaler un contenu illicite / Données personnelles)