
C'est un des plus magnifique exemple de déni et de Dunning-Kruger que j'ai vu à plusieurs niveaux.
Franchement, c'est carrément du bonheur pour un psy.
Et ça aussi, c'est magnifique, tu nous sors :
- un argument d'autorité
- comme c'est toi qui cites leurs réponses délirantes vu tes questions ultra-orientées et qu'en plus, tu ne sais pas prompter, cela te permet de croire que tu as dit quelque chose de pertinent en faisant photocopieuse
- en même temps, tu confirmes que tu vis dans un monde où tu as renoncé à toute forme de pensée et d'opinion
- en faisant tes copier-coller, tu montres aussi que tu ne sais pas du tout utiliser Claude qui serait parfaitement capable d'être autonome pour participer à ce fil. Tu ne peux absolument pas mesurer l'ironie de la chose parce qu'il aurait fallu lire le fil et avoir une vague idée de ce qu'est un agent.
Je me demande vraiment ce qui passe par la tête des trolls comme toi qui viennent pourrir les discussions en voulant absolument participer à une discussion entre adultes alors qu'ils sont des gamins qui n'ont pas la moindre idée du sujet abordé mais veulent juste un peu d'attention.
Mais surtout ce que je n'ai jamais compris, c'est pourquoi ce forum est obsédé par laisser le même petit groupe de trolls pourrir les discussions systématiquement année après année, voir partir les intervenants compétents sous prétexte qu'il faut être gentil avec les gens qui n'ont rien à dire parce qu'ils n'ont pas de fonctions cognitives au delà de la diarrhée verbale.
Et qui maintenant ont délégué les fonctions cognitives à un chatbot sans même arriver à s'en servir.
Bonjour pm42 et les autres,
Tes premières réponses m'ayant vraiment impressionné, je souhaiterai t'en poser une autre sur l’évolution possible des I.A.s
Penses tu qu'il serait possible dans le futur, disons dans 50 ans, de dire aux meilleurs I.A. : " bonjour pourriez vous collaborer entre vous pendant 1 mois pour résoudre un des problèmes du millénaire de l'institut Clay par exemple P=Np ou autre. Merci " et qu'elles y arrivent ?
Merci
C'est ce que j'ai entendue de la part du patron d'Anthropic. Lui parlait plutôt de 1 million sur 24h.
Ce n'est pas dans 50 ans, beaucoup plus tôt. ChatGPT 3.5, le 1er LLM a s'être imposé est sorti il y a moins de 4 ans. Ses capacités étaient impressionnantes mais limitées : pas d'accès Internet, pas d'outils, pas de capacité à faire tourner des programmes et aucun raisonnement. Son autonomie se limitait à donner des réponses instantanées.
Depuis, on a développé énormément de techniques et outils autour, la capacité de réfléxion est suffisante pour démontrer des théorèmes, l'autonomie est passée à plusieurs heures au moins...
Et la "puissance" des IA double tous les 7 mois environ. Depuis 2024-2025, cela même été 2 fois plus vite que ça.
Donc savoir ce qui va se passer dans les 2 à 5 ans qui vienne n'est pas facile mais il y a de bonnes chances qu'une IA ou une collaboration d'IA démontre quelque chose de vraiment pointu.
On peut aussi taper un mur et voir les progrès ralentir ce qui est déjà arrivé dans le passé mais là, on a beaucoup de gens très intelligents qui travaillent sur l'amélioration de l'IA partout sur la planète (enfin surtout USA et Chine) et avec des moyens presque illimités.
C'est peut-être parce que tu n'as pas encore compris que ce forum est au départ destiné à être un échange entre ignorant et sachant en étant ouvert à toutes les origines de l'ignorance y compris la limitation cognitive ?Mais surtout ce que je n'ai jamais compris, c'est pourquoi ce forum est obsédé par laisser le même petit groupe de trolls pourrir les discussions systématiquement année après année, voir partir les intervenants compétents sous prétexte qu'il faut être gentil avec les gens qui n'ont rien à dire parce qu'ils n'ont pas de fonctions cognitives au delà de la diarrhée verbale.
Et qui maintenant ont délégué les fonctions cognitives à un chatbot sans même arriver à s'en servir.
La bêtise humaine c'est comme la corrida : c'est une tradition locale ininterrompue.
Ca doit être ça.
Je veux bien que tu m'expliques en quoi les copier-coller de ce qu'une IA très mal utilisée par Biname lui a sorti participe d'un échange entre ignorant et sachant ?
Pendant qu'on y est, explique moi aussi pourquoi tu sors ça alors que justement sur ce fil, je viens exactement de faire ça, partager mon expertise ?
Tu as apporté quoi ?
Oups. Mais c'est le problème de ce forum depuis toujours : expliquer qu'il faut être gentil et patient envers les trolls, supporter leurs pourrissages systématiques de tous les fils, leur mépris, insulte, perdre son temps à débunker leurs délires.
Résultat : ça donne quoi la fréquentation et le niveau actuellement ?
Il y a combien de personnes ici qui sont capables de parler d'IA par exemple ?
Et rassure toi, bientôt, vous aurez le bonheur d'avoir seulement Biname qui prendra vos questions, les copiera avec des erreurs dans Claude ou autre, puis recopiera la réponse avec des erreurs ici pour vous expliquer qu'au final, cela fait de lui quelqu'un d'intelligent.
Bravo pour avoir au fil des années dérivé vers le trollisme total qui est la marque de fabrique de cet endroit qui a d'ailleurs aussi épuisé ses modérateurs parce qu'ils n'ont jamais remis leur modèle en cause et refusé de voir que quand on laisse n'importe qui causer, on devient un réseau social rempli de l'équivalent de photos de chats, théories du complot et autres.
P.S : bon, les sections bricolages sont franchement pas mal mais c'est tout. Un comble pour un forum scientifique mais c'était ma seule raison de garder un compte.
Sauf que maintenant, Claude est incroyablement bon quand il s'agit de donner des conseils sur ces sujets là aussi.
D'en parler je dirai moi mais j'en connais d'autres. Après ça dépend pour dire quoi et à quiIl y a combien de personnes ici qui sont capables de parler d'IA par exemple ?
Bonjour, voila un exemple de discussion mais interne à un modèle (DeepSeek-R1-Distill-Qwen-14B-Q4_K_M.gguf), comme on peut le voir, il y a une sorte de discussion interne dans ce modèle qui le rend bien meilleur que gemma2 :
"content_LLM": "Alright, let's tackle this query. The user is asking about the variant CHEK2 c.844G>A p.E282K. First, I need to check if this exact combination is mentioned in the provided context. Looking at the context, I see that the variant discussed is MLH1 c.844G>A, not CHEK2. So, the specific variant the user is asking about isn't present.\n\nSince the exact combination isn't found, I should respond with \"Non mentionné dans les sources\" for all fields. I must avoid making any assumptions or interpretations. It's crucial to stick strictly to the instructions and not infer any information that's not explicitly stated.\n\nI also need to ensure that I don't confuse this variant with others in different genes. Even though the variant in MLH1 is mentioned, it's a different gene, so it doesn't apply here. Therefore, all the fields should be marked as not mentioned.\n\nI'll structure the response with all the required fields, each indicating that the information isn't found in the sources. This includes the variant details, classification, evidence level, genetic characteristics, population frequency, associated cancers, clinical significance, and references.\n\nFinally, I'll make sure to cite the PMID provided, even though it doesn't mention the specific CHEK2 variant. This way, the response remains accurate and adheres to the user's strict guidelines.\n</think>
\n\n**Synthèse structurée :**\n\n**variant:** \"CHEK2 c.844G>A p.E282K\" \n**gene:** \"CHEK2\" \n**genomic_variation:** \"c.844G>A\" \n**amino_acid_change:** \"p.E282K\" \n**amino_acid_converted:** \"E\" \n\n---\n\n**Classification ACMG :** \n**pathogenicity_class:** \"Non déterminable à partir des sources\" \n**pathogenicity_justificatio n:** \"Non mentionné dans les sources\" \n\n---\n\n**Niveau de preuve :** \n**evidence_level:** \"Non déterminable\" \n**evidence_justification:** \"Non mentionné dans les sources\" \n\n---\n\n**Caractéristiques génétiques :** \n**inheritance_pattern:** \"Non mentionné\" \n**penetrance:** \"Non mentionné\" \n**mechanism:** \"Non mentionné\" \n\n---\n\n**Fréquence population :** \n**population_frequency:** \"Non mentionné\" \n**population_frequency_sourc e:** \"Non mentionné\" \n\n---\n\n**Cancers et syndromes associés :** \n**associated_cancers:** \"Non mentionné\" \n**associated_syndrome:** \"Non mentionné\" \n\n---\n\n**Synthèse clinique :** \n**clinical_significance:** \"Non mentionné\" \n**therapeutic_implications:* * \"Non mentionné dans les sources\" \n**clinical_recommendations:* * \"Non mentionné\" \n\n---\n\n**Évaluation et résumé :** \n**confidence_score:** \"0\" \n**confidence_justification:* * \"Aucune information disponible sur le variant spécifié.\" \n**executive_summary:** \"Aucune information n'est disponible sur le variant CHEK2 c.844G>A p.E282K dans les sources fournies.\" \n\n---\n\n**Sources :** \n**pmid_references:** [37694253] \n**publication_years:** [2023]"
Salut,
Je ne suis pas du tout, mais alors là, pas du tout d'accord !
On sais pas à qui tu parles
Cela ressemble à de Chain of thought classique. Je me demande pourquoi Gemma 2 ne le ferait pas.
Mais j'ai repensé à ton cas et je me demande si du fine-tuning d'un modèle existant ne serait pas possible. Ou si tu ne peux pas tout ramener à un univers tabulaire pour faire de l'IA statistique.
Salut,
C'est un peu ce que mon immense ignorance a fait dire, par un hasard inexplicable, à Claude msg #28Bonjour, voila un exemple de discussion mais interne à un modèle (DeepSeek-R1-Distill-Qwen-14B-Q4_K_M.gguf), comme on peut le voir, il y a une sorte de discussion interne dans ce modèle qui le rend bien meilleur que gemma2 :
...
Even though the variant in MLH1 is mentioned, it's a different gene, so it doesn't apply here.
...
"Mais c'est justement là que le bât blesse : le problème qu'il décrivait avant (CHEK2 vs MLH1) n'est pas une erreur de compréhension complexe, c'est une erreur d'attention/associativité — le genre d'erreur qu'un collégien attentif ne ferait presque jamais, parce qu'un humain qui lit "le variant X est dans le gène MLH1" ne va pas soudain l'attribuer à CHEK2 juste parce que ce gène est mentionné trois lignes plus loin. Un LLM, lui, peut le faire, précisément parce qu'il ne "lit" pas comme un collégien — il génère du texte statistiquement plausible, ce qui est différent de suivre une référence précise dans un texte."
L'IA calcule la distance cosinus dans un EVN fait de 'mots', entre le contexte et les mots de son lexique ? PM42 corrigera avec plaisir mon imprécision.
J'ai posé la question à Deepseek version gratuite.
Apparemment, ce modèle Deepseek a été entraîné avec des milliers d'exemples où une réponse correcte est précédé d'un raisonnement explicite.
https://arxiv.org/pdf/2501.12948
Page 21 du pdf, il y a : " Specifically, we first engage human annotators to convert
the reasoning trace into a more natural, human conversational style. The modified data pairs
are then used as examples to prompt an LLM to rewrite additional data in a similar style"
Le pdf fait 86 pages, je l'ai juste survolé pour essayer de comprendre un peu mieux.
Oui, c'est du chain of thought implémenté directement dans le modèle par Reinforcement Learning.
Au départ (2022) on faisait du Chain of Thought par prompting et depuis qu'on a des modèles avec un mode "réflexion", qui ont été brièvement appelés Large Reasoning Models (o1 chez OpenAI par ex), on les entraine directement à "penser" comme ça.
Un des axes de recherche est de leur permettre de penser sans verbaliser tout ce qui augmenterait l'efficacité à tous points de vue.
C'est vrai que j'ai du passer de 1024 token à 2048 pour la sortie. Avec un modèle local, c'est pas très grave à mon avis mais avec les API, la facture doit être salée ?
Oui. Ce qui sauve, c'est les abonnements prix fixe. Je paye 200$/mois pour Claude, 20$/mois pour ChatGPT que j'utilise beaucoup moins.
Mais si je payais à l'API, je dépenserais dans les 10000$/mois. Ce qui n'est pas choquant dans un cadre professionnel quand on multiplie sa productivité par 5, 50 ou plus.
On évalue que bientôt, certaines entreprises vont dépenser plus en tokens qu'en salaire. Si on garde son organisation/modèle économique pre-IA, ce n'est pas tenable et cela a donné des articles dans la presse grand public.
Mais si on fait à 3 le boulot de 30 et beaucoup plus vite avec une meilleure qualité, pas de pb.
Bonsoir,
@PM42
Un peu hors sujet :
Aurais-tu des bouquins pas trop hard à conseiller pour évoluer au-delà de l'utilisation "IA-Google" et pourquoi pas en utilisant un peu de Python pour se faire la main ?
En dur de préférence aux pdf qui sont un peu difficiles à lire sur écran pour une vieille croûte et chers à imprimer.
Seuls les faucons volent. Les vrais restent au sol.
Non, je n'ai pas le souvenir d'avoir lu de livre sur le sujet et ça bouge tellement vite que je ne sais même pas si cela a du sens actuellement.
Tout dépend aussi de ce que tu veux apprendre, le sujet est quand même vaste.
Salut,
L'IA Claude propose une solution concrète sur base de ton premier message, pas de l'esbroufe
-----------------
3) Architecture plus adaptée à vos contraintes
Plutôt qu'un post-hoc critique en langage naturel, inversez le pipeline : extraction structurée avant génération.
Extrayez d'abord tous les couples (gène, variant) présents dans l'abstract avec une méthode déterministe ou quasi-déterministe : cooccurrence dans la même phrase, dépendances syntaxiques (spaCy + règles), ou un outil de NER biomédical (type outils tmVar/GNormPlus pour la reconnaissance de variants et de gènes). Coût de calcul quasi nul, pas besoin de LLM ici.
Ne donnez au LLM générateur que les couples validés, avec obligation de citer le span exact de l'abstract qui justifie chaque fait (extractive grounding). Vous vérifiez ensuite par un simple match de sous-chaîne que la citation existe réellement et correspond bien à l'association gène-variant attendue.
Le "critique LLM" devient alors un vérificateur de cohérence entre JSON généré et spans cités, tâche beaucoup plus mécanique donc plus fiable pour un petit modèle.
C'est moins élégant qu'un dialogue de deux agents, mais plus robuste sur ce type d'erreur — et ça évite l'usine à gaz côté RAG puisque vous déplacez la charge de fiabilité sur du parsing plutôt que sur un second LLM.
-----------------
Toute la réponse (20 lignes) :
Cliquez pour afficher
Le vrai problème que vous décrivez (variant attribué au mauvais gène) n'est pas un problème de raisonnement ou de "conscience critique" du LLM, c'est un problème de liaison d'entités (entity linking). Un dialogue LLM↔LLM ne le résout pas bien parce que les deux modèles partagent souvent les mêmes biais d'association statistique (CHEK2 et le variant apparaissent proches dans le texte → association plausible même si fausse).
1) Prérequis pour un dialogue LLM-LLM efficace
Le critique doit avoir un accès indépendant à la vérité terrain, pas juste relire le texte du générateur. Sinon il "critique" avec les mêmes biais que celui qui a halluciné.
Il faut un signal de vérification déterministe quelque part dans la boucle (regex, parsing structuré, base de données), pas seulement du texte-contre-texte.
Le critique doit avoir une tâche étroite et vérifiable ("ce couple gène-variant apparaît-il dans la même phrase/section ?"), pas une tâche ouverte ("est-ce que cette fiche est fiable ?").
2) Même modèle ou modèle distinct ?
Pour des 7-9B, l'auto-critique (même modèle) apporte peu sur ce type d'erreur factuelle — le modèle a tendance à re-confirmer sa propre hallucination car le raisonnement qui l'a produite est stable. Un second modèle différent aide un peu plus (surtout si son prompt le pousse à chercher activement des contradictions), mais l'essentiel du gain viendra de la vérification déterministe, pas de la diversité des modèles.
3) Architecture plus adaptée à vos contraintes
Plutôt qu'un post-hoc critique en langage naturel, inversez le pipeline : extraction structurée avant génération.
Extrayez d'abord tous les couples (gène, variant) présents dans l'abstract avec une méthode déterministe ou quasi-déterministe : cooccurrence dans la même phrase, dépendances syntaxiques (spaCy + règles), ou un outil de NER biomédical (type outils tmVar/GNormPlus pour la reconnaissance de variants et de gènes). Coût de calcul quasi nul, pas besoin de LLM ici.
Ne donnez au LLM générateur que les couples validés, avec obligation de citer le span exact de l'abstract qui justifie chaque fait (extractive grounding). Vous vérifiez ensuite par un simple match de sous-chaîne que la citation existe réellement et correspond bien à l'association gène-variant attendue.
Le "critique LLM" devient alors un vérificateur de cohérence entre JSON généré et spans cités, tâche beaucoup plus mécanique donc plus fiable pour un petit modèle.
C'est moins élégant qu'un dialogue de deux agents, mais plus robuste sur ce type d'erreur — et ça évite l'usine à gaz côté RAG puisque vous déplacez la charge de fiabilité sur du parsing plutôt que sur un second LLM.
4) DeepSeek-R1-Distill
Les distillations de raisonnement (chaîne de pensée) améliorent surtout la cohérence logique sur des tâches multi-étapes, pas la fidélité factuelle à un texte source — ce n'est pas le type d'erreur que vous rencontrez ici. Vous pourriez voir une légère amélioration en 14B sur le respect du format JSON et la rigueur du raisonnement affiché, mais je ne m'attendrais pas à un gain net sur les hallucinations d'attribution gène-variant, car ce n'est pas ce pour quoi ces modèles sont distillés. Ça vaut le test rapide, mais je ne l'utiliserais pas comme axe principal d'amélioration.
En une minute !
@ pm42 https://fr.wikipedia.org/wiki/Rasoir_de_Hanlon
Mais bon c'est pas facile à suivre comme règle dans certains cas![]()
La bêtise humaine c'est comme la corrida : c'est une tradition locale ininterrompue.
Oui, j'y ai pensé, l'avantage serait de se passer de carte graphique mais se serait chiant à maintenir je pense.
Etant donné qu'avec DeepSeek-R1, j'obtiens un résumé parfait des abstracts, tu as clairement tort.
Dernière modification par vgondr98 ; 21/07/2026 à 08h16.
Il n'a pas tort : il se contente de faire du copier/coller de ce que dit un IA et il est totalement incapable de s'en servir. Il ne comprend d'ailleurs pas plus ce qu'il écrit dedans que la sortie.
Mais bon, je vais vous laisser causer entre vous.
Salut,
PM42 a raison, je ne comprends pas parfaitement tout ce que je colle.
Biname via IA : Plutôt qu'un post-hoc critique en langage naturel, inversez le pipeline : extraction structurée avant génération.
Toi : Oui, j'y ai pensé, l'avantage serait de se passer de carte graphique mais se serait chiant à maintenir je pense.
(les pb de parsing et de format qui change, je connais)
Claude parle de NER, une IA ciblée gratuite de 115 MB à 350 MB utilisée sur ce terrain spécifique ?
Biname via IA : 4) DeepSeek-R1-Distill
Les distillations de raisonnement (chaîne de pensée) améliorent surtout la cohérence logique sur des tâches multi-étapes, pas la fidélité factuelle à un texte source
Toi : Etant donné qu'avec DeepSeek-R1, j'obtiens un résumé parfait des abstracts, tu as clairement tort.
Alors ton pb est résolu ! Bravo (Claude en doute ?).
Pourquoi n'ouvres-tu pas un chat sur ce sujet sur une grande IA ?
Je vais faire un petit update sur mon projet. Il marche vraiment très bien sauf au niveau du format généré par le LLM qui a de nombreuses variations. Parfois il répond avec les clefs en anglais, parfois en français, parfois avec des clefs imbriqués, parfois en json, parfois en markdown.
J'ai commencé par tenter de régler ce problème avec une fonction de parsing mais elle est rapidement devenu une usine à gaz monstrueuse.
Mais hier, je suis tombé sur la technique du constraint decoding qui semble parfaite pour régler ce problème. Si j'ai bien compris, cette technique impose pendant la génération des token de choisir parmi un nombre limité de token par exemple le token { afin de produire du json valide.
Si j'ai bien compris, on peut aussi imposer le choix des clefs du json et l'ordre de création.
Je me suis aussi demandé si on pouvait utiliser cette technique pour faire écrire par le LLM les règles ACMG (des règles à suivre pour classer un variant) avant sa réflexion afin de l'améliorer ?
Bonne question et je ne suis pas sur. On entraine les LLMs à produire certains formats comme le JSON pour des raisons évidentes. Et notamment parce que les 1ers faisaient n'importe quoi "de temps en temps" ce qui cassait leur utilisé en production.
Là, on parle d'un format qui est rare donc j'ai un gros doute.
J'essaierais plutôt de faire générer au prompt puis de faire relire par un autre appel au même modèle ou mieux à un autre modèle en lui demandant de corriger les erreurs. Mais c'est juste une idée.
D'autant plus que les problèmes que tu décris au début de ton message sont assez typiques des petits modèles et que j'y ai consacré assez peu de temps.
@pm42
Bonjour,
Dans l' ancien post de juin 2026 signalé par Philippedelimoges pm42 tu as écrit :
Je viens de le faire avec ChatGPT qui me semble t'il a très bien répondu;P.S : Je conseille à ceux qui veulent en savoir plus de poser à Claude, idéalement Opus 4.8 les question suivantes dans la même conversation :
- Quid des problème de maths résolus récemment par des IAs ?
- que donneraient des modèles de type LCM, Large Concept Models en maths ?
- quels autres progrès prévisibles qui auraient un impact en maths ?
Les réponses sont effrayantes.
Cela aurait été différent avec Claude Opus 4.8 ?
