• keepthepace@tarte.nuage-libre.fr
      link
      fedilink
      Français
      arrow-up
      1
      ·
      7 months ago

      On a eu plusieurs articles qui ont présenté ça comme une fatalité mais ça n’a pas l’air de se retrouver en pratique dans les LLMs

      Pendant au moins une génération, ça s’explique assez bien: Dans les teratokens qui ont été injectés, y a beaucoup de trucs à jeter, y a des choses fausses, y a des redondances, des infos obsolètes, des textes de mauvaise qualité.

      Un LLM qui a déjà effectué un apprentissage dessus a moyen de ressortir un dataset sans ces choses. C’est techniquement des infos qui ont disparues, peut être même certaines infos utiles filtrées par erreur, mais c’est aussi un dataset qui va aller à l’essentiel et retenir plus rapidement les choses importantes. La généralisation arrive plus vite.