← News Today

investigacion · 08 de octubre de 2026, 12:10

Chutes y Harvard publican dataset de 6.12B solicitudes para modelos de lenguaje

Investigadores de Chutes y Harvard lanzan un nuevo conjunto de datos masivo diseñado para entrenar y evaluar modelos de lenguaje de gran escala.

Investigadores de Chutes en colaboración con la Universidad de Harvard han publicado un dataset que contiene 6.12 mil millones de solicitudes de usuarios dirigidas a modelos de lenguaje. El conjunto de datos representa un recurso significativo para la comunidad de investigación en inteligencia artificial, proporcionando una visión detallada de cómo los usuarios interactúan con sistemas de lenguaje de gran escala en aplicaciones del mundo real.

El dataset incluye información diversa sobre patrones de uso, consultas típicas y comportamientos de usuario que pueden utilizarse para mejorar el entrenamiento y la evaluación de futuros modelos de lenguaje. Esta información es valiosa tanto para optimizar el rendimiento de los sistemas existentes como para investigar sesgos y limitaciones en las respuestas generadas por inteligencia artificial.

La publicación del dataset busca avanzar en la investigación colaborativa y permitir que otros equipos de desarrollo exploren nuevas metodologías de entrenamiento. Los investigadores esperan que esta base de datos contribuya a acelerar el desarrollo de modelos de lenguaje más seguros, eficientes y alineados con las necesidades reales de los usuarios.

Fuente original: shattered.io