¡Oye! Como proveedor de transformadores, a menudo me preguntan qué conjuntos de datos se utilizan habitualmente para entrenar modelos de transformadores. Es un tema súper interesante y hoy lo voy a desglosar para todos ustedes.
En primer lugar, comprendamos por qué los conjuntos de datos son tan importantes cuando se trata de entrenar modelos Transformer. Estos modelos son como estos estudiantes súper inteligentes, pero necesitan una gran cantidad de datos para aprender realmente bien y poder hacer todo tipo de cosas interesantes, como traducción de idiomas, generación de texto e incluso responder preguntas como lo estoy haciendo yo ahora.
1. Conjuntos de datos de Wikipedia
Uno de los conjuntos de datos más populares que existen son los datos de Wikipedia. Es enorme y cubre una amplia gama de temas. Tienes artículos sobre historia, ciencia, tecnología, cultura y prácticamente todo lo que hay bajo el sol. El lenguaje utilizado en los artículos de Wikipedia también es bastante diverso y está bien estructurado.


Lo mejor de utilizar datos de Wikipedia es que están disponibles públicamente. Puede simplemente ir y obtener la información que necesita (por supuesto, siguiendo las reglas y regulaciones adecuadas). Los modelos de transformadores pueden aprender mucho de él, incluido vocabulario, gramática y conocimientos sobre diferentes campos. Por ejemplo, si está entrenando un modelo para responder preguntas de conocimiento general, los datos de Wikipedia pueden proporcionar una base sólida. El modelo puede captar cómo se relacionan diferentes conceptos, como cómo se conecta una teoría científica particular con sus aplicaciones en el mundo real.
2. LibroCorpus
BookCorpus es otro conjunto de datos impresionante. Como sugiere el nombre, se compone de una gran colección de libros. Los libros son diferentes de los artículos de Wikipedia. A menudo tienen una estructura narrativa y el lenguaje utilizado puede ser más creativo y matizado.
Cuando usa BookCorpus para entrenar un modelo Transformer, el modelo puede aprender sobre técnicas de narración, desarrollo de personajes y diferentes estilos de escritura. Esto es realmente útil si buscas entrenar un modelo para tareas como escritura creativa o generación de texto en un contexto más literario. El modelo puede comenzar a imitar el flujo y el ritmo de libros bien escritos y puede generar texto que se lea de manera más fluida y atractiva.
3. Rastreo común
Common Crawl es un conjunto de datos masivo. Básicamente es una enorme colección de páginas web que se rastrean y archivan periódicamente. La escala de Common Crawl es alucinante. Tiene petabytes de datos.
La ventaja de utilizar Common Crawl es que representa el uso del idioma en el mundo real en Internet. Tienes todo tipo de contenido, desde artículos de noticias y blogs hasta publicaciones en redes sociales y reseñas de productos. Esto significa que un modelo Transformer entrenado en Common Crawl puede comprender y generar texto similar a lo que la gente realmente escribe y lee en línea. Sin embargo, la desventaja es que los datos son bastante ruidosos. Hay mucha basura, como spam, anuncios y contenido mal escrito. Por lo tanto, debe realizar mucha limpieza y preprocesamiento antes de usarlo para entrenar su modelo.
4. Conjuntos de datos de caras abrazadas
Hugging Face tiene esta colección de conjuntos de datos realmente interesante. Han seleccionado una gran cantidad de conjuntos de datos diferentes para diferentes tareas. Tiene conjuntos de datos para análisis de opiniones, reconocimiento de entidades nombradas y traducción automática, solo por nombrar algunos.
Lo bueno de los conjuntos de datos de Hugging Face es que son de fácil acceso y uso. Hugging Face proporciona una biblioteca de Python que le permite descargar y preprocesar los conjuntos de datos con solo unas pocas líneas de código. También tienen mucha documentación y ejemplos, por lo que incluso si eres nuevo en el trabajo con conjuntos de datos, puedes comenzar bastante rápido. Estos conjuntos de datos también están bien organizados y, a menudo, vienen con divisiones predefinidas para capacitación, validación y prueba, lo que hace que el proceso de capacitación sea mucho más sencillo.
5. Conjuntos de datos TREC (Conferencia de recuperación de texto)
Los conjuntos de datos TREC se utilizan principalmente para tareas de recuperación de información y respuesta a preguntas. Contienen una colección de documentos y un conjunto de preguntas que deben responderse en base a esos documentos.
Estos conjuntos de datos son excelentes porque están diseñados específicamente para probar y entrenar modelos sobre cómo encontrar información relevante en un gran conjunto de textos. Los modelos de transformadores entrenados en conjuntos de datos TREC pueden llegar a ser realmente buenos para escanear rápidamente documentos y obtener las respuestas más relevantes. Esto es muy útil en aplicaciones como motores de búsqueda y bibliotecas digitales, donde los usuarios buscan información específica.
Ahora, déjame contarte un poco sobre los transformadores que suministramos. Tenemos algunos productos de muy alta calidad, como elTransformador de accionamiento de potencia silencioso y rápido, respuesta rápida ultra silenciosa. Este transformador no sólo es rápido sino también ultrasilencioso, perfecto para lugares donde el ruido puede ser un problema.
También tenemos elTransformador lleno de aceite. Este tipo de transformadores son excelentes para aplicaciones de alta potencia. Están diseñados para manejar grandes cantidades de electricidad y son muy confiables.
Y para aquellos que necesitan aún más potencia, tenemos elTransformador de distribución de energía lleno de aceite de alta capacidad. Este chico malo puede distribuir una enorme cantidad de energía, lo que lo hace ideal para uso industrial.
Si está interesado en alguno de estos productos o si tiene alguna pregunta sobre los conjuntos de datos para entrenar modelos de Transformer, no dude en comunicarse con nosotros. Estamos aquí para ayudarle a tomar las mejores decisiones para sus necesidades. Si usted es un investigador que busca entrenar el próximo gran modelo de transformador o una empresa que necesita transformadores de alta calidad, lo tenemos cubierto. ¡Comencemos una conversación y veamos cómo podemos trabajar juntos!
Referencias
- Brown, Tom B. y otros. "Los modelos de lenguaje son pocos: aprendices de tiro". Avances en sistemas de procesamiento de información neuronal 33 (2020): 1877 - 1901.
- Raffel, Colin y otros. "🤗 Conjuntos de datos: una comunidad - biblioteca para el procesamiento del lenguaje natural". Preimpresión de arXiv arXiv:2010.10759 (2020).
- Callan, Jamie, et al. "TREC - Informe de seguimiento de respuesta a 8 preguntas". Conferencia de recuperación de textos. vol. 8. 2000.






