El post de Alex Wang y la nueva escasez de datos
данные для ИИсинтетические данныеScale AI
Qué puede afirmarse con certeza sobre la publicación
No conviene fingir que conocemos el contenido del post: el texto exacto de la publicación de Alex Wang en X no está disponible en los materiales facilitados. La entrada indexada está fechada el 2 de octubre de 2026, así que atribuirle frases o conclusiones concretas sería inventar.
Aun así, el contexto disponible es bastante preciso. En entrevistas relacionadas y materiales de Scale AI, Wang habla de forma constante del paso desde los datos masivos de internet abierto hacia conjuntos corporativos propietarios, datos elaborados por expertos para tareas avanzadas y ejemplos sintéticos revisados por personas.
Desde el punto de vista técnico, esto supone un cambio del cuello de botella. No basta con generar otro gran conjunto de respuestas verosímiles: hacen falta reglas de selección, especialistas del dominio, controles de errores y un sistema de evaluación que no premie a un modelo por presentar disparates de manera convincente.
La idea de los flujos híbridos entre personas e IA destaca especialmente. El modelo ayuda a crear y escalar datos, mientras las personas orientan el proceso y verifican la calidad. No desaparece el etiquetado; pasa a un nivel más exigente, desde etiquetas simples hasta evaluar razonamientos, respuestas especializadas y el comportamiento del sistema.
Por qué elegir el modelo ya no resuelve el problema
La conclusión práctica va más allá de otra discusión sobre modelos: la ventaja sostenible se desplaza hacia los datos y la retroalimentación. Un mismo modelo base puede producir resultados radicalmente distintos según la calidad del corpus, el diseño de la evaluación y la forma en que los errores vuelven al pipeline.
Para los equipos de desarrollo, esto cambia las prioridades. Primero revisaría el origen de los datos, la cobertura de casos poco frecuentes, la coherencia de las evaluaciones expertas y las protecciones frente a la acumulación de errores sintéticos. Solo después tiene sentido hablar de ajuste fino o de cambiar el modelo.
Para Scale AI, esta tesis amplía lógicamente su papel: de la anotación a la infraestructura de datos y evaluación. Sin embargo, la tensión de ingeniería sigue siendo la misma: los datos sintéticos se escalan con facilidad, pero la confianza en ellos continúa siendo difícil de escalar.