Meta crea un filtro de IA para elegir experimentos antes de gastar horas de GPU
Meta FAIR presentó los AI Research Preference Models, un sistema que clasifica experimentos de aprendizaje automático antes de ejecutarlos para reducir el gasto de GPU. En pruebas de AIRS-Bench, la herramienta elevó la puntuación promedio de 0,684 a 0,729 y alcanzó resultados comparables al entrenamiento de 24 horas en cerca de 15 horas. ***
- Los RPM comparan candidatos no ejecutados y permiten que el agente elija solo el experimento más prometedor.
- La variante agéntica alcanzó una puntuación normalizada promedio de 0,729 frente a 0,684 sin el sistema.
- Ambas versiones igualaron el resultado del modelo base de 24 horas en aproximadamente 15 horas de cómputo.
La investigación autónoma con inteligencia artificial enfrenta un problema menos vistoso que la generación de ideas: comprobarlas cuesta tiempo, dinero y capacidad de cómputo. Un agente puede proponer decenas de modificaciones para un modelo de aprendizaje automático, pero cada entrenamiento completo puede consumir horas o incluso días de GPU, de modo que la selección previa se convierte en una de las decisiones más importantes del proceso.
Un equipo de FAIR en Meta, junto con investigadores de la Universidad de Oxford y University College London, presentó los AI Research Preference Models, conocidos como RPM. El sistema no intenta adivinar una puntuación absoluta ni pronosticar con precisión el resultado final de un experimento, sino ordenar candidatos todavía no ejecutados y escoger cuál merece pasar primero por la costosa fase de entrenamiento.
Un filtro antes del gasto de cómputo
La propuesta parte de una limitación detectada en los modelos de lenguaje: aunque pueden razonar sobre planes, código e historiales de búsqueda, no resultan confiables cuando deben predecir directamente una métrica de ejecución. Por eso, el RPM adopta una tarea más acotada, comparar dos candidatos y decidir cuál parece una dirección de investigación más prometedora con base en la evidencia disponible.
El mecanismo se integra en AIRA-dojo, un entorno de búsqueda en árbol evolutiva que selecciona padres de forma voraz y utiliza los operadores Draft, Improve y Debug. En lugar de generar un hijo, ejecutarlo y repetir el proceso, el agente aplica un operador 15 veces en paralelo, reúne los candidatos no probados y organiza un torneo eliminatorio por comparaciones pareadas.
Solo el ganador de ese torneo llega a la etapa de ejecución, mientras que cada comparación recibe contexto de los nodos explorados mediante un recorrido de búsqueda en anchura. Ese contexto incluye los experimentos anteriores y las puntuaciones de validación que obtuvieron, una información que permite al juez distinguir entre una mejora plausible, una variación redundante y un error que todavía puede corregirse.
El enfoque cambia la pregunta central del agente. En vez de pedirle que prediga cuánto rendirá cada propuesta, le solicita que determine cuál merece consumir el siguiente bloque de recursos, una decisión más cercana a la evaluación que realizan los investigadores cuando deben priorizar hipótesis bajo un presupuesto limitado.
Dos versiones con distintos costos
El equipo evaluó una variante de RPM basada únicamente en inferencia y otra con capacidades agénticas. En la primera, un modelo de lenguaje congelado actúa como juez y examina los planes candidatos, el código y el historial de búsqueda sin realizar experimentos adicionales, mientras una rúbrica optimizada con MIPROv2 de DSPy orienta sus decisiones.
Esa rúbrica intenta reproducir el criterio de un investigador principal: tolera errores corregibles, premia las ideas que pueden extenderse y penaliza las direcciones que repiten trabajo ya explorado. La precisión fuera de línea de esta versión se situó entre 57,7% y 59,0%, una señal de que la selección mejora con respecto a la aleatoriedad, aunque todavía está lejos de representar un criterio perfecto.
La versión agéntica utiliza el mismo juez, pero le permite operar dentro de un entorno aislado que clona el espacio de trabajo del agente e incluye una única H200. Sus herramientas son python, bash y submit_solution, con las que ejecuta pruebas piloto a pequeña escala antes de decidir si conviene continuar con una dirección o finalizar el ciclo de investigación.
El diseño incorpora dos decisiones que afectan directamente el comportamiento del sistema. Para evitar que se detenga demasiado pronto, el presupuesto restante se presenta como 2.700 segundos aunque el tiempo real disponible sea de 300 segundos, y los pilotos se limitan a 30 con un umbral de 60 segundos; además, el selector agéntico solo interviene en Draft e Improve, porque Debug vuelve a una selección aleatoria para no consumir el reloj con evaluaciones adicionales.
Resultados frente a la selección aleatoria
Las pruebas se realizaron en AIRS-Bench, con 20 tareas públicas de texto y datos tabulares, 24 horas de cómputo en una sola H200 por tarea y 10 semillas. Qwen3.6-27B funcionó como columna vertebral tanto para los operadores de investigación como para el RPM, una condición diseñada para atribuir la mejora a la capa de selección y no a la incorporación de un juez más potente.
La selección aleatoria, utilizada como referencia sin RPM, obtuvo una puntuación normalizada promedio de 0,684. El modelo basado solo en inferencia elevó esa cifra a 0,711, mientras que la versión agéntica alcanzó 0,729; los techos calculados con un oráculo de validación y un oráculo de prueba fueron 0,748 y 0,759, respectivamente.
La diferencia también apareció en la velocidad para alcanzar el resultado del modelo base. La variante de inferencia llegó a la puntuación final de 0,684 en 14,88 horas, equivalente a una aceleración de 1,61 veces, y el sistema agéntico lo consiguió en 15,50 horas, con una mejora de 1,55 veces frente a las 24 horas de referencia.
El beneficio no elimina todos los costos: la inferencia autoalojada añade 0,660 horas por ejecución. Al ajustar por ese tiempo, el rendimiento reportado para la versión correspondiente se ubicó en 0,708 a las 23,34 horas, lo que muestra que la ventaja práctica depende tanto de la calidad del filtro como de la eficiencia de la infraestructura que lo ejecuta.
Resultados destacados y límites de la propuesta
El informe atribuye dos nuevos resultados de referencia a las variantes de RPM. En WinoGrande, el sistema agéntico alcanzó 94,1%, por encima del 90,4% atribuido a un sistema agéntico previo denominado AIRA₂, mientras que la versión basada solo en inferencia obtuvo 95,7% en SVAMP, frente a un resultado humano previo de 94,2%.
Estas cifras no significan que el selector pueda reemplazar la evaluación experimental, porque el RPM sigue necesitando ejecutar el candidato elegido y verificar su desempeño. Su aporte consiste en reducir el número de propuestas que llegan a esa fase, una diferencia importante en escenarios donde la capacidad de GPU determina cuántas hipótesis puede explorar un equipo.
La arquitectura también muestra que la autonomía no depende únicamente de entregar más herramientas al agente. El rendimiento mejora cuando el sistema organiza el presupuesto, conserva el contexto de las pruebas anteriores y compara alternativas antes de comprometer recursos, aunque las decisiones de diseño, como el presupuesto sobrestimado y el regreso de Debug a la aleatoriedad, revelan compromisos todavía experimentales.
La propuesta es parcialmente desplegable: AIRA-dojo y AIRS-Bench son de código abierto, los LLM empleados permanecen congelados y Qwen3.6-27B cuenta con pesos abiertos. Sin embargo, el uso de una H200, el costo de la inferencia autoalojada y la dependencia de pilotos cortos indican que trasladar estos resultados a otros entornos requerirá medir infraestructura, tareas y presupuestos de forma independiente.
MarkTechPost informó que el trabajo fue desarrollado por FAIR en Meta junto con la Universidad de Oxford y University College London, y presentó los RPM como una capa de priorización para agentes de investigación con IA. El resultado más relevante, más allá de una cifra puntual, es la posibilidad de convertir la selección de experimentos en un componente explícito del ciclo de aprendizaje automático, en lugar de dejarla a la generación aleatoria o a la intuición del agente.
La publicación también señaló que la probabilidad estimada de mejora frente a la configuración sin RPM fue de 0,5923 para la variante de inferencia y de 0,5913 para la agéntica, con límites inferiores del intervalo de confianza del 95% de 0,5066 y 0,5018. Esos datos sugieren una ventaja estadística moderada y aconsejan interpretar los resultados como evidencia prometedora, no como una garantía de que el método funcionará igual en cualquier problema de investigación.
Para los equipos que entrenan modelos con presupuestos ajustados, el atractivo está en obtener más exploración útil con las mismas horas disponibles. La idea todavía debe sostenerse en más tareas y configuraciones, pero ofrece una respuesta concreta a una tensión creciente: los agentes pueden generar experimentos cada vez más rápido, mientras que la capacidad para ejecutarlos continúa siendo escasa y costosa.
Este contenido se ofrece únicamente con fines informativos generales y no constituye un asesoramiento financiero, de inversión, legal ni fiscal. Cualquier evento, recompensa, promoción en línea o información relacionada que se mencione en el presente documento no debe considerarse como una recomendación, solicitud o invitación a comprar, vender, operar o de negociar de otra manera con cualquier criptoactivo. Los criptoactivos son sumamente volátiles y pueden provocar pérdidas. La disponibilidad de los servicios, productos y eventos relacionados de WEEX puede variar según la región. Tienes la responsabilidad de asegurarte de que tu participación esté de acuerdo con las leyes y regulaciones locales vigentes.
Te puede gustar

La visita de CZ a Kirguistán destaca por qué el respaldo estatal no puede garantizar una salida de stablecoin

Cuando Polymarket y otros se mueven hacia "el trasfondo": ¿la segunda mitad del mercado de predicciones fuera de las plataformas?

Informe de Polymarket del primer semestre de 2026: ¿Operadores de alta frecuencia o superpredictores?

IFM lanza K2 Horizon, una familia abierta de IA que llega hasta 375.000 millones de parámetros

Nepal pide USD $2.500 millones al fondo climático de la ONU tras inundaciones devastadoras

Avión de carga de Amazon se estrella al aterrizar en Miami y deja varios heridos

Cómo minar Bitcoin: Guía para principiantes sobre la minería de BTC - Los 4 mejores sitios de minería en la nube en 2026
![[Editorial] Lo más importante, más allá de la democracia, es la libertad](/public-static/29_4631d65680.png?format=avif)
[Editorial] Lo más importante, más allá de la democracia, es la libertad

Economía: China inyecta 54 mil millones en su sistema financiero

Acceso a Stock Connect Baidu: ¿las acciones pueden subir un 20% en un mes?

¿Pueden realmente los chips de AI Preferred Networks superar a Nvidia por diez veces?

Recompensas del trading cripto con IA frente a humanos en WEEX en septiembre de 2026

¿Son buenas las apps de trading con IA para las criptomonedas? Dentro del hackathon WEEX AI Wars

La aprobación de Trump cae al 33% y presiona a los mercados antes de las elecciones de medio término

México: Un wallet de Bitcoin de 1,5 M$ vinculado al asesinato de un músico y su familia

Criptomonedas: Una familia secuestrada y agredida por error cerca de Rennes

Informe semanal de la industria de TRON: el informe de empleo no agrícola es agresivo, pero el CPI decidirá si BTC puede mantenerse por encima de 80,000; análisis del KOR Protocol para la construcción de contenido digital y la capitalización de activos IP

XRP Healthcare dice que 4,011 billeteras perdieron $452,000

Meme Coin emparejado directamente con tokens de acciones: la verdadera razón del auge de Robinhood Chain

¿El trading con IA es real o solo publicidad? Explicación de WEEX AI Wars II

Reunión rara durante el período de silencio de la Reserva Federal, controversia en la agenda de Bowman y Powell

Socio de Blockchain Capital: La tokenización es el contenedor del mercado de capitales

Vivienda, industria, coyuntura: La agenda ocupada del Insee en Francia

¡Corea del Sur lleva su mercado de capitales a la blockchain: se revela el plan!

Los ricos evitan impuestos, dejando a los pools de préstamos DeFi cargando con el peso

El fundador de Bankless que liquidó su ETH, ganó mucho en tres meses con cinco activos
![[Entrevista] Park Chang-beom, presidente de HanJaPyeong: "La inversión en criptomonedas extranjeras debe permitirse a través de intercambios nacionales"](/public-static/40_d9655504cd.png?format=avif)
[Entrevista] Park Chang-beom, presidente de HanJaPyeong: "La inversión en criptomonedas extranjeras debe permitirse a través de intercambios nacionales"

唐华斑竹: Se inicia la octava edición de la actividad estratégica de USDD, con un fondo total de 700,000 dólares

Capital B adquiere 25,3 millones de euros en Bitcoin tras completar aumentos de capital

