# Cross-Domain Hybrid OPD for Generalizable Search Agents
> Ficha editorial pública de Research IA. Estado: Lectura primaria completa. La interpretación editorial no sustituye la fuente primaria.

- Página canónica: https://luiseduardodemiguel.com/research-ia/papers/cross-domain-hybrid-opd
- Fuente primaria: https://arxiv.org/abs/2608.02101
- Versión leída: v1
- Fuente comprobada: 2026-08-20 · método, resultado y límites revisados; fuente primaria enlazada
- Autores: Hongzhan Chen, Xiaoyu Liu, Dengming Zhang y Yuanbao Team
- Fecha del corte: 03 AGO 2026
- Área: SEARCH AGENTS · RL · GENERALIZACIÓN

## Tesis y contexto

El trabajo combina reinforcement learning para búsqueda con on-policy distillation de expertos de dominios generales para reducir el alignment tax de la especialización.

- Problema: Entrenar mucho una conducta agentic concreta puede mejorar la búsqueda y degradar capacidades generales que siguen siendo necesarias en un asistente universal.
- Por qué importa: Anticipa una arquitectura de modelos especializados que recuperan generalidad mediante destilación cruzada, en lugar de elegir entre search y conversación general.

## Evidencia reportada

- **reported-result**: El technical report sostiene que la búsqueda especializada mejora sin pagar el alignment tax habitual. [localizador](https://arxiv.org/html/2608.02101v1#S3)

## Lectura y límite

- Método: Combina RL agentic para búsqueda con on-policy distillation de expertos de dominios generales sobre Hunyuan3 para recuperar capacidades amplias después de especializar el agente.
- Límite: Es un technical report ligado a una arquitectura y a un conjunto de expertos concreto; la generalización a otros modelos, dominios y escalas necesita reproducción independiente.
- Confianza editorial: Media
- Limitación: Es un technical report y la afirmación sobre alignment tax depende de la selección de dominios, tareas y métricas; falta replicación independiente.
- Limitación: Una búsqueda especializada puede aumentar la tarea evaluada y empeorar seguridad, cobertura o latencia cuando el dominio cambia o la consulta es ambigua.

## Localizadores de evidencia
- [Fuente primaria · canonical](https://arxiv.org/abs/2608.02101): tipo abstract
- [Entrenamiento · HTML](https://arxiv.org/html/2608.02101v1#S3): tipo section
- [HTML · fuente navegable](https://arxiv.org/html/2608.02101): tipo abstract

## Próxima prueba

- ¿La búsqueda híbrida conserva la mejora entre dominios sin degradar seguridad ni coste de inferencia?
- Métrica: Puntuación de tarea, cobertura de evidencia, tasa de respuestas inseguras, latencia y coste.
- Regla de parada: Parar si la ganancia es menor de 5 puntos o si la tasa de respuestas inseguras aumenta 1 punto porcentual.

## Recursos reproducibles
- [HTML · fuente navegable](https://arxiv.org/html/2608.02101v1)

## Enlaces relacionados

- [Before Reasoning Can Fail](https://luiseduardodemiguel.com/research-ia/markdown/papers/before-reasoning-can-fail)
- [CoEvo-Mem](https://luiseduardodemiguel.com/research-ia/markdown/papers/coevo-mem)
- [Shape Your Feed](https://luiseduardodemiguel.com/research-ia/markdown/papers/shape-your-feed)