Lo esencial antes de invertir más tiempo.
Argumenta que muchos benchmarks castigan formato más que conocimiento. Propone adaptar solo 10 vectores de soft-prompt para separar conocimiento real de capacidad de seguir formato. En 7 modelos y 7 datasets, satura format-following en unas 80 steps y predice mejor el ranking post-training que zero/few-shot.
1 (a), we measure no gain on the knowledge metric over the 120 steps of soft-prompt tuning; the same trend holds for open-ended datasets (Fig.
Resultado reportado con fuente enlazada · 5 localizadores disponibles.La lectura primaria permite comprobar método y resultados en el HTML, pero no convierte sus conclusiones en validación independiente. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 4 Experimental Evaluation of Soft-Prompt Tuning.
Comparar la métrica principal de la fuente junto con calidad, coste, latencia y tasa de errores.
Argumenta que muchos benchmarks castigan formato más que conocimiento. Propone adaptar solo 10 vectores de soft-prompt para separar conocimiento real de capacidad de seguir formato. En 7 modelos y 7 datasets, satura format-following en unas 80 steps y predice mejor el ranking post-training que zero/few-shot.
Qué está reportado y qué conviene comprobar.
1 (a), we measure no gain on the knowledge metric over the 120 steps of soft-prompt tuning; the same trend holds for open-ended datasets (Fig.
contexto: 4 Experimental Evaluation of Soft-Prompt Tuning
1 (b) and 2 (b) show that post-trained models (orange) still achieve suboptimal format-following via zero- or few-shot prompting alone, despite their explicit instruction-following training.
contexto: 4 Experimental Evaluation of Soft-Prompt Tuning
1 and 2 ), where Qwen models demonstrate higher format-following capabilities with few-shot prompting compared to other model families.
baseline: Comparación declarada en la sección de evaluación · contexto: 4 Experimental Evaluation of Soft-Prompt Tuning
In some settings, soft-prompt-tuned base models slightly exceed their post-trained counterparts, consistent with recent findings that, given proper prompting, base models can outperform instruction-tuned variants ( Munjal et al.
baseline: Comparación declarada en la sección de evaluación · contexto: 4 Experimental Evaluation of Soft-Prompt Tuning
Qué estudiaron y qué cambia.
La síntesis está separada de los resultados reportados y de las inferencias.PROBLEMA / La señal entra en el radar porque Evaluaciones injustas entre modelos base y post-entrenados.
MÉTODO / La lectura de 3 Soft Prompts for Fair Base-Model Evaluation on Benchmarks describe la intervención y su construcción: Let us now introduce soft-prompt tuning and discuss how to use it for fair benchmarking. Soft-prompt tuning ( Lester et al. 2021 ) shifts instructions from the discrete space of natural-language tokens to the continuous space of embedding vectors. Given a frozen LLM with parameters \theta and embedding dimension D , we define a soft-prompt as a sequence of L learnable vectors \mathbf{S}=\{s_{1},s_{2},\dots,s_{L}\} , where each s_{i}\in\mathbb{R}^{D} . [Fuente: https://arxiv.org/html/2606.12117#S3]
RESULTADO / La sección 4 Experimental Evaluation of Soft-Prompt Tuning informa: 1 (a), we measure no gain on the knowledge metric over the 120 steps of soft-prompt tuning; the same trend holds for open-ended datasets (Fig. 1 (b) and 2 (b) show that post-trained models (orange) still achieve suboptimal format-following via zero- or few-shot prompting alone, despite their explicit instruction-following training. 1 and 2 ), where Qwen models demonstrate higher format-following capabilities with few-shot prompting compared to other model families. [Fuente: https://arxiv.org/html/2606.12117#S4]
LÍMITE / El cierre de la fuente señala: In this section, we present plots comparing the task accuracy scores achieved with soft-prompt tuning and LoRA on both base and post-trained models. Fig. 15 shows a scatter plot of all base and post-trained models evaluated under LoRA and soft-prompt tuning. The plot reveals a clear linear trend between soft-prompt and LoRA performance, indicating close alignment between the two methods. Fig. 17 compares the rankings of LoRA and soft-prompt tuned… La transferencia a evaluación interna de LLMs requiere repetir la comparación con datos y criterios propios [Fuente: https://arxiv.org/html/2606.12117#S5].
La lectura primaria permite comprobar método y resultados en el HTML, pero no convierte sus conclusiones en validación independiente. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 4 Experimental Evaluation of Soft-Prompt Tuning.
- PROBLEMA
- Evaluaciones injustas entre modelos base y post-entrenados.
- MÉTODO
- La lectura de 3 Soft Prompts for Fair Base-Model Evaluation on Benchmarks describe la intervención y su construcción: Let us now introduce soft-prompt tuning and discuss how to use it for fair benchmarking. Soft-prompt tuning ( Lester et al. 2021 ) shifts instructions from the discrete space of natural-language tokens to the continuous space of embedding vectors. Given a frozen LLM with parameters \theta and embedding dimension D , we define a soft-prompt as a sequence of L learnable vectors \mathbf{S}=\{s_{1},s_{2},\dots,s_{L}\} , where each s_{i}\in\mathbb{R}^{D} .
- TIPO DE EVIDENCIA
- La sección 4 Experimental Evaluation of Soft-Prompt Tuning informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2606.12117#S4.
- LÍMITE
- La lectura primaria permite comprobar método y resultados en el HTML, pero no convierte sus conclusiones en validación independiente. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 4 Experimental Evaluation of Soft-Prompt Tuning.
La lectura también deja rastro.
Guarda una observación junto a la evidencia. Tú escribes aquí; los agentes pueden añadir notas por MCP y aparecerán identificados.
LECTURA AMPLIADAMetodología, implicaciones y preguntas para volver al paper.+
La lectura de 3 Soft Prompts for Fair Base-Model Evaluation on Benchmarks describe la intervención y su construcción: Let us now introduce soft-prompt tuning and discuss how to use it for fair benchmarking. Soft-prompt tuning ( Lester et al. 2021 ) shifts instructions from the discrete space of natural-language tokens to the continuous space of embedding vectors. Given a frozen LLM with parameters \theta and embedding dimension D , we define a soft-prompt as a sequence of L learnable vectors \mathbf{S}=\{s_{1},s_{2},\dots,s_{L}\} , where each s_{i}\in\mathbb{R}^{D} .
Para startups, elegir modelo por benchmark bruto puede ser engañoso; conviene distinguir conocimiento, formato y post-training.
La lectura primaria permite comprobar método y resultados en el HTML, pero no convierte sus conclusiones en validación independiente. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 4 Experimental Evaluation of Soft-Prompt Tuning.
Cómo lo llevaría a un proyecto
Probar la propuesta en evaluación interna de LLMs reproduciendo primero la comparación y registrando calidad, coste, latencia y errores.
Preguntas que conviene probar
- ¿La mejora se mantiene cuando evaluación interna de LLMs cambia de dominio o distribución?
- ¿Qué componente del método explica la mayor parte del resultado y qué baseline lo pone realmente a prueba?
Si tuviera que convertirlo en una prueba mañana.
Mi lectura
La pregunta operativa es si evaluación interna de LLMs puede medirse con una línea base y un criterio de parada claros.
Esta última frase es una inferencia editorial a partir del paper y de sus posibles implicaciones; no es una afirmación de los autores.