Después de diecisiete etapas midiendo recuperación, longitud, variedad y repetición, el fallo llegó por donde llegan siempre: alguien usando la aplicación.
input: tengo una entrevista de trabajo y estoy mazo de nervioso
output: Pues nada, tío, que tiene una entrevista de trabajo y está mazo de nervioso, ¿eh?
me la devuelve en 3ª persona y sin ninguna gracia. hay que controlar eso
Dos quejas en tres líneas. Resultaron ser dos fallos distintos, y uno de ellos ni siquiera era el que parecía.
No era la tercera persona
Lo primero fue reproducirlo con doce frases escritas en primera persona. Y lo que salió no fue lo esperado:
«tengo una entrevista» → «tienes… estás» segunda persona
«me he dejado las llaves» → «me he dejado» correcta
«llevo toda la semana» → «llevo» correctaEl sujeto no se iba a tercera persona: se iba a donde le pillara. Seis de las doce lo perdían, y de tres maneras diferentes: cuatro pasaban a segunda persona —«el jefe te pide currar el sábado»—, dos lo eliminaban dejando un titular sin protagonista —«segundo suspenso en el examen de conducir»— y una dejaba de contar para ponerse a responder: «entrevista de trabajo, ¿eh? Te entiendo perfectamente».
Esa última es la que conecta las dos quejas. Cuando el modelo se pone a comentar el texto en vez de contarlo, se queda sin contenido que adornar, y lo que sale es una frase hueca. La falta de gracia y la pérdida del sujeto eran el mismo suceso visto desde dos ángulos.
La etapa anterior ya medía fidelidad: qué proporción de las palabras con contenido del texto original sobreviven en la respuesta. Es una medida que funcionó bien —cazó una regresión que todas las métricas de estilo pasaron por alto— y que aquí es ciega por construcción.
«Tengo una entrevista» y «tienes una entrevista» comparten todas y cada una de sus palabras con contenido. La frase sigue hablando de una entrevista y sigue hablando de nervios. Solo que le pasan a otro.
Hizo falta un control nuevo, perico.evals.person, que no mide qué palabras sobreviven sino de quién se habla.
La causa: el prompt se contradecía
Dos instrucciones, separadas por veinte líneas en el mismo texto:
- Coloquial y directa. Tuteas, te diriges a quien te escucha.
...
- Lo primero: tiene que seguir contando lo mismo. Quién, qué pasa y cómo acaba.Léelas juntas y el conflicto salta: si te digo que tutees y a la vez que respetes quién protagoniza lo que se cuenta, ¿qué haces con un texto escrito en primera persona? El modelo resolvía la contradicción como le venía en cada petición, que es exactamente lo que se veía.
La corrección consistió en separar dos cosas que estaban mezcladas: a quién te diriges y de quién hablas. El «¿eh?» va dirigido al oyente; no convierte al protagonista en «tú».
Con eso, de seis sobre doce a doce sobre dieciséis, y cero casos de segunda persona.
La segunda queja: no era falta de gracia, era exceso de fórmula
Con el sujeto arreglado, tocaba mirar lo de «sin ninguna gracia». Y ahí los datos fueron más duros que la queja:
| él, en sus 1.103 frases | nosotros, en 16 respuestas | |
|---|---|---|
| abre con «pues nada» | 0,1 % (una frase) | 94 % (quince) |
| contiene «¿eh?» | 7 % | 81 % |
Quince de dieciséis respuestas empezaban exactamente igual. No era que faltara gracia: es que sobraba molde.
Y el culpable estaba, otra vez, en el prompt:
- Arrancas las frases con «pues», «bueno» u «o sea», y las cierras
buscando la razón del otro: «¿eh?», «¿no?».Resultado: los arranques distintos pasaron de dos sobre dieciséis a catorce sobre dieciséis.
El cambio que hubo que retirar
Pero ese arreglo trajo una regresión. Al soltarle la fórmula, el modelo gastó la libertad recién ganada en adornar más, y la fidelidad cayó del 81 % al 70 %. Un caso concreto lo enseña bien:
IN : he quemado la comida y viene mi suegra a cenar
OUT: Tela, tela. Tela marinera. Se me ha ido el pajarito con la sartén
y me sale todo más tostao que un puerto de tercera.No hay suegra. Fidelidad: 0 %.
La reacción natural fue reforzar la regla de contenido, explicando que si el texto trae dos cosas, las dos tienen que sobrevivir. Se escribió, se midió… y la fidelidad bajó del 70 % al 64 %.
Ése es el resultado que más enseña de toda la etapa, y es contraintuitivo: la instrucción que explicaba mejor el problema lo agravó. Cada párrafo añadido a un prompt compite por la atención del modelo con todos los demás, incluido el que intenta reforzar.
El cambio se revirtió. Está documentado en el fichero de instantánea del prompt, con su fecha y sus números, precisamente para que a nadie se le ocurra volver a intentarlo dentro de seis meses pensando que es buena idea.
Un sospechoso exonerado por los datos
Quedaba un cabo suelto: «tela marinera» aparecía en la mitad de las respuestas. La sospecha obvia era la recuperación, que es la que pone frases suyas delante del modelo.
Se comprobó, y no:
en el núcleo de 1.103 frases suyas 1 frase (0,1 %)
entra en el sorteo de 25 3 % de las peticiones
la sirve la recuperación 0 de 16 peticiones
aparece en nuestras respuestas 50 %Nadie se la estaba dando. El modelo la había cogido por su cuenta, porque es pegadiza, y la repetía. Y al revertir el refuerzo de contenido bajó sola al 19 %, sin tocar nada relacionado con ella.
Dos cosas que merece la pena separar de aquí: la sospecha más razonable puede ser falsa, y comprobarla costó una consulta a la base de datos sin gastar un céntimo en generación. Y una muletilla puede ser síntoma de otra cosa, no la enfermedad.
Dónde quedó
| al empezar | al terminar | |
|---|---|---|
| sujeto conservado | 6/12 (50 %) | 14/16 (88 %) |
| en segunda o tercera persona | 5 | 0 |
| fidelidad | 81 % | 78 % |
| arranques distintos | 2/16 | 14/16 |
| abre con «pues nada» | 94 % | 19 % |
Tres cambios probados, dos conservados, uno retirado por los números.
- El usuario encuentra lo que las métricas no buscan. Diecisiete etapas de medición y el fallo lo trajo alguien escribiendo una frase sobre una entrevista de trabajo.
- Una métrica mide lo que mide. La fidelidad por solapamiento de palabras es útil y era ciega a esto: cambiar de persona no cambia ni una palabra con contenido.
- Un prompt puede contradecirse sin que lo parezca. Las dos instrucciones eran razonables por separado. Solo chocaban ante un texto en primera persona.
- Nombrar un recurso lo convierte en obligación. Es la lección de la etapa 13, y estaba sin aplicar en la misma página donde se había aprendido.
- Explicar mejor una regla puede empeorarla. El párrafo más claro sobre fidelidad la bajó seis puntos.
- Un cambio, una medición. Tres cambios seguidos sin medir entre medias y no se sabría cuál de ellos arregló qué, ni que uno de los tres había que tirarlo.