Un asistente de conocimiento interno es tan bueno como su última respuesta equivocada
A partir de cierto tamaño, todas las empresas tienen el mismo problema de conocimiento, y no es que falte conocimiento. Está en Confluence, en Drive, en la wiki que nadie actualizó desde la reorganización, en un hilo de marzo. Lo que falta es el camino para llegar a él: buscar es lento, los resultados están desactualizados y preguntarle a una persona en Slack es más rápido y confiable. Así que las personas preguntan en Slack — las mismas preguntas, cada semana, a las mismas tres personas.
Un asistente que responda esas preguntas a partir de los documentos es una idea evidente. La mayoría de los que se construyen dejan de usarse en el primer mes. La diferencia entre unos y otros no es el modelo.
Por qué la mayoría deja de usarse
Se confía en un asistente de conocimiento como se confía en un colega: una respuesta equivocada, dada con seguridad, sobre la política de días libres y nadie vuelve a preguntarle. Tres cosas provocan esa respuesta.
Responde de memoria en lugar de hacerlo a partir del documento. Si le preguntas a un modelo general sobre tu política, producirá un párrafo fluido, convincente y equivocado. El asistente tiene que recuperar información primero y responder solo a partir de lo que encontró — y mostrar dónde lo encontró para que quien lo lea pueda comprobarlo.
No sabe que el documento cambió. La política se actualizó el martes; el índice todavía tiene la versión del lunes. El asistente comunica con seguridad la regla anterior. La actualización no es un extra deseable; es la razón por la que las personas dejaron de confiar en la wiki.
Muestra a las personas cosas que no deberían ver. Las bandas salariales también son un documento. Si el asistente indexa todo y responde a todos, es una filtración con una interfaz amable. La recuperación tiene que respetar los mismos permisos que ya tienen los documentos, por usuario, al momento de la consulta.
Qué hace uno bueno
- Responde con citas o dice "no sé". Cada respuesta enlaza al pasaje del que proviene. Cuando la recuperación no devuelve resultados o es ambigua, el asistente lo dice y ofrece a la persona que sabría responder. Un "no tengo esa información" correcto vale más que una suposición fluida.
- Vuelve a indexar cuando hay cambios, no según un calendario. Cuando se edita un documento, sus embeddings se reconstruyen en ese momento — para que el asistente nunca esté por detrás de la fuente.
- Está donde ya se hacen las preguntas. Dentro de Slack o Google Chat, no en un portal que las personas deban recordar. La idea es recibir la pregunta en el lugar donde se hace.
- Deriva los casos sin fricciones. Las preguntas que no puede responder las dirige a la persona responsable — y esas derivaciones se convierten en la lista de documentos que hace falta escribir.
El trabajo que nadie presupuesta
El asistente muestra la realidad de tu documentación de una forma en que la wiki nunca lo hizo. Las primeras semanas de preguntas hacen aparecer cada página desactualizada, contradictoria o faltante, porque el asistente ahora las está leyendo en voz alta. Eso no es un fracaso del proyecto; es su resultado más útil. Reserva tiempo para que una persona responsable corrija lo que encuentre.
La otra pieza es un conjunto de evaluación: cincuenta preguntas reales que las personas hicieron, con la respuesta que daría un colega que conoce el tema. Ejecútalo cada vez que cambien los documentos, los prompts o el modelo. Sin él, "parece funcionar" es la única señal, y es la señal que llevó a la wiki en la que nadie confía.
La tecnología, brevemente
Nada de esto necesita infraestructura exótica. Embeddings y búsqueda vectorial sobre los documentos — Postgres con una extensión vectorial es suficiente para la mayoría de las empresas —, una etapa de recuperación con filtrado de permisos, un modelo de lenguaje que redacte la respuesta a partir de los pasajes recuperados y la integración con el chat. Se ejecuta dentro de tu nube y tus permisos, porque los documentos ya están ahí y las preguntas son sobre ellos.
Qué medir
La proporción de preguntas respondidas con una cita. La proporción que el asistente rechazó responder y sobre qué trataban. Las correcciones que reportan los usuarios. Y la que importa a quienes antes respondían todo: cuántas preguntas repetidas dejaron de llegarles.
Empieza con las preguntas de un equipo — RR. HH. y operaciones suelen ser los más activos — y un canal. Si se gana la confianza ahí, la misma base se extiende a la documentación de ingeniería, los manuales operativos de soporte y el material de ventas; si no, sabrás por qué en un mes, y la respuesta estará en los documentos, no en el modelo.
Qué aprendimos al prototiparlo
Lo construimos como una prueba de concepto con nuestra propia documentación: embeddings y búsqueda vectorial en Postgres (pgvector), recuperación e indexación con LlamaIndex, un modelo de pesos abiertos (Gemma 3) que redactaba las respuestas a partir de los pasajes recuperados y una integración con Google Chat para que las preguntas pudieran hacerse donde ya se hacían.
El modelo fue la decisión menos interesante. Un modelo pequeño de pesos abiertos respondía bien cuando la recuperación era buena y mal cuando no lo era — ese es el punto: la calidad estaba en lo que se indexaba, cómo se dividía en fragmentos y si el índice estaba actualizado. La primera versión volvía a indexar cada noche; una política editada por la mañana seguía dando respuestas equivocadas hasta el día siguiente, y esa respuesta equivocada costaba más confianza que una semana de respuestas correctas. Incorporamos de inmediato la reindexación al cambiar los documentos.
Los permisos fueron la restricción de diseño que definió todo lo demás. Filtrar al momento de la consulta, por usuario, según las reglas de acceso de los propios documentos, no es un complemento; determina la estructura del índice. Constrúyelo primero.
Y el asistente fue implacable con nuestra propia documentación. En cuestión de días había detectado las contradicciones y las páginas que nadie había tocado en un año — que es exactamente el resultado que justifica el proyecto, si alguien se hace responsable de corregirlas.
Lo que añade la producción: manejo de entidades nombradas para personas y productos, para que la recuperación coincida con la forma en que realmente se hacen las preguntas; un conjunto de evaluación basado en preguntas reales; y una persona responsable de la deuda de documentación que el asistente seguirá encontrando.