Inteligencia y búsqueda documental

Tus documentos ya saben la respuesta.

Contratos, facturas, informes, tickets, wikis — convertimos los documentos con los que funciona tu negocio en respuestas fundamentadas y acciones automatizadas, conectadas a los sistemas donde pasa el trabajo.

Qué construimos

  • Asistentes de conocimiento

    Respuestas fundamentadas a partir de tu documentación interna, con citas a la fuente. Tus datos, no internet abierto.

  • Pipelines de procesamiento de documentos

    Extracción, clasificación y validación para facturas, contratos y formularios — alimentando los sistemas que ya tienes, no un silo nuevo.

  • Recuperación bien hecha

    Chunking, indexación y evaluación ajustados a tu corpus; la calidad de la recuperación se mide, no se supone.

  • Revisión humana en el circuito

    Los umbrales de confianza derivan los casos ambiguos a personas, para que la precisión quede auditable.

Pruebas

Nuestra propia contratación

Un agente que convierte transcripciones de entrevistas en perfiles listos para el cliente lleva adelante nuestra contratación desde principios de 2025 — un año en producción; de dos a seis horas por perfil pasaron a unos diez minutos.

la nota de campo
Agente de contratación
Desde principios de 2025
Transcripción → perfil listo para el cliente
2–6 h → ~10 min
Por perfil

Dos formas de leer

Extracción

Entran documentos, salen campos estructurados: los ítems de la factura, las partes y los términos del contrato, las respuestas del formulario — validados contra lo que ya sabes y volcados a los sistemas que ya operas. Invisible cuando funciona; medido para que sepas cuándo no.

Recuperación

Entran preguntas, salen respuestas fundamentadas — desde tu documentación, tus registros, tu historia, con la fuente a la vista y los permisos aplicados en el momento de la consulta. Cuando el corpus no contiene la respuesta, "no tengo ese dato" es la respuesta correcta, y el sistema la da.

Las dos se apoyan en la misma disciplina: calidad medida sobre tu corpus, citas que un lector puede verificar y una compuerta para los casos que el modelo no debería decidir solo.

Cuándo nos buscan los equipos

  • Horas perdidas buscando conocimiento interno
  • Carga manual de documentos que crece al mismo ritmo que el volumen
  • Un equipo de cumplimiento o de legales ahogado en revisiones

Cómo empieza

El Discovery Sprint te dice qué flujo documental se paga primero — y qué les falta a tus datos antes de que pueda hacerlo.

Cómo lo construimos

  1. Auditoría del corpus

    qué documentos, con qué calidad, con qué accesos

  2. Diseño de la recuperación

    chunking e indexación ajustados y medidos sobre tu corpus

  3. Salir con citas

    cada respuesta trazable hasta su fuente

  4. Ciclo de retroalimentación

    las respuestas equivocadas se vuelven señal de mejora

Lo difícil no es leer la factura — lo que aprendimos

Qué significa “confiable”

Validación

un campo es correcto porque coincide con algo que ya sabes — la orden de compra, el registro del proveedor, la suma de sus propias líneas — no porque el modelo estuviera seguro.

Derivación

la confianza decide quién ve cada documento: pasa derecho, una revisión de un clic, o una persona — la revisión queda reservada para el criterio.

Citas

cada respuesta y cada alerta apuntan a su página; una salida sin fuente se ignora la segunda vez que se equivoca.

Evaluación

un conjunto de prueba armado con tus documentos reales, ejecutado cada vez que cambia un prompt, un modelo o el corpus.

Una extracción acertada el 95% de las veces deja mal uno de cada veinte documentos. El trabajo del sistema es saber cuál.

Cómo es un proyecto

Empieza por el corpus, no por el modelo: un flujo documental, un equipo, una métrica — facturas al libro mayor, contratos a revisión, preguntas a respuestas. El AI Discovery Sprint encuentra qué flujo se paga primero y qué les falta a tus documentos antes de que pueda; si ya lo sabes, traes el flujo directo a implementación. Lo que se entrega: el pipeline o el asistente, la pantalla de revisión que tu equipo va a usar de verdad, las citas y el conjunto de evaluación — tuyos para operar, con nosotros o sin nosotros. Un primer flujo documental son semanas de trabajo, no trimestres.

Funciona bien con

Preguntas frecuentes

  • Nuestros documentos son un desastre, ¿eso lo bloquea?

    Es el primer entregable: la auditoría te dice qué arreglar y en qué orden.

  • ¿Cómo sabemos que las respuestas son correctas?

    Citas a la fuente más calidad de recuperación medida. "Confía en mí" no es una arquitectura.

  • ¿Nuestros datos entrenan el modelo de otra persona?

    No. Tus datos se quedan dentro de tus controles de acceso; fundamentar no es entrenar.

  • Escaneos, fotos, escritura a mano, ¿los puede leer?

    Los modelos que entienden el layout manejan la mayor parte de lo que el OCR por plantilla no podía; los escaneos y las fotos pasan primero por OCR; con la escritura a mano la respuesta es honesta, caso por caso. La auditoría del corpus te dice qué necesitan tus documentos de verdad — antes de que nadie prometa una precisión.

  • Nuestros documentos cambian: los contratos se renegocian, las políticas se actualizan.

    El índice se actualiza cuando se actualiza el documento, no según un calendario. Una respuesta sacada de la política del mes pasado es peor que ninguna respuesta, y la vigencia es parte del diseño, no algo que se agrega después.

  • ¿Puede actuar sobre lo que lee?

    Ese es el paso siguiente: la extracción alimentando acciones — registros actualizados, tickets abiertos, pagos programados — con una persona aprobando hasta que cada clase de acción se gana la autonomía. Ese trabajo vive en AI Agents & Assistants; la lectura que se construye acá es lo que lo hace seguro.

Deja de pagarle a gente para buscar.