Transparencia técnica

Por qué Legatiq tarda 30-60 segundos: la latencia como precio de la trazabilidad

Equipo editorial de LegatiqEditora jurídica7 min

La pregunta que aparece en cada demo

Cuando un usuario nuevo prueba Legatiq por primera vez, la primera reacción suele ser la misma: "¿por qué tarda tanto?". ChatGPT responde en cinco segundos, Gemini incluso menos, Perplexity es prácticamente instantáneo. Legatiq tarda entre 30 y 60 segundos para una consulta legal de complejidad media. La diferencia es notable y pide explicación.

La explicación no es "estamos optimizando" ni "es un problema técnico". La latencia de Legatiq es decisión de arquitectura, y entenderla es entender por qué el producto sirve para uso profesional donde otras herramientas no.

Lo que pasa en esos 30-60 segundos

Cuando lanzas una consulta a Legatiq, el sistema ejecuta cuatro fases consecutivas, cada una con su tiempo de cómputo:

Fase 1: análisis de la pregunta (1-3 segundos)

El sistema no se lanza directamente a buscar. Primero clasifica la consulta: ¿es legal o conversacional? ¿Qué áreas del derecho involucra? ¿Hay documentos adjuntos? ¿Se está pidiendo respuesta breve, detallada o necesita más información del usuario? ¿Qué fuentes son relevantes?

Esta fase es barata pero necesaria: sin clasificación correcta, las fases siguientes consultan las capas equivocadas y la respuesta se desvía.

Fase 2: recuperación en paralelo por capas (15-30 segundos)

Aquí está el grueso del tiempo. El sistema dispara búsquedas en paralelo sobre las capas de fuentes oficiales relevantes:

  • BOE consolidado: para legislación estatal vigente.
  • Boletines autonómicos: para normativa de la comunidad autónoma relevante.
  • Ordenanzas locales: para reglamentación municipal cuando aplica.
  • Jurisprudencia: para sentencias del TS, TC, AN y TSJ vía CENDOJ.
  • Entidades públicas: para criterios administrativos de AEAT, TGSS, INSS, SEPE, DGT.
  • Convenios colectivos: para tablas salariales, cláusulas y derechos laborales sectoriales.

Cada capa devuelve los pasajes más relevantes a la consulta. Las capas que no aplican a la consulta no se activan, lo que ahorra tiempo. Las que sí, ejecutan recuperación vectorial sobre su corpus específico.

Por qué tarda: la búsqueda vectorial sobre corpus de millones de chunks (artículos del BOE, párrafos de sentencias, criterios administrativos) tiene un coste real de cómputo. Hacerla bien es preferible a hacerla rápido.

Fase 3: filtrado, expansión y síntesis técnica por capa (5-15 segundos)

Cada pasaje recuperado pasa por dos pasos antes de llegar a la respuesta final:

  • Filtrado de relevancia: el sistema descarta los pasajes que tienen similitud léxica alta pero relevancia jurídica baja para la consulta concreta.
  • Expansión de contexto: para cada pasaje seleccionado, el sistema reconstruye el contexto necesario (artículo completo, párrafo siguiente, encabezado de capítulo) para que la cita tenga sentido fuera del fragmento aislado.

Después, cada capa produce una síntesis técnica propia: un mini-resumen estructurado con sus citas anclado a los pasajes recuperados. Estas síntesis son las que después se cruzan en la respuesta final.

Fase 4: síntesis final con streaming (3-15 segundos perceptibles)

La respuesta final combina las síntesis por capa con su jerarquía normativa correcta, citando cada nivel donde aplica. Esta fase usa streaming: en cuanto el modelo empieza a generar tokens, los envías al usuario para que vea la respuesta aparecer mientras se construye.

La latencia perceptible para el usuario en esta fase es menor que la real porque el primer token aparece pronto. La respuesta completa puede tardar 15-30 segundos adicionales pero el usuario ya está leyendo desde el segundo 5.

Comparación visual con otras IAs

SistemaTiempo típicoQué hace en ese tiempo
ChatGPT (GPT-4 estándar)3-8 segundosGenera respuesta sobre datos de entrenamiento
Gemini con búsqueda Google5-15 segundosBusca en internet abierto y sintetiza
Perplexity5-12 segundosBusca en internet abierto con citas web
Legatiq30-60 segundosRecupera por seis capas oficiales, filtra, sintetiza con citas verificables al BOE

La diferencia con ChatGPT es de un orden de magnitud (5x-10x más lento). La diferencia con Gemini o Perplexity es menor (2x-5x). La razón es la misma: Legatiq trabaja sobre un corpus restringido y verificado, no sobre internet abierto.

Por qué la latencia es asumible en uso profesional

La latencia es problema cuando el flujo de uso es muy reactivo (chat conversacional rápido, asistente en tiempo real durante una llamada). La mayoría de flujos profesionales reales no son así:

  • Despacho redactando un escrito: el tiempo dedicado a una alegación se mide en horas. Una respuesta de 40 segundos es marginal.
  • Gestoría preparando una declaración: cada cliente cuesta minutos. Que la IA cite con verificación al BOE en 40 segundos en lugar de tener que buscar manualmente es una ganancia neta de tiempo, no una pérdida.
  • Profesional respondiendo a un cliente: la respuesta no se manda en el segundo en que llega la pregunta. Hay reflexión, edición y envío. La IA encaja en esa ventana sin fricción.

La queja por latencia suele aparecer en pruebas demo "de juguete", donde el usuario lanza una pregunta intrascendente y espera respuesta instantánea. En el flujo profesional real, los 40 segundos pasan desapercibidos porque el usuario está preparando otra cosa mientras llega la respuesta.

Lo que la latencia compra: trazabilidad real

La diferencia entre 5 segundos de ChatGPT y 40 de Legatiq compra algo concreto:

  • Cita con enlace verificable al pasaje vigente del BOE consolidado, no afirmación sin referencia.
  • Recuperación de jurisprudencia real del CENDOJ, no inventada plausible.
  • Cruce con normativa autonómica y local cuando la pregunta lo requiere, no solo norma estatal.
  • Síntesis anclada al texto recuperado, no parafraseo libre que puede desviarse.
  • Respuesta verificable de un clic por parte del profesional, condición para cumplir el artículo 14 del AI Act.

Si comparas el coste profesional de 40 segundos de espera con el coste profesional de presentar un escrito con una sentencia inventada (caso Mata vs Avianca), la decisión técnica se hace evidente.

Por qué no se puede ir mucho más rápido sin perder calidad

Tres palancas determinan la latencia:

Tamaño del corpus consultado

El corpus oficial español es enorme: cientos de miles de artículos del BOE, millones de párrafos de sentencias, decenas de miles de criterios administrativos. La búsqueda vectorial sobre corpus de este tamaño tiene un coste real. Reducir el corpus para acelerar significa perder la profundidad de cobertura, que es lo que diferencia a Legatiq de una IA generalista.

Número de capas activadas

Cada capa adicional añade tiempo. La opción "fácil" sería consultar solo BOE y descartar autonómicas, locales, jurisprudencia, criterios administrativos. La consecuencia: respuestas pobres en consultas que cruzan jurisdicciones. Y el derecho español cruza jurisdicciones constantemente.

Filtrado de relevancia

Sin filtrado de relevancia, la respuesta final se construye sobre pasajes que tienen similitud léxica con la consulta pero no relevancia jurídica real. El filtrado es lo que separa una IA seria de una herramienta que combina texto al azar bajo etiqueta de "jurídico".

Las tres palancas juntas explican el rango de 30-60 segundos. Reducir cualquiera de ellas reduce la latencia pero también la calidad. La banda elegida es la mínima compatible con uso profesional serio.

Cómo Legatiq mitiga la latencia percibida

Aunque la latencia real no se puede reducir agresivamente sin sacrificar calidad, sí se puede reducir la latencia percibida por el usuario. Tres mecanismos:

Streaming

Como hemos comentado, la respuesta empieza a aparecer en pantalla en cuanto el modelo genera el primer token, no cuando termina. El usuario ve la respuesta construyéndose y la lee mientras llega.

Memoria entre turnos

En conversaciones continuadas, la síntesis técnica acumulada de turnos anteriores se reutiliza. La latencia del segundo o tercer mensaje suele ser sensiblemente menor que la del primero porque parte del trabajo ya está hecho.

Indicaciones de progreso

La interfaz puede mostrar en qué fase está el sistema (analizando, recuperando, sintetizando). El usuario sabe que algo pasa y puede esperar con expectativa, no con incertidumbre. La incertidumbre es lo que hace que 30 segundos parezcan 3 minutos.

El compromiso explícito

Aceptar la latencia de Legatiq es aceptar el compromiso técnico que la herramienta declara: respuestas verificables contra fuente oficial cuestan tiempo, y ese tiempo es la garantía de la verdad citada. Quien busca respuestas instantáneas sin citas tiene ChatGPT. Quien necesita citas verificables y está dispuesto a esperar un minuto, tiene Legatiq.

La elección no es "rapidez vs calidad". Es "rapidez plana vs profundidad verificable". En un contexto profesional con responsabilidad técnica, la segunda gana siempre.

Para profundizar

Para entender por qué la trazabilidad es estructural y no opcional: trazabilidad como diseño en Legatiq.

Para ver la arquitectura completa con orquestador, herramientas y memoria: Legatiq no es un chatbot.

Para conocer las seis capas de fuentes oficiales: las seis fuentes oficiales que lee Legatiq.

FAQ

Preguntas frecuentes

01

¿Por qué Legatiq es más lento que ChatGPT?

Porque hace cosas distintas. ChatGPT genera la respuesta sobre la marcha a partir de su entrenamiento general, sin verificar fuentes. Legatiq, antes de generar la respuesta, recupera pasajes textuales de seis capas de fuentes oficiales españolas (BOE consolidado, boletines autonómicos, ordenanzas, jurisprudencia, entidades públicas, convenios), filtra los relevantes y construye una respuesta anclada al texto recuperado. Cada uno de esos pasos cuesta tiempo de cómputo real.

02

¿Qué hace Legatiq exactamente en esos 30-60 segundos?

Cuatro fases consecutivas. Primero analiza la pregunta y decide qué capas de fuentes son relevantes. Segundo lanza recuperación en paralelo en cada capa, devolviendo los pasajes más relevantes. Tercero filtra y expande cada pasaje recuperado para asegurar relevancia real (no solo similitud léxica). Cuarto construye la respuesta final cruzando las síntesis de cada capa con su jerarquía normativa correcta. La salida lleva los enlaces verificables al BOE oficial.

03

¿Esa latencia es problema en uso profesional?

No, en la mayoría de flujos profesionales. Una consulta jurídica real cuesta minutos de pensamiento previo, lectura de la respuesta y verificación. Que la IA tarde 40 segundos en producir una respuesta verificable contra el BOE oficial es una ganancia neta frente a buscar tú mismo en CENDOJ y AEAT. Donde la latencia sí podría ser problema es en interfaces de chat conversacional muy reactivas, pero ese no suele ser el flujo profesional realista.

04

¿Por qué no acortar el tiempo recortando capas?

Porque cada capa cubre un nivel jerárquico distinto. Si recortas autonómicas para ganar segundos, pierdes la respuesta correcta para una pregunta sobre alquiler en Cataluña o cuotas de autónomo en Cantabria. Si recortas jurisprudencia, pierdes la doctrina interpretativa. La arquitectura por capas es la condición para responder bien en derecho español, que es estratificado por construcción. Recortar latencia recortando capas es perder la respuesta.

05

¿Streaming de respuesta ayuda a la percepción?

Sí, y Legatiq lo usa. Cuando el sistema termina la fase de recuperación y empieza la generación de la respuesta final, los tokens se envían al usuario según se producen. El usuario ve la respuesta empezar a aparecer en pantalla y puede leer mientras se completa. La percepción de latencia se reduce significativamente respecto a esperar la respuesta completa silenciosamente. Es transparencia operativa: no ocultas el cálculo, lo muestras.

06

¿Por qué el primer mensaje de una conversación tarda más?

Porque el sistema no tiene contexto previo y debe levantar todas las capas relevantes desde cero. En mensajes posteriores de la misma conversación, parte de la síntesis técnica acumulada se reutiliza y la latencia baja. Esto es la memoria entre turnos: la conversación es continua, no son consultas aisladas. La latencia del segundo o tercer mensaje en un mismo hilo suele ser sensiblemente menor que la del primero.

07

¿Hay un techo de latencia que sería inaceptable?

Razonablemente, sí. Por encima de 90 segundos para una consulta de complejidad media, hay un cuello de botella sin valor añadido proporcional. Por debajo de 10 segundos para una consulta legal compleja con citas a fuentes oficiales, hay sospecha de que la recuperación es cosmética o el corpus muy reducido. La banda profesionalmente sensata está entre 20 y 70 segundos para la mayoría de consultas, con picos en consultas complejas que cruzan varias áreas jurídicas.

08

¿Mejorará la latencia con la evolución de la tecnología?

Sí, en dos direcciones. Mejora del hardware y de los modelos LLM hace cada paso más rápido. Mejoras en infraestructura de búsqueda vectorial reducen los tiempos de recuperación. Pero la mejora tiene un límite duro: cualquier IA que consulte fuentes oficiales antes de afirmar tendrá una latencia mínima estructural. La trayectoria realista es bajar de 30-60 segundos hoy a 15-30 segundos en los próximos años, no a 2 segundos. Y eso está bien: un poco de espera es la garantía de la cita verificable.

Fuentes

Fuentes oficiales consultadas

  1. 01
    Hallucinating Law: Legal Mistakes with Large Language Models are Pervasive
    Stanford Institute for Human-Centered AI2024-01-11
  2. 02
  3. 03
    Boletín Oficial del Estado
    Agencia Estatal Boletín Oficial del Estado
  4. 04
    Centro de Documentación Judicial (CENDOJ)
    Consejo General del Poder Judicial
Sigue leyendo

Guías relacionadas

Probar el producto

Pregunta tu caso a Legatiq

Cada situación legal tiene matices. Si la guía no resuelve la tuya, hazle la pregunta exacta a Legatiq y recibirás una respuesta basada en fuentes oficiales.

Probar gratis