Salud
Por qué apagamos un clasificador que funcionaba técnicamente
Piloto de clasificación de eventos que funcionó técnicamente y se apagó al no justificar todavía su costo operativo.
Tipo de cliente
Piloto interno de IA aplicada a conversaciones operativas, sin despliegue autónomo sobre clientes
Desafío
La fricción operativa a resolver.
Una IA también se evalúa por cómo sale de producción
Una IA también se evalúa por cómo sale de producción
El 21 de julio de 2026 retiramos de la infraestructura de Dermathani un clasificador de eventos conversacionales. La decisión cerró un ciclo completo de ingeniería: entrenamiento, evaluación separada, despliegue en observación y apagado verificado. El modelo y sus datos quedaron conservados; la mensajería siguió operativa.
En esta clínica de dermatología y estética de Lima, trabajamos sobre conversaciones de recepción y captación. El objetivo técnico era extraer señales estructuradas del texto: reconocer candidatos a eventos y dejarlos disponibles para análisis, separados de las acciones sobre la atención. Esa separación define el alcance del sistema y gobierna su arquitectura.
El valor de este caso está en las decisiones que tomamos con evidencia: qué modelo servir, qué permisos conceder, cómo contener la incertidumbre y cuándo retirar capacidad de una infraestructura compartida.
Del texto conversacional a un evento utilizable
Del texto conversacional a un evento utilizable
Un mensaje aislado tiene poco contexto. Para interpretar una solicitud de información, el clasificador necesita leer parte del intercambio y producir una categoría consistente. A esa tarea se suma otra exigencia: distinguir una señal suficientemente clara de un candidato que requiere revisión.
Construimos una evaluación específica para esa frontera. El dataset usa etiquetas generadas por un modelo maestro y separa entrenamiento y evaluación por conversación. Así, los intercambios de una misma conversación permanecen en un único conjunto y la prueba mide generalización a otras conversaciones.
La infraestructura añade una condición concreta. El servicio comparte recursos con sistemas de atención. Su continuidad exige evaluar tanto la clasificación como el consumo y la actividad efectiva. Incorporamos esos criterios a la decisión de despliegue y retiro.
Enfoque
Entrenar para la tarea, elegir por fidelidad
Entrenar para la tarea, elegir por fidelidad
Al 18 de julio de 2026, entrenamos el clasificador con 4.238 mensajes y lo evaluamos sobre 631 mensajes reservados. Frente al 24,4 % de concordancia del modelo de referencia sin entrenamiento específico, la versión FP32 alcanza 75,9 %. Estas cifras comparan las predicciones con las etiquetas del maestro: esa es la medida utilizada para seleccionar el modelo.
También evaluamos una versión cuantizada INT8. En CPU con dos hilos, FP32 registra 197 ms por mensaje; INT8 registra 59 ms. La versión compacta alcanza 72,3 % de concordancia. Cada combinación conserva su resultado: la velocidad de INT8 pertenece a una variante distinta de la que alcanza 75,9 %.
Elegimos FP32 para el despliegue en observación porque priorizamos fidelidad sobre velocidad. La alternativa compacta entrega menor latencia a cambio de concordancia. Con el volumen previsto, el tiempo de FP32 encaja en la tarea. Por la misma razón, descartamos el modelo sin entrenamiento específico como opción de despliegue: el ajuste con conversaciones de la operación ofrece una diferencia clara en la evaluación.
Observar sin intervenir: el diseño del servicio
Observar sin intervenir: el diseño del servicio
El despliegue del 19 de julio conecta la creación de mensajes con un servicio interno, sin puertos públicos. La suscripción recoge texto entrante y saliente de recepción y captación; el filtro excluye mensajes privados. El diseño restringe desde la entrada qué información llega al clasificador.
La deduplicación es determinista: combina conversación y texto, con una vigencia de una hora. Una repetición dentro de esa ventana se descarta antes de ejecutar inferencia. El contexto conserva los últimos 12 mensajes por conversación durante siete días, y el modelo recibe una ventana de siete mensajes con el mismo formato utilizado al entrenar. Mantener ese formato alinea evaluación y servicio.
La salida aplica umbrales por tipo de evento y envía a cuarentena los candidatos con confianza inferior a 0,6. La cuarentena separa la emisión de una predicción de su aceptación operativa. La política conserva control sobre las señales ambiguas en lugar de delegar toda la decisión al puntaje del modelo.
Los candidatos pasan a una cola sin el texto de las conversaciones. El servicio opera en observación estricta: carece de llamadas de acción sobre la plataforma de atención. Elegimos este límite frente a conectar directamente las predicciones con respuestas o cambios en conversaciones. Primero evaluamos señales; los permisos de ejecución permanecen fuera del clasificador.
Cómo queda la operación tras el retiro
Las pruebas verifican el recorrido completo con una entrada sintética, el descarte de mensajes privados y la eliminación de duplicados antes de inferencia. Los contadores distinguen recibidos, filtrados, inferidos, duplicados y resultados por umbral. Esa observabilidad hace visible qué trabajo realiza cada etapa.
Resultado
Cómo queda la operación tras el retiro
El estado de cierre es un servicio detenido, con el modelo, los datos y la definición de despliegue conservados. El retiro del 21 de julio responde a una lectura conjunta de actividad y recursos: el proceso ocupaba 1.588 MiB de memoria de intercambio y sus contadores registraban cero mensajes recibidos o inferidos desde el reinicio del servidor.
Ejecutamos la salida en orden. Primero respaldamos la configuración de la suscripción sin credenciales; después retiramos esa suscripción y detuvimos el servicio. Eliminar la entrada antes del apagado evita reintentos hacia un destino detenido. La secuencia también conserva una ruta de reactivación con comprobación de salud y credenciales nuevas.
Tres resultados que orientan la siguiente decisión
La verificación final confirma la suscripción retirada, el clasificador detenido y los servicios de mensajería activos. Al 21 de julio de 2026, el servidor mantiene 112 contenedores en ejecución y ninguno marcado como no saludable. El cierre libera el proceso de inferencia y preserva los artefactos del trabajo realizado.
Tres resultados que orientan la siguiente decisión
Obtuvimos una comparación reproducible entre entrenamiento específico, precisión numérica y latencia. Desplegamos una arquitectura que separa clasificación, cuarentena y acción. Y ejercimos el retiro controlado en la infraestructura real de Dermathani, verificando la continuidad de los servicios de atención.
La lección principal es operativa: la calidad de una IA incluye el control de su ciclo de vida. Un buen resultado de evaluación fundamenta la selección del modelo; la actividad y los recursos fundamentan su permanencia. Conservar artefactos, retirar entradas y comprobar los servicios restantes son decisiones de ingeniería tan concretas como entrenar.
Si estás evaluando IA para interpretar conversaciones de tu operación, agenda un diagnóstico operativo. Revisamos contigo la señal que necesitas, el criterio de aceptación y los permisos que corresponden antes de conectar una predicción con una acción.
Evidencia y resultados documentados
- Mensajes de entrenamiento y evaluación separada — 4.238 / 631 — al 18 de julio de 2026
- Concordancia FP32 con el modelo maestro y latencia CPU — 75,9 % / 197 ms por mensaje — al 18 de julio de 2026
- Concordancia INT8 con el modelo maestro y latencia CPU — 72,3 % / 59 ms por mensaje — al 18 de julio de 2026
Sistema aplicado
Servicios y solución relacionados.
La empresa necesita que la IA ejecute tareas dentro de un flujo, no una demo aislada.
Agentes de IA para procesos
Agentes que ejecutan tareas dentro de flujos operativos con control humano.
Diseño de una transición operable
Diseño de soluciones de IA y automatización
Una solución viable y una transición por etapas sin detener la operación.
Continuidad después del lanzamiento
Soporte y mejora continua de sistemas
Soporte responsable y mejora continua después del lanzamiento.
FAQ
Preguntas sobre este caso
¿Qué clasificaba el sistema?
Identificaba candidatos a eventos operativos en mensajes de recepción y captación, utilizando contexto de la conversación. El caso la sitúa dentro del recorrido operativo descrito y limita el alcance a las decisiones, controles y resultados documentados; no añade capacidades, impactos ni condiciones que no estén respaldados por esa evidencia.
¿Qué significa el 75,9 %?
Es la concordancia FP32 con las etiquetas del modelo maestro sobre 631 mensajes separados del entrenamiento, al 18 de julio de 2026. El caso la sitúa dentro del recorrido operativo descrito y limita el alcance a las decisiones, controles y resultados documentados; no añade capacidades, impactos ni condiciones que no estén respaldados por esa evidencia.
¿El clasificador respondía a los contactos?
El despliegue operaba en observación estricta. Emitía candidatos a una cola sin enviar respuestas ni ejecutar acciones sobre las conversaciones. El caso la sitúa dentro del recorrido operativo descrito y limita el alcance a las decisiones, controles y resultados documentados; no añade capacidades, impactos ni condiciones que no estén respaldados por esa evidencia.
¿Por qué elegimos FP32 frente a INT8?
Priorizamos la fidelidad. FP32 alcanzó 75,9 % de concordancia frente a 72,3 % en INT8; sus 197 ms por mensaje encajaban en el volumen previsto. El caso la sitúa dentro del recorrido operativo descrito y limita el alcance a las decisiones, controles y resultados documentados; no añade capacidades, impactos ni condiciones que no estén respaldados por esa evidencia.
¿Qué quedó después del retiro?
Conservamos el modelo, los datos y la definición del servicio. Retiramos la suscripción de mensajes y verificamos la continuidad de la mensajería. El caso la sitúa dentro del recorrido operativo descrito y limita el alcance a las decisiones, controles y resultados documentados; no añade capacidades, impactos ni condiciones que no estén respaldados por esa evidencia.