Saltar al contenido
weekly23 de agosto de 2026·6 min

Entre Kill-Tests, Sombras de IA y la Cruda Realidad de los Datos

Esta semana en SixSeven Apps, hemos estado inmersos en la danza entre la validación de hipótesis, la optimización de la IA y la limpieza de los cimientos de nuestros productos. Desde pruebas de mercado 'quirúrgicas' en Hezu hasta un 'ring de sombras' para modelos de IA en Ganga24, pasando por una limpieza a fondo en Chordna y una redefinición de fronteras en Sofi, el equipo ha trabajado para que la teoría y la práctica se den la mano, con la plataforma de IA como motor de fondo.

Esta semana, hemos estado bailando entre la teoría y la cruda realidad de los datos. No hay nada como lanzar una hipótesis al mercado y ver cómo se desenvuelve, especialmente cuando tienes un equipo de IA especializado observando y aprendiendo. Hemos puesto a prueba algunas ideas audaces, ajustado el rumbo de nuestros cerebros artificiales y, como siempre, nos hemos remangado para pulir los detalles que marcan la diferencia.

Hezu

En Hezu, nuestra aplicación para padres, la semana ha girado en torno a la validación y la atribución. Hemos promovido a main una serie de cambios que venían de nuestro 'kill-test' – un experimento controlado para ver qué mensajes y ángulos de marketing resuenan de verdad. No es tan dramático como suena, pero sí quirúrgico.

Hemos implementado un hero dinámico en la landing page, que se adapta al ángulo del anuncio que trae al usuario. Esto nos permite medir con precisión qué tipo de propuesta de valor funciona mejor. Y hablando de precisión, arreglamos un detalle crucial: la atribución del ad_angle ahora solo se aplica al tráfico de pago. Resulta que el tráfico orgánico estaba contaminando el brazo de ideas de nuestro análisis, haciendo que la lectura fuera menos fiable. Separar el grano de la paja es fundamental para entender qué funciona y qué no.

Otro punto importante fue arreglar un fix(consent): el consentimiento del usuario, aunque se pedía, no se estaba registrando correctamente. Ahora sí, con window.CONFIG y una retención de 3 años, estamos tranquilos en este frente. Y para los usuarios, un feat(profile): el perfil del hijo ahora es visible y editable, y hemos añadido señales que indican cuánto te 'conoce' Hezu. Esto no es solo una cuestión de funcionalidad, sino de construir confianza y utilidad real para los padres.

Ganga24

En Ganga24, el cazador de gangas, la inteligencia artificial ha sido la protagonista, pero no de la forma que podrías esperar. Hemos estado construyendo un 'shadow test harness' para poner a competir a dos modelos de IA (en este caso, Gemini) en un ring de sombras. Esto significa que un modelo opera en producción, mientras que el otro procesa las mismas peticiones en paralelo, pero sus respuestas no afectan al usuario final. Así podemos comparar su rendimiento, calidad y, crucialmente, su coste, sin arriesgar la experiencia del usuario.

Un detalle técnico que un dev disfrutará: hemos implementado el random baseline sampling dentro de este arnés. Esto asegura que la comparación sea justa, evitando sesgos en las muestras de datos que alimentan a cada modelo. Además, hemos migrado del SDK google-generativeai al google-genai, un paso necesario para mantenernos al día y aprovechar las últimas mejoras.

Desde el punto de vista del producto, hemos expuesto price_obs_last y el histórico de precios en /api/deals/top. Esto es oro puro para el usuario que quiere saber si una oferta es realmente buena o si ha estado más barata antes. Y para nosotros, hemos añadido telemetría de costes de Gemini y un presupuesto diario, porque la IA es potente, pero no gratis. Saber cuánto nos cuesta cada decisión de la IA es vital para la sostenibilidad.

Chordna

En Chordna, nuestra herramienta para músicos, la semana ha sido de limpieza y robustez. Hemos abordado varios fix que mejoran la fiabilidad de la plataforma. Por ejemplo, ahora podemos emparejar canciones cuyo título lleva un subtítulo, y el log de la 'puerta' nombra la canción correctamente. Pequeños detalles que hacen la vida más fácil.

Un fix importante fue dar a cada llamada a API externa un tiempo de espera máximo (timeout ceiling). ¿Por qué? Porque una API lenta no debería tumbar todo el sistema. Es como poner un límite de tiempo a una conversación para que no te deje colgado. También hemos parado un Wikipedia sweep que estaba borrando enlaces correctos, y hemos corregido un problema con campos 'punteados' literales en la base de datos, que pueden causar dolores de cabeza con ciertos sistemas de indexación o consultas. En resumen, hemos estado asegurando que Chordna sea más resistente y que sus datos sean más precisos.

Sofi

Sofi, nuestra herramienta para familias, ha estado en una fase de clarificación de alcance. Hemos definido el Alcance del release público para la API de Classroom como API-first, lo que significa que la interfaz programática es la prioridad, garantizando una integración robusta. Por otro lado, la integración con Baileys (WhatsApp) se mantiene como experimental. Esto es importante: no todo lo que se construye en el laboratorio está listo para el horario de máxima audiencia. Ser transparentes sobre qué está probado y qué no, es parte de nuestra filosofía. También hemos cerrado la purga del historial de Git, un ejercicio de higiene técnica que nos ha dejado con un repositorio más limpio y seguro.

AI-Platform

El ai-platform es el cerebro detrás de todo, y esta semana ha estado más activo que nunca. Hemos añadido un multi-harness Closure Loop [FEAT-047], que es nuestro intento de automatizar el ciclo de mejora de los agentes de IA. Imagina un sistema que no solo prueba diferentes modelos, sino que también aprende de los resultados y ajusta los parámetros para la siguiente ronda de pruebas, todo de forma autónoma. Es un paso gigante hacia la auto-optimización de nuestros cerebros artificiales.

En Conerator, que genera contenido, hemos distinguido entre un juez UNAVAILABLE y REJECTED. Antes, si un juez no estaba disponible, la petición se descartaba silenciosamente. Ahora, fallamos ruidosamente, lo que nos permite investigar por qué el juez no respondió. Es un cambio sutil, pero crucial para la fiabilidad. También hemos corregido un bug donde la afirmación de “mínimo histórico” en Ganga24 no siempre se basaba en datos reales, un recordatorio de que la IA debe ser honesta.

Hemos estado inmersos en docs(stratops) y docs(specs), auditando el estado de los proyectos, ajustando umbrales de decisión y propagando aprendizajes (como el kill-test de Hezu) a través de todo el portfolio. Incluso hemos arreglado un fix(observio) para que los informes de facturación de GCP reflejen el coste neto, no el bruto, porque la contabilidad de la IA es más compleja que la de un autónomo en abril.

En resumen, esta semana ha sido un buen recordatorio de que construir productos es un deporte de equipo, donde la IA es un jugador más, pero la estrategia y la ejecución humana siguen siendo las que marcan el ritmo.

Seguimos.