Stampli comprimió 243 horas de trabajo de lanzamiento en 77 horas—una reducción del 68%—al entregar Deep Finance utilizando Codex y ChatGPT Work de OpenAI. OpenAI publicó las cifras el 20 de agosto de 2026. Es uno de los benchmarks de productividad más granulares disponibles para entrega de software y contenido asistida por IA.
Deep Finance es una capa de inteligencia de gastos para CFOs y VPs en la plataforma procure-to-pay de Stampli. El lanzamiento requería siete tipos de entregables en paralelo: serie de blog, emails de lanzamiento, webinar y presentación, creatividad social y pagada, comunicado PR Newswire, página web y habilitación de ventas. Los recursos de diseño y contratistas externos no estaban disponibles—el equipo de marketing ejecutó con lo que tenía.
El equipo construyó un sistema de conocimiento compartido en Codex en lugar de abordar tareas secuencialmente. Codex ingirió contexto de producto, notas de reunión, tickets Jira, historial GitHub y directrices de mensajería, luego produjo borradores listos para revisión en todos los tipos de entregables. Cada activo dirigido al cliente recibió revisión humana. Codex manejó el 90% de la animación principal antes de que un contratista terminara la escena de apertura. La estimación de 243 horas es lo que esas tareas habrían costado sin Codex; 77 horas es lo que realmente tardaron.
La misma infraestructura ahora ejecuta el trabajo diario. Antes, mantener los materiales actualizados significaba entrevistar a PMs, leer Jira, revisar GitHub e invertir manualmente en artículos del centro de ayuda, one-pagers y presentaciones. Stampli ahora utiliza agentes conectados a su fuente de verdad para extraer información de sistemas de productos y notas de reunión. La Directora de Marketing de Productos Melad Zahedi dijo que el sistema multiplicó la producción por 10×, de un par de piezas por semana a cientos.
Las consultas en vivo revelaron demandas de confiabilidad más altas. Durante una reunión ejecutiva, un empleado utilizó Codex para extraer y analizar métricas HubSpot en segundos. Zahedi dijo que la alternativa era medio día de trabajo de FP&A. El tiempo real: 20 segundos de pulsaciones de teclado. Esto no es un benchmark controlado—es un evento en reunión, lo que significa que el estándar de latencia y confiabilidad fue más alto que un flujo de trabajo asíncrono típico.
El caso de estudio omite la sobrecarga de ingeniería de prompts, tasas de error antes de la revisión humana y cómo el equipo maneja la desviación de versiones cuando Jira o GitHub se actualiza más rápido que la ventana de contexto de Codex. Los equipos que repliquen esto enfrentarán esos costos. La cifra del 68% es producción neta, no esfuerzo de configuración o mantenimiento.
Para equipos que comparan velocidad asistida por IA, los números de Stampli funcionan como un techo, no una mediana. Las condiciones fueron favorables: un pequeño equipo de marketing técnicamente dispuesto, alcance fijo y acceso sólido al contexto del producto. Si su equipo se está ahogando en reconstrucción de contexto antes de la ejecución, vale la pena modelar una capa de ingestión con tecnología GPT. Stampli te da un número específico para usar.