Un artículo de investigación de PricewaterhouseCoopers publicado el 6 de agosto en arXiv compara dos formas de hacer que los modelos de lenguaje llamen herramientas: JSON nativo versus llamadas programáticas de herramientas (PTC), donde los modelos escriben Python ejecutable. El beneficio sigue líneas de generación de modelos: los cinco modelos Anthropic y las tres generaciones GPT más recientes se benefician de PTC; tres modelos GPT más antiguos no.
El estudio probó 14 modelos de lenguaje en BFCL v4, Berkeley's Function Calling Leaderboard, que pondera tareas agénticas multi-paso en 40% y desempeño multi-turno en 30%. En modo JSON, los modelos emiten un objeto JSON estructurado por llamada de función. En PTC, las herramientas se exponen como stubs de Python tipados; el modelo escribe un script ejecutado en un subprocess aislado, devolviendo todos los resultados en un turno de inferencia en lugar de uno por llamada.
PTC igualó o superó JSON en 11 de 14 modelos. La familia GPT-5.6 ganó 10,6%. Bajo fan-out paralelo, PTC igualó o superó JSON en 13 de 14 modelos. El hallazgo clave: la división de desempeño sigue líneas de generación de modelos, no líneas de familia.
La longitud de la cadena importa más. Con 12 o más llamadas de herramientas secuenciales, PTC abre una brecha de precisión del 18,8% sobre JSON—impulsada por el turno de inferencia adicional que JSON requiere por enlace. Los pipelines que encadenan más de una docena de llamadas hacen que la elección de andamiaje sea una variable de confiabilidad primaria.
JSON golpea una pared estructural en llamadas paralelas. En umbrales específicos del modelo—N=70–72 para Claude Sonnet 5—JSON descarta silenciosamente llamadas completas. PTC mantuvo precisión del 100% en N=100. Los agentes que rastrean catálogos de API o ejecutan consultas de base de datos simultáneas alcanzan este límite sin advertencia.
Bajo carga de contexto adversarial, JSON se degrada 2,3% en promedio; un enfoque de descubrimiento de sistemas de archivos cae 32%. PTC permanece estable. El aislamiento del subprocess previene que el crecimiento del contexto de conversación corrompa los argumentos de la llamada de función.
PTC tiene un costo genuino: requiere modelos capaces de código y un tiempo de ejecución aislado, exigiendo gestión de dependencias y alcance de permisos. Las llamadas de herramientas JSON no necesitan ninguno. Para modelos lanzados antes de finales de 2024, estos costos de infraestructura no compran ganancia de desempeño; PTC tiene un desempeño inferior en generaciones GPT más antiguas, lo que sugiere un umbral de capacidad.
Si su pila de agentes ejecuta un modelo de generación actual y encadena 12 o más pasos, o se aproxima a los límites de llamadas paralelas específicos del modelo, cambie a llamadas programáticas de herramientas—dado un subprocess aislado seguro.