El Departamento de Servicios Digitales de Amsterdam publicó "Grip on LLMs", un conjunto de benchmarks evaluando más de 30 modelos de lenguaje en seis dimensiones adaptadas para uso del sector público holandés. El artículo, lanzado en arXiv el 10 de agosto, fue escrito por los servidores públicos Laurens Samson, Iva Gornishka y Gossa Lô junto con investigadores de la Universidad de Amsterdam Yuki M. Asano y Sennay Ghebreab. Es el primer marco sistemático que pondera conjuntamente valores de la administración pública y requisitos de lenguaje no inglés—una brecha que bloqueó la adquisición responsable de LLM en gobiernos de la UE.
Las seis dimensiones—precisión, honestidad, sesgo social, consumo de energía, costo y transparencia de datos de entrenamiento—fueron moldeadas por una junta consultiva que incluye un oficial de sostenibilidad, oficial de privacidad, asesor de diversidad e inclusión y propietarios de negocios. La investigación con usuarios y encuestas a servidores públicos informaron los criterios. El resultado es un cuadro de mandos que los oficiales de adquisición pueden defender en comité.
Las pruebas en amsterdam.github.io/grip-on-llms ejecutan experimentos en holandés, lo que cambia materialmente los resultados versus benchmarks en inglés. Las huellas de energía abarcan dos órdenes de magnitud: TinyLlama-1.1B consume 0,63 Wh por consulta a €0,01 por millón de tokens; OLMo-2-0325-32B-Instruct alcanza 68,59 Wh a €0,89. GPT-4o cuesta €1,55 por millón de tokens sin cifra de energía divulgada. Para una ciudad ejecutando un chatbot a escala poblacional, una diferencia de 29× en tamaño de modelo (1,1B vs. 32B parámetros) no produce ganancia de calidad proporcional—pero genera aproximadamente una penalidad energética de cien veces.
Precisión y honestidad son propiedades independientes gobernadas por mecanismos distintos. Un modelo que responde correctamente la mayoría del tiempo no necesita reconocer incertidumbre. Para uso gubernamental—donde respuestas confidentemente incorrectas sobre beneficios o zonificación causan daño real—ambas dimensiones deben evaluarse por separado. Alta precisión no implica alta honestidad.
Las puntuaciones de sesgo son en gran medida ortogonales a calidad y costo. Gastar más en un modelo de frontera no reduce el sesgo demográfico en las salidas en holandés. La transparencia de datos de entrenamiento se califica como una dimensión de primera clase: solo siete de más de 30 modelos probados—TinyLlama-1.1B, SmolLM3-3B, EuroLLM-9B, OLMo-2-1124-7B, OLMo-2-0325-32B-Instruct, Apertus-8B y Apertus-70B—tienen datos de entrenamiento completamente abiertos. La divulgación completa es un requisito riguroso bajo algunas reglas de adquisición de la UE.
El panel de control está activo en gripopllms@amsterdam.nl para municipios que replican la metodología. El marco utiliza una licencia CC BY-NC-SA, permitiendo que otros equipos del sector público lo adapten para adquisiciones no comerciales.
Para arquitectos que construyen o adquieren servicios respaldados por LLM en entornos regulados: compare en su idioma de implementación, no en inglés. Separe evaluaciones de precisión y honestidad—no se mueven juntas. Trate la energía y el costo como dimensiones primarias, especialmente a escala poblacional. Verifique la procedencia de los datos de entrenamiento temprano; el cumplimiento retroactivo después de la implementación es costoso.