O Departamento de Serviços Digitais de Amsterdam publicou "Grip on LLMs", um conjunto de benchmarks avaliando mais de 30 modelos de linguagem em seis dimensões adaptadas para uso do setor público holandês. O artigo, lançado no arXiv em 10 de agosto, foi escrito pelos servidores públicos Laurens Samson, Iva Gornishka e Gossa Lô ao lado dos pesquisadores da Universidade de Amsterdam Yuki M. Asano e Sennay Ghebreab. É o primeiro framework sistemático a pesar conjuntamente valores da administração pública e requisitos de linguagem não-inglesa—uma lacuna que bloqueou a aquisição responsável de LLMs em governos da UE.

As seis dimensões—precisão, honestidade, viés social, consumo de energia, custo e transparência de dados de treinamento—foram moldadas por um conselho consultivo incluindo um oficial de sustentabilidade, oficial de privacidade, consultor de diversidade e inclusão, e proprietários de negócios. Pesquisa com usuários e pesquisas com servidores públicos informaram os critérios. O resultado é um scorecard que oficiais de aquisição podem defender em comissão.

Testes em amsterdam.github.io/grip-on-llms executam experimentos em holandês, o que muda resultados materialmente em relação a benchmarks em inglês. Pegadas de energia variam em duas ordens de magnitude: TinyLlama-1.1B consome 0,63 Wh por consulta a €0,01 por milhão de tokens; OLMo-2-0325-32B-Instruct atinge 68,59 Wh a €0,89. GPT-4o custa €1,55 por milhão de tokens sem figura de energia divulgada. Para uma cidade executando um chatbot em escala populacional, uma diferença de 29× no tamanho do modelo (1,1B vs. 32B parâmetros) não produz ganho de qualidade proporcional—mas gera aproximadamente uma penalidade energética centessa.

Precisão e honestidade são propriedades independentes governadas por mecanismos distintos. Um modelo respondendo corretamente a maior parte do tempo não precisa reconhecer incerteza. Para uso governamental—onde respostas confidentemente incorretas sobre benefícios ou zoneamento causam danos reais—ambas dimensões devem ser avaliadas separadamente. Alta precisão não implica alta honestidade.

Scores de viés são em grande parte ortogonais a qualidade e custo. Gastar mais em um modelo de fronteira não reduz viés demográfico em outputs em holandês. Transparência de dados de treinamento se qualifica como uma dimensão de primeira classe: apenas sete de mais de 30 modelos testados—TinyLlama-1.1B, SmolLM3-3B, EuroLLM-9B, OLMo-2-1124-7B, OLMo-2-0325-32B-Instruct, Apertus-8B e Apertus-70B—carregam dados de treinamento totalmente abertos. Divulgação completa é um requisito rigoroso sob algumas regras de aquisição da UE.

O dashboard está ativo em gripopllms@amsterdam.nl para municípios replicando a metodologia. O framework usa uma licença CC BY-NC-SA, permitindo que outros times do setor público o adaptem para aquisição não-comercial.

Para arquitetos construindo ou adquirindo serviços com suporte de LLM em ambientes regulados: faça benchmark em seu idioma de implementação, não em inglês. Separe avaliações de precisão e honestidade—elas não se movem juntas. Trate energia e custo como dimensões primárias, especialmente em escala populacional. Verifique a proveniência dos dados de treinamento cedo; conformidade retroativa após a implementação é cara.