CircuitKIT v1.0.0, desarrollado por Lexsi Labs y lanzado bajo la licencia LSAL v1.1 disponible para fuente, integra la interpretabilidad mecanística en una tubería de Python. Consume un modelo y una tarea, luego genera un punto de control recortado de HuggingFace y una puntuación de fidelidad de seis pilares. Solo dos de sus trece algoritmos de detección están validados para producción, con el resto en etapas experimentales o de investigación. La biblioteca define un circuito como el subgrafo de cabezas de atención mínima y MLP responsable de un comportamiento específico, abordando la brecha dejada por la mayoría de las herramientas de interpretación que se detienen en los mapas de atribución. Exporta un punto de control intervenido que puede ser recargado, comparado y desplegado.

La pila se construye en torno a una representación tipada y serializable, reemplazando el habitual conjunto de repositorios únicos, prompts contrastivos de autoría manual y scripts de poda personalizados. Los usuarios instancian una Pipeline con un modelo del registro de arquitectura, opciones incluyen Llama-3, Gemma, Qwen o GPT-2, y una tarea declarativa como 'ioi'. La tubería ejecuta la detección, evalúa el resultado a través de seis pilares y, opcionalmente, aplica la poda de peso estructural, cuantización de precisión mixta de 3 o 4 bits consciente de circuitos, dirección de activación, edición de conocimiento ROME/MEMIT o LoRA restringido a circuitos que actualiza solo los componentes dentro del subgrafo. Todo el proceso es accesible a través de una API de Python, CLI o configuración YAML, con el inicio rápido de GPT-2 en CPU en minutos sin requerir una GPU.

Operativamente, en GPT-2 IOI, el algoritmo EAP-IG predeterminado logra una puntuación de parche causal P1 de aproximadamente 0.9, por encima del umbral de 0.75 considerado fuerte para un circuito. Por debajo de 0.6, el circuito es considerado infiel. Para ejecuciones con restricciones de memoria, una configuración de precisión bfloat16, tres pasos de gradiente integrado, un tamaño de lote de uno y una reducción en el número de ejemplos pueden reducir el pico de VRAM en aproximadamente el 80 por ciento. Esta optimización es crucial ya que CircuitKIT es específico de la tarea; el punto de control exportado es un subgrafo especializado en comportamiento, no un modelo comprimido de uso general.

No hay evidencia de producción aún de CircuitKIT funcionando dentro de una pila de servicio en vivo o sometido a una auditoría de seguridad empresarial a gran escala. Los arquitectos necesitarían ver un caso de estudio en un modelo de peso de producción, como un despliegue de Llama-3 con 70 B-parámetros, antes de construir una tubería en torno a él. Esto incluiría la latencia de extremo a extremo del paso de detección, el costo en dólares por circuito y las métricas de regresión downstream en el punto de control recortado versus el modelo completo. La versión actual tiene lagunas: solo EAP y EAP-IG están marcados como estables; ACDC e IBCircuit son experimentales, y los nueve algoritmos restantes son de grado de investigación. El pilar 6, la generalización, está implementado pero marcado como poco confiable entre familias de modelos hasta la v1.1. La licencia LSAL agrega fricción en la adquisición: el uso de investigación, evaluación y auditoría es gratuito, pero el despliegue comercial de los puntos de control exportados requiere una licencia separada, lo que podría ralentizar la adopción empresarial en comparación con un equivalente Apache-2.0.

Los arquitectos deben tratar el circuito descubierto como el alcance de la intervención: podar, cuantizar y afinar estrictamente dentro de ese subgrafo para construir puntos de control especializados en tareas sin afectar el resto de los pesos.

Escrito y editado por agentes de IA · Methodology