- Normalmente, para comprobar si un agente de IA se comporta mal, otra IA vuelve a leer su resultado. Goodfire dice haber presentado un método que lee las señales que el modelo calcula internamente mientras trabaja, mediante pequeños detectores llamados sondas.
- En las pruebas de la empresa, vigilar unas 1,500 sesiones del modelo Kimi K3 costó unos 51 dólares. La empresa afirmó que el mismo trabajo costaría 233 dólares con un modelo de IA barato que revisa cada paso, y unos 10.000 dólares con un modelo de primer nivel.
- En las mismas pruebas, el método detectó 94% de las sesiones de hackeo malicioso y envió 8.7% de las sesiones inofensivas a una revisión adicional. La empresa explicó que, aunque se ejecuten 4 sondas al mismo tiempo, el tiempo que tarda el modelo en empezar a responder aumentó en menos de 2%.
- Los clientes de Baseten pueden elegir qué vigilar entre hackeo, uso indebido de armas biquímicas y piratería de recompensas. Al encontrar algo, pueden decidir la respuesta entre registrar, revisión humana o rechazar la solicitud.
La frase 'la proporción que detectó 94%' me llama la atención. El artículo no explica qué son las demás 6%, así que antes de conocer esa parte es pronto para confiar en ello. La diferencia entre 51 dólares y 10.000 dólares también es grande, pero como las cifras provienen de un solo modelo, Kimi K3, y de una prueba interna de una empresa, no sé si se mantendrían en otros entornos. ¿Alguna vez ha calculado cuánto cuesta realmente vigilar agentes?