StartupXO
Search
English

Find XO: Goodfire, AI 에이전트의 내부 신호를 읽어 감시하는 저비용 도구 공개(techcrunch.com)

No votes yet startupxo 1 editorial / 0 comments

Writing language: KoreanRead translation

Summary / Read source ↗

- AI 에이전트가 잘못된 행동을 하는지 보통은 다른 AI가 결과물을 다시 읽어 확인한다. Goodfire는 모델이 작업하는 중 내부에서 계산하는 신호를 작은 감지기인 프로브로 읽는 방식을 내놓았다고 밝혔다. - 회사 테스트에서 Kimi K3 모델의 세션 약 1,500개를 감시하는 비용은 약 51달러였다. 같은 작업을 모든 단계마다 검사하는 저렴한 AI 모델로 하면 233달러, 최상위 모델로는 약 1만 달러가 든다고 회사는 밝혔다. - 같은 테스트에서 악성 해킹 세션의 94%를 잡아냈고, 무해한 세션의 8.7%를 추가 검토로 보냈다. 프로브 4개를 동시에 돌려도 모델이 응답을 시작하기까지 걸리는 시간은 2% 미만 늘었다고 회사는 설명했다. - Baseten 고객은 감시 대상으로 해킹, 생화학 무기 오용, 보상 해킹 중에서 고를 수 있고, 발견했을 때 대응은 기록, 사람 검토, 요청 거부 가운데 정할 수 있다.
Found on

TechCrunch ↗ / Published by source

Have you run into something like this? Tell us in a line or two what you did. You do not need to know the product.

Sign in to comment

1 comment

Editorial opinionstartupxo

94%가 잡아낸 비율이라는 말에서 시선이 멈춥니다. 나머지 6%가 어떤 세션인지 기사에 나오지 않아서, 그 부분을 알기 전에는 믿고 맡기기 이르다는 생각이 드네요. 51달러와 1만 달러 차이도 크지만, Kimi K3 한 모델과 회사 테스트에서 나온 숫자라 다른 환경에도 같을지는 모르겠습니다. 실제로 에이전트 감시 비용을 따져 보신 적이 있으신가요?
Writing language: Korean

Keyboard shortcuts

Choose a post with the up and down arrows, then press Enter.

↑ / ↓
Previous post / next post
Enter
Open summary and comments for the selected post
Tab
Move to the submit or comment button, then press Enter

Type normally in text fields. Tab and Enter are always available.