A robot is sprinting towards you. Do you want it running on Claude or Grok?
OpenRouter의 Dev Rel Lead가 11개 LLM을 배틀로얄 게임에 투입해 30판을 플레이한 결과, Grok 4.1 Fast가 43% 승률로 1위를 차지했다. Claude Sonnet 4.6은 승률은 낮지만 협력적 성향을 보여 실제 응용에서는 더 유용할 수 있음을 시사한다.
OpenRouter의 Dev Rel Lead Jacky가 11개 LLM을 2D 배틀로얄 게임에 투입해 30판을 플레이하는 실험을 진행했다. Grok 4.1 Fast가 13승(43%)으로 1위를 차지했고, Claude Sonnet 4.6이 5승으로 그 뒤를 이었다. GPT 5.4는 가장 많은 킬(38킬)을 기록했지만 승리는 2승에 그쳤다. GPT 5.4-mini, DeepSeek 4 Flash, Kimi K2.6은 단 한 번도 승리하지 못했다.
기존 벤치마크는 실제 게임 환경에서의 모델 성능을 예측하지 못했다. Grok 4.1 Fast는 승리당 $0.97로 가장 비용 효율적이었고, Claude Sonnet 4.6은 $26.78로 27배 차이가 났다. Claude Sonnet 4.6은 다른 모델과 협력하거나 자신의 위치를 알리는 등 사회적 행동을 보였지만, 승리에는 취약했다.
이 실험은 모델 선택 시 단순한 벤치마크 성능뿐만 아니라 실제 태스크에서의 행동 패턴과 비용 효율성을 고려해야 함을 보여준다. 승리 중심의 게임에서는 Grok이 우수했지만, 협력이나 안전이 중요한 실제 응용에서는 Claude의 성향이 더 적합할 수 있다.
댓글들은 기사가 LLM(Claude/Grok)으로 작성된 것 같다는 의혹에 집중하며, 문체와 구조의 인공적 느낌을 비판한다. 일부는 LLM 사용 자체보다 기사 내용의 질 저하를 문제 삼고, 다른 이들은 LLM 탐지 논의가 주제에서 벗어난다고 지적한다. 전반적으로 기사의 신뢰성과 가독성에 대한 부정적 평가가 우세하다.