GPT 5.5이 AI 보안 경쟁에서 선두를 차지하고, DeepSeek은 비용 효율성에서 1위를 기록
Kasra Rahjerdi 보안 연구원은 최근 주요 대규모 언어 모델의 보안 추론에 대한 실제 테스트를 상세히 다룬 중요한 보고서를 발표했습니다. 그는 의도적으로 취약점이 있는 도서 리뷰 애플리케이션을 구축하여 이를 달성했습니다. 이 시나리오는 실제 세계의 취약점을 모방한 것으로, Rahjerdi는 애플리케이션 파일 내에 Google 모바일 백엔드 서비스 자격 증명을 삽입했습니다. 모델들은 이러한 자격 증명을 추출하고 식별하여 데이터베이스에 직접 접근하는 임무를 부여받았습니다.

주요 모델 비교
2시간의 시간 제한과 10달러의 예산이라는 엄격한 제약 하에서 모델들은 다양한 수준의 성능을 보였습니다. GPT-5.5이 가장 우수한 성과를 보였으며, 10번의 시도 중 7번을 성공적으로 완료하고 성공률에서 선두를 차지했습니다. 보고서는 GPT-5.5이 추출 후 주요 자격 증명을 빠르게 찾아내며 복잡하거나 관례적인 애플리케이션 인터페이스의 방해 요소를 무시했다고 언급합니다.
반면, Gemini의 성능은 기대에 미치지 못했습니다. Gemini 3.1 Pro Preview는 각 작업 시작 시 거의 즉시 내장된 안전 필터를 트리거하여, 다른 테스트된 모델들에 비해 현저히 낮은 토큰 소비량을 기록했습니다.
비용 효율성 평가
GPT-5.5이 높은 성공률을 보였음에도 불구하고, 성공적인 실행당 평균 비용은 9.46달러에 달하여 대량으로 도구를 실행해야 하는 팀들을 주저하게 만들었습니다. 반면, DeepSeek V4 Pro은 우수한 비용 효율성으로 두각을 나타냈습니다. 비록 10번의 테스트 중 3번에만 성공했지만, 성공적인 실행당 평균 비용은 단 0.62달러에 불과했습니다.
이는 단일 성공당 비용을 계산할 때 DeepSeek V4 Pro이 GPT-5.5보다 약 15배 저렴함을 나타냅니다. 실패한 시도 중 백엔드 인증 인터페이스를 가끔 오용하기도 했지만, 이러한 막대한 비용 우위는 대규모 보안 테스트를 배포하는 팀들에게 상당한 실용적 가치를 제공합니다.
관련 기사
머스크, “스페이스X의 AI가 반년 이내에 앤트로픽을 앞지를 수 있다”고 밝혀
스페이스XAI의 CEO 엘론 머스크는 컴퓨팅 하드웨어를 활용해 경쟁사들과의 격차를 좁힘으로써 6개월 이내에 AI 분야에서 주도권을 잡을 것이라고 전망했다.스페이스XAI의 CEO 엘론 머스크는 최근 X를 통해 자사가 약 6개월 이내에 최첨단 AI 분야의 선두를 차지할 계획이라고 밝혔다.머스크는 신중한 낙관론을 표명하며, 스페이스XAI가 2~3개월 내에 앤트로
WeRide, 물리적 AI 대규모 모델 ‘WITT’ 공개
자율주행 기술은 놀라운 속도로 발전하고 있습니다. 7월 17일, 선도적인 자율주행 기업인 WeRide는 자체 개발한 물리적 AI 인지 기반 모델인 ‘WeRide WITT’를 공개했습니다. 이번 출시로 AI가 복잡한 실제 데이터를 이해하고 처리하는 능력에 있어 중요한 이정표를 세웠습니다.WeRide WITT의 핵심에는 ‘최소 물리적 사실 단위(minimum
GitHub Copilot이 수 시간 내에 GPT-5.4를 통합합니다
GitHub Copilot은 다시 한번 빠른 대응 능력을 입증했습니다. OpenAI가 최신 플래그십 모델인 GPT-5.4를 출시한 지 몇 시간 만에 GitHub은 전 세계 개발자에게 이 첨단 기술로 구동되는 지능형 코딩 지원을 제공하는 완전한 통합을 발표했습니다.GitHub에 따르면 내부 테스트 결과, GPT-5.4는 "에이전트" 소프트웨어 개발 작업에서 뛰어난 성능을 보이며 이전 모델 대비 작업 성공률이 현저히 증가했습니다. Codex 계통
관련 특별 주제 추천
의견 (0)
0/500
Kasra Rahjerdi 보안 연구원은 최근 주요 대규모 언어 모델의 보안 추론에 대한 실제 테스트를 상세히 다룬 중요한 보고서를 발표했습니다. 그는 의도적으로 취약점이 있는 도서 리뷰 애플리케이션을 구축하여 이를 달성했습니다. 이 시나리오는 실제 세계의 취약점을 모방한 것으로, Rahjerdi는 애플리케이션 파일 내에 Google 모바일 백엔드 서비스 자격 증명을 삽입했습니다. 모델들은 이러한 자격 증명을 추출하고 식별하여 데이터베이스에 직접 접근하는 임무를 부여받았습니다.

주요 모델 비교
2시간의 시간 제한과 10달러의 예산이라는 엄격한 제약 하에서 모델들은 다양한 수준의 성능을 보였습니다. GPT-5.5이 가장 우수한 성과를 보였으며, 10번의 시도 중 7번을 성공적으로 완료하고 성공률에서 선두를 차지했습니다. 보고서는 GPT-5.5이 추출 후 주요 자격 증명을 빠르게 찾아내며 복잡하거나 관례적인 애플리케이션 인터페이스의 방해 요소를 무시했다고 언급합니다.
반면, Gemini의 성능은 기대에 미치지 못했습니다. Gemini 3.1 Pro Preview는 각 작업 시작 시 거의 즉시 내장된 안전 필터를 트리거하여, 다른 테스트된 모델들에 비해 현저히 낮은 토큰 소비량을 기록했습니다.
비용 효율성 평가
GPT-5.5이 높은 성공률을 보였음에도 불구하고, 성공적인 실행당 평균 비용은 9.46달러에 달하여 대량으로 도구를 실행해야 하는 팀들을 주저하게 만들었습니다. 반면, DeepSeek V4 Pro은 우수한 비용 효율성으로 두각을 나타냈습니다. 비록 10번의 테스트 중 3번에만 성공했지만, 성공적인 실행당 평균 비용은 단 0.62달러에 불과했습니다.
이는 단일 성공당 비용을 계산할 때 DeepSeek V4 Pro이 GPT-5.5보다 약 15배 저렴함을 나타냅니다. 실패한 시도 중 백엔드 인증 인터페이스를 가끔 오용하기도 했지만, 이러한 막대한 비용 우위는 대규모 보안 테스트를 배포하는 팀들에게 상당한 실용적 가치를 제공합니다.
머스크, “스페이스X의 AI가 반년 이내에 앤트로픽을 앞지를 수 있다”고 밝혀
스페이스XAI의 CEO 엘론 머스크는 컴퓨팅 하드웨어를 활용해 경쟁사들과의 격차를 좁힘으로써 6개월 이내에 AI 분야에서 주도권을 잡을 것이라고 전망했다.스페이스XAI의 CEO 엘론 머스크는 최근 X를 통해 자사가 약 6개월 이내에 최첨단 AI 분야의 선두를 차지할 계획이라고 밝혔다.머스크는 신중한 낙관론을 표명하며, 스페이스XAI가 2~3개월 내에 앤트로
WeRide, 물리적 AI 대규모 모델 ‘WITT’ 공개
자율주행 기술은 놀라운 속도로 발전하고 있습니다. 7월 17일, 선도적인 자율주행 기업인 WeRide는 자체 개발한 물리적 AI 인지 기반 모델인 ‘WeRide WITT’를 공개했습니다. 이번 출시로 AI가 복잡한 실제 데이터를 이해하고 처리하는 능력에 있어 중요한 이정표를 세웠습니다.WeRide WITT의 핵심에는 ‘최소 물리적 사실 단위(minimum
GitHub Copilot이 수 시간 내에 GPT-5.4를 통합합니다
GitHub Copilot은 다시 한번 빠른 대응 능력을 입증했습니다. OpenAI가 최신 플래그십 모델인 GPT-5.4를 출시한 지 몇 시간 만에 GitHub은 전 세계 개발자에게 이 첨단 기술로 구동되는 지능형 코딩 지원을 제공하는 완전한 통합을 발표했습니다.GitHub에 따르면 내부 테스트 결과, GPT-5.4는 "에이전트" 소프트웨어 개발 작업에서 뛰어난 성능을 보이며 이전 모델 대비 작업 성공률이 현저히 증가했습니다. Codex 계통





집






