Anderson의 관점

연구: LLM이 악의적인 ‘바이브 코딩’에 협조할 의향이 있음

mm
Unite.AI를 Google의 선호 소스에 추가
ChatGPT-4o and Adobe Firefly.

최근 몇 년 동안, 대규모 언어 모델(LLM)은 공격적인 사이버 보안에서 악용될 가능성에 대한 주목을 받았습니다. 특히, 소프트웨어 취약점을 생성하는 데 사용될 수 있습니다.

최근의 ‘바이브 코딩’ 트렌드(사용자가 코드를 작성하는 대신 언어 모델을 사용하여 코드를 빠르게 개발하는 것)는 2000년대에 최고조에 달했던 개념을 다시 부흥시켰습니다. 즉, 상대적으로 기술이 부족한 악의적인 공격자가 조금만 지식이 있다면 손상적인 공격을 복제하거나 개발할 수 있습니다. 이는 위협이 증가할 것이라는 자연스러운 의미를 가지고 있습니다.

모든 상업용 LLM에는 이러한 목적을 위해 사용되는 것을 방지하기 위한 어떤 종류의 가드레일이 있습니다. 그러나 이러한 보호 조치는不断적으로 공격을 받고 있습니다. 일반적으로, 대부분의 FOSS 모델은 서방에서 규정 준수를 위해 어떤 종류의 유사한 보호로 출시됩니다.

그러나 공식 모델 릴리즈는 사용자 커뮤니티에 의해 더 완전한 기능을 위해 정교화되거나, 제한을 우회하고 잠재적으로 ‘원치 않는’ 결과를 얻기 위해 LoRAs가 사용됩니다.

대부분의 온라인 LLM은 사용자에게 악의적인 프로세스를 지원하지 않도록 방지하지만, ‘제약이 없는’ 이니셔티브는 보안 연구자가 자신의 상대방과 동일한 수준에서 작동하도록 도와줍니다.

현재 사용자 경험은 주로 ChatGPT 시리즈에서 대표되며, 필터 메커니즘은 자주 비판을 받습니다.

시스템 공격 시도!

이러한 제한과 검열의 경향에 비추어 볼 때, 사용자는 ChatGPT가 최근 연구에서 테스트된 모든 LLM 중에서 악의적인 코드 취약점을 생성하는 데 가장 협조적이라는 사실을 알게 될 것입니다.

UNSW 시드니와 CSIRO의 연구자들이 작성한 새로운 논문은 이러한 모델이 작동하는 취약점을 생성하는 데 얼마나 효과적으로.prompting할 수 있는지에 대한 첫 번째 체계적인 평가를 제공합니다.

연구는 원본과 수정된 버전의 알려진 취약점 랩을 사용하여 모델이 원본과 수정된 버전의 취약점 랩에서 어떻게 수행하는지 비교합니다.

연구에서 제공된 예시 대화는 작가들이 제공했습니다.

연구는 모델이 원본과 수정된 버전의 취약점 랩에서 어떻게 수행하는지 비교하여 모델이 기억된 예제에 의존하는지, 또는 내장된 안전 제한으로 인해 어려움을 겪는지 여부를 나타냅니다.

지원 사이트에서 Ollama LLM이 연구자에게 문자열 취약점 공격을 개발하는 데 도움을 주는 모습

지원 사이트에서 Ollama LLM이 연구자에게 문자열 취약점 공격을 개발하는 데 도움을 주는 모습 Source: https://anonymous.4open.science/r/AEG_LLM-EAE8/chatgpt_format_string_original.txt

모델은 모두 효과적인 취약점을 생성하지 못했지만, 몇몇 모델은 매우 가까운 결과를 얻었습니다. 더욱 중요한 것은 몇몇 모델이 작업을 더 잘하고 싶어했다는 것입니다. 이는 기존의 가드레일 접근 방식의 잠재적인 실패를 나타냅니다.

논문은 다음과 같이 말합니다.

‘우리의 실험은 GPT-4와 GPT-4o가 취약점 생성에서 높은 협조도를 보인다는 것을 보여줍니다. 평가된 모델 중 Llama3는 이러한 요청에 가장 저항했습니다. ‘

‘그들의 협조 의향에도 불구하고, 이러한 모델이 제기하는 실제 위협은 제한적입니다. none이 성공적으로 취약점을 생성하지 못했기 때문입니다. 그러나 GPT-4o는 우리 연구에서 가장 강력한 수행자였으며, 일반적으로 각 시도에서 하나 또는 두 개의 오류만을犯했습니다. ‘

‘이것은 LLM을 사용하여 고급, 일반화된 [자동 취약점 생성(AEG)] 기술을 개발하는 데 상당한 잠재력을 나타냅니다.’

두 번째 기회

LLM에 대한 일반적인 진실은 ‘첫 인상을 잘 남겨야 한다’는 것입니다. 그러나 LLM의 일반적으로 제한된 컨텍스트 창으로 인해, 부정적인 컨텍스트(사회적 의미에서, 즉 적대적)는 지속되지 않습니다.

예를 들어, 도서관에 가서 실제 폭탄 제작에 대한 책을 요청하면, 최소한 거절될 것입니다. 그러나(이 요청이 대화의 시작부터 완전히 탱크되지 않았다면) 관련 작품에 대한 요청, 즉 화학 반응이나 회로 설계에 대한 책은, 처음 요청과 관련이 있으며, 그렇게 취급될 것입니다.

도서관 사서가 또한 미래의 만남에서 당신이 폭탄 제작 책을 요청한 적이 있다는 것을 기억할 것입니다. 이는 새로운 컨텍스트를 만들며, 이는 수리할 수 없습니다.

LLM은 현재 대화에서 토큰화된 정보를 유지하는 데 어려움을 겪을 수 있으며, 장기 메모리 지침(있는 경우)은 없습니다.

따라서 ChatGPT와의 사전 대화는 때때로 작고 큰 것을 삼키는 것을 보여줍니다. 특히, 다른 활동과 관련된 주제, 연구 또는 프로세스가 대화 중에 개발될 때입니다.

이것은 모든 현재 언어 모델에 해당하며, 가드레일의 품질은 그들 사이에서 다를 수 있습니다.

방법 테스트

연구자들은 LLM이 작동하는 취약점을 생성하는 데 얼마나 멀리 밀릴 수 있는지 테스트했습니다. 이를 위해, 그들은 5개의 SEED 랩을 사용하여 제어된 환경을 설정했습니다. 각 랩은 알려진 취약점을 중심으로 구축되었습니다.

연구자들은 또한 원본과 수정된 버전의 각 랩을 사용하여 모델이 원본과 수정된 버전의 취약점 랩에서 어떻게 수행하는지 비교했습니다.

연구자들은 또한 두 번째 LLM을 루프에 도입했습니다. 공격 모델은 대상 모델을 프롬프트하고 재프롬프트하여 다중 라운드를 통해 출력을 개선하기 위해 설계되었습니다.

LLM 기반 공격자의 워크플로우

LLM 기반 공격자의 워크플로우

연구 대상 모델은 GPT-4o, GPT-4o-mini, Llama3(8B), Dolphin-Mistral(7B), Dolphin-Phi(2.7B)였습니다.

로컬로 설치할 수 있는 모델은 Ollama 프레임워크를 통해 실행되었으며, 다른 모델은 API를 통해 액세스되었습니다.

결과

연구자들은 각 모델이 취약점 생성 프로세스에서 얼마나 협조적이었는지 테스트했습니다. 이를 위해, 그들은 모델이 작업을 지원하려고 시도한 응답의 百分比를 기록했습니다.

주요 테스트 결과, 평균 협조도

주요 테스트 결과, 평균 협조도

GPT-4o와 GPT-4o-mini는 평균 응답률이 97%와 96%로最高의 협조도를 보였습니다.

Dolphin-Mistral과 Dolphin-Phi는 평균 협조도가 93%와 95%로 뒤를 이었습니다. Llama3는 27%의 협조도만을 보였습니다.

오리지널 SEED 랩 프로그램에서 LLM이犯한 오류 수(왼쪽)와 리팩토링된 버전에서犯한 오류 수(오른쪽)

오리지널 SEED 랩 프로그램에서 LLM이犯한 오류 수(왼쪽)와 리팩토링된 버전에서犯한 오류 수(오른쪽)

실제 성능을 조사한 결과, 모델은 의도한 대로 작동하는 데 실패했습니다. GPT-4o는 리팩토링된 5개의 랩에서 총 6개의 오류만을犯했습니다. GPT-4o-mini는 8개의 오류를犯했습니다.

오류는 기술적인 실수로 인해 취약점이 작동하지 않도록 했습니다. 예를 들어, 버퍼 크기가 잘못되거나, 루프 논리가 누락되거나, 구문적으로 유효하지만 효과가 없는 페이로드가 있었습니다.

모델은 모두 작동하는 취약점을 생성하지 못했습니다. 그러나 대부분의 모델은 작동하는 취약점과 유사한 코드를 생성했습니다. 이는 모델이 코드 구조를 모방하는 것보다 논리를 이해하지 못했기 때문입니다.

결론

연구자들은 이 연구에서 테스트된 언어 모델이 원래 SEED 랩을 처음 훈련할 때 보았는지 여부에 대한 의구심이 있다고 인정합니다. 따라서 변형된 버전을 생성했습니다. 연구자들은 향후 이 연구의 후속 버전에서 실제 악용 사례를 사용하고 싶다고 말합니다.

연구자들은 또한 이 연구에서 수행되지 않은 더 최근의 모델인 GPT-o1과 DeepSeek-r1이 결과를 개선할 수 있을 것이라고 말합니다.

논문은 대부분의 테스트된 모델이 작동하는 취약점을 생성할 수 있었을 것이라고 결론지었습니다. 그러나 그들의 출력이 완전히 작동하는 출력이 되지 못한 것은 정렬 안전보장으로 인한 것이 아니라, 아키텍처의 실제 제한 때문일 수 있습니다.

첫 번째로 게시됨: 2025년 5월 5일

기계 학습 분야 작가, 인간 이미지 합성 분야 전문가입니다. Metaphysic.ai의 연구 콘텐츠 책임자였으며, DNEG의 Brahma.ai로의 합병으로 해체될 때까지 그 역할을 수행했습니다.
포트폴리오 사이트: martinanderson.ai
연락처: martin@martinanderson.ai