NewsLayer.com
NewsLayer PulseLIVEBTC$83,875+1.01%ETH$2,543+1.49%SOL$112.35+2.25%XRP$1.42+1.09%DOGE$0.0873+1.58%ADA$0.2548+0.43%Total Cap$2.97T+1.12%Layer Index46 Neutral

AI 에이전트의 과학 해석 능력 부족, 해결책은 무엇인가?

AI 에이전트는 과학을 해석하는 데 서툽니다. 무엇을 할 수 있을까요? Chemical & Engineering News

Chemical & Engineering News

Publisher

Oct 7, 2026 at 4:39 PM UTC · 9 분 소요

AI 에이전트의 과학 해석 능력 부족, 해결책은 무엇인가?
Image via Chemical & Engineering News

Key Signal

42 studies flawed studies sampled

Last Updated

4일 전

 

핵심 통찰

  • 연구자들이 과학 문헌을 탐구하기 위해 인공지능 모델을 점점 더 많이 사용하고 있습니다.
  • 이 모델들은 확실한 연구와 의심스럽거나 철회된 연구를 종종 구분하지 못합니다.
  • 과학자들은 이 문제에 대처하기 위한 몇 가지 방법을 제안했지만, 이를 위해서는 학술 출판사들의 협력이 필요할 것입니다.

인공지능 에이전트가 과학을 해석하고 심지어 수행하는 데 점점 더 많이 사용되고 있습니다. 하지만 이들이 확실한 과학과 수준 이하의 과학을 정확하게 구분할 수 있을까요? 

Valentin Rodionov는 이를 알아보고 싶었습니다. 이를 위해 그는 정당한 연구의 기준을 충족하지 못하는 42개의 연구를 선택했습니다. 일부는 문헌에서 철회되었으며, 다른 연구들은 문제가 있거나 사기성이 있거나 유사과학적인 것으로 간주되지만 공식적으로 철회되거나 수정되지는 않았습니다. 

칼라 셔츠를 입고 컨퍼런스 배지를 단 사람이 잎이 무성한 배경 앞에서 포즈를 취하고 있습니다.
Case Western Reserve University의 유기 화학자인 Valentin Rodionov는 인공지능 모델이 의심스러운 연구에 대해 얼마나 비판적이지 않은지에 놀랐습니다. 크레딧: Valentin Rodionov 제공

Case Western Reserve University의 유기 화학자인 Rodionov는 샘플 논문의 섹션들을 30개의 AI 모델에 각각 10번씩 업로드했습니다. 이 AI 모델들은 대부분 Anthropic, OpenAI, Meta, Google, Mistral AI 등 거대 기술 기업들이 만든 잘 알려진 대규모 언어 모델(LLM)이었습니다. 

그런 다음 Rodionov는 LLM에게 해당 연구의 전제를 바탕으로 후속 실험과 분석을 제안해 달라고 요청했습니다. 그는 LLM이 해당 발췌문에 대해 적절하게 비판적인 피드백과 맥락을 제공할 것으로 기대했습니다. 하지만 8월에 arXiv에 게시된 그의 논문에서 밝혀졌듯이, AI 모델들은 평균적으로 약 93%의 경우 결함이 있는 연구를 바탕으로 후속 연구를 진행할 것을 비판 없이 제안했습니다. 

"이는 모델에게 '유니콘의 개체 수를 어떻게 추적합니까?'라고 묻는 것과 같습니다. 유일한 정답은 '유니콘 같은 것은 없습니다'입니다."

“과학을 한다는 것은 단순히 알려진 답을 상기하는 것이 아닙니다. 그것에 대해 추론해야 합니다.”라고 Rodionov는 말합니다. “어떤 과학이 좋은 과학이고 어떤 과학이 나쁜 과학인지 알아야 합니다.”

Rodionov의 논문은 AI 에이전트가 과학 연구를 제대로 해석하지 못하고 종종 더 넓은 맥락을 놓치고 있음을 강조합니다. 한편, 다른 연구자들은 연구를 스캔하고 관련 정보를 추출하는 도구의 능력을 향상시키기 위해 노력하고 있습니다. 이들 모두는 AI가 과학적 노력을 돕고 가속화하는 도구가 되려면 연구를 정확하고 적절하게 해석해야 한다는 생각에 동기를 부여받고 있습니다.