학습·인사이트 IT 서비스 창업가 5기 1주차 · 일반 수업 미션·실습

Chapter 05 실습 · 파일 분석, 웹 검색, 이미지 이해

CogBench 논문, 2023~2025 노벨상, ChatGPT UI를 실제 자료와 공식 출처로 분석했습니다.

제출 완료

Chapter 05에서는 파일 분석, 웹 검색, 이미지 이해를 각각 실제 자료로 수행했습니다. 생성된 답을 그대로 사용하지 않고 논문 원문, NobelPrize.org, 화면에서 직접 확인되는 요소로 다시 검증했습니다.

Chapter 05 · 실습 3개

C05-S0001 · 실습 1: CogBench 논문 분석

1. 과제

「CogBench: a large language model walks into a psychology lab」을 분석하고 연구 목적과 문제 제기, 연구 방법론, 핵심 실험과 지표, 의의와 한계를 포함해 요약합니다.

2. 프롬프트 초안

CogBench 논문을 요약해줘.
연구 목적, 방법, 핵심 결과, 의의와 한계를 포함해줘.

3. 첫 결과에서 발견한 문제

  • 실험 7개와 행동 지표 10개의 구체적인 연결이 부족했습니다.
  • 성능이 높다는 것과 인간과 비슷하게 행동한다는 것을 혼동할 수 있었습니다.
  • 40개 LLM, 다층 회귀, 프롬프트 기법의 정량 결과가 누락될 수 있었습니다.
  • 논문의 주장과 해석을 구분하는 출처 표시가 필요했습니다.

4. 수정 프롬프트

첨부한 CogBench ICML 2024 논문만 근거로 분석해줘.

필수 항목:
1. 기존 LLM 벤치마크의 문제와 연구 질문
2. 평가 모델 수, 실험 설계, 온도 설정, 분석 방법
3. 7개 인지심리 실험과 10개 행동 지표의 대응
4. 성능 지표와 행동 지표가 다르게 보여준 사례
5. RLHF, 모델 크기, 오픈소스, 코드 튜닝에 대한 결과
6. CoT와 take-a-step-back의 정량 결과
7. 저자가 밝힌 한계와 후속 연구

각 주장에 논문 쪽수를 표시하고,
논문에서 확인되지 않는 내용은 추측하지 마.
마지막에 실무자가 얻을 수 있는 시사점 3개를 별도로 정리해줘.

5. 최종 결과

연구 목적과 문제 제기

기존 LLM 벤치마크가 정답률 같은 성능 중심 지표에 치우쳐 “어떤 방식으로 문제를 푸는가”를 충분히 보여주지 못한다는 문제에서 출발합니다. CogBench는 인지심리학 과제를 LLM용 텍스트 실험으로 변환해 행동적 특성을 비교하려는 벤치마크입니다.

연구 방법론

  • 40개 이상의 공개·비공개 LLM을 평가했으며 별도 미세조정 없이 문맥 내 학습만 사용했습니다.
  • 기본 실험에서는 온도를 0으로 설정하고 나머지 생성 매개변수는 기본값을 유지했습니다.
  • 미세조정 계열 모델 간 종속성을 고려하기 위해 통계적 다층 회귀를 사용했습니다.
  • 성능 점수 외에 인간 데이터와 비교 가능한 행동 매개변수를 계산했습니다.

7개 실험과 10개 행동 지표

실험 측정 행동
확률 추론 사전확률 가중치, 가능도 가중치
Horizon task 지향적 탐색, 무작위 탐색
Restless bandit 메타인지
Instrumental learning 학습률, 낙관 편향
Two-step task 모델 기반성
Temporal discounting 시간 할인
BART 위험 감수

핵심 결과

  • GPT-4는 6개 성능 지표 중 5개에서 인간 수준의 점수를 보였지만, 대부분 모델은 다수의 행동 지표에서 인간과 비슷하지 않았습니다.
  • Horizon task에서는 높은 성능에도 인간과 같은 탐색 행동이 부족해, 성능과 해결 전략이 다를 수 있음을 보여줬습니다.
  • RLHF 적용 모델은 행동 공간에서 인간과 더 가까웠고, 메타인지에도 유의한 긍정 효과가 있었습니다.
  • 모델 파라미터 수는 성능과 모델 기반성에 긍정적 영향을 보였지만 학습 데이터 양과 코드 데이터 사용은 뚜렷한 효과가 없었습니다.
  • 예상과 달리 이 분석에서는 오픈소스 모델이 비공개 모델보다 덜 위험 감수적인 경향을 보였습니다.
  • 확률 추론 정확도는 CoT가 평균 9.01%, step-back이 3.10% 향상했습니다. 모델 기반성은 각각 64.59%, 118.59% 증가해 과제에 따라 적합한 프롬프트가 달랐습니다.

의의와 한계

절차적으로 생성되는 심리 실험과 행동 지표를 사용해 단순 정답률을 넘어 모델의 전략 차이를 관찰했다는 점이 중요합니다. 다만 비공개 모델의 학습 정보가 부족하고, 인간을 위해 설계한 심리 과제의 구인이 AI에도 같은 의미인지 검증되지 않았습니다. 하나의 LLM을 한 명의 피험자로 볼지 개체군으로 볼지도 명확하지 않으며, 프롬프트 기법 분석은 제한된 모델·지표에 대한 초기 결과입니다.

체크리스트 검증

  • ✓ 연구 목적과 기존 평가의 문제를 설명했습니다.
  • ✓ 40개 LLM·7개 실험·10개 행동 지표·다층 회귀를 포함했습니다.
  • ✓ 성능과 행동의 차이를 사례로 설명했습니다.
  • ✓ 논문이 직접 밝힌 한계와 초기 분석 범위를 표시했습니다.

원문: PMLR · CogBench (ICML 2024). 확인일: 2026-08-04.

C05-S0002 · 실습 2: 최근 3년 노벨상 웹 검색

1. 과제와 프롬프트 개선

초안: 최근 3년간 노벨상 수상자와 업적을 표로 정리해줘.

수정:
- 기준일은 2026-08-04, 최근 완료된 수상연도 2023~2025로 고정
- 물리학·화학·생리의학·문학·평화·경제학 전체 부문 포함
- 수상자가 여러 명이고 업적이 나뉘면 같은 부문 안에서 구분
- NobelPrize.org 공식 목록과 각 부문 페이지를 우선 사용
- 결과에 연도, 부문, 수상자, 수상 업적, 출처 포함
- 번역은 의미를 보존한 한국어 요약으로 작성

2. 최종 결과

연도 부문 수상자 수상 업적
2025 물리학 John Clarke, Michel H. Devoret, John M. Martinis 전기회로에서 거시적 양자역학적 터널링과 에너지 양자화를 발견
2025 화학 Susumu Kitagawa, Richard Robson, Omar M. Yaghi 금속-유기 골격체(MOF) 개발
2025 생리의학 Mary E. Brunkow, Fred Ramsdell, Shimon Sakaguchi 말초 면역 관용에 관한 발견
2025 문학 László Krasznahorkai 종말론적 공포 속에서도 예술의 힘을 재확인하는 강렬하고 선구적인 작품 세계
2025 평화 Maria Corina Machado 베네수엘라 국민의 민주적 권리와 평화로운 민주 전환을 위한 활동
2025 경제학 Joel Mokyr; Philippe Aghion, Peter Howitt 기술 진보를 통한 지속 성장의 전제조건 규명; 창조적 파괴를 통한 지속 성장 이론
2024 물리학 John J. Hopfield, Geoffrey Hinton 인공신경망 기반 머신러닝을 가능하게 한 기초 발견과 발명
2024 화학 David Baker; Demis Hassabis, John Jumper 계산 단백질 설계; 단백질 구조 예측
2024 생리의학 Victor Ambros, Gary Ruvkun microRNA와 전사 후 유전자 조절에서의 역할 발견
2024 문학 Han Kang 역사적 트라우마에 맞서며 인간 삶의 연약함을 드러내는 강렬한 시적 산문
2024 평화 Nihon Hidankyo 핵무기 없는 세계를 위한 노력과 핵무기가 다시 사용돼서는 안 된다는 증언
2024 경제학 Daron Acemoglu, Simon Johnson, James A. Robinson 제도가 형성되고 번영에 영향을 주는 방식에 관한 연구
2023 물리학 Pierre Agostini, Ferenc Krausz, Anne L’Huillier 물질의 전자 동역학 연구를 위한 아토초 빛 펄스 생성 실험 방법
2023 화학 Moungi Bawendi, Louis Brus, Aleksey Yekimov 양자점의 발견과 합성
2023 생리의학 Katalin Karikó, Drew Weissman 효과적인 코로나19 mRNA 백신 개발을 가능하게 한 뉴클레오사이드 염기 변형 발견
2023 문학 Jon Fosse 말할 수 없는 것에 목소리를 부여한 혁신적인 희곡과 산문
2023 평화 Narges Mohammadi 이란 여성 억압에 맞서고 모든 사람의 인권과 자유를 증진한 투쟁
2023 경제학 Claudia Goldin 여성의 노동시장 성과에 대한 이해를 발전시킨 연구

체크리스트 검증

  • ✓ 최근 완료된 3개 연도인 2023~2025를 사용했습니다.
  • ✓ 매년 여섯 부문을 모두 포함해 총 18행으로 정리했습니다.
  • ✓ 공동수상자와 분리된 업적을 같은 부문 안에서 구분했습니다.
  • ✓ 공식 NobelPrize.org 목록과 대조했습니다.

공식 출처: NobelPrize.org · All Nobel Prizes. 확인일: 2026-08-04.

C05-S0003 · 실습 3: ChatGPT UI 이미지 이해

1. 분석 화면

로그아웃 상태의 ChatGPT 새 대화 화면과 로그인 패널
개인 대화 기록이 표시되지 않는 로그아웃 상태의 ChatGPT 화면을 사용했습니다.

2. 프롬프트 초안과 개선

초안: 이 ChatGPT 화면의 UI를 분석해줘.

수정:
이 스크린샷에서 직접 확인되는 요소만 근거로 분석해줘.
1. 버튼·메뉴·입력창·상태 안내를 영역별로 식별
2. 처음 방문한 사용자의 시작 → 입력 → 결과 흐름 설명
3. 사용성 문제는 화면 근거와 영향을 함께 작성
4. 개선안은 P1~P3 우선순위, 해결할 문제, 기대효과로 정리
5. 보이지 않는 기능이나 로그인 후 화면은 추측하지 말 것

3. 최종 분석

주요 구성 요소

  • 왼쪽 탐색 영역: ChatGPT 브랜드, 새 채팅, 검색·이미지 관련 아이콘, 계정 진입 아이콘이 세로로 배치돼 있습니다.
  • 중앙 작업 영역: “무엇이든 편하게 시작해 보세요” 안내와 큰 프롬프트 입력창, 파일 추가, 음성 입력 버튼이 핵심 행동을 형성합니다.
  • 오른쪽 인증 패널: Google·Apple·휴대전화·이메일 로그인 수단과 계속 버튼을 제공합니다.
  • 하단 쿠키 배너: 쿠키 설명, 거부·허용 선택과 닫기 버튼이 화면 하단을 차지합니다.

사용자 흐름

  1. 중앙 입력창에서 질문을 시작하거나 오른쪽에서 로그인 방법을 선택합니다.
  2. 파일 추가·텍스트·음성 중 입력 방식을 선택합니다.
  3. 입력 후 응답을 받고 후속 질문으로 결과를 개선합니다. 이 마지막 단계는 캡처 화면에는 아직 나타나지 않습니다.

사용성 문제와 우선순위

우선순위 문제 개선안 기대효과
P1 로그인 패널과 쿠키 배너가 동시에 열려 핵심 입력 영역의 집중을 분산 첫 방문에서는 쿠키 선택 후 인증 패널을 단계적으로 노출하거나 패널 폭을 축소 첫 행동 선택 부담 감소
P2 왼쪽 아이콘만으로 기능 의미를 즉시 알기 어려움 초기 방문 시 아이콘 라벨 또는 짧은 툴팁 제공 탐색 학습 비용 감소
P3 로그인하지 않아도 가능한 기능 범위가 중앙에서 명확하지 않음 입력창 근처에 비로그인 사용 가능 범위와 로그인 이점을 한 줄로 설명 로그인 전환과 기대 관리 개선

체크리스트 검증

  • ✓ 버튼·메뉴·아이콘·입력 영역을 식별했습니다.
  • ✓ 시작·입력·결과 흐름을 화면 근거와 구분해 설명했습니다.
  • ✓ 문제마다 화면 근거와 사용자 영향을 연결했습니다.
  • ✓ 개선안을 P1~P3으로 정리했습니다.
회고: 이미지 분석 프롬프트에 “보이는 것”과 “추정”을 구분하라는 조건을 넣으면, 존재하지 않는 버튼이나 흐름을 만들어내는 오류를 줄일 수 있습니다.

실습 기준: 강의자료 Chapter 05, 35~37쪽. 작성 및 검토일: 2026-08-04.