이 글은 미션 제출용 보고서가 아니라, 팀원들이 우리가 만든 JSON 기반 RAG를 어떻게 이해하고 활용하면 되는지 공유하기 위한 자료다.
핵심은 하나다.
우리가 수집한 지식iN JSON은 단순 참고자료가 아니라, 보호자의 실제 질문과 채택답변을 검색해 사업 인사이트와 서비스 답변으로 재구성할 수 있는 RAG 지식베이스다.
1. 우리가 만든 RAG는 무엇인가
케어잇 RAG는 지식iN의 실제 질문과 채택답변 JSON을 지식베이스로 만들고, 보호자의 질문과 문맥이 비슷한 사례를 찾아 현재 상황에 맞는 답변과 사업 인사이트로 재구성하는 구조다.
예를 들어 팀원이 이렇게 질문할 수 있다.
원거리 보호자가 가장 많이 겪는 시니어 케어 Pain Point는 뭐야?
그러면 RAG는 1만 건 JSON 안에서 원거리 보호자, 부모님 돌봄, 병원동행, 복약, 비용, 장기요양 등과 문맥이 비슷한 질문과 채택답변을 찾고, 반복되는 문제를 요약한다.
2. 왜 ChatGPT 단독이 아니라 RAG인가
ChatGPT에 바로 질문해도 자연스러운 답변은 나온다. 하지만 시니어 케어처럼 복지제도, 의료, 비용, 가족 돌봄 부담이 섞인 문제에서는 실제 상황과 맞지 않는 일반론이 나오거나 근거 없는 내용을 그럴듯하게 생성할 수 있다.
RAG는 먼저 데이터를 검색한 뒤 답한다. 케어잇 RAG에서는 이 검색 대상이 지식iN의 실제 질문과 채택답변이다.
특히 채택답변은 질문자가 자기 상황에 도움이 되었다고 선택한 답변이다. 공식 정답은 아니지만, 실제 문제 상황에서 도움이 된 해결 단서를 담고 있다.
그래서 케어잇 RAG는 다음에 강하다.
- 실제 보호자들이 어떤 표현으로 문제를 묻는지 파악
- 비슷한 상황의 질문과 채택답변을 Vector Search로 검색
- 검색된 사례를 현재 질문자의 문맥에 맞게 재구성
- LLM 단독보다 실질적인 답변 가능성을 높임
- 제도/의료 정확성이 필요한 부분은 공식 자료 확인으로 분리
정확히 말하면 RAG가 할루시네이션을 0%로 없애는 것은 아니다. 다만 답변 전에 실제 사례를 검색하고, 검색된 근거 안에서 답변하도록 설계할 수 있기 때문에 근거 없는 답변 가능성을 크게 낮출 수 있다.
3. 현재 JSON 데이터 구성
이번 프로젝트에서 만든 데이터 흐름은 다음과 같다.
지식iN 후보 질문 수집
216,347개
↓
상세 질문 크롤링
10,000건
↓
채택답변 포함 질문 확보
2,745건
↓
Pain Point / Persona / Existing Solution / Unmet Need 분석
↓
사업전략과 RAG 지식베이스로 활용
주요 파일은 다음과 같다.
| 파일 | 역할 |
|---|---|
03-crawl-dataset.json | 상세 크롤링된 지식iN 질문/답변 원천 데이터 |
senior-care-rag-analysis.json | Pain Point, 수요 신호, 페르소나, 기존 해결방식 분석 결과 |
senior-care-rag-analysis.md | 사람이 읽기 쉬운 분석 리포트 |
careit-business-strategy-report.md | 미션 제출용 사업 전략 기획서 |
careit-rag-pitch-deck.pptx | 발표용 피치덱 |
4. 구현된 RAG 아키텍처
Naver 지식iN 질문/답변
│
▼
질문 후보 수집
216,347개
│
▼
상세 크롤링 JSON 생성
10,000건
│
▼
채택답변 포함 데이터 분리
2,745건
│
▼
분석용 JSON 생성
Pain Point / Persona / Existing Solution / Unmet Need
│
▼
RAG Knowledge Base
질문 + 채택답변 + 키워드 + 분류값
│
▼
Vector Search
현재 질문과 문맥이 비슷한 실제 사례 검색
│
▼
LLM 재구성
검색된 사례를 현재 보호자 상황에 맞게 요약/답변/전략화
│
▼
활용 결과
사업전략 / 가설검증 / 발표자료 / 사용자 상담 / 콘텐츠 기획
핵심은 JSON을 그냥 저장하지 않는 것이다. 질문, 채택답변, 키워드, Pain Point, 고객 유형을 구조화하면 나중에 팀원이 질문했을 때 비슷한 실제 사례를 찾고 답변에 반영할 수 있다.
5. Vector Search가 답변을 만드는 방식
사용자가 이렇게 질문한다고 가정한다.
멀리 사는데 어머니가 약을 제대로 드시는지 어떻게 확인하면 좋을까요?
키워드 검색은 "약", "어머니", "확인" 같은 단어가 들어간 글을 찾는다. 하지만 실제 사람들은 같은 문제를 다르게 표현한다.
- 어머니가 약을 자꾸 빼먹습니다.
- 엄마가 처방약 먹는 걸 계속 잊습니다.
- 고령 부모님의 복약 여부를 확인하기 어렵습니다.
- 치매 부모님이 약을 먹었다고 하는데 실제로는 안 드신 것 같습니다.
Vector Search는 이런 문장의 의미를 숫자 벡터로 바꿔서, 표현은 달라도 문맥이 비슷한 질문을 찾아낸다.
사용자 질문
↓
질문을 Vector로 변환
↓
10,000건 JSON의 질문/답변 Vector와 비교
↓
문맥이 비슷한 질문-채택답변 검색
↓
LLM이 검색 결과를 읽고 현재 상황에 맞게 답변 재구성
이 구조 덕분에 케어잇은 일반적인 복약 관리 방법이 아니라, 실제 보호자들이 비슷한 상황에서 어떤 답변을 도움으로 선택했는지를 근거로 답변할 수 있다.
6. 팀원이 바로 쓰는 RAG 질문 템플릿
아래 프롬프트를 그대로 사용하면 된다.
너는 케어잇 RAG 분석 도우미다.
역할:
- 지식iN 시니어 케어 질문/채택답변 JSON을 근거로 답한다.
- 답변은 실제 보호자 질문과 채택답변에서 반복되는 패턴을 우선한다.
- 의료/제도 판단은 공식 기관 확인이 필요하다고 분리해서 안내한다.
- 근거가 부족하면 추측하지 말고 "추가 검증 필요"라고 표시한다.
답변 형식:
1. 질문 의도
2. 검색된 유사 사례의 공통 맥락
3. 반복 Pain Point
4. 채택답변에서 보이는 해결 단서
5. 케어잇 서비스/사업전략으로의 해석
6. 추가 검증이 필요한 부분
내 질문:
[여기에 질문 입력]
팀원은 질문을 이렇게 쓰면 좋다.
시니어 헬스케어 팀미션 관점에서,
지식iN JSON과 채택답변 패턴을 근거로
[고객/문제/서비스/가설/콘텐츠] 관점의 답변을 정리해줘.
질문:
[구체적인 질문]
7. 질문 예시
Pain Point 찾기
- 원거리 보호자가 가장 많이 겪는 문제를 5개로 정리해줘.
- 부모님 병원동행 관련 질문에서 반복되는 불편은 뭐야?
- 치매 부모를 돌보는 보호자의 가장 큰 불안은 무엇으로 보여?
- 비용, 지원금, 본인부담 관련 질문은 어떤 맥락에서 많이 나와?
- 식사, 반찬, 가사도우미 질문에서 해결되지 않은 니즈를 찾아줘.
고객과 페르소나 정의
- 케어잇의 User와 Customer를 분리해서 설명해줘.
- 초기 결제 고객을 시니어가 아니라 보호자로 잡아야 하는 근거를 찾아줘.
- 원거리 자녀 보호자 페르소나를 지식iN 질문 기반으로 만들어줘.
- 1인 가구 시니어와 보호자 동거 시니어의 니즈 차이를 정리해줘.
서비스 기획
- 케어잇 MVP에 꼭 들어가야 할 기능 5개를 데이터 근거로 추천해줘.
- 병원동행, 복약, 생활지원 중 초기 MVP 우선순위를 정해줘.
- RAG 상담 답변 화면에는 어떤 정보가 보여야 해?
- 보호자 리포트에는 어떤 항목을 넣어야 실제로 도움이 될까?
사업모델과 수익화
- 보호자가 월 구독료를 낼 만한 기능을 지식iN Pain Point 기준으로 뽑아줘.
- 연결 수수료 모델이 가능한 서비스 영역을 찾아줘.
- B2B/B2G로 확장할 수 있는 근거를 정리해줘.
- 케어잇의 BMC를 RAG 분석 결과 기반으로 요약해줘.
가설 검증
- 가장 먼저 검증해야 할 리스크 3개를 정리해줘.
- 보호자 30명 설문에 넣을 질문을 만들어줘.
- RAG 답변 유용성을 검증하기 위한 인터뷰 질문을 만들어줘.
- 랜딩페이지 CTA 테스트 문구를 3개 제안해줘.
콘텐츠 기획
- 검색 유입용 블로그 글 주제 20개를 실제 질문 기반으로 뽑아줘.
- 장기요양등급 관련 콘텐츠 제목을 보호자 언어로 만들어줘.
- 병원동행 서비스 소개 글의 FAQ를 만들어줘.
- "부모님이 약을 자꾸 잊을 때" 콘텐츠 개요를 만들어줘.
8. 질문하면 답변 가능한 예시
예시 1. Pain Point 요약
질문
지식iN JSON 기준으로 보호자들이 가장 반복적으로 겪는 시니어 케어 Pain Point를 정리해줘.
RAG 답변 예시
1. 질문 의도
보호자 관점에서 반복되는 시니어 케어 문제를 우선순위로 정리하려는 질문입니다.
2. 검색된 유사 사례의 공통 맥락
부모님의 식사, 복약, 병원동행, 치매 의심, 장기요양등급, 비용 부담을 묻는 질문이 반복됩니다.
3. 반복 Pain Point
- 식사·가사·생활지원 공백
- 비용·지원금·본인부담 불확실성
- 보호자 시간·심리 부담
- 돌봄/요양/복지 서비스 탐색 어려움
- 치매·인지저하 대응 불안
4. 채택답변에서 보이는 해결 단서
가족이 직접 해결하기 어려운 상황에서는 방문요양, 병원동행, 장기요양등급, 지역 복지서비스, 민간 생활지원 서비스를 함께 비교하는 답변이 도움 되는 단서로 보입니다.
5. 케어잇 서비스/사업전략으로의 해석
케어잇은 기능 제공보다 보호자가 선택지를 비교하고 다음 행동을 결정하도록 돕는 RAG 상담과 리포트가 핵심 가치가 됩니다.
6. 추가 검증이 필요한 부분
비용과 제도 조건은 지역, 등급, 소득, 건강 상태에 따라 달라지므로 공식 기관 자료 확인이 필요합니다.
예시 2. 병원동행 서비스 기획
질문
병원동행 관련 질문을 보면 케어잇 MVP에 어떤 기능이 필요할까?
RAG 답변 예시
1. 질문 의도
병원동행 Pain Point를 MVP 기능으로 바꾸려는 질문입니다.
2. 검색된 유사 사례의 공통 맥락
보호자가 직장, 거리, 시간 문제로 부모님의 병원 방문을 직접 동행하지 못하는 상황이 반복됩니다.
3. 반복 Pain Point
- 예약 시간 확인과 이동 동선 관리가 어렵다.
- 진료 내용을 보호자가 직접 듣지 못한다.
- 검사, 약 처방, 다음 예약 정보를 놓칠까 불안하다.
- 병원동행 서비스 비용과 신뢰도가 걱정된다.
4. 채택답변에서 보이는 해결 단서
병원동행 도우미, 가족 대리 동행, 진료 후 기록 공유, 지역 복지서비스 확인 등이 반복됩니다.
5. 케어잇 서비스/사업전략으로의 해석
초기 MVP에는 병원 일정 등록, 동행 요청, 진료 후 요약 리포트, 다음 예약/복약 알림이 들어가야 합니다.
6. 추가 검증이 필요한 부분
실제 병원동행 서비스 연결은 지역별 제공 가능 업체, 자격, 보험, 개인정보 처리 기준을 확인해야 합니다.
예시 3. 15일 업데이트 후 비교
질문
15일마다 새 JSON을 만들면 팀은 무엇을 비교해야 해?
RAG 답변 예시
1. 질문 의도
정기 업데이트 데이터를 어떻게 사업 개선에 쓸지 묻는 질문입니다.
2. 검색된 유사 사례의 공통 맥락
시니어 케어 질문은 제도, 비용, 계절, 질병 이슈에 따라 자주 변할 수 있습니다.
3. 반복 Pain Point
기존 상위 Pain Point가 유지되는지, 새롭게 늘어나는 질문이 있는지 비교해야 합니다.
4. 채택답변에서 보이는 해결 단서
새로운 채택답변 패턴이 생기면 보호자들이 최근 어떤 해결책을 실질적으로 받아들이는지 확인할 수 있습니다.
5. 케어잇 서비스/사업전략으로의 해석
15일 업데이트는 RAG 답변 최신화뿐 아니라 MVP 우선순위와 콘텐츠 주제 선정에도 활용됩니다.
6. 추가 검증이 필요한 부분
새로운 질문 증가가 실제 시장 변화인지, 일시적 키워드 노이즈인지 확인해야 합니다.
9. 지식iN 데이터는 신뢰할 수 있나
발표에서 이 질문은 나올 가능성이 높다.
답변은 이렇게 하면 된다.
지식iN 데이터는 공식 의료/복지 정답 데이터가 아닙니다. 하지만 실제 사람들이 겪은 상황과 그 상황에서 도움이 된 채택답변이 함께 담겨 있습니다. 그래서 우리는 지식iN을 정답 데이터가 아니라 실제 상황 데이터로 사용합니다. 고객의 Pain Point와 질문 표현은 지식iN에서 찾고, 의료·제도 판단은 공공기관, 병원, 전문가 자료로 보강합니다.
더 짧게 말하면 이렇게 정리할 수 있다.
지식iN은 정답을 찾는 곳이 아니라, 고객이 실제로 겪는 문제와 도움이 된 답변 패턴을 찾는 곳입니다.
10. 15일 주기 데이터 업데이트 계획
케어잇 RAG는 한 번 만든 뒤 끝나는 데이터베이스가 아니다. 15일에 한 번씩 지식iN의 관련 질문과 채택답변을 업데이트하는 구조로 운영할 수 있다.
15일마다 관련 키워드 재검색
↓
신규 질문 후보 수집
↓
이미 수집한 URL/문서 ID 중복 제거
↓
질문 본문과 채택답변 크롤링
↓
시니어 케어 관련성 필터링
↓
Pain Point / Persona / Category 재분류
↓
회차별 별도 JSON으로 저장
↓
Vector DB에 신규 질문-답변 임베딩 반영
↓
RAG 답변과 내부 분석에 최신 사례 반영
운영 원칙은 다음과 같다.
- 기존 JSON에 덮어쓰지 않고 업데이트 회차별 별도 JSON으로 저장한다.
- 중복 질문은 URL 또는 문서 ID 기준으로 제거한다.
- 신규 데이터는 관련성 필터링 후 RAG 지식베이스에 반영한다.
- 제도/의료 정보는 최신 공공기관 자료와 함께 검증한다.
- 15일마다 Pain Point 순위, 새 키워드, 채택답변 패턴 변화를 비교한다.
11. 팀원이 발표에서 사용할 핵심 문장
케어잇 RAG는 단순히 ChatGPT에게 답변을 맡기는 방식이 아닙니다.
지식iN의 실제 질문과 채택답변 JSON을 먼저 검색하고,
현재 보호자의 질문과 문맥이 비슷한 사례를 찾아 답변을 재구성합니다.
채택답변은 질문자가 실제 상황에서 도움이 되었다고 선택한 답변이기 때문에,
케어잇은 이를 활용해 일반론보다 더 실질적인 돌봄 의사결정 답변을 제공할 수 있습니다.
짧게 말하면:
실제 질문과 채택답변을 근거로,
비슷한 상황의 사례를 찾아
현재 보호자에게 맞는 답변으로 재구성하는 RAG입니다.
12. 팀 내부 다음 작업
- 상위 Pain Point별 대표 질문 30~50건 수동 검수
- 질문 JSON에
persona,pain_point,category,desired_outcome필드 보강 - 사용자 상담용 RAG 답변 목업 3개 제작
- 보호자 인터뷰에서 RAG 답변이 실질적으로 도움이 되는지 검증
- 제도/의료 관련 답변에는 공공기관/전문가 자료 연결
- 15일 주기 업데이트용 키워드 목록과 저장 규칙 확정
참고 자료
- hongsik.blog: https://hongsik.blog/
- 교육과정 페이지: https://hongsik.blog/it-founder-5-curriculum/
- 내부 분석 JSON:
C:UsersmisohTTJTeamProjectsenior-care-rag-analysis.json - 상세 크롤링 데이터:
C:UsersmisohTTJnaverkin-answer-assistantdatamarket-rag-scansmarket-rag-300k-20260820-002 3-crawl-dataset.json - 팀원 공유 원본 자료:
C:UsersmisohTTJTeamProjectcareit-team-rag-briefing.md