WISESTONECase Storise

케이스 스토리

Case Stories

실제 도입 사례를 통해 와이즈스톤의 차별화된 가치를 확인해보세요.

AI 에이전트(AI Agent)

생성형AI

K사 기업용 생성형 AI 플랫폼 — 신뢰할 수 있는 품질 검증 사례

Challenge

K사는 기업 고객이 업무 목적에 맞게 생성형 AI 기능을 구성·활용할 수 있는 플랫폼을 운영하고 있습니다문제는 생성형 AI의 결과가 하나의 정답으로 고정되지 않는다는 점이었습니다같은 질문을 입력해도 표현이 달라지고선택한 모델에 따라 답변 구성과 응답 속도도 바뀝니다몇 개의 결과만 보고 품질을 판단하면우연히 잘 나온 사례나 일부 실패 사례에 평가 전체가 흔들릴 수 있습니다.

특히 프롬프트 생성 기능은 입력 문장을 단순히 다듬는 수준을 넘어업무 분야에 맞는 역할과 맥락을 반영해야 했습니다챗봇 응답 역시 문장의 자연스러움이 아니라질문 의도에서 벗어나지 않고 업무에 바로 쓸 수 있는 형태인지가 핵심이었습니다여러 생성형 AI 모델을 선택해 쓸 수 있는 구조인 만큼특정 모델에서만 좋은 결과가 나온다면 전체 기능의 품질로 보기 어렵다는 점도 풀어야 할 과제였습니다.

Testing Approach

와이즈스톤은 생성 결과를 인상이나 일부 예시로 판단하지 않도록업무 분야별 입력 데이터와 판정 기준을 먼저 정의한 뒤 검증에 들어갔습니다. 고객 응대마케팅기술 분석번역보고서 작성처럼 성격이 다른 업무 영역을 폭넓게 아우르도록 입력 데이터를 구성해특정 업무 유형에 결과가 치우치지 않도록 했습니다.

프롬프트 생성 품질은 생성된 문장에 업무 역할이 반영되어 있는지입력 의도와 맥락이 유지되는지실제 AI 입력값으로 바로 활용 가능한 문장 구조를 갖추었는지를 함께 확인했습니다. 챗봇 응답 품질은 질문과의 관련성뿐 아니라응답이 핵심 의도에서 벗어나지 않는지업무 활용에 필요한 내용을 담고 있는지를 기준으로 검토했습니다.

모델별 품질 비교에서는 복수의 생성형 AI 모델에 동일한 질의 데이터를 입력해특정 모델에만 유리한 평가가 되지 않도록 공정한 기준을 적용했습니다마지막으로 프롬프트 생성과 챗봇 응답 각각에 대해 반복 측정을 수행해단일 실행 결과에 좌우되지 않는 평균 응답 속도를 함께 확인했습니다.

What We Tested

  • ৹ 다양한 업무 분야에 대한 프롬프트 생성 결과의 정상 동작 여부

  • ৹ 입력 문장의 업무 역할·맥락 반영 여부

  • ৹ 분야별 질의에 대한 챗봇 응답의 관련성

  • ৹ 서로 다른 생성형 AI 모델 간 응답 품질 비교

  • ৹ 프롬프트 생성 및 챗봇 응답의 평균 반환 시간

Results & Value

K사는 이 검증을 통해 생성형 AI 기능이 업무 맥락을 정확히 이해하고어떤 모델을 선택하더라도 일관되고 빠른 응답 품질을 제공한다는 것을 데이터로 확인했습니다와이즈스톤은 "자연스러움"이라는 인상이 아니라 문맥 반영도응답 관련성반환 속도라는 정량 기준으로 접근해개발자가 프로덕션에 그대로 가져다 쓸 수 있는 수준의 신뢰를 검증했습니다.