하루 동안 받은 메일을 요약·분류하고, 처리할 일을 일간 보고서로 정리하는 Chrome Extension 서비스입니다. 네이버 부스트캠프 AI Tech 7기 Upstage 기업 해커톤에서 6인 팀으로 개발했습니다.
개발 리더로 LLM 파이프라인 설계, Reflexion 구현, 백엔드·확장 프로그램 통합을 맡았습니다. 생성 결과를 평가하고 피드백을 반영하는 과정을 구성해, 최종 보고서의 G-Eval 평균을 3.75에서 4.19로 높였습니다.
개발 배경
중요한 일정과 요청은 메일 본문뿐 아니라 첨부 문서와 이미지에도 흩어져 있습니다. 매일 쌓이는 메일에서 필요한 정보를 찾고, 처리할 일을 별도로 정리하는 부담을 줄이고자 했습니다.
Gmail에서 수집한 메일과 첨부를 함께 처리하고, 개별 메일의 요약을 모아 카테고리별 보고서와 체크리스트로 제공했습니다. 사용자는 Chrome Extension에서 보고서를 확인합니다.
직접 맡은 부분
생성 결과를 다시 평가하는 파이프라인
개별 메일 요약에는 근거 확인과 Self-Refine을 적용하고, 최종 보고서에는 G-Eval 평가와 피드백을 반영하는 Reflexion 루프를 구성했습니다. 프롬프트 지시와 형식 준수 여부를 평가 조건으로 비교하며 보고서 품질을 개선했습니다. 모델의 가중치를 학습시키는 방식이 아니라, 생성된 결과를 평가하고 다시 작성하는 흐름입니다.
보고서를 실제 서비스로 연결
Google OAuth 2.0과 Gmail API로 메일에 접근하고, Document Parse로 첨부파일과 이미지의 내용을 추출했습니다. FastAPI·MySQL 백엔드와 React 기반 Chrome Extension을 구현해, 메일 수집부터 보고서 저장·조회까지 연결했습니다.
주요 구현 기술은 Python·FastAPI·React·MySQL, AI 처리에는 Solar Pro·Document Parse·Embedding을 사용했습니다.
품질과 비용을 함께 비교한 평가
최종 보고서 품질
| 생성 방식 | G-Eval 평균 |
|---|---|
| Self-Refine 기준선 | 3.75 |
| Reflexion + 지시문·형식 페널티 | 4.19 |
프로젝트 평가셋을 G-Eval로 자동 평가한 결과, 4.5점 만점 기준 0.44점 상승했습니다.
메일 분류의 토큰 사용량
| 지표 | 원문 기반 | 요약문 기반 |
|---|---|---|
| 정확도 | 81.04% | 77.08% |
| 토큰 사용량 | 97,436 | 52,477 |
요약문 기반 분류는 토큰 사용량을 약 46% 줄였지만 정확도는 3.96%p 낮아졌습니다. 정확도와 토큰 사용량을 함께 비교해 비용 효율을 우선하는 구성을 선택했습니다.
시스템 구성

