인공지능(AI)
실제 운영에서 버티는 AI
많은 AI 프로젝트가 그럴듯한 데모와 실제로 믿고 쓸 수 있는 시스템 사이에서 멈춥니다. 저희는 그 간극을 메우는 일을 전문으로 합니다. 평가, 가드레일, 비용 관리, 그리고 시제품을 제품으로 바꾸는 눈에 띄지 않는 운영 작업입니다.
제공 내용
검색·지식 기반
고객사의 문서, 문의 이력, 계약서, 데이터베이스 위에 모델을 올립니다. 답변의 품질을 논하기 전에 검색 계층이 올바른 부분을 돌려주는지부터 확인합니다.
- 공개 벤치마크가 아니라 고객사 문서 집합에 맞춰 조정한 청킹·임베딩·키워드와 벡터의 하이브리드 검색
- 권한을 반영한 색인. 사용자가 직접 열 수 없는 문서가 검색 결과에 나타나지 않습니다
- 출처 문단까지 되짚을 수 있는 인용을 붙인 답변. 검토자가 그 자리에서 확인할 수 있습니다
- 기간계 시스템의 갱신을 따라가는 증분 색인. 일주일 뒤처진 색인이 되지 않습니다
에이전트와 업무 자동화
도구를 호출하고 상태를 읽고 실제로 처리를 수행하는 다단계 시스템입니다. 모든 단계를 경계 짓고, 관측 가능하며, 되돌릴 수 있게 설계합니다.
- 단계마다 명시적인 도구 계약과 권한 경계. 모든 것을 여는 열쇠 하나를 쥐여 주지 않습니다
- 쓰기·결제·발송·삭제가 일어나는 동작에는 사람의 승인 게이트를 둡니다
- 입력, 도구 호출, 재시도, 실제로 지나간 경로까지 담은 완전한 실행 추적
- 제공사 장애, 요청 제한, 그리고 단순한 오작동에 대비한 결정적 대체 경로
평가·가드레일·운영
실제 사용자에게 내보내도 되는지를 결정하는 단계이자, 많은 프로젝트가 뒤늦게 빠져 있었음을 깨닫는 단계입니다.
- 고객사의 실제 사례와 실패 사례로 만드는 업무 특화 평가 세트
- 프롬프트·모델·검색 설정의 모든 변경에 대한 회귀 실행. 사용자에게 닿기 전에 수행합니다
- 입출력 필터링, 거부 동작, 개인정보 처리 방식을 심사 자리에서 제시할 수 있는 형태로
- 기능 단위의 토큰·지연 예산, 그리고 그것을 지키는 모델 라우팅과 캐싱
일하는 원칙
평가 기준에서 시작합니다
무엇을 기준으로 채점할지 만들기 전에 합의합니다. 채점 기준이 없으면 “좋아졌다”는 의견에 그치고, 변경이 도움이 됐는지 아무도 판단할 수 없습니다.
기준을 통과하는 가장 작은 모델로
벤치마크는 위가 아니라 아래로 내려가며 확인합니다. 평가를 통과하는 저렴한 모델은, 마찬가지로 통과하는 최상위 모델보다 나은 답입니다.
파인튜닝보다 검색이 먼저입니다
품질 문제의 대부분은 근거 연결의 문제입니다. 파인튜닝은 유지 비용이 크고, 가장 먼저 시도할 수단이 되는 경우는 드뭅니다.
틀린 답을 전제로 설계합니다
모델은 언젠가 틀립니다. 중요한 것은 그 오류를 업무 흐름이 잡아내고, 영향을 가두고, 대응할 수 있는 사람에게 보이게 만드는가입니다.
함께하는 방식
2 – 4주
AI 적용 가능성 진단
데이터, 업무 흐름, 제약 조건을 확인하고 자동화할 가치가 있는 것과 없는 것, 그리고 운영 비용을 보고드립니다. 가치와 위험으로 순위를 매긴 후보 목록까지 포함합니다.
4 – 8주
가치 검증(PoV)
실제 데이터와 실제 평가 세트로 한 가지 사례를 구축해, 현업이 매일 쓸 수 있는 곳에 배포합니다. 산출물은 데모 영상이 아니라 근거에 기반한 추진 여부 판단입니다.
3개월 이상
운영 구축과 운영 지원
시스템 본체, 평가 체계, 운영 도구까지 구축합니다. 이후에도 운영과 튜닝, 새 모델 대응을 함께합니다.
다루는 기술
프로젝트마다 선택합니다. 모든 과제에 밀어 넣는 자사 표준 스택은 두지 않으며, 고객사 팀이 이미 운영하고 있는 기술에 맞춥니다.
모델과 서빙
한 제공사에 묶이지 않습니다. 모델 선택은 평가의 결과이며, 제공사 전환은 이전 프로젝트가 아니라 설계에 미리 포함시켜 두는 사항입니다.
- Claude
- OpenAI
- Gemini
- Llama
- Python
- PyTorch
- FastAPI
- vLLM
- MCP
검색과 데이터
벡터 검색만으로 끝나는 경우는 드뭅니다. 대부분은 임베딩, 키워드 검색, 관계형 저장소, 그리고 원천 시스템의 변경 스트림을 함께 씁니다.
- PostgreSQL + pgvector
- Elasticsearch
- Redis
- Kafka
- pandas
- NumPy
- BM25 + hybrid
실행 기반과 관측 가능성
AI 기능도 하나의 서비스입니다. 배포, 오토스케일, 추적, 그리고 비용을 책임지는 사람이 필요합니다.
- Docker
- Kubernetes
- AWS
- Google Cloud
- OpenTelemetry
- Grafana
- Prometheus
프로젝트 진행 방식
1 – 2주 차
정의
사용 사례, 사용자, 데이터 원천, 그리고 “충분히 좋다”의 정의. 평가 기준을 먼저 문서로 남기고 합의한 뒤 착수합니다.
2 – 5주 차
근거 연결
데이터 연결, 수집, 검색. 생성 품질을 논하기 전에 검색 품질을 따로 측정합니다. 원인이 다르면 처방도 달라지기 때문입니다.
4 – 10주 차
구축
애플리케이션, 가드레일, 사람이 개입하는 경로. 모든 프로젝트에 적용하는 것과 같은 AI-DLC 리뷰 게이트 아래에서 구현합니다.
지속
운영
추적, 변경마다의 평가, 요청 단위 비용, 그리고 새 모델로 옮길 때의 절차서. 다시 만들지 않고 따라갈 수 있는 상태를 유지합니다.
남게 되는 것
- 고객사가 소유하고, 저희 없이도 다시 실행할 수 있는 평가 세트와 채점 체계
- 추적, 기능 단위 비용 파악, 되돌릴 경로를 갖춘 운영 중인 시스템
- 담당자가 바뀌어도 이유가 남도록 기록된 프롬프트와 아키텍처 결정
- 모델 교체 절차서. 무엇을 다시 실행하고 무엇을 확인한 뒤 바꿀지 명문화합니다
- 품질을 조용히 망가뜨리지 않으면서 프롬프트와 검색 설정을 바꿀 수 있는 엔지니어 팀
이 영역에서 상의할 일이 있으십니까
문제의 윤곽을 알려 주십시오. 저희가 적임인지 아닌지 솔직하게 말씀드리겠습니다.