AI Coding Agent Benchmark
- Question
- 업무 성격에 따라 적합한 Coding Agent는 달라지는가?
- Tested
- 동일 Repository와 요구사항에서 Codex와 Claude를 독립 실행하고 교차 평가했습니다.
- Learned
- 단일 순위보다 조사·버그 수정·기능 구현별 역할 배치가 중요했습니다.
Backend / AI Engineer · Portfolio 2026
Java/Spring 금융 서비스 백엔드에서 시작해 시계열 ML, LLM, RAG, AI Agent 검증으로 영역을 확장했습니다. 모델의 출력과 서비스의 결정을 분리하고 실패·편향·재현성의 한계를 다음 설계의 근거로 사용합니다.
01 · AI Engineering Research
모델 순위보다 개발 워크플로 안에서 AI와 사람이 맡을 역할의 경계를 실험했습니다.
02 · Financial AI
기존 Signals 운영에서 확인한 선택 편향과 재현성 문제를 바탕으로 Model Output과 Service Decision을 분리한 V2 정책 구조를 설계했습니다.
Test·Live 결과가 정책 선택에 영향을 준 문제를 확인했습니다.
Validation-only Selection, Embargo, One-shot Test Evaluation으로 절차를 고정했습니다.
Train 2012~2023, Validation 2024, Test 2025의 시간 순서를 유지합니다.
V2 신호 이력의 최신 종가 평가를 불러오고 있습니다.
거래비용·세금·슬리피지·실제 체결·자본 제약을 반영하지 않은 신호 단위 시뮬레이션입니다. 무료 개인 연구 기록이며 투자 자문, 리딩, 매매 추천을 제공하지 않습니다.
03 · Privacy-aware RAG
더 큰 모델보다 무엇을 제거하고 어떤 의미 단위로 검색할 것인지 먼저 정의했습니다.
전화번호·주소·개인 보상과 비공개 식별정보를 검색 데이터에서 제거했습니다.
고정 글자 수가 아니라 경력·프로젝트·문제 해결 단위로 문서를 분리했습니다.
회사 경력과 개인 프로젝트를 구분하고 넓은 질문에는 관련 범위를 다양하게 검색합니다.
필수 필드, 중복 ID, 개인정보와 URL 패턴을 인덱싱 전에 다시 검사했습니다.
04 · Engineering View
모델 예측은 정책·위험·시장 조건을 거쳐 서비스 결정이 됩니다.
통과한 테스트가 요구사항·계약·회귀를 모두 보장하지는 않습니다.
AI는 근거를 확장하고 프로젝트 맥락과 최종 책임은 사람이 가집니다.
높은 수치보다 선택 편향·검증 절차·전진 재현성을 함께 확인합니다.
RAG 검색 품질은 개인정보 정책과 청크 설계에서 시작합니다.