Thu thập 20 đến 50 task thực tế gần nhất
Platform engineer thu thập từ 20 đến 50 task thực tế từ các công việc gần đây, mỗi task đi kèm kết quả kỳ vọng hoặc được chấp nhận rõ ràng.
Hệ thống Continuous Evals trong CI: Kiểm thử hồi quy năng lực Agent khi thay đổi cấu hình và model
Evals là giải pháp tương đương stage-gate QA trong môi trường AI-native. Trong thực tế, điều đó có nghĩa là một bộ suite chạy bất cứ khi nào cấu hình của agent thay đổi. Khi một model mới được thay thế hoặc một prompt được viết lại, bộ eval suite sẽ cho biết agent liệu còn hoàn thành công việc theo đúng tiêu chuẩn tương tự hay không.
Đánh giá hành vi trên task thực tế: test suite pass, lint clean, giữ nguyên behavior và tuân thủ policy. Ngăn suy giảm năng lực khi đổi prompt hoặc nâng cấp model.
Chỉ kiểm tra logic hàm tĩnh trong codebase. Không phát hiện được việc agent xóa nhầm file, vi phạm kiến trúc phân tầng hoặc bỏ qua quy chuẩn bảo mật.
Cấu hình điều khiển agent (CLAUDE.md, Skills, Hooks) trực tiếp định hình code sinh ra, do đó cần regression testing nghiêm ngặt như mã nguồn ứng dụng.
Pipeline CI phân nhánh song song giữa kiểm thử xác định (Deterministic Tests) và hệ thống chấm điểm đánh giá Agent với eval grader (bộ chấm điểm tự động bằng LLM judge hoặc unit test):
CLAUDE.md và Feedback Loop (chu trình tự sửa lỗi) (Stage 4: Test).5 bước triển khai hệ thống Continuous Evals tự động trong CI/CD:
Platform engineer thu thập từ 20 đến 50 task thực tế từ các công việc gần đây, mỗi task đi kèm kết quả kỳ vọng hoặc được chấp nhận rõ ràng.
Viết từng nhiệm vụ thành một eval case: prompt đầu vào kèm bộ tiêu chí kiểm tra đạt (tests pass, lint clean, behavior unchanged, policy followed) được đánh giá bởi eval grader (bộ chấm điểm tự động bằng LLM judge hoặc unit test).
Bộ suite chạy phi tương tác trong CI theo lịch trình và trên bất kỳ thay đổi nào đối với CLAUDE.md, skills, hoặc hooks, vì cấu hình đó trực tiếp điều hướng agent và xứng đáng nhận được kiểm thử hồi quy (regression testing) tương tự như mã nguồn ứng dụng.
Đặt kết quả chạy eval thành điều kiện kiểm soát (gate) các thay đổi cấu hình. Một thay đổi skill làm giảm tỷ lệ đạt (pass rate) phải được xem xét kỹ qua Approval Gates (cổng phê duyệt của con người) trước khi merge.
Mỗi sự cố production được chính nhóm sở hữu sự cố viết thành một eval case, và lưu giữ vĩnh viễn trong bộ suite làm bài kiểm thử hồi quy (regression test).
Cấu hình GitHub Actions thực thi eval suite tự động trong CI (.github/workflows/agent-evals.yml):
name: Agent evals
on:
pull_request:
paths: ['CLAUDE.md', '.claude/**']
schedule:
- cron: '0 2 * * *'
jobs:
evals:
runs-on: ubuntu-latest
steps:
- uses: actions/checkout@v4
- run: npm install -g @anthropic-ai/claude-code
- name: Run eval suite
env:
ANTHROPIC_API_KEY: ${{ secrets.ANTHROPIC_API_KEY }}
run: |
for eval in evals/*.json; do
claude -p "$(jq -r '.prompt' $eval)" \
--allowedTools "Read,Edit,Bash(make test)" \
--output-format json > result.json
./evals/check.sh "$eval" result.json
done
Evals mang lại cho QA một cổng kiểm soát (gate) bắt kịp tốc độ sinh code của agent. Ngưỡng pass-rate threshold được thực thi như một merge check, các lượt chạy được ghi log để so sánh kết quả theo thời gian, và nhóm kỹ sư sở hữu thay đổi cấu hình sẽ phê duyệt trước khi merge.
| Yếu tố Quản trị | Chi tiết Thực thi Kỹ thuật |
|---|---|
| What is enforced | Ngưỡng tỷ lệ đạt (pass-rate threshold) được thực thi bắt buộc như một merge check trên PR. |
| Where it is logged | Toàn bộ các lần chạy eval được ghi log để so sánh kết quả theo thời gian và đánh giá qua từng phiên bản model. |
| Who approves | Nhóm sở hữu thay đổi cấu hình (CLAUDE.md, skills, hooks) trực tiếp xem xét và phê duyệt qua Approval Gates (cổng phê duyệt của con người). |