VNPT

Continuous Evals in CI (Stage 4: Test)

Hệ thống Continuous Evals trong CI: Kiểm thử hồi quy năng lực Agent khi thay đổi cấu hình và model

Bài gốc: Anthropic Claude Academy reference/ai-native-sdlc/course/09-continuous-evals-in-ci.md 2026-09-16 ~5 phút đọc

1. Bắt đầu: Continuous Evals trong CI

Evals là giải pháp tương đương stage-gate QA trong môi trường AI-native. Trong thực tế, điều đó có nghĩa là một bộ suite chạy bất cứ khi nào cấu hình của agent thay đổi. Khi một model mới được thay thế hoặc một prompt được viết lại, bộ eval suite sẽ cho biết agent liệu còn hoàn thành công việc theo đúng tiêu chuẩn tương tự hay không.

Traditional: Deterministic Unit Tests

Chỉ kiểm tra logic hàm tĩnh trong codebase. Không phát hiện được việc agent xóa nhầm file, vi phạm kiến trúc phân tầng hoặc bỏ qua quy chuẩn bảo mật.

Nguyên tắc cốt lõi

Cấu hình điều khiển agent (CLAUDE.md, Skills, Hooks) trực tiếp định hình code sinh ra, do đó cần regression testing nghiêm ngặt như mã nguồn ứng dụng.

2. Sơ đồ pipeline: Continuous Evals trong CI

Pipeline CI phân nhánh song song giữa kiểm thử xác định (Deterministic Tests) và hệ thống chấm điểm đánh giá Agent với eval grader (bộ chấm điểm tự động bằng LLM judge hoặc unit test):

Archify Interactive Diagram (Stage 4: Continuous Evals in CI) Mở toàn màn hình ↗

3. Điều kiện tiên quyết & Hạ tầng

4. Các bước thực thi: 5 bước xây dựng

5 bước triển khai hệ thống Continuous Evals tự động trong CI/CD:

1

Thu thập 20 đến 50 task thực tế gần nhất

Platform engineer thu thập từ 20 đến 50 task thực tế từ các công việc gần đây, mỗi task đi kèm kết quả kỳ vọng hoặc được chấp nhận rõ ràng.

dataset historical tasks
2

Định nghĩa Eval Case dạng Prompt + Validation Checks

Viết từng nhiệm vụ thành một eval case: prompt đầu vào kèm bộ tiêu chí kiểm tra đạt (tests pass, lint clean, behavior unchanged, policy followed) được đánh giá bởi eval grader (bộ chấm điểm tự động bằng LLM judge hoặc unit test).

rubric eval grader
3

Tự động hóa CI phi tương tác (Non-interactive CI)

Bộ suite chạy phi tương tác trong CI theo lịch trình và trên bất kỳ thay đổi nào đối với CLAUDE.md, skills, hoặc hooks, vì cấu hình đó trực tiếp điều hướng agent và xứng đáng nhận được kiểm thử hồi quy (regression testing) tương tự như mã nguồn ứng dụng.

CI/CD GitHub Actions
4

Thiết lập Quality Gate chặn PR suy giảm năng lực

Đặt kết quả chạy eval thành điều kiện kiểm soát (gate) các thay đổi cấu hình. Một thay đổi skill làm giảm tỷ lệ đạt (pass rate) phải được xem xét kỹ qua Approval Gates (cổng phê duyệt của con người) trước khi merge.

Quality Gate Approval Gates
5

Biến mọi Production Incident thành Eval Case vĩnh viễn

Mỗi sự cố production được chính nhóm sở hữu sự cố viết thành một eval case, và lưu giữ vĩnh viễn trong bộ suite làm bài kiểm thử hồi quy (regression test).

incident triage regression

5. Cấu hình GitHub Actions mẫu cho Agent Evals

Cấu hình GitHub Actions thực thi eval suite tự động trong CI (.github/workflows/agent-evals.yml):

name: Agent evals
on:
  pull_request:
    paths: ['CLAUDE.md', '.claude/**']
  schedule:
    - cron: '0 2 * * *'
jobs:
  evals:
    runs-on: ubuntu-latest
    steps:
      - uses: actions/checkout@v4
      - run: npm install -g @anthropic-ai/claude-code
      - name: Run eval suite
        env:
          ANTHROPIC_API_KEY: ${{ secrets.ANTHROPIC_API_KEY }}
        run: |
          for eval in evals/*.json; do
            claude -p "$(jq -r '.prompt' $eval)" \
              --allowedTools "Read,Edit,Bash(make test)" \
              --output-format json > result.json
            ./evals/check.sh "$eval" result.json
          done

6. Kiểm soát ngưỡng & Đo lường

Evals mang lại cho QA một cổng kiểm soát (gate) bắt kịp tốc độ sinh code của agent. Ngưỡng pass-rate threshold được thực thi như một merge check, các lượt chạy được ghi log để so sánh kết quả theo thời gian, và nhóm kỹ sư sở hữu thay đổi cấu hình sẽ phê duyệt trước khi merge.

Yếu tố Quản trị Chi tiết Thực thi Kỹ thuật
What is enforced Ngưỡng tỷ lệ đạt (pass-rate threshold) được thực thi bắt buộc như một merge check trên PR.
Where it is logged Toàn bộ các lần chạy eval được ghi log để so sánh kết quả theo thời gian và đánh giá qua từng phiên bản model.
Who approves Nhóm sở hữu thay đổi cấu hình (CLAUDE.md, skills, hooks) trực tiếp xem xét và phê duyệt qua Approval Gates (cổng phê duyệt của con người).

Chỉ số Đo lường Năng lực