DATASET / TRAINING HANDOFF · V0.1.0-SEED

模型侧试训包已经就绪

同一份规范源数据导出 prefix-only 策略样本、messages SFT 样本和 full-context Oracle 样本。线上训练与未来结果监督物理分离,便于老师直接试跑并审计泄漏。

完整讨论
18
在线策略样本
72
OFFER_FORK
10
WAIT
62
拆分
12 / 3 / 3
01 · RECOMMENDED START

先跑 Qwen3.5-4B LoRA SFT

第一轮只训练严格 prefix-only 的结构化裁决。4B 作为主基线,0.8B 测延迟下界,9B 测质量上界。当前 48 条训练样本只用于验证训练链路、JSON 稳定性和过拟合,不用于宣称生产效果。

pip install "ms-swift[llm]" -U
./training/train-qwen35-4b-lora.sh
Qwen3.5 官方仓库 ↗
02 · HARD RULE

不要把 Oracle 当在线真值

policy-*sft-* 只包含 T1…Tt,可用于线上策略;oracle-* 含完整讨论,只能做候选定位、事后稳定性和辅助目标。后来被推翻不自动说明当时的介入错误。

种子集限制

全部对话是人工编写的合成样本。正式实验需要真实 CoGraph 讨论、双人独立标注和独立团队盲测集。

下载训练数据

训练、验证和测试按完整对话划分;同一对话的相邻前缀不会跨集合。

数据视图TrainDevTest用途
Policy JSONL 48 条 12 条 12 条 结构化分析、自定义分类/多任务训练
SFT messages 48 条 12 条 12 条 ms-swift / TRL 直接读取
Full Oracle 12 条 3 条 3 条 离线教师与未来结果辅助监督
03 · EVALUATION

优先看错误介入

  1. Offer precision错误打断代价最高
  2. Offer recall避免策略完全沉默
  3. Factor macro-F1定位哪一项门控学坏了
  4. Safety checksJSON、未来证据、硬门控违规率
  5. Online metrics介入延迟与 P50/P95 响应时间
node scripts/evaluate-policy.js \
  data/training/generated/policy-test.jsonl \
  predictions.jsonl
04 · NEXT DATA MILESTONE

正式训练前补到真实 500 / 5000

建议至少积累 500 段真实讨论和 5000 个复核前缀,优先收集 offer 前 1~3 turn、只差一个门槛的 WAIT、非编码行动项,以及合理介入但后来被不可预见信息推翻的样本。

  • 完整会议或团队级拆分,禁止随机拆 prefix
  • 两人独立标 causal label,第三人裁决分歧
  • 训练可重采样,测试必须保留真实 OFFER 发生率
  • 独立 calibration split 用于选择上线阈值