先跑 Qwen3.5-4B LoRA SFT
第一轮只训练严格 prefix-only 的结构化裁决。4B 作为主基线,0.8B 测延迟下界,9B 测质量上界。当前 48 条训练样本只用于验证训练链路、JSON 稳定性和过拟合,不用于宣称生产效果。
pip install "ms-swift[llm]" -U ./training/train-qwen35-4b-lora.shQwen3.5 官方仓库 ↗
同一份规范源数据导出 prefix-only 策略样本、messages SFT 样本和 full-context Oracle 样本。线上训练与未来结果监督物理分离,便于老师直接试跑并审计泄漏。
第一轮只训练严格 prefix-only 的结构化裁决。4B 作为主基线,0.8B 测延迟下界,9B 测质量上界。当前 48 条训练样本只用于验证训练链路、JSON 稳定性和过拟合,不用于宣称生产效果。
pip install "ms-swift[llm]" -U ./training/train-qwen35-4b-lora.shQwen3.5 官方仓库 ↗
policy-* 与 sft-* 只包含 T1…Tt,可用于线上策略;oracle-* 含完整讨论,只能做候选定位、事后稳定性和辅助目标。后来被推翻不自动说明当时的介入错误。
全部对话是人工编写的合成样本。正式实验需要真实 CoGraph 讨论、双人独立标注和独立团队盲测集。
训练、验证和测试按完整对话划分;同一对话的相邻前缀不会跨集合。
node scripts/evaluate-policy.js \ data/training/generated/policy-test.jsonl \ predictions.jsonl
建议至少积累 500 段真实讨论和 5000 个复核前缀,优先收集 offer 前 1~3 turn、只差一个门槛的 WAIT、非编码行动项,以及合理介入但后来被不可预见信息推翻的样本。