目标行为
“你们对这个事应该一致了,要不我先做着,你们继续。”
Agent 不是因为知道更多、发现错误或被叫到才发言,而是发现一个已经局部闭合、可以低风险并行实施的软件任务。我们称之为 Consensus-Gated Parallel Execution,在线动作记为 OFFER_FORK。
前一部分定义 LobbyAgent 所处的应用场景与介入动机;后一部分解决训练时能看完整对话、部署时只能看上文的信息不对称。
研究“什么时候值得主动提出先做一个局部任务”。
02 / METHOD 全景标注到因果在线策略研究“如何用未来信息监督一个看不到未来的模型”。
When should an agent offer to fork and execute a locally agreed task while people keep discussing?
“你们对这个事应该一致了,要不我先做着,你们继续。”
Agent 不是因为知道更多、发现错误或被叫到才发言,而是发现一个已经局部闭合、可以低风险并行实施的软件任务。我们称之为 Consensus-Gated Parallel Execution,在线动作记为 OFFER_FORK。
| 邻近问题 | 它判断什么 | 为什么不是 LobbyAgent |
|---|---|---|
| Code review | 已有代码或 diff 是否存在问题 | LobbyAgent 面对实现前/过程中的功能头脑风暴,没有稳定 diff |
| Action-item detection | 谁承诺在何时完成什么 | LobbyAgent 不要求已经出现显式指派或开工表态 |
| When-to-speak | Agent 此刻是否应该发言 | LobbyAgent 的发言动机被限定为“安全分叉并行执行” |
| Meeting facilitation | 如何主持、总结、调解或推进会议 | LobbyAgent 不结束讨论,只承接已经局部闭合的任务 |
| Proactive feedback | 是否应提供建议、纠错或补充信息 | 这里的价值来自提前产生实现材料,而不是意见本身 |
目前没有公开数据直接标注“参与者已经局部一致,Coding Agent 可以先做着且不打断主讨论”。真实 CoGraph vibe-coding 讨论仍是最终训练与测试数据的核心。
How can a future-aware offline teacher supervise a causal policy that only observes the dialogue prefix?
Teacher: P(labelt | turns 1…T)知道后来是否反悔、任务是否稳定、实际返工和最终结果。
Student: P(actiont | turns 1…t)在决策点只能读取当前及上文,不可能拥有未来事实。
如果全景教师利用未来事实产生二元在线标签,学生会被要求学习一种不可观察的“事后诸葛亮能力”,形成不可约标签噪声和未来泄漏。
只根据 1…t,现在提出并行执行是否合理?保存六项门控、可见证据和未决问题。
后来任务是否稳定、是否返工、并行开始是否实际有用?完整对话只负责回答结果。
后来需求发生变化,不自动说明早期决策错误。如果变化当时不可预见,而任务低成本可逆,早期开始仍可能是合理策略。
读取完整讨论,定位候选 episode、后续稳定性、实际返工、并行收益和 hard negatives。未来信息用于结果验证与候选定位。
对候选 turn t 重新构造严格的 turns 1…t,独立判断六项因素与 OFFER_FORK / WAIT。
审查两者分歧,区分 stable opportunity、premature、hindsight-only、reasonable-but-invalidated 和 missed opportunity。
L = L_online_policy + λ₁ L_future_stability + λ₂ L_decision_factors + λ₃ L_timing + λ₄ L_prefix_teacher_distillation
L_online_policy:prefix-only 裁决标签L_future_stability:全景结果作为辅助预测目标L_decision_factors:六项可解释门控L_timing:earliest-safe / latest-useful 区间L_prefix_teacher_distillation:只有教师也只看相同 prefix 时才直接蒸馏完整会议金标准包含 4 个介入点。旧 listener v21 原始模型产生 23 个 surface 候选,但硬门控后为 0,最终 4 个机会全部漏掉。
这说明瓶颈不只是阈值:需要重新分离场景定义、因果标签与未来结果监督,而不是继续叠加 prompt 规则。