RESEARCH MAP / 2026-09-01

两个相互独立、彼此支撑的研究方向

前一部分定义 LobbyAgent 所处的应用场景与介入动机;后一部分解决训练时能看完整对话、部署时只能看上文的信息不对称。

01 / SCENARIO 协作讨论中的介入 Agent

研究“什么时候值得主动提出先做一个局部任务”。

02 / METHOD 全景标注到因果在线策略

研究“如何用未来信息监督一个看不到未来的模型”。

方向一 · 场景

协作式 vibe coding 讨论中的主动介入

When should an agent offer to fork and execute a locally agreed task while people keep discussing?

目标行为

“你们对这个事应该一致了,要不我先做着,你们继续。”

Agent 不是因为知道更多、发现错误或被叫到才发言,而是发现一个已经局部闭合、可以低风险并行实施的软件任务。我们称之为 Consensus-Gated Parallel Execution,在线动作记为 OFFER_FORK

六项介入门槛

  1. Local consensus相关参与者已接受局部范围
  2. Executable task存在明确的软件实现产物
  3. Spec sufficient目标、产物和关键边界足够开始
  4. Independent不依赖当前未决核心分歧
  5. Reversible能在隔离分支低成本试做
  6. Agent capable属于 Coding Agent 的能力与权限

与邻近问题的区别

邻近问题它判断什么为什么不是 LobbyAgent
Code review已有代码或 diff 是否存在问题LobbyAgent 面对实现前/过程中的功能头脑风暴,没有稳定 diff
Action-item detection谁承诺在何时完成什么LobbyAgent 不要求已经出现显式指派或开工表态
When-to-speakAgent 此刻是否应该发言LobbyAgent 的发言动机被限定为“安全分叉并行执行”
Meeting facilitation如何主持、总结、调解或推进会议LobbyAgent 不结束讨论,只承接已经局部闭合的任务
Proactive feedback是否应提供建议、纠错或补充信息这里的价值来自提前产生实现材料,而不是意见本身

最相关的研究脉络

可用数据与局限

  • When2Speak Dataset可预训练低打扰 speak/silent,但没有“并行实现”动机。
  • TIDES团队互动与事件结构,可预训练讨论状态表示。
  • AMI Meeting Corpus设计会议、决策和 dialogue acts;需重新标注任务分叉时机。
  • ICSI Meeting Corpus真实多人会议语音与转写,但不是功能实现讨论。
  • act4teams-short适合团队行为建模,不直接提供 Agent 介入标签。
研究空缺

目前没有公开数据直接标注“参与者已经局部一致,Coding Agent 可以先做着且不打断主讨论”。真实 CoGraph vibe-coding 讨论仍是最终训练与测试数据的核心。

方向二 · 方法

完整对话特权监督下的因果在线训练

How can a future-aware offline teacher supervise a causal policy that only observes the dialogue prefix?

核心信息不对称

离线全景教师Teacher: P(labelt | turns 1…T)

知道后来是否反悔、任务是否稳定、实际返工和最终结果。

实时在线模型Student: P(actiont | turns 1…t)

在决策点只能读取当前及上文,不可能拥有未来事实。

不能直接做普通蒸馏

如果全景教师利用未来事实产生二元在线标签,学生会被要求学习一种不可观察的“事后诸葛亮能力”,形成不可约标签噪声和未来泄漏。

方法研究基础

两套标签,不混为一谈

Causal policy label

只根据 1…t,现在提出并行执行是否合理?保存六项门控、可见证据和未决问题。

Hindsight outcome label

后来任务是否稳定、是否返工、并行开始是否实际有用?完整对话只负责回答结果。

Ex ante ≠ Ex post

后来需求发生变化,不自动说明早期决策错误。如果变化当时不可预见,而任务低成本可逆,早期开始仍可能是合理策略。

三阶段标注流程

  1. A
    Full-dialogue Oracle

    读取完整讨论,定位候选 episode、后续稳定性、实际返工、并行收益和 hard negatives。未来信息用于结果验证与候选定位。

  2. B
    Causal Replay

    对候选 turn t 重新构造严格的 turns 1…t,独立判断六项因素与 OFFER_FORK / WAIT

  3. C
    Hindsight Audit

    审查两者分歧,区分 stable opportunity、premature、hindsight-only、reasonable-but-invalidated 和 missed opportunity。

建议的小模型训练目标

L = L_online_policy
  + λ₁ L_future_stability
  + λ₂ L_decision_factors
  + λ₃ L_timing
  + λ₄ L_prefix_teacher_distillation
  • L_online_policy:prefix-only 裁决标签
  • L_future_stability:全景结果作为辅助预测目标
  • L_decision_factors:六项可解释门控
  • L_timing:earliest-safe / latest-useful 区间
  • L_prefix_teacher_distillation:只有教师也只看相同 prefix 时才直接蒸馏

未来信息可以怎样使用

适合
  • 结果与稳定性辅助标签
  • 返工成本预测
  • 困难负例挖掘
  • 候选 episode 定位
  • 课程学习和样本加权
不适合
  • 直接覆盖在线动作真值
  • 在 prefix 中注入全局摘要
  • 让 rationale 引用未来 turn
  • 用后来反悔倒推当时必然错误
  • 跨会议随机拆 turn 评测

数据与评测中的因果检查

□ 在线输入不含完整会议摘要 □ 滚动状态只由当时 prefix 产生 □ 在线证据不引用 >t 的 turn □ train/dev/test 按完整会议或团队划分 □ 同一 ready episode 只奖励首次合适介入 □ 同时报告误打断、漏机会和介入延迟 □ 评估实际返工与节省的并行时间 □ Accuracy 不作为主要指标
CURRENT BASELINE

真实 145-turn 讨论暴露了什么问题

完整会议金标准包含 4 个介入点。旧 listener v21 原始模型产生 23 个 surface 候选,但硬门控后为 0,最终 4 个机会全部漏掉。

Gold offers
4
Raw surfaces
23
Eligible
0
Recall
0%
Stage accuracy
38.6%
P95 latency
16.0s

这说明瓶颈不只是阈值:需要重新分离场景定义、因果标签与未来结果监督,而不是继续叠加 prompt 规则。