后续输入建议
理解建议生成条件、接受不提交、fast model 成本和 daemon 客户端差别。
后续建议在输入区显示浅色占位,预测你可能接下来提出的请求。它使用额外模型调用分析对话,也可能从回复里的显式操作提示提取建议。
接受后仍需提交
Tab、Enter 或右方向键会把建议填入输入框;Enter 第一次不会发送,再按一次才提交。因此接受 /clear 等建议不会立即执行命令。开始输入、接受建议或新模型轮次开始会清除原占位。
生成条件
共同条件是至少两个模型轮次、当前不是 Plan、ui.enableFollowupSuggestions 启用,默认 true。
| 路径 | 额外条件 |
|---|---|
| 交互 CLI | 回复结束、最近无错误、没有可见待确认流程;自己的无头/SDK 路径不生成 |
| daemon | stop reason 为 end_turn、todo stop guard 未挡自动轮次、没有待运行提示,最后历史项为模型响应 |
daemon 在 cancelled、refusal、max_tokens、max_turn_requests 等非正常结束后不生成。它可能为不会展示建议的附加客户端也生成;消费 daemon 会话的无头/SDK 客户端应主动关闭,不能套用“CLI 自身无头不生成”的结论。
部分 CLI renderer 无法感知中途打开的 shell 对话框,可能在其后生成建议;输入区此时不挂载,所以不会显示,但该次模型成本仍可能发生。
模型与设置
默认用主模型,也可通过 /model --fast 选择辅助模型。关键设置:
| 字段 | 默认 |
|---|---|
| ui.enableFollowupSuggestions | true |
| ui.enableCacheSharing | true,实验性 |
| ui.enableSpeculation | false,实验性 |
| fastModel | 空,建议路径回退主模型 |
后台建议和 speculation 会关闭 thinking/reasoning,不继承主会话的推理开启状态。建议用量在 /stats,当前 fast model 可在 /about 检查。
换 fast model 可以降低延迟,但未必降低总费用。前缀缓存按模型区分,另一个模型可能需要重新计入长历史;不要只比较模型单价,忽略失去原缓存的输入成本。
过滤与限制
通常接受两到十二个词,CJK 为二到三十字符,总长低于一百字符。过滤评价语、助手自述、多句、Markdown、错误字符串和标签前缀。常用单词命令或斜杠命令允许单项建议。
建议是下一步输入草案,出现“commit”或“push”不代表用户已经授权;必须经过实际提交和适用的执行审批。