目标
明确完成标准和不可触碰的边界
怎样让模型不只回答问题,还能可靠地完成一项工作?
普通对话产品通常停留在一次输入和一次回答。Agent 则需要理解目标、拆分任务、选择工具、保存状态,并在遇到异常时知道如何继续。真正困难的不是让流程跑起来,而是让用户知道它正在做什么、为什么这样做,以及什么时候需要人工介入。
任务应该由用户拆分,还是由系统自动规划?
工具调用失败后,是重试、换工具还是询问用户?
怎样展示执行进度,既透明又不过度暴露技术细节?
如何用评测集验证多步骤任务的稳定性?
明确完成标准和不可触碰的边界
把任务拆成可执行、可检查的步骤
选择工具,并记录每一步的输入与结果
向用户说明进度、异常和需要确认的事项
失败时回退到安全状态,避免错误继续放大