面向开发者的云端 AI 编程助手:用户在客户端提问或下任务,Agent 负责写代码、查接口文档、回答技术问题,也能远程执行任务。难点在模型这一层:输出是自然语言加 XML 标签,还常漏标签、写错标签;一次会话里任务类型会变,需要多个专业 Agent 协作和切换;用户还经常直接贴截图报错,要支持图文混合输入。
点击空白处退出提示
面向开发者的云端 AI 编程助手:用户在客户端提问或下任务,Agent 负责写代码、查接口文档、回答技术问题,也能远程执行任务。难点在模型这一层:输出是自然语言加 XML 标签,还常漏标签、写错标签;一次会话里任务类型会变,需要多个专业 Agent 协作和切换;用户还经常直接贴截图报错,要支持图文混合输入。
1、Agent 决策(agent_brain):解析模型输出、整理成结构化动作,递归解析校验 XML 标签(含嵌套标签)并纠正模型写错的标签,动作检测复杂度 O(n²)→O(1)。
2、多 Agent 编排:XProgrammer、API_Document、Ask、RemoteAgent 等角色,各有 Full-Cycle 和 Vibe 两种模式,切换时不丢上下文和待执行动作。
3、提示词工程:按 user_id、task_id、agent_name、agent_mode 四维下发,前置/后置提示词与动作配置用 JSON 管理,支持版本控制和 A/B。
4、多模态:文本 + 图片混合输入,兼容 qwen-vl-plus、gpt-4o 等视觉模型,图片支持 Base64 和 HTTPS 链接。
5、流式生成:token 级输出,回答(content)与推理(reasoning)分开并行处理。
我负责 Agent 侧的算法与工程实现,技术栈是 Python(AsyncIO、AsyncGenerator),模型用 qwen-vl-plus 和 gpt-4o。
1、agent_brain:原来用单层标签检测,嵌套标签匹配不上,也没有纠错逻辑;改成递归解析校验后,动作误判大幅减少,检测复杂度从 O(n²) 降到 O(1)。
2、切换 Agent 时 ActionList 会被覆盖、前面的动作丢失,我用深拷贝 + 增量合并保住各 Agent 的 action。
3、提示词原来硬编码在代码里、改一次要发版,改为按四个维度从接口拉取,毫秒级返回。
4、多模态统一图文输入结构;对标签不闭合、多余标签、空结果做兜底,避免错误标签被当成动作执行。



评论