winBrain · 专家创建 / 进化 —— 界面与体验(UI Mock)

每步 = 一张真实浏览器窗口 mock · 全程真实 UAT 验证过

一句话:同一套隔离 Sandbox / 草稿 / 真实测试 / 发布链路,支持两条使用路径 —— A · GUI 专家 API:表单(零后端调用)→ 审阅 Enter → 流式执行 → 发布 → `POST /responses` 对话;B · 纯对话:直接聊「专家创建师 / 专家进化师」专家,用自然语言建/改技能。全程「无审批弹窗、无暂停」。

两条使用路径 · 同一条发布链路

A 面向 GUI 操作终端用户(表单向导 + 专家 API);B 面向对话用户(把 expert-creator / expert-fixer 当作可聊的专家)。两条都汇入同一套 草稿→真实测试→发布→可对话。

业务需求 路径 A · GUI 专家 API 面向 GUI 终端用户 · #/experts 表单向导 表单 · 0 调用 审阅 Enter 执行 发布新版本 POST /responses 对话 {input} · 无会话历史 路径 B · 纯对话 直接聊「专家创建师 / 专家进化师」专家 对话 expert-creator 对话 expert-fixer 自然语言建/改读 chat 上下文写 evals 汇合 · 已发布专家 + evals 快照 同一 Sandbox / 草稿 / 真实测试 / 版本归档

1资产列表 · #/experts A · 入口

状态徽标 = active / retired,已发布版本 + MCP 绑定一眼可见

http://127.0.0.1:7683/#/experts 资产 专家 项目 本体 资源 遥测 专家资产 6 在职 · N 已退休(.versions 快照) 搜索专家… active expert-msn1bi5s 千川账号追投分析 已发布 v11 · 可对话 进化对话 对话 active expert-yuntu-material-diag 素材表现诊断 已发布 · 绑定 winbrain-yuntu 进化对话 对话 retired expert-nopause-creator-t2 测试专家 已退休 → .versions 快照 恢复 / 快照

2进入资产 · 选路 A · 表单入口

同一资产三条路:创建新技能 / 进化已有 / 直接对话

http://127.0.0.1:7683/#/expert/expert-msn1bi5s expert-msn1bi5s · 千川账号追投分析 active · 已发布 v11 专家创建师 · Creator 用业务自然语言新建技能 创建草稿 → 真实测试 → 发布 专家进化师 · Evolve 带个人想法改进已有技能 进化对话 → 草稿 → 冻结新版本 已发布资产操作 直接对话 / 发布 API / 切版本 / 退休 发布内容 ≠ 发布 API(须显式 PUT)

3表单阶段 · 零后端调用 A · 表单(B 用对话替代)

所有输入只更新本地 CreationSpec,纯函数重建 Prompt —— 审阅按 Enter 才第一次后端调用

http://127.0.0.1:7683/#/create 专家名 Yuntu Material Diag 行业 效果广告 · 素材投放 岗位职责 诊断素材表现并给追投建议 员工 Skills [✓] material-performance-diagnosis [+ 添加] MCP / 数据库 [✓] winbrain-yuntu(已有 MCP,只记名称不猜命令) 测试用例 「对比 2 个素材的 ROI,判断追投还是暂停」 Prompt 预览(纯本地重建) 你是 winBrain 专家 Creator…加载 plugin-dev + skill-creator mode=create · expert=Yuntu Material Diag mcpServers=["winbrain-yuntu"] · ontologyMcps=[] 员工: material-performance-diagnosis 测试用例: 1 … BACKEND CALLS 0 · 仅本地 审阅 → Enter 才调用 进入审阅

4隔离 Sandbox 执行 · SSE 流式 A+B · 共用

工具活动逐条实时可见 · 全程无审批弹窗、无暂停

http://127.0.0.1:7683/#/expert/…/evolve 无暂停 把素材按新素材/老素材分组,老素材连续 3 天 ROI 低于基线 80% 建议替换 ● SDK 已加载 · 隔离运行时已就绪 ● 正在加载员工 Skill ● 生成文件:skills/material-performance-diagnosis/SKILL.md ● 并行测试 3 用例 · 每例全新 Session Sandbox streaming · running → completed 成功才原子提交 .drafts/<id> → 真实测试 verified 才可发布 继续改进…(输入已禁用 = 后端执行中) 独享 Session Sandbox · 完整工具 + 互联网 · 写入仅限当前 Sandbox · Plugin / Skill 只读 · 凭据仅 winbrain_credentials MCP · 模型 gpt-5.6-luna PreToolUse 路径门禁 · 禁绕过 Sandbox 每用例全新 SDK query() + local Plugin 全过才发布新版本

5发布 · 版本切换 A+B · 共用

candidate 冻结 → published;整树(含 evals)快照进 .versions/<id>/<sha256>/,旧版可切回

http://127.0.0.1:7683/#/expert/expert-msn1bi5s/versions 版本历史 · expert-msn1bi5s v10 v11 · 当前 candidate 冻结 → published v10 已归档 · 可一键切回 整树不可变快照 含 skills/*/evals/evals.json → sha256 写入 .versions/<id>/<sha256>/(删不可逆) 目录哈希 = 回归基线 · 退没退一眼比对 发布 ≠ 对话 API 发布内容后须显式 PUT /publication 退休 / 归档 移出 active → .versions 快照 按 AGENTS.md 默认归档保留

6对话新专家 · POST /api/v1/experts/<slug>/responses A · GUI 触发

body 为 {input} · 每次独立任务、无会话历史 · 返回 gpt-5.6-luna 真实业务回复

http://127.0.0.1:7683/#/expert/expert-msn1bi5s expert-msn1bi5s · 千川账号追投分析 在线 API · 无会话历史 · body {input} 10:04 最近 3 天 ROI 0.58,低于基线 0.80,还该追投吗? 10:05 结论:不建议继续追投,建议立即止损/暂停。 近 3 天 ROI 0.61 / 0.55 / 0.58,均低于基线 0.80;3 日均值 0.58,较基线低约 27.5% 依据 winbrain-yuntu 真实数据 · 区分事实 / 计算 / 建议 · 已消耗… 证据:POST /responses 200 · gpt-5.6-luna · 真实回复 输入消息…(body {input} · 每次独立任务) 发送 同源剪贴板桥:复制 curl → 终端调用

7路径 B · 纯对话 expert-creator / expert-fixer B · 对话

把「专家创建师 / 专家进化师」当作可聊的专家打开,自然语言建/改 —— 无表单、无 BACKEND CALLS 数字,触发的是同一套隔离 Sandbox 与草稿流程

http://127.0.0.1:7683/#/expert/skill-expert-fixer 专家进化师 · expert-fixer 对话中 10:12 把素材诊断改成按新/老素材分组,老素材 ROI 低基线 80% 标「建议替换」 10:12 ● 已读当前 chat 上下文 → 定位改动点 ● 生成 evals → 改进 skills/*/SKILL.md ● 写进化草稿 ev-expert-…/(隔离,原版不动) streaming · 真实测试 verified → 发布新版本 同一 Sandbox / 草稿 / 测试 / 发布链路(见卡 4 / 5) 继续对话…(无表单 · 无 BACKEND CALLS) skill-expert-fixer 专家进化师 Plugin 员工 expert-fixer 逐条跑 eval · 交互式修正规则 存档评估进回归基线 绑定 MCP:winbrain-yuntu · exa 纯对话 · 无表单 · 无 BACKEND CALLS 同一发布链路收敛(见总览卡)

8Evals · 展示位置 + 内联表格渲染(非 JSON)

eval-html = skill-creator 官方 eval viewer 产物。展示位置见下方折叠;本页把归档 evals 直接内联渲染成可搜索/排序的表格,不再以 JSON 展示。

http://127.0.0.1:7683/#/evals evals.json skill-creator schema · 事实源 eval-viewer/generate_review.py scripts/transcript-eval.py 调用 eval-review.html Outputs + Benchmark 双 tab 审查
已产出的 eval-html 位置(点击展开)
产物路径大小/说明
Skill eval viewer 产物uat-artifacts/agent-webapp-skill-eval/eval-review.html55MB(含视频),Outputs/Benchmark
viewer 生成器workspace/experts/skill-expert-creator/skills/expert-creator/eval-viewer/generate_review.pytranscript-eval.py 驱动
描述触发评估模板…/skills/expert-creator/assets/eval_review.htmlshould/should-not-trigger 审查
本页内联渲染uat-artifacts/ui-ux-onepager.html下方 17 case 表格,非 JSON
17 条
草稿 ↑↓ # Prompt(触发场景) 期望输出 本次答案 / 出处 ↑↓ 边界信号 ↑↓

真实运行答案 · 本次 benchmark 会话(with_skill / without_skill)

Eval 会话 配置 Prompt 本次答案(摘要) 答案文件(太长→内联链接) 结果
禁代执行(只分析不执行) 别只看 CTR / 需基准 归因窗口 / 口径冲突 数据缺失 · 不编造

9关键 UX 事实(UAT 实测)

体验证据
无暂停creator 运行期+结束态无审批/暂停 UIPASS · creator-not-pause
不全跑即完首 completed 是中间态,须发布+对话后才算过PASS · evolve-publish v11
表单 0 调用审阅 Enter 前页面明确 BACKEND CALLS 0PASS
真实测试门禁每用例全新会话,全过才发布(verified 为权威信号)PASS
发布≠API发布内容后须显式 PUT /publication 才可对话实测契约
对话为独立任务{input} 无会话历史,返回真实业务回复PASS · gpt-5.6-luna
两条路径A GUI 表单→专家 API;B 纯对话 expert-creator/fixer(读 chat 写 evals)PASS · creator-not-pause / fixer-evals-chat