不期而至🎁 惊喜礼盒
🎁 Surprise · 不定期 · 随缘更新


🎁 Surprise · 不定期 · 随缘更新
🎁 SURPRISE
谢谢你停在这里。愿你被温柔以待,也愿你带着一点勇气继续往前——这是我留给访客的小小礼物 🎀✨。
— threetwoa
(=;ェ;=) 客来不妨坐下,落叶声里续一壶茶;猫会自己找你。
走进数字花园
这套配置的价值,不在于把几个模型堆在一起,而在于把任务按能力和成本拆开:bestcodex/gpt-5.6-luna 负责判断、路由和验收,opencode-go/deepseek-v4-flash 负责可拆分的纯文本执行,MiniMax MCP 负责图片、音乐、视频、TTS 和音色等产物。
这样做的结果是,主控模型不用承担所有重复执行,子 Agent 也不用假装自己拥有视觉能力。真正重要的部分,是每次委派都把边界和工具权限重新写进任务契约里,避免子 Agent 依赖历史上下文。
相关阅读:Best Codex 中转:三把钥匙、一个 Luna——那边讲 Key 与额度;这篇讲接到 OpenCode 之后怎么分活。
成本收益来自路由,而不是来自「所有任务都换成便宜模型」。
| 工作类型 | 更合适的角色 | 原因 |
|---|---|---|
| 需求理解、复杂取舍、视觉入口、最终验收 | luna-orchestrator / bestcodex/gpt-5.6-luna | 需要更长上下文、更强推理或图片输入能力 |
| 文件扫描、结构化分析、代码修改、测试和工具结果处理 | deepseek-v4-flash-worker / opencode-go/deepseek-v4-flash | 任务可以拆开,输入和输出都能用文本表达 |
| 图片、音乐、视频、TTS、音色和图片理解 | MiniMax / minimax-coding 工具 | 产物由专用能力生成或解析,不占用主控的全部推理链 |
主控模型只在需要判断的地方出现,纯文本执行交给子 Agent,媒体能力按需触发。任务越清晰,这个分工越省成本;任务越模糊,越应该先让 Luna 收敛目标,再派发执行。
| 角色 | 接收什么 | 负责什么 | 交付什么 | 不做什么 |
|---|---|---|---|---|
luna-orchestrator | 用户需求、原始图片、视频上下文、子任务结果 | 识别模态、选择能力、拆分任务、判断风险、Review 和验收 | 结构化任务、路由决策、最终结论 | 不把空结果、无证据结果或未完成的异步任务判为成功 |
deepseek-v4-flash-worker | 结构化文字、路径、URL、Prompt、歌词、文本、task_id 和工具返回结果 | 执行独立纯文本任务,并在范围内直接调用已暴露且获准的工具 | 非空结果、文件变更清单、验证证据、工具结果或任务状态 | 不把原始图片或视频字节作为模型输入,不猜测视觉内容,不伪造工具结果 |
MiniMax / minimax-coding | prompt、text、lyrics、voice_id、task_id、image_source 等结构化参数 | 生成媒体、理解图片、查询音色、执行相关搜索 | 文件路径、结构化分析文字、task_id 或状态 | 不主动扩大任务,不把 enabled 自动解释成余额充足 |
有一个容易被误解的点:DeepSeek 是纯文本模型,不等于它只能写调用方案。它可以直接调用当前会话已经暴露、并且权限和认证都通过的 OpenCode 原生工具与 MCP。它不能接收媒体字节,但可以把路径、URL、Prompt 或 task_id 作为工具参数传出去,再处理工具返回的文本结果。
子 Agent 不应该依赖主控上一轮说过什么。每次通过原生 task 委派时,都重复注入下面这段固定声明:
DeepSeek V4 Flash 是纯文本执行 Agent,不接收图片、剪贴板附件或未转换的多媒体,只处理主控提供的结构化文字,并返回非空结果、修改文件、验证命令、验证结果和剩余风险。
同一个任务里还要补上正向能力声明:
DeepSeek 可以直接调用当前会话已注册且权限/认证通过的 OpenCode 原生工具和 MCP;多媒体只能通过工具参数处理,不能作为原始模型输入。工具不可见或调用失败时,必须返回非空阻塞结果,不得猜测或伪造媒体结果。
这两段话缺一不可。只有限制没有授权,DeepSeek 会把自己误判成「只能分析文本、不能碰工具」;只有授权没有限制,它可能把图片附件当作模型输入,或者把无法验证的媒体结果说成已完成。
固定契约至少要覆盖五件事:
图片理解时,image_source 是传给视觉工具的路径或 URL,不是把图片字节交给 DeepSeek。标准流程是:
image_source 和分析 Prompt。minimax-coding_understand_image 处理图片,返回 OCR、对象、颜色、布局或其他结构化文字。生成任务也遵循同样的接力方式。DeepSeek 可以直接调用媒体工具,但要先识别副作用:生图和生音频会产生文件和额度消耗,视频可能是异步任务,播放会产生本地设备副作用,网页搜索会产生外部网络请求。
视频任务尤其不能把「已提交」当成「已完成」:MiniMax_generate_video 返回 task_id 后,必须继续使用 MiniMax_query_video_generation 查询到终态,并以最终产物和 Review 结果为准。
当前 OpenCode 会话登记并暴露的能力族如下。具体参数以当次运行时工具签名为准,能力索引不替代工具定义。
| 能力 | 工具入口 |
|---|---|
| 图片生成 | MiniMax_text_to_image |
| 图片理解和 OCR | minimax-coding_understand_image |
| 音乐生成 | MiniMax_music_generation |
| 文本转语音 | MiniMax_text_to_audio |
| 视频生成与查询 | MiniMax_generate_video、MiniMax_query_video_generation |
| 音色列表 | MiniMax_list_voices |
| 音频播放 | MiniMax_play_audio |
| 音色设计 | MiniMax_voice_design |
| 音色克隆 | MiniMax_voice_clone |
| 网页搜索 | minimax-coding_web_search |
这套工具面让产物不再只有文本和代码,还可以包括图片、音乐、语音、视频、OCR 结果和结构化媒体分析。DeepSeek 的职责不是拥有这些媒体模态,而是把结构化任务送到正确的工具,并继续处理返回结果。
验证结论要分层写,不能把配置状态和业务成功混在一起。
| 状态 | 当前结论 |
|---|---|
| 配置启用 | MiniMax 和 minimax-coding 在全局 OpenCode 配置中为 enabled |
| 工具可见 | 当前会话暴露了 MiniMax 媒体工具和 minimax-coding 工具 |
| 只读调用成功 | MiniMax_list_voices 使用 system 和 voice_cloning 两种参数均成功返回;后者返回空列表 |
| DeepSeek 直接调用工具 | 已验证。DeepSeek 子 Agent 直接调用 MiniMax_list_voices 成功,不只是生成调用方案 |
| 生成端点逐项成功 | 尚未逐项验证,不能把配置声明写成全部生成工具已验收 |
| 权益或余额充足 | 当前没有从工具栏得到明确余额查询结果,不能从 enabled 推断 |
| 服务端模型真实路由 | 子 Agent 不能独立证明请求最终命中的服务端节点,只能报告配置路由和运行行为 |
「工具已注册」「MCP 已连接」「认证通过」「权益充足」「业务调用成功」是五个不同状态。任何一项都不能替代另外四项。
Luna 收到 task_result 后,至少检查以下内容:
| 检查点 | 不通过时的处理 |
|---|---|
| 结果非空 | 重试一次或报告阻塞 |
| Agent 和模型路由正确 | 不验收,检查委派方式和运行信息 |
| 工具结果真实存在 | 不接受只有模板或计划的文字 |
| 文件变更符合授权 | 发现越界修改时暂停验收 |
| 验证命令和结果齐全 | 不把「应该通过」算作证据 |
| 异步任务已到终态 | 继续查询或报告未完成 |
| 剩余风险已列出 | 要求补充边界,不用乐观措辞掩盖未知项 |
这套验收机制把模型的「记性」变成了可检查的契约。子 Agent 即使忘了上下文,也会在当前 Prompt 中重新获得能力边界和工具入口;它即使给出错误结论,Luna 仍然可以通过结果、权限和验证证据把错误拦下来。
| 容易误导的说法 | 更准确的说法 |
|---|---|
| MiniMax 已启用,所以媒体功能一定可用 | MCP 处于 enabled 状态,工具是否可用要看当前会话暴露、认证和实际调用结果 |
| 图片交给 DeepSeek 处理 | 图片通过 image_source 交给视觉工具,DeepSeek 只处理工具返回的结构化文字 |
| DeepSeek 只能生成调用方案 | DeepSeek 可以直接调用当前会话已暴露且获准的工具,纯文本边界只限制模型输入,不限制工具编排能力 |
| 调用方案已经生成,所以任务完成 | 只有实际调用获得返回,并完成验证和 Review,才算执行完成 |
| 视频任务已经提交,所以视频生成完成 | 必须保存 task_id,查询到终态并确认产物 |
| 音色列表为空,所以 MiniMax 没有权益 | 空列表只说明当前分类没有可枚举条目,不能推出权益状态 |
| 纯文本模型不能做媒体任务 | 纯文本模型不能直接理解媒体字节,但可以通过工具参数编排媒体任务 |
opencode.json 是运行时配置来源,capability-index.md 是能力登记表,AGENTS.md 和 session-bootstrap.md 是协作规则和新会话同步层。task 委派都重复注入固定能力声明,不依赖历史上下文。enabled 字段替代运行时证据。task_id 就结束。这套方案的核心不是让某一个模型变得无所不能,而是让每个角色都知道自己能做什么、该把什么交给工具、什么时候必须停下来等主控验收。这样,成本、能力和产物多样性才会同时成立。
复制链接或生成海报,发给感兴趣的人。

纯文本模型看不懂图?把视觉理解外挂到工具层、生成交给 MiniMax:understand_image 兜底看图、MM 出图出视频,主模型只做编排。本机已跑通的一套接线与纪律。
2026-08-05部分内容可能已过时
分享你的想法,与大家交流讨论
像发消息一样写就好:点工具栏插入表情 / 图片,表情会直接显示。插图 ≤5MB。
🎁 Surprise · 不定期 · 随缘更新
🎁 SURPRISE
谢谢你停在这里。愿你被温柔以待,也愿你带着一点勇气继续往前——这是我留给访客的小小礼物 🎀✨。
— threetwoa
有什么想了解的?
我基于博客内容回答