MiMo V2.6 教程:从 Studio 验证到 API 上线
MiMo V2.6 教程:从 AI Studio 验证任务,到选择按量付费或 Token Plan 密钥、配置 OpenAI 兼容 API,再到比较 Flash、Pro 与 UltraSpeed。附 Python 请求、价格测算、七个业务工作流和按顺序排错的方法,帮助团队在接入真实数据前完成安全评估。

这份 MiMo V2.6 教程介绍如何通过 Xiaomi API,把一条经过验证的提示词变成可重复运行的业务流程。先在 Studio 中验证任务,再用 Flash 发起首个生产请求;只有当质量或延迟数据证明额外成本值得时,才切换模型。
最快的上手路径并不复杂:先在 AI Studio 中测试一个虚构任务,创建与计费方式匹配的密钥,再把 OpenAI 兼容客户端指向 Xiaomi 的 base URL。接入真实客户数据之前,务必先检查返回的 JSON。
这个顺序很重要,因为它能把提示词问题与账户问题拆开。如果任务在 Studio 中都跑不通,修改 Python 代码也无济于事;如果 Studio 中正常、API 却提示密钥无效,问题多半出在凭证通道,而不是模型本身。
MiMo-V2.6 到底是什么
MiMo-V2.6 是一个模型系列,实际使用时可以从两个版本入手。mimo-v2.6-flash 成本更低,适合高频调用;mimo-v2.6-pro 定价更高,面向复杂、长周期任务。两者都支持文本、图像、视频和音频输入,并输出文本;也都提供 1 million token 上下文窗口、128,000 token 最大输出、工具调用、流式传输、结构化输出、网页搜索和上下文缓存。
可以把模型看作发动机,把访问通道看作加油卡:发动机可以相同,但卡、计费表和加油站并不通用。按量付费密钥不能消耗 Token Plan 配额,Token Plan 密钥也无法通过按量付费的 base URL 完成认证。
Xiaomi 已在 AI Studio、MiMo Code、MiMo Desktop、API 平台和 OpenRouter 中提供 Pro 与 Flash。Studio 最适合作为起点,因为业务人员可以先判断任务是否可行,再由工程师把它封装成系统。

MiMo V2.6 教程:跑通首个任务的配置流程
第一步应选择一个无敏感信息、但足以代表真实工作的任务。以客服分流为例,不要粘贴真实客户的姓名、邮箱、订单记录或付款信息,而要使用结构相同的虚构工单:
将这条虚构客服工单归入以下标签之一:
billing(账单)、access(访问)、bug(故障)或other(其他),然后给出一项下一步操作:我的银行卡已经扣款,但工作区余额没有更新。
1. 先在 Studio 中验证任务
使用 Xiaomi 账户登录,打开 AI Studio,选择 MiMo-V2.6-Flash,然后提交这条虚构提示词。此时要确认三件事:分类是否正确、下一步操作能否真正执行,以及回答是否足够稳定,方便后续整理成固定 Schema。
暂时不用追求措辞漂亮。一个合格的初始结果可以返回 billing,并建议检查款项是否结算,或升级处理余额不一致的问题。如果回答过于发散,就收紧类别,并明确只允许给出一项下一步操作。Studio 是排练场,不是生产系统。
2. 创建密钥前,先选定凭证通道
对于通用的企业 API 工作流,按量付费通常是最直接的默认方案。先为 MiMo 控制台充值,再到 API Keys 创建 sk- 格式的普通密钥,并使用:
- Base URL:
https://api.xiaomimimo.com/v1 - 模型:
mimo-v2.6-flash
Token Plan 是面向 AI 编程负载的订阅产品。个人用户会获得独立的 tp- 密钥,团队用户则使用 ttp- 密钥,对应配置为:
- Base URL:
https://token-plan-cn.xiaomimimo.com/v1 - 模型:
mimo-v2.6-flash或mimo-v2.6-pro
两条通道的 API 格式相同,但密钥必须与 base URL 成对切换。Xiaomi 明确说明,按量付费余额与 Token Plan 配额不能互通。完整的访问与收费规则可参阅 MiMo V2.6 是否免费。
3. 发起一个最小但有用的 Python 请求
下面的请求沿用了 Xiaomi 的 OpenAI 兼容示例,但删除了官方示例中过时的 2025 年十二月系统日期。它使用不涉及真实数据的任务,从环境变量读取密钥,并打印完整响应,以便保留返回的模型 ID、用量和内容。
import os
import time
from openai import OpenAI
client = OpenAI(
api_key=os.environ["MIMO_API_KEY"],
base_url="https://api.xiaomimimo.com/v1",
)
started = time.perf_counter()
response = client.chat.completions.create(
model="mimo-v2.6-flash",
messages=[{
"role": "user",
"content": (
"Classify this synthetic support ticket as billing, access, "
"bug, or other, then give one next action: My card was charged "
"but my workspace balance did not update."
),
}],
max_completion_tokens=120,
stream=False,
extra_body={"thinking": {"type": "disabled"}},
)
print(f"latency_seconds={time.perf_counter() - started:.3f}")
print(response.model_dump_json(indent=2))安装当前版本的 OpenAI Python 包,导出 MIMO_API_KEY,然后运行该文件。如果购买的是 Token Plan,需要同时更换密钥和 base_url,不能只改其中一项。
本文实际验证了什么,又没有验证什么
这段示例没有实际执行,因为发布环境中没有获得授权的 MiMo 账户或密钥。不过,一次不带凭证的探测成功到达了 https://api.xiaomimimo.com/v1/chat/completions,并在 0.067 秒内返回 HTTP 401、invalid_key 以及提示 Invalid API Key。这是可以修复的配置错误:提供与对应账户通道匹配的有效密钥即可。
认证在推理开始前就已失败,因此无法如实提供模型 ID、token 用量或补全结果。成功运行后,应保留完整响应 JSON、客户端测得的延迟,以及经过脱敏的请求副本。这样既能比较模型、排查计费,也不会把密钥或客户数据写进日志。

按任务选择 Flash、Pro 或 UltraSpeed
默认从 Flash 开始。它与 Pro 具有相同的已公布输入模态、上下文窗口、最大输出和平台速率限制,但 token 价格更低。只有小规模评估集证明更好的决策质量足以覆盖价差后,才应把任务升级到 Pro。
Xiaomi 表示,在质量相同的前提下,UltraSpeed 的输出速度最高可达 Pro 的 20 倍;其未缓存输入和输出价格也都是 Pro 的 10 倍。只有当响应时间能够带来可衡量的商业价值时,这笔交换才合理。
对于简短分类任务,模型费用可以很低。假设每条工单消耗 1,000 个未缓存输入 token 和 200 个输出 token。按已公布费率计算,10,000 条工单使用 Flash 约需 $1.96,使用 Pro 约需 $6.09,使用 Pro-UltraSpeed 则约需 $60.90。若使用 Flash 批处理,这一假设场景下的模型费用可降至约 $0.98。
这些数字只是算术场景,不是实际用量结果;其中不包含重试、网页搜索、存储、监控、工程投入和人工审核。Xiaomi 对海外网页搜索单独计费,价格为每 1,000 次调用 $5。真正可能打破预算的,并不只是客服人力成本,而是误以为每次初筛分类都必须先购买另一个应用席位,或先由人工处理才能进入分流。

七个值得测试的业务工作流
以下工作流按三个标准排序:输入是否清晰、结构化回答是否有价值,以及团队能否在交给模型更多控制权之前安全地衡量结果。
1. 为高流量客服队列做工单分流
客服运营负责人可以把每张新工单发送给 Flash;确有需要时,再附上已清除敏感信息的截图。模型负责分类问题、提出一项下一步操作,并返回文本,由路由系统转换为字段。这样能加快第一轮分流,而且几千条短工单的模型费用仍可能低于一美元。退款、账户变更和模糊案例仍须由人工客服负责。
2. 为软件团队维护代码仓库
工程经理可以向编程系统提供 bug 报告、相关仓库上下文、测试命令和工具权限。Flash 负责频繁探索,未达到评估阈值的案例再交给 Pro。收益并不是泛化的代码生成,而是在一个明确工作流中减少付费助手席位,同时记录每次请求和工具操作。需要注意的是,外围系统、沙箱、测试和代码审查带来的风险,可能比模型调用本身更大。
3. 分析大型文档包
运营分析师可以把合同提取文本、政策页面和扫描页图像组合起来,再要求模型按固定 Schema 找出例外项。1 million token 上下文窗口使大型证据包成为可能,结构化输出则让下游软件获得可预测的格式。它能缩短第一轮审查时间,但不能替代法律判断;每个被引用的例外项仍须链接回原始页面。
4. 为电商内容做视觉质检
电商团队可以把商品图片与商品文案一起发送,并询问可见颜色、包装数量和宣传主张是否一致。Flash 返回文本,供规则引擎直接接受或放入待处理队列。价值在于发布前捕捉明显不一致之处。模型不会返回编辑后的图片,因此仍需要单独的图像处理流程。
5. 审查通话录音与屏幕证据
客户成功团队可以提供音频、屏幕录制和评分标准,要求模型用文本总结承诺事项、尚未解决的阻碍和后续行动。原生音频与视频输入减少了首个原型所需的独立模型数量,也能把原本分开的转录队列和视觉检查队列合并为一个审查队列。前提是先明确用户同意、数据保留和敏感信息规则。
6. 用桌面端试跑研究与办公任务
尚未准备自行开发的业务人员,可以先从 MiMo Desktop 入手;其中现已包含 Pro、Flash 和 UltraSpeed。在要求工程团队集成之前,可以先验证模型能否处理真实的研究或文档任务,从而降低探索阶段的成本。但桌面端跑通,并不能证明自动化 API 工作流在大规模运行时同样可靠。
7. 夜间批量处理积压任务
平台运营团队或合规团队可以通过批处理 API 处理不紧急的分类任务。Xiaomi 对 Flash 和 Pro 的批处理输入与输出按实时报价的一半计费;UltraSpeed 不支持该模式。当完成时间具有弹性时,收益直接且容易衡量。凡是会在客户等待期间影响其体验的任务,都应走实时通道。
三款可以基于 MiMo 构建的产品
最佳机会:面向垂直领域的智能体编程助手
可以为一个昂贵但长期被忽视的技术栈打造编程智能体,例如内部 Java 迁移检查,或受监管代码仓库中的测试修复。目标客户是这样的工程团队:他们认为通用助手覆盖面广,却难以治理。
需求已经显现:agentic ai coding assistant 在美国每月约有 2,900 次搜索,具有交易意图,CPC 为 $19.04;关键词数据集显示其同比增长 200%。GitHub 目前列出的 Copilot Business 价格为每席位每月 $19,Enterprise 为 $39。这为买方提供了清晰的价格参照。
最小可售版本只需连接一个代码仓库、一个问题队列、一个沙箱和一个测试运行器。用 Flash 做探索,把失败或高风险案例升级到 Pro,并向客户展示每项任务的成本、延迟、补丁和测试证据。真正的壁垒是针对该技术栈的评估集与控制机制,而不是聊天框。
难点在于市场拥挤,而且安全工作不能省略。没有专有测试、工作流知识或审批边界的简单封装,很快就会被复制。尽管如此,它仍是最有力的机会,因为这个查询的有效需求最高、交易意图明确,并且已有买方熟悉的价格锚点。
开放模型编程网关
可以为希望引入开源模型选项、又不想让每位开发者都研究模型 ID、密钥类型、上下文限制和回退策略的团队构建路由层。买方只需面对一个内部端点,就能获得策略控制,并按任务比较 Flash 与 Pro。
open source ai coding assistant 在美国每月约有 1,600 次搜索,带有商业意图,CPC 为 $2.94;建议词数据显示其年增长率为 1,977%。MVP 需要认证、模型提供商适配器、成本与延迟日志、小型编程评估,以及基础管理视图。
难点在于,开源模型与托管 API 是两种不同的采购决策。这个网关需要明确的数据处理条款,并提供自托管路径或其他能形成壁垒的治理能力,否则客户完全可以直接调用 Xiaomi。
多模态文档与附件分流台
可以为需要接收长文本、截图、语音备注和短视频的客服、理赔或运营团队构建材料接收产品。它先把文件转换为支持的输入格式,再让 Flash 给出结构化文本决策,并把低置信度案例转交人工。
ai document analysis 在美国每月约有 1,000 次搜索。该查询的 CPC 为 $10.44,页首竞价范围为 $3.23 至 $19.87;尽管关键词趋势目前正在下滑,这些数据仍说明供应商重视这类线索。MVP 只需一个上传入口、一个 Schema、一个审查队列,以及带来源链接的证据。
难点是信任。MiMo 输出的是文本,不是经过验证的决策;1 million token 的窗口也不代表每个细节都会得到同等关注。聚焦一类文档并强制人工审核,比打造万能分析器更可靠。
MiMo-V2.6 解决不了哪些问题
API 提供的是一台性能不错的发动机,而不是企业运营系统。它不会替你定义分类体系、清理敏感数据、制定审批规则、运行评估,也不会决定回答不确定时该怎么处理。这些属于产品与运营工作。
不要因为 UltraSpeed 听起来更强就直接采用它。应从 Flash 开始并记录证据。也不要因为上下文窗口很大,就把每个文件都塞进去;只保留最相关的上下文,并保存来源引用。更不要把结构化输出等同于事实。格式有效的 JSON 对象,仍可能包含错误决策。
如果在多次工具调用中启用 thinking mode,Xiaomi 建议把之前的 reasoning_content 连同消息历史一起传递。丢弃它,就等于改变了模型接收到的上下文。若使用网页搜索能力,还需将其成本与 token 费用分开预算。
如需直接比较模型,请阅读 MiMo V2.6 Pro 与 Flash 对比。实际规则依然是:先用 Flash,评估后再上 Pro;只有当延迟已经可以明确折算成价格时,才考虑 UltraSpeed。
按正确顺序排查问题
- **密钥无效:**确认密钥以
sk-、tp-还是ttp-开头,并搭配正确的 base URL。切勿将密钥打印到日志。 - **Studio 中没有可用结果:**先修改任务描述、分类和输出要求,再处理集成代码。
- **模型选择错误:**使用完全一致的小写 ID
mimo-v2.6-flash或mimo-v2.6-pro。 - **规模扩大后流量停滞:**将实际负载与 Pro、Flash 已公布的每分钟 100 次请求和每分钟 10 million token 限制对照。
- **日期表现异常:**删除 Xiaomi 当前示例中过时的 2025 年十二月系统日期。只有任务确实需要日期时,才提供当前日期。
- **工具调用的连续性中断:**启用 thinking mode 时,按照 Xiaomi 的建议,在各轮之间保留
reasoning_content。 - **成本看起来不对:**分别核算按量付费余额、Token Plan 点数、token 费用,以及独立计费的网页搜索服务。
下周一就这样开始
周一,客服运营负责人可以准备 20 条虚构工单,定义四个类别,并为每条工单设定一项安全的下一步操作,再用 Flash 在 Studio 中测试。周二,工程师可以通过付费 API 跑同一组工单,保存脱敏请求和完整响应,然后比较结果一致性、延迟与 token 用量。完成这些步骤后,团队才能连接真实队列,同时保留人工审核分支。
MiMo V2.6 怎么用?
先在 AI Studio 中用虚构数据测试目标任务。要构建 API 工作流,需创建 Xiaomi 账户,在按量付费和 Token Plan 之间作出选择,创建对应通道的密钥,使用与之匹配的 base URL,再通过 OpenAI 兼容或 Anthropic 兼容 API 调用 mimo-v2.6-flash。
Xiaomi MiMo 免费吗?
Xiaomi 的部分入口可能提供试用或免费额度,但生产 API 已公布按量付费价格,也有付费 Token Plan。具体访问方式可参阅 MiMo V2.6 是否免费。
MiMo 每月多少钱?
个人 Token Plan 提供 $6、$16、$50 和 $100 的月度档位;团队方案则为每席位每月 $16、$50 或 $100。已公布的按量付费方案没有固定月费,而是根据 token 用量从预付余额中扣款。
Xiaomi MiMo 适合编程吗?
它面向编程和智能体工作流设计,Xiaomi 也公布了表现出色的基准测试与产品示例。但对企业而言,答案取决于自己的代码仓库。应使用一组固定问题和测试分别评估 Flash 与 Pro,再比较被接受的补丁、延迟和成本。
MiMo 值得用吗?
如果低 token 价格、多模态输入、长上下文或开源模型选项很重要,MiMo 值得接受一次可控评估。但若没有针对具体任务的测试、数据规则和人工回退机制,就不值得仓促上线。
如果希望把上述任一 API 工作流真正落地,并配套评估、监控和安全的人工交接机制,可查看 AI 生产系统。
- 最近更新
- 2026年9月22日
- 分类
- AI







