# 一、简介与定位
Minimax M1是中国上海的AI独角兽企业MiniMax(稀宇科技)于2025年6月17日发布的开源大规模混合架构推理大模型,核心定位是面向开发者和生产力场景的高效能、低成本开源基座模型。
其名称中“M”是MiniMax模型家族的通用前缀,代表“MiniMax自研基座”,“1”代表该混合架构推理模型的首个版本,核心功能聚焦于超长上下文处理、高效代码生成和智能体工具调用。使用门槛极低,官方App与Web端支持不限量免费使用,API服务采用分档定价模式,无强制订阅要求,无免费额度限制但按实际使用量计费;同期发布的“兄弟模型”包括视频生成模型Hailuo 02、通用智能体MiniMax Agent等,共同构成MiniMax“开源周”的核心产品矩阵。
目前Minimax M1仍处于生命周期的活跃阶段,未被淘汰,是MiniMax开源模型体系中的核心主力之一,其最突出的核心特点是“高性能与低成本兼具”,以百万级上下文窗口和极低的训练、推理成本,成为Agent时代热门的开源基座选择。
# 二、发展历程
# 2.1 研发背景
Minimax M1发布前,全球大模型行业已从“参数规模比拼”进入“效率、成本、落地能力”的竞争下半场。当时主流大模型分为两大阵营:海外阵营以OpenAI GPT-4o、Anthropic Claude 3 Opus、谷歌Gemini 2.5 Pro为主,优势是性能强劲但训练推理成本高昂,部分模型不开源;国内阵营以DeepSeek R1、Qwen3、文心大模型4.5为主,其中DeepSeek R1凭借较强的推理能力和开源特性占据市场优势,但长文本处理能力和成本控制仍有提升空间。行业普遍面临“高性能与低成本难以兼顾”“长文本处理效率低”“开源模型工具调用能力不足”的痛点,Minimax M1正是在这样的行业局势下诞生,主打“开源+高效+低成本”,打破“算力-资本”壁垒,填补开源模型在超长上下文推理领域的短板。
# 2.2 关键节点
MiniMax自2022年初成立以来,始终聚焦AGI研发,2023年下半年开始偏离行业主流的稠密架构,转向“稀疏激活”的MoE架构研究,为混合架构的研发奠定基础。2025年1月,MiniMax发布并开源新一代“01系列”模型,其中MiniMax-Text-01模型已具备400万tokens的超长上下文处理能力,成为M1模型的技术雏形。同年3月,MiniMax完成品牌拆分,优化产品布局,集中资源推进推理模型的研发与开源准备,随后进入内部内测阶段,重点测试长文本处理、代码生成和工具调用的稳定性与效率。2025年6月17日,MiniMax正式对外发布Minimax M1,同步开源模型权重和技术报告,开启为期五天的“开源周”活动,M1作为开篇产品,迅速引发行业关注。
# 2.3 家族构成
Minimax M1隶属于MiniMax全栈模型矩阵,该家族涵盖文本、语音、视频、图像与音乐五大方向,核心相关模型如下:
MiniMax-Text-01:M1的前代文本模型,2025年1月发布并开源,主打400万tokens超长上下文处理,为M1的混合架构和长文本能力提供了核心技术积累,定位为“超长上下文基础语言模型”。
Minimax M1:2025年6月发布,全球首个开源大规模混合架构推理模型,定位为“Agent时代首选开源基座模型”,聚焦长文本推理、代码生成和工具调用,主打高效能、低成本。
Minimax M2.7:M1的后续升级文本模型,2026年发布,主打模型自我进化,强化工程与Coding能力、复杂Office自动化能力和Agent Harness能力,定位为“生产级交付的高阶推理模型”。
Hailuo系列(如Hailuo 02):与M1同期及后续迭代的视频生成模型,定位为“高动态、高质感视频生成模型”,其中Hailuo 02因“猫跳水”视频出圈,具备媲美谷歌Veo3的性能。
Speech系列(如Speech 2.6):语音生成模型,定位为“Agent适配型语音模型”,具备超低时延、超拟人特性,支持多语言、多口音、多音色生成,与M1协同支撑多模态智能体研发。
# 三、核心技术剖析
# 3.1 固有技术
Minimax M1继承了前代MiniMax-Text-01模型的核心优势,底层基于Transformer架构,保留了标准的Transformer encoder-decoder结构,确保文本理解与生成的基础能力。同时,继承了常规的监督微调(SFT)和人类反馈强化学习(RLHF)对齐手段,通过真实人类反馈优化模型输出的准确性和实用性,避免出现偏离人类需求的生成内容。此外,还延续了MiniMax家族一贯的多模态适配能力,可无缝集成MiniMax MCP(多模态输出工具),支持文本、语音、视频等多模态内容的协同处理,为智能体开发提供基础支撑。
# 3.2 创新技术
Minimax M1的核心竞争力在于两大创新技术,彻底解决了传统开源模型“长文本效率低、训练成本高”的痛点,具体解读如下:
1. 独创Lightning Attention(闪电注意力)混合架构:这是M1实现百万级上下文处理的核心技术。传统Transformer模型的注意力机制,计算量会随文本序列长度呈平方级增长,处理长文本时不仅效率低下,还会消耗大量算力。而Lightning Attention混合架构,通过优化注意力计算方式,打破了这一限制,使模型能够原生支持100万tokens的上下文输入和8万tokens的推理输出,且计算效率大幅提升——进行8万tokens深度推理时,所需算力仅为DeepSeek R1的30%,生成10万tokens时,推理算力仅为DeepSeek R1的25%,从根本上降低了长文本处理的算力成本。简单来说,就是让模型“记住”超长文本的能力更强,同时处理速度更快、更省资源。
2. 自研CISPO强化学习算法:传统强化学习算法(如PPO、GRPO、DAPO)要么训练效率低,要么稳定性不足,导致模型训练成本居高不下。M1采用的CISPO算法(Clipped IS-weight Policy Optimization),另辟蹊径通过裁剪重要性采样权重,而非调整Token更新方式,来提升强化学习的效率和稳定性。实验数据显示,在AIME测试集中,CISPO的收敛性能比字节跳动的DAPO算法快一倍,也显著优于DeepSeek早期使用的GRPO算法。这一创新直接将M1的强化学习训练成本控制在53.47万美元,仅使用512张H800 GPU,耗时三周,远低于OpenAI、谷歌动辄上亿美元的训练成本,也低于DeepSeek R1的557.6万美元,实现了“低成本高性能”的突破。
# 四、表现评估
# 4.1 历史与现状
刚发布时,Minimax M1凭借“全球首个开源大规模混合架构推理模型”“百万级上下文窗口”“极致性价比”三大亮点,迅速引爆行业,发布当天便在Hugging Face平台成为热门模型,位列全球开源模型第二,仅次于DeepSeek R1-0528,同时引发海外X平台、开源社区的广泛关注,被业内评价为“倒逼行业真开源、卷成本”的标杆模型。截至2026年4月,M1仍保持活跃状态,虽已被后续的MiniMax M2.7等模型迭代,但作为开源基座模型,其在长文本处理、代码生成领域的优势依然突出,仍是开发者搭建智能体、处理复杂文档的优选开源模型之一,API服务和免费使用渠道持续正常运营,社区生态不断完善。
# 4.2 优势亮点
结合业内公认的评测集数据和媒体实测,Minimax M1的优势主要集中在三个核心维度,表现处于行业第一梯队:
1. 长文本处理能力:在MRCR长文本评测集中,M1凭借100万tokens的上下文窗口,全面超越所有开源对手,甚至击败了OpenAI的GPT-4o和Anthropic的Claude 3 Opus,仅以微弱差距落后于谷歌Gemini 2.5 Pro,位列全球第二。其上下文处理能力与Gemini 2.5 Pro持平,是DeepSeek R1和Qwen3的8倍,是GPT-4o和Claude 4的5倍,可轻松处理《红楼梦》《三体》三部曲等百万字级别的长篇文本,无明显遗忘或信息丢失问题。
2. 代码生成能力:在SWE-bench代码评测中,M1的40k版本和80k版本分别取得55.6%和56.0%的优异成绩,显著超越其他所有开源模型,稳居开源模型第一梯队,能够高效完成代码编写、调试、优化等任务,适配主流编程语言,满足软件工程场景的核心需求。
3. 工具调用能力:在TAU-bench工具调用评测集中,M1-40k模型领跑所有开源模型,甚至超越了闭源的Gemini 2.5 Pro,具备强大的智能体工具调用能力,可无缝集成GitHub、Figma、Slack、Notion等常用工具,通过API key快速接入,为智能体开发提供了便捷支撑。
此外,M1的性价比优势极为突出,API定价远低于同类开源模型,0-32k输入长度区间,输入成本仅0.8元/百万token,输出8元/百万token,不到DeepSeek R1的20%和50%,且支持不限量免费使用,大幅降低了开发者和普通用户的使用门槛。
# 4.3 缺点与不足
客观来看,Minimax M1并非完美,仍存在以下明显短板,主要集中在非核心生产力场景:
1. 通用文本生成的细腻度不足:相较于GPT-4o、文心大模型4.5等模型,M1在文学创作、情感表达等场景中表现一般,生成的文本缺乏细腻的情感张力,语言风格较为单一,难以满足高质量文学创作、沉浸式角色扮演等需求。
2. 数学推理能力较弱:在数学计算题、复杂逻辑推理题(如高等数学、奥数题)中,M1的正确率明显低于DeepSeek R1、Qwen3等同类模型,容易出现计算错误、逻辑断层的问题,不适用于高精度数学计算场景。
3. 小语种支持不足:模型主要优化中文和英文处理能力,对日语、法语、西班牙语等小语种的理解和生成能力较弱,存在翻译不准确、语义偏差等问题,难以满足多语种场景的使用需求。
4. 开源生态仍需完善:虽然M1开源了模型权重和技术报告,但相较于DeepSeek、Qwen等成熟开源模型,其社区二创、第三方适配工具较少,开发者遇到问题时的解决方案相对有限,后期维护和迭代的频率也低于后续升级模型。
# 五、重大事件
1. 2025年6月17日:Minimax正式发布Minimax M1,同步开源模型权重和技术报告,开启“开源周”活动,M1作为全球首个开源大规模混合架构推理模型,发布后迅速引发行业关注,登上国内AI领域热门话题,被多家科技媒体报道,海外开源社区也纷纷跟进测评。
2. 2025年6月中下旬:M1在Hugging Face平台快速崛起,成为全球第二热门模型,同时其极致性价比引发行业讨论,倒逼多家模型厂商调整API定价策略,推动开源模型“性价比竞争”的趋势,被分析人士评价为“打破算力壁垒的标杆事件”。
2025年7月:依托M1的技术基础,MiniMax推出的Hailuo 02视频生成模型,生成的“猫跳水”视频在海外社交平台获得3亿现象级播放量,开创“动物奥运会”AI视频新品类,间接带动M1的曝光度,让更多开发者关注到该模型的基座能力。
2025年下半年:Minimax与国家超算平台、vLLM等主流开源框架达成合作,优化M1的部署效率,让开发者能够更轻松地部署和使用M1模型,进一步扩大了M1的开源生态影响力,推动其在智能体开发、长文本处理等场景的落地。
社区真实评价
登录后才能发表评价,与极客们一起交流哦~