星期三, 22 7 月

Kimi K3遭控蒸馏Claude 月之暗面:性能源自三大自研技术

大陆AI模型公司月之暗面推出Kimi K3震惊全球科技界,甚至有人说是另一个「DeepSeek时刻」,不过,也有传言K3也是蒸馏自美国模型而来,对此,月之暗面业务负责人黄震昕21日澄清K3性能跃升的核心来自底层原创架构创新,并非对现有模型蒸馏复刻。

21世纪经济报导,黄震昕明确表示:「开源模型、中国大模型不该被贴上低价标签,我们做出了SOTA级(State-of-the-Art 的缩写,指当前最优技术或最先进水平)模型,也能匹配合理商业定价。」

此前有传闻称Kimi蒸馏自Anthropic的Claude。不过,K3并非来自蒸馏,黄震昕说,K3的底层自研技术有三方面:

其一是Moon Clip,为全新二阶优化器,由Kimi首次应用于大模型训练。当前全球可用训练数据基本见底,这项技术能让20T训练数据跑出40T的训练效果,同等性能下训练成本、算力功耗直接减半;

其二是Kimi Linear Tension,自研线性注意力机制,解决传统线性注意力处理超长任务时性能衰减的痛点。AI可执行任务时长每7个月翻一倍;这套机制让上下文窗口扩大十倍,训练成本仅同步扩大十倍;

其三是Attention Residuals(注意力残差),这是马斯克曾专门发文称赞的底层技术,优化模型多层网络间信息传递、复用逻辑,让2.8兆超大参数模型既能稳定完成训练,又能让推理效率同步提升25%。

在商业化层面,黄震昕透露,Kimi现阶段暂不提供私有化部署服务,商业模式对标海外成熟头部AI企业,核心发力打磨模型基础能力;公司收入结构中API业务占比最高,暂未对外披露私有化、行业解决方案细分营收占比。同时明确行业参数规模趋势:大模型参数规模会持续向上拓展,不会止步于当前2.8兆规模。

对于开源会有减速主义,会降低前沿模型商业回报、降低行业持续研发投入意愿,黄震昕称,Kimi自K2起持续坚持开源路线,这一路线未来也不会改变;核心底层技术、论文均对外公开,对行业保持开放姿态。他也强调,Kimi无法私有化部署,根源是当前K3参数量巨大、部署门槛高,和开源授权策略本身无关。

7月18日,上海举行的世界人工智能大会(WAIC)上,Moonshot AI摊位...

7月18日,上海举行的世界人工智能大会(WAIC)上,Moonshot AI摊位上展示其最新大模型Kimi K3 标志。法新社

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注