打开APP
×
AI竞争跑出新变量?大湾区首家大模型初创公司,刷新全球dLLM融资纪录
科创板日报记者 杨小小
2026-10-09 星期五
原创
①DiffuSpace正在推进新一代更大参数规模扩散语言模型的训练,计划于今年10月正式发布并开源。
②扩散语言模型在海内外已经吸引了多家大厂和创业公司的共同参与。各家公布的成果,也在逐步呈现这条路线的优势与局限。
人工智能
关注

《科创板日报》10月9日讯(记者 杨小小)在大语言模型头部格局逐渐形成、并纷纷走向公开市场之际,大湾区跑出的首家大语言模型初创公司拿到了大额融资。

《科创板日报》记者独家获悉,成立于今年5月的扩散语言模型创业企业DiffuSpace,于近期完成了两轮融资,由经纬创投、顺为资本、君联资本联合领投,中科创星、华为哈勃、地平线等机构跟投。

接近公司人士向记者透露,两轮融资规模合计近5亿元,是目前扩散语言模型(dLLM)领域初创公司的最大融资纪录。

与目前主流的大语言模型不同,DiffuSpace选择的是扩散语言模型路线。前者采用的自回归路线按照先后顺序生成文本;后者则尝试在多个位置并行补全内容,通过迭代逐步修正。差异化的生成方式,让扩散语言模型在部分任务中表现出了更快的生成速度,以及处理多重约束的潜力。

需要说明的是,扩散模型已经在图像和视频生成中得到广泛应用,但在语言模型领域,它仍是一条处于追赶和探索阶段的路线。

这也正是DiffuSpace团队看到的机会点。团队成员龚珊三此前在采访中对《科创板日报》记者表示,在过往的算力和训练条件下,自回归是一条更简单直接的路线,也因此率先走通。“现在我们要去探索上限可能更高的路线。”

据悉,DiffuSpace正在推进新一代更大参数规模扩散语言模型的训练,计划于今年10月正式发布并开源。

港大团队从研究走向创业

DiffuSpace的核心成员大多来自香港大学。孔令鹏现为香港大学NLP实验室联合主管,此前曾在DeepMind从事研究。出生于1997年的龚珊三是香港大学计算机系博士,曾在Apple MLR、腾讯AI Lab、上海AI Lab等机构开展研究。负责公司的基础模型研发的叶佳成也同样为港大计算机博士。

在龚珊三的讲述中,DiffuSpace团队对扩散语言模型的研究,要早于这轮大模型创业热潮。从2022年的初步探索开始,团队陆续研究了如何根据给定条件生成文本、如何将扩散方法用于离散文本数据等问题,并逐步尝试扩大模型规模,验证扩散模型的通用语言能力。

Dream 7B模型的研发,则是这一过程中的重要节点。

据团队介绍,这一模型以Qwen2.5 7B权重初始化,再进行扩散训练。评测显示,这款70亿参数的模型在多项任务上取得了与同规模自回归模型可比的表现,在Countdown数字运算规划和数独任务的部分测试设置中,其表现甚至超过了6710亿参数的DeepSeek V3,后者的参数规模约为Dream 7B的96倍。Dream 7B开源模型于2025年推出,截至目前在Hugging Face上的累计下载量超过250万次。

扩散语言模型在上述任务的部分测试中展现出的优势,与其生成方式有关。扩散语言模型可以同时利用前后不同位置的信息,在生成过程中逐步补全和调整内容,因而更有利于处理需要兼顾多个条件、进行全局规划的任务。

与此同时,生成顺序的灵活性,也带来了提速的空间。对于相对独立的内容,模型可以在一次计算中生成多个token,减少逐个生成带来的等待。不过,速度与效果之间仍有取舍:减少迭代次数可以加快生成,也可能损失部分质量。“我们的目标就是把性能和速度的这个trade-off(取舍)走到最好。”龚珊三说。

这一特性为扩散语言模型率先打开了应用想象空间。对于需要反复调用模型的Agent,以及车载助手等实时交互产品,生成环节的提速可以缩短用户等待的时间。

相关的应用合作探索已经开始推进。今年9月,DiffuSpace已与端侧计算平台公司Acrab达成合作,Dream 7B完成了在其平台上的测试,双方即将发布扩散语言模型与新一代计算平台的适配。

大语言模型跑出新变量?

DiffuSpace之外,扩散语言模型在海内外已经吸引了多家大厂和创业公司的共同参与。各家公布的成果,也在逐步呈现这条路线的优势与局限。

生成速度是一个较早得到验证的方向。字节Seed团队于2025年发布的Seed Diffusion Preview,主要探索代码生成和编辑。技术报告显示,在英伟达H20上的相关代码测试中,模型生成速度达到每秒2146个token。

谷歌今年6月发布的DiffusionGemma,则进一步展示了部署条件对加速效果的影响。这款总参数量260亿的实验模型主要面向本地、低延迟交互。根据谷歌披露的信息,在独立GPU上的特定测试条件下,其可实现最高约四倍的生成加速,但整体输出质量仍低于标准Gemma 4。在高并发云服务中,加速收益可能缩小,也未必具有成本优势。

能否在提速的同时提高任务完成质量,是另一个需要回答的问题。蚂蚁将扩散语言模型推进到千亿参数规模,并进一步探索Agent应用。其发布的LLaDA2.2-flash支持128K上下文、多轮交互和工具调用,还引入了删除、插入机制,让模型能够在生成过程中调整内容。

根据蚂蚁团队公布的测试,该模型在列出的任务中,生成吞吐高于作为对照的Ling-2.6-flash,但任务得分各有高低,部分编程测试仍然落后,尚未形成全面优势。

创业公司则开始寻找具体业务中的使用机会。美国Inception披露,编程工具Augment Code接入其Mercury系列模型后,上下文压缩耗时由约150秒缩短至27秒。这一结果体现了扩散语言模型在Agent部分工作环节中的价值。

Inception也获得了产业资本的支持。2025年11月,公司宣布完成5000万美元种子轮融资,由Menlo Ventures领投,英伟达旗下NVentures、微软旗下M12等机构参投。

从阶段性进展来看,包括OpenAI、DeepSeek等厂商采用的自回归路线,无疑率先拿到了“大结果”,更早实现了模型能力和大规模应用上的突破。龚珊三对记者表示,这与早期的算力和训练条件有关:按照从左到右的顺序学习和生成,给模型设定了一条明确的路径,也更容易在有限资源下先取得效果。

她进一步表示,扩散语言模型现在也已经走到了可以进一步扩大规模的阶段,判断的依据则来自于Dream 7B在多项任务中跑出的与同规模自回归模型相近的表现。这也是DiffuSpace成立的直接原因,以公司的形式获取更多资源,支持下一阶段的模型训练。

从这轮融资获得的市场反馈来看,更高智能上限的持续探索仍然受到各方关注。DiffuSpace团队告诉《科创板日报》记者,公司成立以来,团队一天要接待十位来访者,其中既有投资人,也有关注模型应用的产业方和其他各产业链环节的从业者。

对于自回归和扩散路线的未来,龚珊三认为,未来行业可能会出现融合的趋势,即自回归与扩散方法在模型的训练或推理中结合使用。而从长远来看,她对扩散路线的发展有着更积极的预期:扩散语言模型的生成顺序更加灵活,这种灵活性意味着它未来有可能替代自回归模型。

这一预期无疑仍需要更多研究结果支撑。但可以看到,当前,随着扩散语言模型从技术研究走向规模化训练,其在通用能力、推理效率及部署成本等方面的潜力,在行业内外受到的关注也越来越多。模型规模的持续扩大,也将为验证这一路线的能力边界提供更多机会。

模型的探索还在向硬件延展。龚珊三对《科创板日报》记者表示,模型算法与硬件之间可以进行联合设计开发,也就是说,芯片可以针对扩散模型的计算特点进行优化,模型也可以结合硬件条件改进。对于算力产业链而言,不同生成方式带来的计算需求差异,也为软硬件适配提供了新的探索方向。

特别声明:文章内容仅供参考,不构成投资建议。投资者据此操作风险自担。
相关企业家
联系Ta
联系企业家
为保护双方个人信息请联系您的专属助理进行接洽
我再想想
点击复制
复制成功,请去微信添加