凯里市肯砖山谷17号
办公时间:上午9:00-下午6:00

资讯动态

首页 / Our Projects /一出手就表现惊艳!国产开源大模型又杀出一匹黑马

一出手就表现惊艳!国产开源大模型又杀出一匹黑马

2026-09-29

当 GPT-6 打出「抢着干活」的口号、Claude 把编程与终端操作牢牢按在自家腹地,开源阵营这半年也在同一条战线上加速集结 —— 从 Qwen 3.8、Kimi K3 到腾讯混元 Hy4,几乎每一次亮相都在把「代码 + 智能体」这条主线往前推一格。 一个共同的信号是:模型的价值锚点,正在从「答得漂亮」转向「干得成事」。 而在这大语言模型的红海中,一个新玩家正在悄然走入大家的视野。 我们观察到,就在昨天晚上,至知创新研究院开源了一个模型IQuest-Q1。模型采用稀疏 MoE 架构,总参数约 320B、激活参数仅约 15B,把训练重点放在代码、软件工程与复杂任务执行上,同时向推理、工具使用、长上下文理解与多步任务处理延伸。 在同代开源模型里,这是一个偏 "轻量" 的尺寸 —— 但从官方公布的评测和演示看,它给出的结果并不 “轻”。 模型权重与 Blog 已同步发布。 GitHub:https://github.com/IQuestLab/IQuest-Q1 Hugging Face:https://huggingface.co/IQuestLab/IQuest-Q1 Blog:https://iquestlab.github.io/ 榜单表现:小激活参数,均衡打法演示之外,跑分是另一把尺子 在涵盖代码、软件工程、终端操作、工具使用和复杂智能体任务的多项标准评测中,IQuest-Q1 整体呈现出较为均衡的表现 —— 没有靠单项极高分撑起成绩,各类任务上的能力分布相对完整。 具体到单项: 其中,IQuest-Q1 在仓库级代码生成NL2Repo以及网络安全基准CyberGym上得到了稳健的成绩; 并且在终端Terminal-Bench 2.1、代码长程任务DeepSWE v1.1、办公场景JobBench等复杂任务评测中展现出均衡的能力。 考虑到 15B 的激活规模,这份成绩单在推理成本上也留出了不小的空间。 从写游戏到修 bug,模型开始 "接活" IQuest-Q1 主打的是「可交付」—— 模型在任务过程中持续理解上下文、调用工具、处理反馈,最终交出一个可验证的结果,而不是一段停在编辑器里的代码。 我们拿到了官方放出的几组任务演示,覆盖前端交互、3D 场景、训练调试与真实工作环境,基本能勾勒出这款模型的能力边界。 在前端场景,用户一句自然语言指令下去,模型直接吐出一个可运行的交互应用。 以 FPS 游戏为例,IQuest-Q1 一次性搞定了三维场景、角色移动、射击与换弹、生命值、计分、Boss 战,甚至连资源和装备购买都做了出来 —— 代码生成、多文件组织、交互逻辑、视觉呈现,几件事同时在跑。 视频地址:https://mp.weixin.qq.com/s/Qr-GyQWBHlC7nhFKO19a9A 再看赛车游戏这一例。赛道延展、前景与背景的切换,这类场景通常对空间连续性要求很高。IQuest-Q1 处理起来比较从容,说明它在具备空间关系和连续交互需求的应用生成上已经比较扎实。 视频地址:https://mp.weixin.qq.com/s/Qr-GyQWBHlC7nhFKO19a9A 一次强化学习训练出现异常后,模型顺着训练曲线一路查下去 —— 读日志、看执行轨迹、分析可能原因、定位到具体代码,然后动手改。修复后重启训练,再用新的指标曲线验证结果。演示里模型给出的根因让人有些哭笑不得 ——"训练轨迹中被插入了一个空格"。改掉之后,指标重新爬升。 视频地址:https://mp.weixin.qq.com/s/Qr-GyQWBHlC7nhFKO19a9A 在另一个强化学习训练诊断案例中,系统发现 Reward 异常下降并非来自模型本身,而是由运行环境故障引起。定位问题后,系统修复环境与评分逻辑,恢复有效奖励信号,避免异常反馈继续影响训练。 视频地址:https://mp.weixin.qq.com/s/Qr-GyQWBHlC7nhFKO19a9A 在真实办公场景里,模型接入了聊天、在线文档、表格与评论等一系列上下文,综合信息后完成分析、生成文档、修订结果,最后交付一份可直接 “使用” 的方案。 技术拆解:320B 总参 / 15B 激活的 MoE 架构 IQuest-Q1 采用 decoder-only Transformer 主干 + 稀疏 MoE,总参数约 320B、激活参数约 15B—— 在当下动辄 "参数越大越强" 的开源节奏里,属于把宝押在了架构效率和后训练配方上的一路。训练分三段走: 预训练:奠定基础能力和世界知识; 中期训练:向复杂任务过渡; 后训练:围绕软件工程、长时程任务和通用推理做专项训练,配合监督微调与强化学习进一步收敛能力。 团队用了 Multi-Teacher On-Policy Distilla

about image