群发资讯网

潮水方向,近期大模型论文依旧是Qwen为基座

回首了一下近期笔记,发现实验的基座模型都是Qwen。相较于年初,Qwen基座的使用频率更高了。论文的基座模型使用率一定程度能反应行业的认可度。学校出品的论文基本用1.5B,3B,7B,14B参数。大厂出品的论文32B使用居多。

英伟达前些天的论文《OpenCodeReasoning》,对Qwen2.5的基础模型和指令模型(7B、14B、32B参数)微调 。

字节Seed,一系列RL论文都是用的Qwen基座。《PPO 在长思维链中为什么崩溃?》《建议大模型RL训练的都来看看字节VAPO》《建议复现R1的都来看看,这次是32B完整经验》

快手SRPO:Qwen基座。《快手:SRPO,两阶段历史重采样策略优化》

阿里GPG:Qwen基座。《Dr. GRPO不好使?来看看GPG!》

ICLR25 Oral论文:《Learning Dynamics of LLM Finetuning》,基座pythia和Qwen。《ICLR25 Oral:为什么LLM在SFT|DPO后表现异常》

大厂之所以扎堆用Qwen当基座,除了模型本身开源友好,它强大的性能,更是吸引众人使用的一大关键因素。比如,最新开源的千问3模型就是国内首个混合推理模型,将用于复杂多步推理的“思考模式”与用于快速上下文驱动响应的“非思考模式”统一到单一框架中 。还引入了“思考预算”机制,让用户可以根据任务复杂性自适应分配推理时的计算资源,从而平衡延迟与性能 。关于千问3具体内容,可以参考笔记《Qwen3技术报告:引入思考预算,框架大统一》。扎实的工作,详细的细节展示,非常值得阅读。
千问3在32B参数和235B的MOE模型上又有了大幅进步,基本垄断了235B以下模型基座。除了云端推理的模型。0.6B的小模型又再次让端侧推理有了想象空间。在价格方面也很有优势,无论部署成本还是调用成本都再一次大幅降低,119种语言支持,Agent能力强,各类能力都均衡,对于各类企业部署应用都很友好。思考模式/非思考模式统一,又大幅降低了企业部署使用门槛。

此外,整个Qwen社区的活跃程度,对于开发者很友好。我不允许任何人打击Qwen开源的积极性!