DeepSeek V4.1与Astra实测对比
在老手游反编译和代码修改测试中,DeepSeek V4.1 Flash展现了近300 tok/s的高推理速度,但在处理复杂任务时易陷入无效循环,反复穷举方案导致问题搁置或模块损坏。相比之下,Astra虽然速度较慢,但逻辑推理更稳,基本能在两轮内定位并解决问题。这表明国产大模型在复杂编程任务的深度推理和稳定性上仍有提升空间,速度优势尚无法完全弥补复杂场景下的短板。
在老手游反编译和代码修改测试中,DeepSeek V4.1 Flash展现了近300 tok/s的高推理速度,但在处理复杂任务时易陷入无效循环,反复穷举方案导致问题搁置或模块损坏。相比之下,Astra虽然速度较慢,但逻辑推理更稳,基本能在两轮内定位并解决问题。这表明国产大模型在复杂编程任务的深度推理和稳定性上仍有提升空间,速度优势尚无法完全弥补复杂场景下的短板。
近日,腾讯推出了新一代混元大模型(hy3)。社区开发者针对该模型进行了前端代码生成能力的实际测试,测试环境基于 Claude Code(Max 模式)并通过中转 API 进行。测试主要包含两个经典场景:一是 iOS 18 风格天气卡片,要求使用 HTML/CSS/JS 实现包含四种天气及动画效果的横版卡片,实测显示其视觉效果略显简陋,但基本功能完整;二是 3D 交互魔方,要求单 HTML 文件实现高性能 Web 交互,但实测发现该任务未达标,存在部分区域无法转动、打乱操作无动画等 Bug。整体而言,开发者认为混元3在复杂前端交互生成上与 GLM 等竞品相比仍有差距。目前该模型在中转平台提供两周免费体验,适合开发者自行测试评估。