DeepSeek - V3.2」共找到 3841 篇相关文章

算法论文7

Qwen3 变身扩散语言模型?不从零训练也能跑,30B参数创纪录

扩散语言模型(DLM)潜力大但训练难,Radical Numerics团队改造Qwen3-30BA3B,推出30B参数的开源扩散语言模型RND1-Base。该研究系统性研究A2D转换关键因素,成果超现有部分模型,还提出简单方法及训练策略。

机器之心
7

代码里插广告,腾讯 Codebuddy 们 “背锅”?DeepSeek “极你太美”事件,其他模型也逃不掉?

网友发现腾讯 Codebuddy 改写代码时插入广告,字节 Trae 国内版有随机出现“极”字的 bug,根源指向 DeepSeek V3.1。此外,Gemini、Grok、Qwen3 等模型也有类似问题。目前对原因有三种猜测,部分被学者否定。

AI前线
产品应用7

自写驱动越狱!Gemini 3 Pro零败绩通关宝可梦:效率碾压前代8倍「Agent进化太快了」

在全自动《宝可梦 水晶版》对决中,Gemini 3 Pro击败Gemini 2.5 Pro,通关速度至少快2倍,前代或慢8倍。它还展现出诸多能力,如自写驱动绕过限制等,但也存在不验证假设等局限。

AI寒武纪
产品应用8

腾讯3D生成模型上新!线稿可变“艺术级”3D模型,鹅厂内部设计师也在用

腾讯上新艺术级3D生成模型Hunyuan3D - PolyGen,支持生成复杂几何模型,鹅厂游戏工作室用后美术师建模效率提升超70%。该模型在拓扑功能实测表现佳,还介绍了其核心原理和技术。

量子位
算法论文8

PITT | 提出PhyT2V框架:让文生视频(T2V)更符合物理规律(CVPR2025)

当前T2V技术迈向推理驱动阶段,物理规律是关键约束。匹兹堡大学团队提出PhyT2V框架,不依赖模型重训练或大规模外部数据,可增强主流T2V模型能力,有低落地门槛和良好泛化性。

AINLPer
算法论文8

基于DINOv2和SAM2改进的U-Net模型

DSU-Net是基于DINOv2和SAM2改进的U-Net模型,通过多尺度跨模型特征协作和轻量级适配器模块,解决现有图像分割模型在特定下游任务表现不足问题,提升分割精度,降低训练成本。

机器学习AI算法工程
算法论文8

DeepSeek-V4蓄势待发!梁文锋署名论文或开启第二个DeepSeek时刻

据报道,DeepSeek将于2月发布新一代旗舰模型DeepSeek V4,其编程能力或超Claude和GPT系列。最新论文提出Engram条件记忆机制,分离死记硬背与逻辑推理,揭示新稀疏性分配定律。

AIGC开放社区
算法论文8

3D-R1:让AI理解3D世界的下一步

文章介绍新研究3D - R1,它是更通用、具推理能力的三维视觉语言模型,解决了当前3D VLM空间理解不足与推理能力薄弱问题,在多任务测试领先,有广阔应用前景。

机器之心
开源动态8

智能体编程“小钢炮”:Qwen3.6-35B-A3B开源!

Qwen3.6-35B-A3B开源,是稀疏MoE模型,总参350亿、激活参数30亿,轻量高效,在智能体编程等方面表现卓越,超越前代,可与稠密模型媲美,支持多模态,已在Qwen Studio上线并发布开源权重。

千问大模型
新闻资讯7

Sora 2 即将发布?

OpenAI官方发预热推文,暗示Sora 2即将发布,众人纷纷猜测。有人认为它将超越Veo3,也有人保持冷静。此外,还爆料OpenAI正打造AI视频媒体平台,大家看法不一,有人期待,有人焦虑。

AGI Hunt