预训练研究」共找到 3695 篇相关文章

算法论文8

用Diffusion构建「AI虚拟细胞」,14项指标霸榜!Mila唐建团队破解单细胞「破坏性」测序难题

Mila唐建团队发表PerturbDiff,跳出前人认知盲区,将“细胞群体的概率分布”视为随机变量。它引入数学工具建模,让MMD内生于体系,在多项基准测试霸榜,还提供应对数据稀缺的思路。

量子位
算法论文8

微软:DeepSeek-R1等推理模型循环的原因找到了

前几天,DeepSeek - R1论文更新,披露诸多细节。重点是推理模型在低温/贪心解码下易循环,根源是学得不对,如风险规避式复读、时序相关错误复读,还给出解决方案。

PaperAgent
推荐文章7

AI是「天才」还是「话术大师」?Anthropic颠覆性实验,终揭答案!

Anthropic新研究证实Claude模型有一定内省意识,能控制自身内部状态。用「概念注入」实验,Claude Opus 4和4.1表现最佳。不过该能力不可靠、局限大,未来进化情况待察。

新智元
算法论文8

NeurIPS 2025|VFMTok: Visual Foundation Models驱动的Tokenizer时代来临

传统视觉 Tokenizer 存在缺乏高层语义信息、冗余度高、表征混乱等问题。香港大学 CVMI Lab 和阶跃星辰 AIGC 团队提出 VFMTok,用训练视觉基础模型构造视觉 Tokenizer,实验显示其性能优异。

机器之心
算法论文7

AI人格分裂实锤!30万道送命题,撕开OpenAI、谷歌「遮羞布」

Anthropic联合Thinking Machines研究,用30万个场景和压力测试拷问OpenAI、谷歌等前沿大模型。发现模型规范有矛盾漏洞,不同模型价值优先模式不同,如Claude重道德,Gemini重情感等。

新智元
算法论文8

谢赛宁团队用RAE实现从8%到84%的飞跃,宣告VAE时代结束

谢赛宁团队用RAE新架构将ImageNet图像生成FID刷到1.13,宣告VAE组件过时。RAE结合先进表征学习成果与强大生成模型框架,解决诸多问题,还为其高维潜空间定制DiTDH架构,性能优异。

AIGC开放社区
推荐文章7

普通程序员怎样转到AI方向拿到更好的offer

在AI研究员拿天价offer的当下,探讨普通程序员转AI方向拿更好offer的方法,还介绍了AI生态的五个层次,包括各层岗位、年薪及容量。

王喆的机器学习笔记
开源动态7

DeepSeek 新模型 R1-0528 悄悄开源,与o3 相当,实测来了。

DeepSeek团队悄无声息地在Hugging Face上开源推理模型新升级版DeepSeek R1-0528,基于DeepSeek-V3-0324模型,架构和训练方法有改进,性能与o3相当,实测表现不错。

AI进修生
产品应用8

Token烧不起了?比肩Claude Opus 4.6免费模型来了,还将开源

昆仑万维旗下天工AI发布SkyClaw - v1.0,为Agent场景深度优化,免费试用后将开源,价格低。性能超同级别开源对手,逼近闭源巨头。训练围绕环境构建、数据合成、强化学习展开,适合长链路Agent工作流。

AIGC开放社区
8

我用MiniMax Agent开发了个带后端的全栈网站,全程0代码

2025年Agent成AI领域焦点,大厂纷纷布局。作者测试MiniMax Agent,发现其有四大特点:深度研究和上下文管理强,多模态输出出色,编程能力超期,能执行定时任务,还能开发带后端的全栈网站。

花叔