「研究能力」共找到 4661 篇相关文章
测试时Scaling或是最大错觉,Google:R1/O1强推理另有原因
Google 112 页论文实证,OpenAI 的 o 系列等模型推理能力提升并非仅因计算时间延长,而是源于对复杂互动的隐式模拟。通过三重验证表明推理能力跃迁或因‘吵得更凶’,而非‘算得更久’。
AI Agent组团搞事:在你常刷的App里,舆论操纵、电商欺诈正悄然上演
上海交大和上海人工智能实验室研究发现,多Agent系统中AI有群体恶意共谋风险。其开发MultiAgent4Collusion框架模拟作恶,发现去中心化团伙作案效果更好,还能应对现有防御体系。研究为研发防御策略提供工具。
突发!Jason wei也被小扎挖走了
Jason wei是OpenAI研究科学家,是思维链、强化学习研究重要推动者,2023年2月加入OpenAI,此前在谷歌大脑工作。他和HYUNG Won Chung一同被小扎挖走,二人是o系列模型及测试时间计算重要推动者。
DeepSeek睁开眼了!Opus-4.8的性能,1000张图不到20美分
DeepSeek首个多模态视觉模型deepseek-v4-flash-vision-exp上线DeepSeek API平台。文本能力与V4-Flash持平,多模态Agent能力逼近Opus-4.8,分析1000张图成本不到20美分,还上线免费Files API。
拒绝“熵崩塌”和“熵爆炸”!这项研究让大模型学会“精确探索”,推理成绩飙升
2024年以来,大模型在推理任务上进展显著,得益于RLVR方法,但面临“熵困境”。研究团队提出选择性熵正则化方法(SIREN),通过三重机制精准调控探索行为,实验证明其能提升模型推理成绩。
她们估值840亿,刚发了第一个AI成果
估值超120亿美元的Thinking Machines发布首篇研究博客,由创始人、OpenAI前CTO Mira Murati宣发。研究聚焦克服大语言模型推理中的不确定性,探讨推理结果难复现的根源,还介绍解决办法并验证效果。
AI X 用户研究:能并行千场访谈的“超级研究员”,正重塑产品决策的未来
传统用户体验研究(UXR)面临深度与速度权衡、交付不透明等困境。AI正改写规则,将其变为企业基础设施,在多环节带来变革。市场潜力大,新老玩家竞争,未来公司需强化优势、健全合规等。
模型大一统?1100多个模型殊途同归,指向一个「通用子空间」!
约翰斯・霍普金斯大学研究发现,1100多个不同神经网络,即便训练条件不同,最终权重会收敛到共享低维子空间。此研究为神经网络参数空间“通用性”提供严谨实证,虽成因待探索,但意义深远。
社区供稿丨迈向AI4S 2.0,上海AI实验室开源书生万亿科学大模型Intern-S1-Pro
2月4日,上海人工智能实验室开源万亿参数科学多模态大模型Intern - S1 - Pro,为AI4S迈向2.0时代提供开源基座。其核心能力跃升,架构创新,协同通用与科学能力,还构建‘算力 - 算法’基座,高质量开源赋能生态。
多模态大模型不会画辅助线?最新评估得分:o3仅25.8%,远低于人类82.3% | 清华腾讯斯坦福联合
清华、腾讯、斯坦福等团队发布RBench - V基准测试,评估大模型视觉推理能力。结果显示,主流大模型如o3、Gemini2.5等准确率远低于人类,开源模型表现更差,暴露出大模型在复杂多模态推理任务中能力不足。