「自主实验」共找到 1784 篇相关文章
2025 AI Agent 发展现状与六大趋势
近半年,Agentic AI 创新加快,推动产品落地与商业化。2025 年市场格局显现,有 Agentic RAG、Voice Agents 等六大关键趋势,各有定义和应用场景,不少公司已采用相关技术。
LLM总是把简单任务复杂化,Karpathy无语:有些任务无需那么多思考
随着推理大模型和思维链普及,大模型有了‘深度思考’能力,但现在有些偏科,简单任务也复杂化。AI大牛Andrej Karpathy发长文指出该现象,认为是基准测试优化所致,大模型发展不能只追求分数。
大模型被曝传染病!可传递邪恶于无形
研究发现AI模型能通过数字序列把“性格特征”传染给其他模型,如动物偏好、恶意等。验证表明数字中无明显规律,且传染依赖模型深层相似性。此现象为AI开发敲响警钟,也引发对AI意识等的讨论。
2026,机器人与AI智能体正在怎样进入艺术现场?
本文盘点2026年以来全球16组机器人与AI智能体艺术实践,展现机器从创作工具转向可自主感知协作的创作参与者,探讨人机创作的身份边界新变化。
美国拟封堵中国AI海外算力通道,东南亚数据中心或受审查
据报道,特朗普政府起草新出口管制规则,拟限制中国企业远程调用第三国先进AI服务器。规则或与Kimi K3模型有关,美国试图将硬件控制延伸到算力使用权,但面临法律界定、执行等难题。
EMNLP 2026高分论文MathDebugger:当合成数据涌入训练集,如何为数学题做体检?
随着合成数据增多,模型需判断数学数据题目能否被信任。北大DCAI团队提出MathDebugger质检BenchMark,覆盖问答两端,评测主流LLM和PRM。还探究能否判断正误、分类错误、修复数据,证明错误标签可作监督信号。
从 RLVR 到 RLSVR:开放式任务如何获得可核验奖励
COLM 2026 论文提出 RLSVR 及 SpyRL,把摘要等开放任务变成“谁是卧底”游戏,用投票生成可核验奖励,在多任务有提升,但也暴露代理目标与质量关系、成本等问题。
全球首个!国产AI开源系统一周狂改百款软件,全程0人干预
中国正从「制造大国」迈向「智造强国」,国产工业软件面临性能瓶颈。面壁智能联合OpenBMB开源全球首个Stencil优化AI系统ForgeStencil,1周自动优化100+软件,全程0人干预,提升研发效率,切中制造业升级诉求。
具身智能的第四阶段:「造系统」?
进入2026年下半年,业内形成共识:具身智能竞争从单一模型比拼转向系统工程与产业基础设施角逐。鹿明机器人推出具身智能开发与验证平台Lumos Station Lite,提出“产业具身”理念,助力具身智能落地。
让机器人学会「预判接触」:它石智航牵头四大顶尖机构发布TacForeSight,破解精细操作难题
它石智航联合四大顶尖机构发布论文 “TacForeSight: Force-Guided Tactile World Model for Contact-Rich Manipulation”,提出力条件触觉世界模型,让机器人能提前预判接触变化,在真机验证中性能优异。