「探索机制」共找到 1533 篇相关文章
终于在国产AI上看到了Opus的影子|GLM-5深度实测
作者起初怀疑GLM - 5称对标Claude Opus 4.6、定位“系统架构师”的说法,但实测后改观。通过宝可梦策略助手、降噪网站沉浸式交互、求职招聘双边匹配三个测试,展现其系统规划、执行、纠错等能力,像真正架构师。
扩散语言模型深度思考
作者探讨扩散语言模型(dllm),认为其建模方式或冲击AR。团队在AAAI报告介绍多项工作,还整理当前diffusion问题及观点,如推理架构、词表、优化范式等,并附项目网站和agent demo。
智能体框架的选择:一文读懂9个主流AI智能体框架
文章深入探索截至2025年11月的9个主流AI智能体框架,阐述成熟AI框架核心要素,分析各框架优劣势、适用场景,助读者选适合团队和业务的框架。
NeurIPS 2025 Spotlight | 选择性知识蒸馏精准过滤:推测解码加速器AdaSPEC来了
大型语言模型推理延迟高、开销大,推测解码可加速但依赖草稿与主模型一致性。佐治亚理工等团队提出 AdaSPEC 蒸馏法,过滤难学 token,提升草稿模型与目标模型对齐度,实验显示能提升接受率和推理速度。
AI越会思考,越容易被骗?「思维链劫持」攻击成功率超过90%
独立研究者Jianli Zhao等人新研究发现,思维链劫持攻击通过在有害请求前填充无害解谜推理序列,能对推理模型实现越狱攻击。在HarmBench基准上,对多模型攻击成功率超90%,揭示思维链推理存在新安全漏洞。
“谈故障色变”到有章可循:美图 SRE 故障应急与复盘实践
在 InfoQ 举办的 QCon 全球软件开发大会上,美图高级运维经理石鹏分享美图 SRE 团队故障应急与复盘实践,探讨故障应急各环节,剖析故障本质与原因,还交流 AIOps、LLM Ops 等技术。
不靠英伟达,中科院在国产 GPU 上跑通 76B 类脑大模型
过去大模型依赖Transformer和NVIDIA GPU体系,硬件自主化难。中科院团队提出类脑大模型SpikingBrain,在超长文本处理上百倍加速,在国产MetaX GPU平台稳定训练76B模型,开辟新道路。
智能流体力学青年学者论坛第二十六、二十七讲 | 国防科技大学陈新海、北京航空航天大学张天汉
智能流体力学青年学者论坛第二十六、二十七讲分别由国防科技大学陈新海、北京航空航天大学张天汉开讲。陈新海介绍智能网格生成研究进展,搭建科学计算智能体平台;张天汉提出ChatCFD方法,提升CFD可及性。
刚刚,Anthropic 成立了个 AI精神病学团队,正在招人
Anthropic宣布成立「AI精神病学」团队,作为可解释性研究一部分,将研究模型人格、动机等致其行为异常的因素。团队现正招聘研究科学家,不过此举措也引发争议。
这款小众 AI 产品,真让我眼前一亮
AI笔记应用Granola获4300万美元融资,估值达2.5亿美元。它打破传统会议记录模式,发挥人和AI优势。其创始人分享创业和产品理念,探讨产品决策、用户反馈筛选等问题,还谈及旅行对直觉的影响及产品发展方向。