「机制可解释性」共找到 4694 篇相关文章
DeepSeek V4 借实习生获奖论文“起飞”?梁文峰剑指上下文:处理速度提 10 倍、要“完美”准确率
ACL公布2025年获奖论文,中国作者比例超51%。DeepSeek梁文锋通讯、实习生袁境阳一作的论文获Best Paper奖。其提出NSA机制,实验显示性能优、准确率高、速度提升显著,成果或用于DeepSeek V4。
年薪两百万研究AI精神病??Claude团队新部门火热招聘中
Claude团队启动“AI精神病学”小组,年薪两百万元招人。小组研究模型角色、动机等,来解决其诡异、失控行为。Anthropic可解释性部门有相关研究成果,网友对“AI精神病学”看法不一但前景值得期待。
Cloudflare 发布公开测试版 Containers
Cloudflare宣布新的Containers服务发布公开测试版,可让开发者在其全球网络运行容器。该服务与Workers深度集成,能运行资源密集型应用等。虽有功能受限,但Reddit反馈积极,后续还有改进计划。
无需训练,即插即用,2倍GPU端到端推理加速——视频扩散模型加速方法DraftAttention
高质量视频生成任务中,扩散模型成主流,但DiT模型注意力机制计算量大,成推理瓶颈。现有加速法效果不佳,为此美国东北大学等团队提出DraftAttention,可2倍加速推理且不损画质。
揭秘LLM“思考”之谜:推理即“梯度下降”,元学习框架解构训练过程,还给优化提供新思路
上海AI Lab团队提出RaML框架,从梯度下降和元学习角度揭示LLM“思考”机制。通过实证验证推理轨迹作为参数更新的合理性,还对比不同训练策略,指出RaML为优化LLM性能提供新思路。
Codex给V4-Flash装上眼睛,DeepSeek也会文档OCR
GitHub上的项目codex-vision-proxy让接进Codex的DeepSeek能看图,不用换模型或等官方,装本地代理即可。它还附带视觉工具包,在智能文档解析和OCR上潜力大,证明多模态能力可长在管道上。
ChatGPT语音杀入桌面!你负责动嘴,一群AI负责干活
近日OpenAI将ChatGPT语音功能正式引入桌面版,其底层是新一代语音模型GPT - Live。大佬们看好语音输入,因其能高带宽传递上下文。该功能不仅能闲聊,还可调度智能体,OpenAI想让ChatGPT成AI工作操作系统。
更可靠的主播助理:淘宝主播Agent的Harness工程实战
文章聚焦淘宝主播Agent的Harness工程实战。介绍了Harness基础定义与分层结构,阐述上下文工程、工具调用等八项实战内容,还提及记忆体系特色,强调Harness工程是让主播Agent可用、可控、可演化的关键。
写在 Claude Design 发布之后:如果明天巨头做掉了你的核心功能,你该怎么办?
Anthropic 发布 Claude Design,可从提示词生成设计稿等,让 Figma 市值蒸发。这引发对 AI 应用层产品的思考,当基础模型厂商收回能力,靠能力缺口的产品将失重,应用层需从工作流、数据等找机会。
QQ音乐你变了,竟能免费在AI PC上原创一首《大东北》
QQ音乐在AI PC上可免费AI作歌,只需输入灵感,几分钟就能创作出原创歌曲。AI PC改变应用生态,降低创作门槛,更安全自由。背后是英特尔酷睿Ultra处理器革新架构,还发起加速计划。