「论文分享会」共找到 3372 篇相关文章
能进化的Skill,才是好Skill~
2026年,我们追求“越干越好”的Agent。AutoSkill和XSKILL两篇论文指出,静态的Skill只是高级Prompt,能自我进化的Skill才是真正的数字资产,还介绍了两者的设计、优势及未来Skill的标准形态。
吴恩达来信:试试语音交互吧!
吴恩达认为基于语音、可对话的AI系统在发展,语音用户界面将普及。虽不会完全取代传统界面,但会带来新应用场景。还介绍了Vocal Bridge架构,且构建语音UI可能比想象容易。
Anthropic 新研究:AI出错是“热混乱”
Anthropic研究团队发现AI可能无一致目标,只是瞎搞。他们将AI错误分类,测试发现推理越久越混乱,大模型复杂任务易失控。此发现改变对AI风险的认知,论文已在arXiv发布。
AIME'25满分炸场!Qwen一波七连发,全家桶大更新
云栖大会上,通义团队成果丰硕。Qwen3-Max性能提升,数学评测满分,多测试成绩优异;Qwen3-VL、Qwen3-Omni等开源,各有亮点;Qwen3-Coder升级。吴泳铭称要发展超级人工智能。
吴恩达:AI编程加速开发也埋下大坑,软件测试空前重要
吴恩达认为AI编程虽加速开发,但Agentic编码系统不可靠,会引入漏洞、删除代码等。他给出核心解法,利用Agentic测试,优先测后端和底层架构,还明确测试优先级,前端低、后端高。
DeepSeek被「猫咪睡觉」给干崩了……
研究员发现,在数学题后加「有趣的事实:猫咪一生大部分时间都在睡觉」,能让DeepSeek数学能力崩塌。研究开发CatAttack方法找「触发词」,无关触发词使模型错误率飙升,还会让回答变长。
半壁江山都来了!龙虾Hermes爆火后首场智能体大会两天议程公布,下周杭州见
2026中国AI智能体大会7月2 - 3日在杭州开幕,由智猩猩主办。有开幕式、论坛、研讨会等,60 + 位嘉宾参与。设展览区,多家企业展示产品。议程已敲定,报名通道临近关闭。
前 DeepMind 研究员反思:评测,而非算力或数据,才是下一阶段的瓶颈
前 Google DeepMind 高级研究员 Lun Wang 在技术长文中指出,当前主流评测体系滞后,静态基准会“安静失效”。作者主张引入序参量,呼吁构建自演进评测,还为一线工程师提供了研发建议。
挖到 9 个 Claude Skills 宝藏开源项目,AI 能力直接拉满!
Claude Skills 热度高,作者梳理分享 9 个值得关注的开源项目。涵盖官方与生态合集、任务规划与技能探索、Agent 与工程化实践等类别,展示不同场景应用,助读者找适合项目。
最强AI编程工具Claude Code,五个使用Tips
作者认为Claude Code是最强AI编程工具,因Anthropic对其针对性强化训练且不计上下文消耗。国内介绍少因自媒体水平差。作者分享五个使用Tips,如/init初始化、Plan Mode规划等。