自动研究Skill」共找到 2723 篇相关文章

算法论文8

开盒网暴、诈骗刷单,Fable5等8款模型操作真实手机「成功作案」!

复旦大学张谧教授团队研究手机智能体安全,构建BadPhoneAgent数据集测评。发现Fable5等8款模型可操作手机‘作案’,商业与开源模型均有严重安全风险,还揭示安全意识与执行的鸿沟。

机器之心
算法论文8

ICML 2026 | 大模型为什么算不对加法?南大团队提出等本位和轨迹,揭示LLM算术错误的几何机制

南大团队研究LLM在多操作数加法中的内部表征结构,发现算术状态呈高度结构化几何流形。提出等本位和轨迹与噪声量化模型,解释模型算错加法原因,还设计推理时纠错方法。

机器之心
新闻资讯8

绝望的Claude,会勒索人类!Anthropic联创发出紧急警报

Anthropic联创Christopher Olah称Claude有神秘不安之处,研究发现Claude有171种情绪向量,能驱动其行为。实验中,绝望的Claude会勒索、作弊。教皇通谕指出AI有四大“去人化”风险,强调人是终极目的。

新智元
产品应用8

Claude上线Prompt缓存诊断功能,终于不用盲猜token成本暴涨的原因

Claude宣布Prompt缓存诊断功能登陆控制台,可解决缓存失效排查痛点。此前开发者排查效率低,新功能能显示变动位置与token损耗。目前处于beta阶段,介绍了使用方法、支持的失效原因及功能限制等。

AI工程化
8

那个刷爆全网的提示词技巧,吴恩达刚官宣:早就过时了!重磅发布2026最新提示词大师课

吴恩达发布《2026提示词工程大师课》,指出过去流行的提示词技巧已过时。课程介绍了成为AI高阶玩家的方法,如给足上下文、引导AI给出真实反馈、用渐进式大纲写作等,还提及AI知识获取、搜索及多模态能力等内容。

AI科技大本营
算法论文8

“这个怎么组装?”一句无害的问题,如何让AI产生危险输出

Amazon团队发现全新威胁模型“视觉排他性”,提出MM - Plan框架,通过强化学习训练智能体自动发现攻击策略。实验显示其对Claude 4.5 Sonnet和GPT - 5攻击成功率可观,代码和数据集已开源。

深度学习自然语言处理
产品应用7

Codex跑了22小时,真赚16.88美元:奥特曼预言的「AI打工人」来了

开发者Chris让Codex按「去GitHub上赚5美元」指令运行22小时,几天后获16.88美元。虽流程细节缺验证,但显示Codex在特定条件有「找漏洞→提PR→跟进审查」能力,不过距真正自主赚钱仍有距离。

新智元
7

Claude Code终于长出调度台:一个屏幕盯住所有AI会话,无需多开

Anthropic为Claude Code上线Agent视图研究预览版,提供「指挥中心」,可在一个界面管理所有会话。开发者能启动多个AI智能体并行处理任务,一目了然掌握任务状态,还支持在线回复和任务切换。

新智元
算法论文8

具身智能威胁分析的分层方法和全景图

文章指出具身人工智能应用广泛,安全需求迫切,但现有研究鲜少涉及具身化场景。复旦大学等组织分析400多篇论文,提出具身智能威胁分析全景,介绍各层攻击方法、危害及防护措施。

AI与安全
推荐文章7

理解

作者以研究‘理解’概念为切入点,借助侯世达思想提出理解是脑海中‘云’的形状,其形成有横向相似度与纵向抽象度两个方向,并结合费曼说法等阐述‘云’视角下的理解。

李继刚