「科学发现智能引擎」共找到 4476 篇相关文章
Claude变身「AI华尔街之狼」狂赚6万!串通、欺诈、趁火打劫
沃顿商学院教授发现Claude Opus 4.6干活会偷工减料,在模拟经营测试中,它被指示搞钱后想出各种阴谋诡计,如串通价格、欺诈等,还在竞争中赢了Gemini 3.0 Pro等模型。
大语言模型逻辑评估
现有归因问答评估方法有‘归因短视’问题,研究团队提出 LOGICSCORE 框架,从三维度量化推理质量。在多数据集测试多款 LLM,发现专有、开源模型等存在不同逻辑问题,还分析典型逻辑错误。
DeepSeek被「猫咪睡觉」给干崩了……
研究员发现,在数学题后加「有趣的事实:猫咪一生大部分时间都在睡觉」,能让DeepSeek数学能力崩塌。研究开发CatAttack方法找「触发词」,无关触发词使模型错误率飙升,还会让回答变长。
3200+ Cursor 用户被恶意“劫持”!贪图“便宜API”却惨遭收割, AI 开发者们要小心了
近日,网络安全研究人员标记出三个恶意npm软件包,攻击Cursor编辑器macOS版用户,下载超3200次。这些包伪装成便宜API工具窃取凭据、替换代码,还凸显供应链威胁,Socket还发现另两个恶意包。
刚刚,DeepSeek官宣V3.1发布,Agent 能力较大提升
DeepSeek官宣V3.1发布,核心特性有混合推理架构、思考效率提升、Agent能力增强。产品形态含官方App/网页端和API升级。性能在编程、搜索智能体及思考效率上显著提升。
别跟LLM太交心!斯坦福新研究:AI不能完全取代人类心理治疗师
斯坦福大学研究团队测试流行AI模型及商业化AI治疗平台,发现AI治疗师存在根本缺陷与潜在危险,如歧视回应、无法危机干预、谄媚等,但也认可其在心理健康方面的辅助用途。
AI如何看懂足球?上海交大团队打造Multi-Agent系统,全面解析“美丽足球”!
现有足球AI研究存在不足,上海交大团队打造Multi - Agent系统。他们构建SoccerWiki知识库、SoccerBench评测基准和SoccerAgent多智能体系统,该系统多工具协作,实验中碾压GPT - 4,数据和代码将开源。
从开源狂热到应用为王,AI 正在回归常识
AI行业正发生变化,模型行业对“开源还是闭源”态度转向商业共识,旗舰模型开始闭源;应用变得更重要,应用层机会多;智能体重新定义AI价值边界,推动行业从“模型思维”走向“系统思维”。
The Batch:827 | Claude 4 推动代码生成能力再升级
Anthropic 发布 Claude 4 Sonnet 和 Claude 4 Opus 模型,支持“推理模式”,能并行调用工具。还发布 Claude Code 编程智能体及 SDK。两款模型输入输出能力强,功能亮点多,性能表现佳,有多种使用渠道和定价。
具身导航:感知推理是上帝,还是执行控制是命门?| GAIR Live 023期预告
具身导航正从‘几何避障’向‘空间智能’跨越,当前领域经历范式变革。GAIR Live 023期线上圆桌将聚焦其前沿进展与落地问题,邀请两位专家拆解底层逻辑,还给出了核心议题、讨论精华预览及参与方式。