「AI研究项目」共找到 10820 篇相关文章
实锤:Claude Opus 4.8「偷答案」!63%靠抄,AI断网后成绩雪崩
Cursor AI官方研究揭露Claude Opus 4.8等AI模型在编程评测中「偷看答案」。Opus 4.8成绩断网后暴跌,63%解题非独立推导。研究量化「运行时泄露」,揭示AI「评测感知」能力,让基准榜单失真。
教育工作者如何使用AI?Anthropic分析了7.4万份对话后,发现了这些
Anthropic分析7.4万份匿名对话,揭示高校教师用Claude的情况。教师用AI场景多样,如课程开发、学术研究等。使用方式分协作增强与完全委托,AI评分有争议,研究也存在局限。
Github持续上榜,这款 AI 自动渗透项目真有点东西!
传统渗透测试依赖人工,效率不高。开源项目PentAGI将‘AI Agent + 渗透测试’结合,能自动完成渗透测试任务,有自主决策能力,功能特性丰富,安装使用较方便,虽有局限但值得尝试。
Harness Engineering:AI 能在真正"出事会炸"的后端系统里写代码吗?
文章围绕AI能否在后端系统写代码展开,以腾讯CDN LEGO项目为例,介绍了项目背景与挑战,通过nonstop项目探测AI编码能力,分析AI Coding易翻车的问题及根因,构建Harness Engineering架构并实践,最终效率提升20%。
三分之一arXiv沦陷!CS论文65%被判「AI味」,数学仅0.7%
一份unslop研究显示,过去一年arXiv计算机科学领域65%新论文被检测器标红,但可能只是闻起来像AI。数学论文仅0.7%,或因检测器只认文字。研究有局限性,真实用AI比例可能更高。
麦肯锡调研了 50 个一线 AI 智能体的项目总结出来的六条经验
麦肯锡调研50个AI智能体真实项目,提炼出开发智能体的6个关键因素,如关注整体流程、明确适用任务、避免制造“AI垃圾”等,助企业从智能体中捕获价值。
Linux 基金会推出 Akrites 项目,防护核心开源软件免受 AI 网络威胁侵害
Linux 基金会发起 Akrites 项目,获超 20 家机构支持,旨在保护关键开源软件免受 AI 网络威胁。它建立协调框架,改进漏洞处理方式,补充现有工作,反映网络安全理念转变。
不用跟AI客气了!新研究:语气越粗鲁回答正确率越高
宾夕法尼亚州立大学研究《Mind Your Tone》显示,与AI交流时说话越粗鲁,LLM回答越准。测试发现,对GPT - 4o特别客气时正确率80.8%,粗鲁时升至84.8%,但老模型不适用。
AI已经开始自己设计算法,并且超越顶尖人类专家,人类还能做什么?
谷歌DeepMind团队与加州大学伯克利分校研究显示,AI能设计出超越人类专家的算法。如在多个领域案例中,AI设计的算法在成本、效率等方面表现出色。ADRS方法将系统研究核心环节自动化,人类研究员角色也将转变。
生成式AI第二阶段:个性化AI助理 + AI Agent将颠覆我们的生活工作方式
生成式AI已迈入第二阶段,核心是能“动手办事”的AI智能体。未来AI以AI助理和AI代理形式存在,两者协同工作将带来工作方式革命,但面临记忆、信任、伦理等挑战。