基准测试平台」共找到 3282 篇相关文章

新闻资讯7

科学界爆发AI认知污染!1年狂投50篇论文,ICLR投稿20%AI生成

如今AI正污染科学界,出现幽灵引用、虚假数据和图片等问题。论文工厂用模板量产造假论文,审稿人用AI应对,作者还用密令操控AI审稿。预印本平台投稿量暴涨,可能沦为垃圾场,引发认知污染。

新智元
新闻资讯8

“商业的HTTP”来了:谷歌CEO劈柴官宣 UCP,Agent 直接“剁手”下单,将倒逼淘宝京东“拆家式重构”?

近日谷歌CEO官宣Universal Commerce Protocol(UCP),目标让Agent在线购物。它能拆解购物流程,与多协议协同。谷歌补数据底座,UCP集结众多伙伴,Agent加速落地交易场景,或使电商平台重构。

AI前线
新闻资讯7

沃顿教授警告:老板用AI正偷偷赚钱,而你还在审它做的17份PPT?

AI跨越关键门槛能完成有经济价值的工作,但也可能产生大量无用内容。OpenAI新测试显示大模型进步快,虽暂难取代人类工作,但智能体工作续航能力大增,人类对其使用方式决定未来。

新智元
算法论文8

微调重要表征以增强思维链的推理能力

团队提出关键表征微调(CRFT)方法,通过信息流分析识别和优化关键表征。在八个数学和常识推理基准及两个模型系列验证其有效性,能提高推理准确率,学习参数量低,还适应少样本场景。

深度学习自然语言处理
新闻资讯7

大模型能复刻这些系统吗?ProgramBench给出了残酷答案

斯坦福NLP组发布ProgramBench,用200个完整代码库重建任务测试主流大模型,要求模型仅根据可执行文件还原如SQLite等项目完整代码,结果所有模型实际解决率为0%,说明模型更擅模仿代码表面结构。

AI工程化
新闻资讯7

一场由中国公司引发的全球热议:AI服务是否该“对结果兜底”?|甲子光年

2025年末软件行业寒冬,百融云创提出“结果即服务”(RaaS)战略及Results Cloud平台,引发全球热议。其将AI定义为员工,转变了商业风险承担模式,但也面临治理、责任归属等问题。

甲子光年
推荐文章7

AI 编码效率 x10,Bug 风险也 x10

亚马逊工程师 Joe Mag 分享团队用 Coding Agent 使代码产出效率提 10 倍,但 Bug 风险也放大 10 倍。介绍‘Agentic Coding’工作流,还给出借助 AI 做‘风洞测试’、升级 CI/CD、升级决策和沟通系统等建议。

宝玉AI
新闻资讯8

又来了!OpenAI 发布 Sora 2,同时推出 AI 版Tiktok

9月30日,OpenAI发布新一代视频生成模型Sora 2,相比Sora 1有显著提升。同时推出iOS社交应用Sora,类似TikTok。应用有安全措施,已在美加iOS平台邀测。社区反应两极分化,OpenAI野心大但或面临挑战。

AI工程化
开源动态8

万帧?单卡!智源研究院开源轻量级超长视频理解模型Video-XL-2

长视频理解是多模态大模型关键能力,当前开源模型有短板。智源研究院联合发布 Video-XL-2,多维度优化长视频理解能力,还设计效率优化策略,在主流评测基准表现出色,有广泛应用潜力。

机器之心
新闻资讯7

Claude Opus 5被扒光了!1511行提示词底牌全摊开

Anthropic的Claude Opus 5上线当天,系统提示词被开发者Eversmile1传到GitHub。提示词含产品说明、法务合规手册、推销渠道内容。其记忆规则严格,版权引用限制多,商业推荐有不同策略。上线24小时能力被广泛测试

新智元