指令遵循率」共找到 612 篇相关文章

新闻资讯7

首个语音智能体端到端测评出炉:Grok登顶,真实场景通过仅一半

Artificial Analysis推出业内首个语音转语音智能体端到端性能基准τ - Voice,测试真实客服场景能力。结果显示最强S2S模型成功刚过一半,Grok Voice Think Fast 1.0夺冠,但也面临诸多质疑。

AI工程化
新闻资讯7

Morgan Stanley:中国 GPU的产能、良、价格及收入

这是Morgan Stanley对中国GPU自给自足程度研报的部分内容,列出华为昇腾系列GPU 2024 - 2027年产能等情况。估算2024年中国AI GPU自给34%,2027年将提至82%,还分析了半导体自给提升原因及各领域国产化进程。

芯师爷
开源动态7

AI 智能体界的 npm 来了!Vercel 推出 Skills.sh,欲统一智能体指令

Vercel 发布开源项目 Skills.sh,为 AI 智能体打造“标准动作库”,让其通过命令行执行可复用操作。它是开放生态,开发者能定义、分享指令。项目获广泛关注,社区认为其实用性强。

InfoQ
新闻资讯7

用隐藏指令诱导AI给论文打高分,谢赛宁合著论文被点名:认错,绝不鼓励

最近,一些简单提示词在AI学术圈掀起风波,操作者将其隐秘嵌入论文诱导AI给高分。谢赛宁合著论文也涉此事,他紧急回应,承认过失,解释缘由并采取补救措施,还呼吁探讨AI时代科研伦理。

机器之心
算法论文8

北大卢宗青团队新作:超 70% 实机成功,支持语言指令的功能性抓取系统

现有抓取研究多在稳定性层面,而功能性抓取更接近真实世界的智能。北大卢宗青团队提出DemoFunGrasp方法,对功能性抓取重新建模,在仿真与真实场景均超70%成功,还引入视觉语言模型让机器人理解语言指令

AI科技评论
开源动态8

腾讯混元开源AI绘画新框架:24维度对齐人类意图,让AI读懂复杂指令

腾讯混元团队开源PromptEnhancer框架,通过“思维链提示重写”提升AI绘画文本 - 图像对齐精度,复杂场景准确提升17%以上。还开源高质量基准测试数据集,为研究提供支撑。

量子位
产品应用8

Strix AI驱动的漏洞动态验证能力分析

传统SAST工具只能发现‘可能有问题的代码’,无法确认漏洞是否可被利用,导致高误报。Strix采用‘静态分析 + 动态验证’的混合模式,先定位可疑点,再对漏洞进行真实攻击验证,显著降低误报

AI与安全
新闻资讯7

深度揭秘OpenAI如何让GPT-5「技术性」超越Claude:悄悄跳过最难的23道题

OpenAI发布会上称GPT-5代码能力全球第一,其在SWE-bench Verified基准获74.9%通过,略高于Claude Opus 4.1的74.5%。但OpenAI未做23道难题,若计入,GPT-5实际通过或低于Claude。

新智元
产品应用7

真·博士水平!GPT-5首次给出第四矩定理显式收敛,数学教授只点拨了一下

在数学教授引导下,GPT - 5首次将定性的第四矩定理扩展为带有显式收敛的定量形式,明确了收敛速。研究人员还引导其将结果推广到泊松情形,作者起初想将其列为论文共同作者但被 arXiv 政策禁止。

量子位
算法论文8

AI修Bug新SOTA:SWE-Bench Lite60.33%修复,像人一样能积累经验,中科院软件所出品

ExpeRepair是中科院软件所团队推出的仓库级缺陷修复系统,模拟人类认知的情景和语义两种记忆模式,能积累经验。在SWE - Bench Lite评测中,其Claude - 4+o4 - mini组合修复达60.3%居首。

量子位