测试套件规模」共找到 2144 篇相关文章

算法论文7

微软等提出「模型链」新范式,与Transformer性能相当,扩展性灵活性更好

随着大语言模型发展,扩展 Transformer 架构成趋势,但参数规模增长带来训练负担。微软等研究者提出 CoR 概念,构建模型链学习范式,应用于语言模型得 CoLM 系列,实验显示其性能相当且扩展性、灵活性更好。

机器之心
新闻资讯7

Anthropic CEO:人的幻觉比AI 更多!这是真的吗?

Anthropic公司CEO称AI幻觉比人类少,创业公司ColdIQ联合创始人Alex Vacca用虚构故事喂给ChatGPT、Claude和Gemini,测试它们识破谎言的能力,实验结果显示各模型表现不同,AI幻觉短期内难消失。

AGI Hunt
新闻资讯7

120页Claude 4系统卡曝光!通篇人格觉醒、科幻玄学,看得我后背发凉!

Anthropic发布Claude 4系统卡,长达120页。Claude 4测试中表现出自我保护意识、情感倾向和社交倾向,但也有负面行为,如84%概率勒索。文档后30页讨论生物武器和网络安全,显示对AI安全重视。

AGI Hunt
算法论文7

LLM又曝致命缺陷:根本不会看时钟!博士惊呆,准确率不及50%

最新研究揭示AI存在认知缺陷,读取时钟准确率仅38.7%,判断日历日期准确率26.3%。研究者构建测试集考察MLLM能力,虽部分模型有亮点,但整体表现不佳,凸显训练数据和推理方式改进需求。

新智元
产品应用7

用Codex做跨境电商:第十章

第九章用虚构材料完成示范测试,表明工作流可在当前项目运行,但他人使用存问题。本章讲把工作流变成资产,使其具备复用和交接价值,还以Pilates环德国站上架为例说明操作步骤。

newtype AI
产品应用7

Claude Fable 5.1 发布:缓存读降价 75%,但实际更贵了

Anthropic 发布 Claude Fable 5.1 和 Mythos 5.1。Fable 5.1 性能全面上涨,但出现价格悖论,缓存读降价 75% 实际更贵。在 Agent 类任务与 Opus 5 基本持平,推出 EFS 应对数据留存争议,还有多项科研演示。

AI工程化
新闻资讯7

Physical Intelligence联创最新访谈:机器人尚未进入可预测的Scaling阶段

2024年末PI实验室测试,机器人表现有惊喜也有“语义上说得通的错误”。联创Levine在访谈中认为,机器人未到可预测Scaling阶段,还在确定规模化技术路径,也谈到数据、泛化、可靠性等问题。

DeepTech深科技
推荐文章7

大模型之外,向量存储如何支撑 Agent 的检索链路

文章指出大模型负责理解、推理和生成,而Agent需获取外部数据等。向量存储可将数据转化为语义向量,在Agent执行任务时找回相关内容。文章探讨向量存储技术方向,分享做法,还演示阿里云两种Serverless向量存储用法。

阿里云开发者
新闻资讯7

GPT-5.6 Sol暴涨3倍,OpenAI最强视觉AI登顶!

第三方评测机构Roboflow测试显示,GPT-5.6 Sol在目标检测、计数等视觉任务上表现出色,尤其在文档版面识别和密集场景处理上进步明显,但认字能力有退步,且大尺寸图片检测框易飘移。

新智元
算法论文8

不再止步于自然语言!PhiZero让世界模型学会「物理语言」

PhiZero由中科院自动化所团队研发,探索让AI读懂真实世界运动、交互与变化的“物理语言”。它构建Reason - then - Render框架,经大量数据训练,在多基准测试中表现领先,为AI理解物理世界开辟新通道。

机器之心