「功能测试」共找到 3143 篇相关文章
LLM又曝致命缺陷:根本不会看时钟!博士惊呆,准确率不及50%
最新研究揭示AI存在认知缺陷,读取时钟准确率仅38.7%,判断日历日期准确率26.3%。研究者构建测试集考察MLLM能力,虽部分模型有亮点,但整体表现不佳,凸显训练数据和推理方式改进需求。
争夺 Agent 市场,微软的押宝点竟是「情商」?
微软AI CEO Mustafa Suleyman接受访谈,分享AI未来见解,探讨情商重要性等问题。他推动AI从功能向人性化发展,认为AI是伴侣非仅工具,强调情感连接,还提及Copilot靠情商打差异化等。
Visual Studio 重磅更新!擅长处理复杂任务的 GitHub Copilot “智能体模式”预览版上线
微软 Visual Studio 官方宣布,GitHub Copilot 智能体模式登陆 17.14 预览版。此模式可自主处理开发全流程,有确定上下文、建议命令等功能。还引入 MCP 服务器,支持连接外部工具,且更新将更频繁。
用Codex做跨境电商:第十章
第九章用虚构材料完成示范测试,表明工作流可在当前项目运行,但他人使用存问题。本章讲把工作流变成资产,使其具备复用和交接价值,还以Pilates环德国站上架为例说明操作步骤。
Claude Fable 5.1 发布:缓存读降价 75%,但实际更贵了
Anthropic 发布 Claude Fable 5.1 和 Mythos 5.1。Fable 5.1 性能全面上涨,但出现价格悖论,缓存读降价 75% 实际更贵。在 Agent 类任务与 Opus 5 基本持平,推出 EFS 应对数据留存争议,还有多项科研演示。
Physical Intelligence联创最新访谈:机器人尚未进入可预测的Scaling阶段
2024年末PI实验室测试,机器人表现有惊喜也有“语义上说得通的错误”。联创Levine在访谈中认为,机器人未到可预测Scaling阶段,还在确定规模化技术路径,也谈到数据、泛化、可靠性等问题。
GPT-5.6 Sol暴涨3倍,OpenAI最强视觉AI登顶!
第三方评测机构Roboflow测试显示,GPT-5.6 Sol在目标检测、计数等视觉任务上表现出色,尤其在文档版面识别和密集场景处理上进步明显,但认字能力有退步,且大尺寸图片检测框易飘移。
不再止步于自然语言!PhiZero让世界模型学会「物理语言」
PhiZero由中科院自动化所团队研发,探索让AI读懂真实世界运动、交互与变化的“物理语言”。它构建Reason - then - Render框架,经大量数据训练,在多基准测试中表现领先,为AI理解物理世界开辟新通道。
GitHub连续霸榜,难怪别人的图表这么高级优雅!
作者让AI画系统架构图效果不佳,朋友推荐diagram-design项目。它是给Agent用的出图技能包,能让AI生成编辑级质量图表,有多种图表类型,具备诸多亮点功能,还介绍了安装使用方法。
北大联合阶跃星辰提出TensorCast:统一可编程管理大模型张量,推理「首字延迟」最高降低93.2%
随着模型规模增长、新应用兴起,大模型基础设施面临管理「张量状态」挑战。北大、阶跃星辰与北邮联合提出 TensorCast,解耦张量状态,复用管理能力,在多场景测试中表现出色,为大模型基建提供新范式。