「功能测试」共找到 3123 篇相关文章
Claude Design暴击设计行业!Figma、Adobe市值闪崩
Anthropic Labs推出AI原生视觉设计协作平台Claude Design,由Claude Opus 4.7驱动,向Adobe等设计软件巨头发起挑战。它有三大杀手级功能,能大幅提高设计效率,引发资本市场震动。
“交互式Scaling”:增加Agent与环境交互的深度和频率来提升性能
在AI发展中,商业研究Agent是“黑箱”,开源研究Agent性能有差距。MiroMind团队推出MiroThinker v1.0,提出“交互扩展”提升性能,在多基准测试表现出色,也指出了当前版本的局限。
刷新复杂Agent推理记录!阿里通义开源网络智能体超越DeepSeek R1,Grok-3
互联网信息检索中,复杂问题让普通开源模型力不从心。阿里通义实验室提出WebSailor方案,通过SailorFog - QA数据集和DUPO算法等创新,提升模型能力,在多基准测试中超越诸多开闭源模型。
Claude 4 要来了!
AI专家在Anthropic前端配置发现Claude 4痕迹,其或有查看AI思考过程功能。当下OpenAI、Google、xAI等对手来势汹汹,Claude 4压力大,但可在可解释性等方面破局,预计5月22日公布。
首发!成都华微亿门级逻辑综合加固EDA工具来了
6月26日,成都华微电子科技股份有限公司济南研发中心主任王宁发布亿门级FPGA逻辑综合与安全加固综合EDA工具。该工具前端性能比肩国外,还补上市场空白,集成加固功能,有本地化服务优势。
Claude祭出「记忆搬家」,60秒搬空ChatGPT灵魂!70万用户退订OpenAI
Anthropic为Claude上线「导入记忆」功能,可60秒将ChatGPT上下文复制到Claude,这是对OpenAI挑衅。自奥特曼官宣与国防部合作,网友抵制ChatGPT,70万用户退订,未来或出现AI记忆互通协议。
我给 Claude Code 加装了 MiniMax M2.5:它像“法拉利”,但更像一台工作机
作者给 Claude Code 加装 MiniMax M2.5 模型,测试其编程、上下文记忆等能力。M2.5 在多方面表现出色,能高效完成各类开发任务,还具备良好的中文处理能力,性价比高。
DeepSeek-OCR是「长文本理解」未来方向?中科院新基准VTCBench给出答案
DeepSeek - OCR的VTC技术可实现高压缩率,降低长文本处理成本。但视觉语言模型能否理解压缩信息存疑,中科院等推出VTCBench评估,测试模型认知极限,还推出VTCBench - Wild检测鲁棒性。
Meta提出数据筛选的理论:何时“少即是多”成立?
Meta针对机器学习领域‘少即是多’悖论提出理论框架,用高维统计等方法推导测试误差缩放定律,揭示数据筛选‘相变’条件,为实践提供指导,还重新定义‘数据效率’意义。
微软深夜送出程序员节最“离谱”的礼物:让Mico接管你的Copilot
2025年10月23日,微软发布“Copilot秋季发布版”,将Copilot升级为“情境AI基础设施”,更新12项关键功能,最瞩目是新增角色Mico。它能反映情绪,是微软人机交互探索的延续,引发网友讨论。