「测试套件规模」共找到 2144 篇相关文章
100万辆“斩杀线”出现,2026年中国智驾进入淘汰赛|甲子光年
2025年中国智能驾驶行业进入规模与交付主导阶段,100万辆成为2026年智驾行业‘斩杀线’。华为已跨过‘安全区’,地平线、卓驭等构成一线梯队。毫末智行等公司因技术与交付问题出局,行业竞争更残酷。
必须得让AI明白,有些不该碰的东西别碰(doge)
近期类o3模型在视觉推理任务表现优异,但陷入‘盲目用工具’状态。港中文MMLab等团队提出AdaTooler-V模型,具备自适应工具使用能力,还引入指标、算法,构建数据集,在多基准测评中优势明显。
以孔子命名,超越Claude 4.5 Opus,Meta发布工业级自我进化AI软件工程师CCA
Meta与哈佛联合推出工业级软件工程师CCA,它是一套让AI在工业级代码库协作的方法论,解决长上下文推理等难题。其三维解耦设计、精细记忆机制、自我进化能力获数据验证,还适合引入强化学习。
谷歌最强大模型付费上线,在DeepSeek开源后被吐槽太贵
谷歌最强模型Gemini 3 Deep Think上线,推理能力强,能将草图变3D场景、搭建游戏。它在多评测基准表现出色,准确率超GPT - 5 Pro等。但仅向Ultra会员开放,月费约1800元,被吐槽贵,开源的DeepSeek-V3.2成冲击因素。
超实用提示词模板!AI科学家教你用协作提示词激发大模型潜力
文章由知名AI科学家Lance Eliot所写,指出主流大语言模型因训练机制变得‘短视’,缺乏深度协作能力。介绍协作提示词技术,能让AI成为主动引导者,并以测试展示效果,还说明了适用场景。
融合风控知识的大模型体系建设与应用实践
腾讯算法专家欧阳天雄在AICon大会分享《大模型驱动下的智能风控落地实践》,介绍腾讯天御融合海量风控知识构建金融风控大模型,解决传统风控模型难题,还展示构建技术、工程实践及落地案例,为金融风控提供新思路。
年度最强AI压轴!谷歌Gemini 3.0下周决战OpenAI,前端要下岗了
谷歌CEO疑似暗示Gemini 3.0下周登场,它或成谷歌重大转折点。其在代码编写、图片生成等方面表现出色,还能一句话生成OS、UI网页。谷歌与OpenAI竞争激烈,巴菲特重仓谷歌股票,业界看好其潜力。
6款小游戏难倒所有顶级VLM!愤怒的小鸟让它们全军覆没,性能不如随机猜测
淘天集团未来生活实验室提出首个系统性评估多模态大模型(VLM)交互式物理推理能力的综合基准DeepPHY。它集成六个物理环境,对17个主流VLM测试,揭示其在物理交互等方面短板。
NeurIPS 2025 | 中科大、港中深、通义千问联合发布CoRT:仅30个样本教会大模型高效推理,token消耗降低50%
大型推理模型在精确数学计算上存在问题,如认知冲突、行为低效、数据稀缺。中科大、港中深、通义千问联合推出CoRT框架,用创新数据合成与多阶段训练,提升模型推理能力和效率,成果已开源。
实战·Agentic 上下文工程(下):实现一个可自我学习与进化的智能体原型
文章参考ACE论文架构与提示词设计,实现可自我学习与进化的ACE智能体原型。介绍整体架构、各模块实现逻辑、工作流组装测试,也指出当前问题如LLM表现波动大等,并给出改进方向。