测试全流程」共找到 3890 篇相关文章

产品应用8

首创“AI+真人”双保障模式!刚刚,百度健康推出7x24小时「能聊、有料、会管」AI管家

百度健康推出7x24小时AI管家,首创“AI+真人”双保障模式,提供链路服务。它能精准咨询、推荐就医、管理健康档案,靠三层模型架构支撑,标志医疗AI向“智能健康伙伴”跃迁。

量子位
算法论文8

推理token减少46%!Meta新方法缩短思维链,告别重复推导

Meta等联合提出元认知复用机制,让模型总结解题思路,提炼为“行为”存于“行为手册”。实验显示,该机制在数学基准测试中显著优化,保持准确率时最多减少46%推理token使用量。

量子位
新闻资讯7

Copilot强塞马斯克Grok新模型,遭开发者集体“抵抗”!GitHub内部工程师曝:我们是被“胁迫”的

微软旗下 GitHub 深化与 xAI 合作,将 Grok Code Fast 1 整合进 Copilot。但 GitHub 内部举报人指其安测试不足、团队被‘胁迫’。此引发开发者‘抗议’,部分要求撤销合作,也有人看好合作价值。

AI前线
新闻资讯7

卷赢OpenAI也没用!Salesforce用100万次对话揭秘:AI Agent最大的坑,根本不是技术!

Salesforce处理超100万次AI Agent与客户对话后复盘,指出行业追求“自动化”是陷阱。AI Agent不仅要融合非结构化和结构化数据,还需提升人工介入率,遵循“同理心优先”原则。

探索AGI
新闻资讯7

疯狂……韩国开发出强大的核灾难处理人形机器人。丑,但实用

韩国原子能研究院正开发用于核灾难响应和废料处理的人形机器人,目标是能举200公斤重物。与其他机器人相比,其举重能力优势明显。不过在真实核灾难现场应用还需长期测试

AGI Hunt
开源动态7

这个开源模型的UI审美碉堡了~

当下流行基于大模型生成HTML源码可视化文本内容,网页审美对模型很难。早期用Claude 3.7,后有DeepSeek V3 0324等。Tesslate开源基于Qwen微调的模型,尺寸,审美佳,想象空间大。

探索AGI
算法论文7

The Batch:826 | 提高输出准确性的记忆层

通常提高大语言模型事实准确性需更大模型规模,会增加计算成本。Meta研究人员在transformer架构加可训练记忆层,可高效存储提取信息,提升计算效率,测试显示其能提升模型输出质量。

DeeplearningAI
开源动态8

代码、多模态检索面登顶SOTA!智源BGE向量模型三连击,并面开放

检索增强技术在代码及多模态场景作用大,向量模型是关键。智源研究院联合高校研发三款向量模型BGE - Code - v1、BGE - VL - v1.5、BGE - VL - Screenshot,登顶多领域测试基准,已面开放助力研究与应用。

机器之心
产品应用8

阿里发布新版 Qoder:做每个人的编程智能体工作台,一手实测!

本文是对阿里新版Qoder的一手实测,新版Qoder从面向专业开发者的AI IDE,转型为面向岗位的编程智能体工作台,支持自定义模型,探讨了AI Agent下半场的竞争方向。

特工宇宙
产品应用7

The Batch: 978 | DeepSeek-V4-Pro 更新了

DeepSeek发布旗舰模型DeepSeek-V4-Pro-0813正式版,性能提升,还发布开源agent harness开发者预览版并提价。模型在多指标表现佳,编码能力改进明显,公司公开基准测试框架意义大。

DeeplearningAI