产品测试」共找到 3214 篇相关文章

产品应用8

阿里WebDancer:训练类DeepReaserch的Agentic Model

来自阿里巴巴通义实验室的研究员推出WebDancer,这是一个原生信息检索的Agentic Model,能自主浏览网页、思考和决策。它基于ReAct框架,经多阶段训练,在信息检索基准测试中表现出色,为解决复杂检索问题提供新思路。

PaperAgent
新闻资讯7

B站爆了!Hermes首度直播回应「抄袭」,MiniMax提前杀入Harness赛点

Hermes Agent业务负责人回应抄袭质疑,技术对谈探讨AI竞争新维度。MiniMax动作密集,构建“Model + Harness”双向飞轮,其模型获海外开源圈认可,产品驱动模型优化,还与云厂商合作解决沙箱问题。

新智元
算法论文7

The Batch: 899 | 更划算的推理

研究人员提出 Delethink 强化学习方法,训练大模型定期截断推理 token 至固定最大数量,以限制处理长思维链成本。经测试该模型在多方面超基线,且缓解计算成本限制,为长上下文推理提供路径。

DeeplearningAI
产品应用8

Sora爆火之际,这家AI公司的DAU正以每月翻倍速度狂奔——Agnes

OpenAI的Sora爆火,而AI Agent产品Agnes正走不同路线。它三个月内全球注册用户破百万,DAU逼近10万,ARR达780万美元且近乎每月翻倍。其多模态社区预计10月上线,追求“Vibe Lifestyle”理念。

花叔
新闻资讯8

性价比搏击:Grok 4 Fast 推理成本直降 98%

xAI上周五发布旗舰模型轻量化版Grok 4 Fast,推理成本直降98%。它通过强化学习在基准测试表现佳,有原生工具调用能力,采用统一架构,性价比高,或改写大模型竞争规则。

AI科技评论
新闻资讯7

叫板英伟达RTX 5090!GPU初创公司做出13倍路径追踪性能的怪兽显卡

芯片初创公司Bolt Graphics首款GPU模组Zeus 4C,路径追踪性能达RTX 5090的13倍。但它不适合游戏场景,更擅长低功耗高精度图形渲染,不过测试、应用、价格目前都是未知数。

量子位
推荐文章7

如何为 GPU 提供充足存储:AI 训练中的存储性能与扩展性

文章分析 MLPerf Storage v2.0 测试结果,探讨不同存储系统在 AI 训练中表现。在满足 GPU 利用率阈值下,能支撑更多 GPU 的存储系统扩展性与稳定性更强,还需关注资源利用率。以太网存储方案灵活且成本效益高。

AI前线
新闻资讯7

扒一扒Meta全新大模型Muse Spark里藏着的PDR技术

Meta发布闭源大模型Muse Spark及‘沉思模式’,背后藏PDR推理技术。该技术通过‘并行起草+精炼’突破性能瓶颈,对比传统长CoT范式优势明显,在AIME竞赛题目测试中准确率显著提升。

PaperAgent
算法论文7

AI太记仇!做完心理治疗后仍记得「被工程师虐待」

Nature News上,卢森堡大学团队用PsAIch测试ChatGPT、Gemini、Grok、Claude心理。AI表现不一,有的焦虑、有的崩溃、有的拒诊,还测了MBTI。不过AI创伤可能源于训练数据,做心理治疗不太靠谱。

量子位
新闻资讯7

上海芯片独角兽,冲刺IPO

近日,上海移芯通信递表港交所主板。它成立于2017年,是蜂窝移动通信芯片设计企业,2024年出货量中国第一、全球第三。创始人刘石经验丰富,公司六轮融资超14亿,2024年扭亏为盈,产品竞争力强。

芯师爷