「产品评估」共找到 2246 篇相关文章
飞书和豆包合并后的第一个Agent产品,豆包工作,它来了。
字节发布飞书与豆包整合后的首个产品——豆包工作,它是完整办公 Agent,与飞书原生打通,功能丰富。对用飞书办公的公司而言,使用便捷,还便于管理 AI 额度,是很好的 Agent 起手式。
解锁任意步数文生图,港大&Adobe全新Self-E框架学会自我评估
香港大学与Adobe Research联合发布Self - E框架,可从零训练实现任意步数文生图。它改变训练范式,用两条互补训练信号,在GenEval基准表现出色,让文生图训练更灵活且具扩展性。
Notion 3.0 |AI转型最成功的互联网产品是怎么做的?
Notion更新3.0,可视为有所有上下文的通用Agent产品,能调用顶尖模型。它有基础AI能力,如选模型、加上下文等,还升级了Agent创建、MCP等功能,依托生态让提示词可变现。
「龙虾热」后,OpenClaw 会是又一个泡沫吗?
OpenClaw是受高度关注的开源项目,发布一周吸引200万访问、超10万GitHub星标。热度外溢到产品和产业,厂商推「类龙虾」产品,应用边界向AI硬件延伸,地方政府也推出支持举措,但围绕其争议也在积累。
北航LiveRepoReflection: 扭转乾坤-仓库级代码反射
本文提出LiveRepoReflection基准,评估多文件仓库代码理解和生成能力,含1888个测试案例。创建RepoReflection - Instruct数据集训练RepoReflectionCoder,评估40多个LLMs,结果显示其能有效测模型反思修复能力。
解决Agent幻觉:HaluMem精准定位记忆系统的“说谎”环节!
近年来,LLM和Agent在记忆管理上存在挑战,现有评估方法无法定位幻觉来源。论文提出HaluMem评估基准,通过三大任务和两个数据集揭示记忆系统幻觉行为,为开发可靠记忆机制提供指导。
4个月,创建20万个应用,这是背后的产品|对话百度秒哒
百度无代码应用搭建平台秒哒4个月创建20万个应用。量子位对话其负责人朱广翔,他表示AI时代创意至上,秒哒让创意落地,还介绍其多智能体协作、打通百度生态等思路,以及功能迭代和未来规划。
阿里老兵造出会说话的迪迦!AI玩具单品20万销量,红杉等2亿A轮抢投
跃然创新推出全球首款迪迦奥特曼AI玩具,完成2亿A轮融资。其首代产品BubblePal销量达20多万台。新品改进诸多不足,优化体验,强调安全。公司瞄准AI Friend,未来产品分儿童和成年线。
从Demo到产品,这场AI实战迎来最终验收 | AI Hackathon Tour 高校联赛
AI Hackathon Tour高校联赛复赛结束,225个团队中57支精英战队晋级决赛。3月21日将在南京进行终极验收,还组建豪华评审天团。大赛由魔搭社区、Datawhale发起,为期100天。
Q:Lab · 龙虾季 | 直播预告
InfoQ 中国推出「Q:Lab」AI 产品测评直播栏目,第一季「龙虾季」聚焦 AI Agent 产品,共 3 期直播,覆盖 9 款核心产品,每期围绕真实职业场景测评,由一线从业者操作并现场出结果。