「产品评估」共找到 2255 篇相关文章
Anthropic CPO:AI写9成代码后,我们迎来了新噩梦!
本文是对Anthropic CPO Mike Krieger的播客访谈。他谈到AI重塑软件开发,约90%代码由AI编写;还分享产品经理价值、Anthropic战略、Artifact关闭原因等,对AI认知从工具变为战略伙伴。
CVPR 2026 Highlight|让家电「在仿真中运转起来」,北大正式发布RealAppliance!
北京大学团队提出 RealAppliance 数据集与 RealAppliance - Bench 评测基准。前者收录 100 个精细家电资产,与真实产品系统多层面对齐;后者围绕五项任务评估模型家电操作规划能力,实验显示主流模型仍面临挑战。
万字攻略|AI 时代,华人创业者进入日本市场的窗口打开了
Linkloud观察发现,AI浪潮下日本正为华人创业者打开窗口。虽日本市场慢且谨慎,但AI能盘活传统流程,客户忠诚度高。文章还从多方面给出创业建议,如产品要“补丁式创新”,先从ToC切入等。
Shopify分享了他们做Agent的万字踩坑经验
Shopify分享构建生产级AI助手Sidekick的万字经验。构建中遇工具拓展难题,用JIT指令解决;评估是大挑战,建立严谨体系,虽有提升但效果仍有波动,模型还会钻空子,最后强调单Agent系统也强大。
OpenAI新幻觉论文惹争议!GPT-5拉胯是测试基准有问题??
OpenAI新论文《语言模型为何会产生幻觉?》提出,模型有幻觉是因标准训练和评估流程倾向奖励“猜对”。GPT - 5不爱猜测,在榜单表现不佳,网友质疑论文是为GPT - 5挽尊,论文引发网友多方向讨论。
3B模型性能小钢炮,“AI下半场应该训练+验证两条腿跑步”丨上海AI Lab&澳门大学
上海AI Lab和澳门大学联合发布通用答案验证模型CompassVerifier与评测集VerifierBench,填补Verifier领域循环迭代体系空白。AI下半场评估比训练更重要,当前验证方法有困境,新模型验证精度高且能用于强化学习。
推荐系统进入「双动力」时代!首篇LLM-RL协同推荐综述深度解析
强化学习是推荐系统主流建模范式,但传统 RL 推荐系统有诸多瓶颈。大语言模型崛起带来新机遇,LLM 与 RL 结合开启新范式。研究团队发布首篇相关综述,提出五大协同范式,总结评估体系,分析挑战与方向。
腾讯开源混元Image 2.1:2K高清+完美文字嵌入,图文天花板来了
今天凌晨,腾讯开源最新图像模型混元Image 2.1,支持原生2K分辨率与长提示词,文字嵌入能力强,适用于专业场景。还开源加速版模型权重和提示词改写模型,评估显示其性能达开源最优,接近闭源商业模型。
肖涵:2026 年的 AI 搜索就是智能体记忆 | Elastic 中国 AI 搜索技术大会
2026 年智能体记忆成 AI 基建新战场,虽概念不新但获前所未有的紧迫感。因智能体任务变长但记性差,加记忆后又有记不住该记、忘不掉该忘的问题,遗忘成最大难题,产品分三条技术路线。
字节最强多模态模型登陆火山引擎!Seed1.5-VL靠20B激活参数狂揽38项SOTA
5月13日,火山引擎在上海发布5款模型和产品,其中豆包1.5・视觉深度思考模型(Seed1.5-VL)最吸睛。它激活参数20B,性能与Gemini2.5 Pro相当,38个评测基准达SOTA,推理成本低,已开放API。