「价值评估」共找到 1341 篇相关文章
GPT-5都救不了的AI幻觉,原来问题不在模型,在“考卷”
OpenAI研究指出AI产生幻觉的根本原因是评估和激励机制有问题。现有训练和评估流程奖励‘猜测’,导致模型易产生幻觉。研究还给出解决方案,要更新‘考试规则’,让模型适当表达不确定。
一文读懂 Deep Research:竞争核心、技术难题与演进方向
文章梳理了深度研究系统,包括其发展历程、现有系统差异、技术实现挑战、评估体系及推理架构演进方向。指出竞争焦点转向综合比拼,评估走向专业化,未来系统将在多方面突破。
700 美金买“真情”?AI情感类产品爆火背后:卖的不止是陪伴,而是年轻人的孤独
本文讲述林悦依赖AI情感陪伴应用的故事,指出当下AI情感陪伴类产品受欢迎,如字节‘显眼包’、卡西欧Moflin。分析市场大的原因,探讨核心价值、产品设计、商业模式等,也提及行业挑战。
音频大模型安全可信度的全面“体检”!6大维度,清华南洋理工联手打造
南洋理工和清华团队提出新框架AudioTrust,将ALLMs评估扩至六个核心维度,探究音频模态特有问题。目前基准及平台已开发,揭示了开源与闭源ALLMs在多维度的潜在风险。
多模态Deep Research,终于有了「可核验」的评测标准
俄亥俄州立大学与 Amazon Science 等联合发布 MMDR - Bench,将多模态 Deep Research 评估拉到可核验标准。它含 140 个专家任务,覆盖 19 领域,把评估拆成 3 段管线、12 指标,强调过程证据链。
AI Native 的影像公司们,颠覆赛道的机会来了!
文章指出过去50年影像公司通过推动坐标点向「计算」端移动创造商业变量。如今计算突破天花板,带来理解、增强、生成现实三层价值释放,解锁新场景,AI Native影像公司机会巨大。
刚刚,Anthropic 发布 Claude「宪法」:一份写给 AI 的人生指南
Anthropic 公开给 Claude 写的数万字「宪法」,从「规则清单」升级为「价值体系」,设定四个核心价值,有「聪明朋友」理论,设硬性限制,对诚实要求严格,还探讨意识等问题,强调透明度和持续进化。
超越DeepSeek-R1,数学形式化准确率飙升至84% | 字节&南大开源
字节跳动Seed团队与南京大学联合发布CriticLean框架,将数学自然语言到Lean 4代码的形式化准确率从38%提升至84%。该框架创新性地将评估模型置于核心,解决语义对齐等问题,还构建了相关基准测试和数据集。
当达沃斯还在热议AI未来时,中国一家公司的AI教育已经服务了全球5000万群体
世界经济论坛第56届达沃斯年会聚焦AI,各方探讨其走向与价值。松鼠Ai作为中国AI独角兽企业受邀,其智适应教学系统落地应用,创始人栗浩洋提出AI价值重构,该企业还具备全球复制潜力。
鹅厂实习生血泪贴:Agent/RAG黑科技,真相竟是这样!
腾讯实习生分享鹅厂项目实战经验,介绍Agent/RAG黑科技。先讲RAG原理、优化方法及评估流程,还提及文档解析;再阐述智能体定义、历史、原理、分类、评估框架与实践案例,助读者快速入门。