「评测缺陷」共找到 811 篇相关文章
具身智能的「GPT时刻」?高德连发两个全面SOTA的ABot具身基座模型
过去几年,机器人行业面临模型与数据绑定特定场景、能力难以泛化的问题。近日,高德发布 ABot 系列具身基座模型,补齐行业能力缺口,标志具身智能从定制系统转向统一模型,有望降低开发门槛。
百度沧海·存储 Mantle 系统架构演进之路,SOSP'25 论文背后的故事
文章讲述百度沧海·存储Mantle系统架构演进故事。面对云存储挑战及业界方案局限,团队经多阶段探索,构建Mantle及MantleX架构,解决性能难题,并规划后续升级方向,为业界提供新思路。
社区供稿丨AgentCPM-Explore开源,4B 参数突破端侧智能体模型性能壁垒
清华大学、中国人民大学等联合研发的 AgentCPM-Explore 智能体模型开源,它基于 4B 参数,在深度探索类任务表现佳。有打破参数壁垒等亮点,还开源配套工具,提供应对小模型挑战方法,邀伙伴共建生态。
专为小说、角色扮演等而生:元象开源泛娱乐场景底座模型
元象作为AI与3D技术服务公司,此次开源XVERSE-Ent系列中英双语大模型。它采用MoE热启动技术与三阶段训练策略,解决泛娱乐场景痛点,适配多元语境,有高部署性价比,为行业提供泛娱乐AI解决方案。
Ilya罕见发声:大模型「大力出奇迹」到头了
Ilya大神在近2万字采访中称,AI正从「规模时代」走向「科研时代」,主流「预训练 + Scaling」路线遇瓶颈。他还探讨了AI泛化、安全对齐、预训练范式等热门话题,给出独特见解。
小红书提出DeepEyesV2,从“看图思考”到“工具协同”,探索多模态智能新维度
小红书推出多模态模型DeepEyesV2,它延续视觉推理优势,实现代码执行、网页搜索和图像操作的全工具协同。通过多工具协同推理解决复杂问题,采用两阶段训练策略,准确率远超开源模型。
HumanSense:探索多模态推理边界,打造「察言观色会共情」的全模态交互伙伴
蚂蚁集团与西安交通大学联合提出并开源 HumanSense,含评估基准与推理模型。通过细粒度评测、全模态消融等研究,提出优化策略,项目已在 GitHub 和 HuggingFace 开源,推动 AI 交互体验革新。
NeurIPS 25 | GRPO进阶版来了,GVPO重构大模型后训练范式
大模型后训练越发关键,GRPO 有缺陷。作业帮与香港科技大学(广州)团队在 NeurIPS 2025 提出 GVPO 方法,解决 GRPO 稳定性难题,理论有最优解保证,实验表现超现有方法。
RAG性能优化:基于RAGFlow自定义解析工具实现文本结构化(含源码教学)
文章围绕RAG性能优化展开,指出RAGFlow框架中DeepDoc解析算法不足,介绍开源与商业化解析工具优劣势及API调用和本地部署特点,推荐TextIn xParse,给出RAGFlow+TextIn知识库构建方法,还探讨了RAG优化方案。
刚刚,OpenAI发长篇论文:大模型幻觉的原因找到了~
OpenAI发论文揭示语言模型出现幻觉的根本原因,即训练和评估过程奖励猜测而非承认不确定性。预训练阶段就埋下幻觉种子,后训练阶段‘考试机制’强化幻觉,还给出改评分规则的解法。