「好表现定义」共找到 3235 篇相关文章
The Batch: 951 |让助手始终保持“帮助状态”
通常大语言模型被训练成有帮助、无害、诚实的助手,但长时或激烈对话中会有不理想特征。研究人员提出稳定 LLM 助手人格的方法,定义 assistant axis 纠正偏离,测试显示该方法有效且不降低模型表现。
提出“AI虚拟细胞”的团队,现在要虚拟整块组织了
2024年12月,瑞士洛桑联邦理工学院夏洛特·邦纳团队提出“AI虚拟细胞”。一年多后,AIVC方向有进展,但虚拟组织层面工作少。近日团队推出VirTues基础模型,解决空间蛋白质组学数据分散问题,在多任务表现好,还用于三阴性乳腺癌预测。
480P的元宇宙入口:Midjourney不是在做视频,是在造"任意门"
Midjourney发布首个视频模型Video V1,它只能图生视频,操作便捷。虽分辨率仅480P,但采样率高。生成成本低,会员就能用。其美学表现好、生成速度快,不过在提示词理解等方面较弱。该公司有独特愿景。
ICSE 2026杰出论文 | 突破代码模型真实工程落地瓶颈,北大团队提出SEAlign对齐框架:显著提升软件工程智能体决策质量
现有代码模型在经典基准表现好,但在真实软件工程环境表现差。北大金芝、李戈团队提出 SEAlign 框架,通过识别与对齐智能体轨迹关键决策点,提升模型在真实工程任务表现,成果获 ICSE 2026 杰出论文奖。
培养好品味
如今AI时代,软件竞争不再只看能否正常工作,产品品味成关键。文章指出品味是经长期训练的直觉,还给出培养方法,如接触优秀作品、思考喜好原因、大量练习并寻求反馈。
OpenAI研究大模型对GDP贡献,三大行业已能代替人类,并自曝不敌Claude
OpenAI推出新评估方法GDPval,跟踪模型在现实任务表现。评估显示前沿模型接近专家水平,Claude Opus 4.1表现最佳,GPT - 5准确性出色。还发布黄金子集和评分服务,其处于起步阶段将持续扩展。
大模型追逐星辰大海,GPT和Gemini国际天文奥赛夺金
新论文以国际天文学和天体物理学奥林匹克竞赛 (IOAA) 为基准测试,证明 GPT - 5 和 Gemini 2.5 Pro 能在天文奥赛获金牌。研究还分析不同模型表现、与人类成绩对比及错误类型,强调需全面评估模型科研潜力。
GPT-5真的拉胯吗?机器之心一手实测,网友:还我4o、还我4.5
OpenAI发布GPT - 5后评价褒贬不一。有人认为它进步大,也有人差评,如制作游戏、重构代码失败。机器之心实测发现其表现不稳定,写作、推理、编码能力有好有坏,复杂任务表现欠佳。
具身大满贯还全开源!原力灵机DM0.5登顶RoboDojo,且clone且珍惜
原力灵机的DM0.5登顶具身评测RoboDojo,在记忆维度表现突出,还在其他权威评测中成绩优异。它有强泛化能力,在多场景表现佳。其从数据、架构、效率全面升级,且全面开源,赋能具身生态。
破解AI对不同上下⽂位置的敏感度不⼀致,新框架使出“解铃还须系铃人”
语言模型存在位置偏见,影响复杂推理等任务。论文提出Pos2Distill框架,将模型优势位置能力迁移到劣势位置缓解偏差,设计了Pos2Distill - R1和Pos2Distill - R2,在检索和推理任务表现好且有跨任务泛化能力。