「选择困难」共找到 1203 篇相关文章
AAAI 2026 Oral | 大模型「爱你在心口难开」?深度隐藏认知让推理更可靠
合肥工业大学团队提出大模型存在‘隐藏的真伪认知’,论文让模型用此给推理‘打分’,过滤错误推理链。通过多层注意力头探测、构建预测器和新推理扩展策略,提升了推理链稳定性,实验效果优异。
具身智能是泡沫还是前夜?两位学霸选择“上天”与“要脸” |5Y View
本期是五源合伙人孟醒与微分智飞高飞、首形科技胡宇航的对话。二人没选主流赛道,高飞要为飞行终端造‘具身大脑’,胡宇航给机器人‘脸面’,这是让机器人进化的尝试。
扩展外部测试时Scaling Law,中关村学院新发现:轻量级验证器可解锁LLM推理最优选择
文章聚焦大语言模型‘测试时扩展’,指出内部方法接近瓶颈,外部方法的传统实现有缺陷。提出 TrajSelector 策略,用轻量级打分模型复用隐状态打分,训练无需手动标注,实验显示性能增长稳定。
英伟达4段简短提示词,IOI夺金!开源模型也能征服最难编程竞赛
英伟达研究者提出GenCluster框架提升开源LLM解题能力,让开源模型gpt - oss - 120b在IOI 2025获金牌级别高分。它执行‘海选+筛选+比拼+提交’流程,优势明显,标志开源AI里程碑式突破。
Nano Banana不及格,开源模型一分难求!上海AI Lab新基准直击文生图模型痛点
上海人工智能实验室等联合发布首个多学科文生图考试基准GenExam,覆盖10学科、1000题。实验显示,GPT - 4o严格评分正确率仅12.1%,开源模型接近0分,暴露出模型在专业场景的短板。
GPT-5、Grok 4、o3 Pro都零分,史上最难AI评测基准换它了
AAI机构提出新基准FormulaOne,让GPT - 5、o3 Pro等前沿大模型集体得零分。该基准含220个图结构动态规划问题,分三类难度。测试结果显示,模型在深层及最深层难度表现差,引发关注。
甲小姐对话彭志辉:既然选择做公众人物,就必须接受被期待的代价 | 甲子光年
甲子光年的甲小姐对话智元机器人联合创始人彭志辉,他称公司是具身行业估值“撑伞人”,采用全栈自研战略。双方还探讨融资、战略、市场、技术、商业、组织等话题,他分享公司发展现状、前景及应对策略。
华人女学霸AI杀疯!本科最难数赛12题全对,自主证明首次公开
24岁华人女学霸Carina Hong初创打造的AxiomProver,在2025 Putnam数学竞赛拿下满分,其自主生成的Lean证明也公开。该竞赛是北美本科生数学竞赛天花板,人类满分罕见。此外,GPT - 5.2 Pro数学表现也很强,引发“奇点将近”之感。
三天逆袭,Sora登顶美榜!15秒大片玩疯奥特曼,全网直呼真假难辨
上线三天,Sora APP登顶美国App Store榜首,Sora 2的「客串」功能和物理智能实现音画同步,奥特曼亲自下场被玩坏。Sora 2 Pro一次可拍15秒大片。奥特曼预告两大更新,Sora却带来视频造假隐患。
为什么 AI 搞不定体力活——对话清华大学刘嘉:这才是生物智能最难攻克的“万里长征” | 万有引力
本文是对清华大学刘嘉教授的访谈。他回顾 AI 研究经历,谈 AI 寒冬、研究错误及第一性原理,还分析学术界与工业界差异、AI 现状与挑战,指出大模型缺创造力,人应与 AI 共进化。