「大模型自信问题」共找到 9569 篇相关文章
LLM又曝致命缺陷:根本不会看时钟!博士惊呆,准确率不及50%
最新研究揭示AI存在认知缺陷,读取时钟准确率仅38.7%,判断日历日期准确率26.3%。研究者构建测试集考察MLLM能力,虽部分模型有亮点,但整体表现不佳,凸显训练数据和推理方式改进需求。
争夺 Agent 市场,微软的押宝点竟是「情商」?
微软AI CEO Mustafa Suleyman接受访谈,分享AI未来见解,探讨情商重要性等问题。他推动AI从功能向人性化发展,认为AI是伴侣非仅工具,强调情感连接,还提及Copilot靠情商打差异化等。
JFM | 浙江大学郑畅东、谢芳芳等:基于Transformer网络的上下文学习跨翼型的主动流动控制策略
浙江大学郑畅东、谢芳芳等提出基于Transformer网络的上下文学习跨翼型主动流动控制策略。该框架引入策略改进算子,结合强化学习与气动形状优化,在翼型流动分离问题中表现出色,提升了整体性能。
微软正式开源UFO²,Windows桌面迈入「AgentOS 时代」
微软研究团队正式开源业内首个深度集成 Windows 操作系统的桌面智能体平台 UFO² AgentOS。它是 UFO 升级版,解决传统智能体问题,在多维度实现突破,经测试表现领先,代码和文档已开源。
机器人伸手时,杯子被挪走了:LIBERO-MAX用22.4万次仿真检验动态可靠性
本文介绍了斯坦福等多校研究者提出的机器人评测基准LIBERO-MAX,针对机器人执行任务中途环境变化的痛点,设计配对测试方案,经大规模仿真评测现有模型性能,为机器人动态鲁棒性改进提供标准化测试平台。
吴恩达新作:87%推理token用不着,丢掉反而快3倍
吴恩达新作Prefix Sliding指出,模型推理时丢弃中间已贬值token,只保留前缀+滑动窗口,无需训练可提速3倍,配合RL训练能将推理轨迹扩展到10万token以上。该方法为Agent场景提供新思路。
让 AI Scientist 真正“做出材料”, 鼎犀智创完成数亿元 Pre-A 轮融资
AI新材料研发公司鼎犀智创完成数亿元Pre - A轮融资,资金用于模型及技术研发等。该公司技术路线独特,案例显示能大幅缩短研发周期,还将中试放大纳入体系,推动材料研发走向平台化。
互联网免费数据已被吃光,普通人反馈早没用了?前英伟达工程师:Transformer的原罪浪费算力,聊天机器人把GPU全糟蹋了
前英伟达工程师、Sail Research 创始人 Neil Movva 认为当前 AI 行业陷“延迟陷阱”,AI 终局应是后台 Agent。他执行“算力拾荒者战略”,想降低智能成本,还指出 Transformer 架构有缺陷,互联网数据被吃光等问题。
豆包工作体验:Agent 正在成为工作的新入口
豆包发布“豆包工作”,定位为独立办公 Agent 工作台。体验良好,能开项目、连办公应用。文章指出用户习惯迁移,Agent 成工作入口,还探讨了办公 Agent 的竞争点、权限问题、组织提效及人员角色转变等。
Physical Intelligence联创最新访谈:机器人尚未进入可预测的Scaling阶段
2024年末PI实验室测试,机器人表现有惊喜也有“语义上说得通的错误”。联创Levine在访谈中认为,机器人未到可预测Scaling阶段,还在确定规模化技术路径,也谈到数据、泛化、可靠性等问题。