大模型自信问题」共找到 9500 篇相关文章

推荐文章8

GPT-5 = Scaling Law失效?毕树超:永远有效,因为它反应的是数据结构,客观规律

Shuchao Bi在哥大演讲阐述AI发展。回顾自监督与强化学习路径,指当前发展遇高质量数据瓶颈,认为Scaling Law不会失效。还探讨通往AGI面临的问题,畅想AI重塑世界,提出两个理解AI发展的心智模型

AI寒武纪
新闻资讯7

具身智能开始进入「下半场」:从会干活到干完活

具身智能正处热门,国内今年上半年赛道融资额高涨。但钱与落地有落差,拉格朗日具身技术自研 Agentic OS,采用分层智能架构处理工程问题。还推动工序重构,制定技能矩阵和排期计划,其团队背景多元,赌让机器人干完活路径。

AI科技评论
推荐文章7

上下文工程如何重塑智能体的“思考方式”?

文章指出在大模型时代,智能体能否理解上下文是关键。介绍了上下文工程的魔力、从提示词到上下文工程的演进,分析了上下文工程不等同于上下文的原因及常见失败类型,还给出编排设计和常见策略,最后提及用RAGFlow构建私有知识问答应用。

阿里云开发者
推荐文章8

刚刚!北大校友Lilian Weng最新博客来了:Why We Think

北大校友Lilian Weng更新博客《Why We Think》,回顾利用测试时计算的研究进展,探讨让模型“思考更久”的方法。文中介绍了思维链、潜变量建模等策略,还提及多种提升生成质量的策略,如并行采样与序列修订,以及强化学习提升推理能力等内容。

机器之心
算法论文8

对噢!为什么LMs就不能直接输出答案+confidence呢?

当前语言模型在复杂问答任务中存在校准退化问题,本文提出RLCR方法,将概率校准融入RL训练目标,重构奖励函数,在多个数据集实验中显著降低校准误差,不损失准确性,为高风险场景AI部署奠基。

深度学习自然语言处理
算法论文7

基于Memory Bank的Cursor长会话记忆内存库理论研究与实践

文章围绕Memory Bank展开,介绍其为解决大模型长会话记忆瓶颈而设计的机制,包括存储、检索、更新模块。阐述其在编程和知识库建设的应用,还评测了Codelf等工具,指出Memory Bank是AI迈向智能的重要一步。

阿里云开发者
算法论文8

56倍加速生成式策略:西交大提出EfficientFlow,迈向高效具身智能

生成式模型在机器人和具身智能领域面临训练依赖大量数据、推理慢的问题。西安交通大学团队提出EfficientFlow,融合等变建模与高效流匹配,提升数据效率,压缩推理迭代步数,在多基准实现SOTA,推理提效显著。

机器之心
开源动态7

卷疯了!这个清华系Agent框架开源后迅速斩获1.9k stars,还要“消灭”Prompt?

随着大模型能力突破,Agent 从概念走向应用。清华系 Agent 框架 Cooragent 开源获 1.9k stars。其创始人王政认为 Agent 框架要适应多样需求,解决泛化与精确性平衡等痛点,还分享了对 MCP、框架融合等看法。

InfoQ
产品应用8

爆改绩效汇报后,赵晓卉:“等着拿奖金了”|甲子光年

本文介绍飞书未来无限大会成果,升级多维表格,发布知识问答产品与开发套件。还在直播节目中帮嘉宾解决业务痛点,如赵晓卉绩效汇报、朱萧木电商管理等问题。此外,飞书发布AI应用成熟度模型,推动行业健康发展。

甲子光年
算法论文7

实证:现在的LLM根本不会Reasoning!

论文指出当前大推理模型(LRM)如DeepSeek - R1等可能只是在表演“思考秀”,遇到复杂问题就崩溃。研究者用4个可控谜题测试,有三大颠覆发现,还揭示思考过程的荒诞现象,直指行业痛点并给出发展方向。

深度学习自然语言处理