「当下的力量」共找到 10582 篇相关文章
UserBench 与 UserRL 带来的交互智能范式转向
当下大模型在与用户交互时存在不足,来自UIUC与Salesforce的UserBench和UserRL两篇新作,将‘用户价值’量化,把‘可测的交互’转化为‘可训练的策略’,从评测和训练层面推动模型向‘懂用户’转变。
这个免费的任务助手登顶 SuperCLUE-XClaw 榜单
近日,SuperCLUE - XClaw发布最新测评榜单,百度文心助手在十个参评的国产龙虾产品中夺冠,获97.62分。SuperCLUE是关注中文大模型评测的第三方体系,其榜单受业内关注。文心助手还是免费的。
普通人的AI知识库
对普通人而言,没必要用复杂AI知识库,把NotebookLM用好就够了。Google的两个更新让它更强大:一是升级Gemini 3,二是和Gemini应用打通。它是最适合普通人的AI知识库,有诸多优点。
上下文工程如何重塑智能体的“思考方式”?
文章指出在大模型时代,智能体能否理解上下文是关键。介绍了上下文工程的魔力、从提示词到上下文工程的演进,分析了上下文工程不等同于上下文的原因及常见失败类型,还给出编排设计和常见策略,最后提及用RAGFlow构建私有知识问答应用。
Andrej Karpathy 提出判断什么工作会被 AI 替代的新标准
Andrej Karpathy 提出判断工作是否会被 AI 替代的新标准,即不看复杂度看可验证性。他在 Software 2.0 框架下解释此现象,还指出任务被 AI 自动化需满足可重置、高效、可奖励三个条件,同时提及该框架有局限性。
独一份!带动效的 PPT 生成 Agent!使用教学&创作思路
作者实现用 Nano Banana Pro 生成带演示动画的 PPT 这一独特功能。介绍了更新后的 PPT 生成 Skills 能力、使用方法、创作思路,还提及成本及对 AI Coding 发展的看法。
烧了1万块横测,你用的模型可能掉队了
作者花大成本从后端、人味、前端、推理等维度,对glm 5.2、kimi k3等国产模型进行测试,展示各模型在不同测试中的结果,指出国模2T俱乐部的kimi和qwen下限高,且刻板印象需改变。
来自 Manus 的一手分享:如何构建 AI Agent 的上下文工程?
Manus 公司联合创始人季逸超分享为 Manus 搭建上下文工程的经验。文章探讨构建 AI 智能体时的关键抉择,给出围绕 KV - Cache 设计、通过掩码约束行为等构建原则,助开发者少走弯路。
刚刚,OpenAI前CTO:战胜LLM不确定性的方法找到了!
OpenAI前CTO创立的Thinking Machines Lab发布研究《战胜LLM推理中的不确定性》。研究指出LLM推理不确定性主因是批处理大小变化,而非常见认为的GPU并行性等。还给出实现批处理不变性的方案及实验结果。
APP 是功能的软件化,Skill 是经验的软件化
文章指出移动互联网时代人类把需求装进 APP,Agent 时代则把经验装进 Skill。当前多数人未充分使用 AI,微信接入 Openclaw推动大众拥抱 AI。Skill 是新旧世界耦合点,还具备进化能力,可形成复利。