「动态扩展」共找到 802 篇相关文章
The Batch:924|GPT-5.4:性能更高,价格也更高
OpenAI更新旗舰模型GPT-5.4,有Thinking和Pro两个版本,扩展工具使用能力,多基准测试达当前先进水平,但定价高。虽在部分任务表现超Claude,挑战Gemini地位,不过成本也更高。
OpenAI 开发者的 Skill 经验:如何使用评估系统来优化 Skill
文章聚焦 OpenAI 开发者优化 Skill 的方法,指出迭代 AI 技能效果难测,可借助评估系统。介绍了用 Codex 评估的流程,包括明确标准、创建技能、手动触发找漏洞等,还提及不同阶段的评估重点和工具。
清华刘洋团队论文:揭示为何 70B 的医疗模型,反而不如 8B 会问诊丨ILCR 2026
在医疗AI领域,模型静态评测与临床问诊能力存在断层。清华刘洋团队提出DOCTOR - R1,将临床问诊建模为POMDP,用强化学习训练。实验验证了其有效性,对医疗AI发展有深远启示。
灵码+Qwen3-Coder——使用Skill机制实现代码审核
本文探讨在灵码内使用Claude Skills能力,介绍其实现机制、灵码适配方案。还以代码审核场景为例,展示自定义Skill的创建方法,总结Claude Skills优势及应用场景,展望其与MCP的发展前景。
硅基文明登场!从Clawdbot到Moltbook,人类退居观众席
文章指出AI正自我进化,如Claude Code能自我改进与扩展,Claude Cowork诞生速度惊人。Clawdbot有自主权与记忆,Moltbook中AI形成社会结构。权力正从人类迁移,人类或退居观众席,需思考应对。
Clawdbot开发者:未来一大批应用都会消失,提示词就是新的interface
Clawdbot开发者Peter Steinberger在采访中分享诸多观点,认为今年是「个人助理」之年,每个人应构建智能体探索记忆机制;指出GUI糟糕,多数MCP应做成CLI;还称未来大批应用会消失,提示词是新界面。
从「能用」到「好用」:数据可视化的三个维度,你还在第一层吗?——人大提出图表创作新方式
数据可视化面临静态视觉与动态叙事挑战,如设计繁琐、动画门槛高、交互难复用。中国人民大学IDEAS Lab团队与山东大学交叉研究中心推出PiCCL、CAST、Libra,解决创作难题,还探索用大模型提升可视化效率。
梁文锋署名!DeepSeek再发炸裂论文:提出“条件记忆”新范式,彻底打破GPU推理显存墙
来自DeepSeek的新论文提出“条件记忆(Conditional Memory)”新范式,推出Engram模块,实现可扩展知识查找。研究揭示U形缩放定律,构建的Engram模型性能超越纯MoE基线,还打破了GPU显存瓶颈。
告别「一条路走到黑」:通过自我纠错,打造更聪明的Search Agent
为解决知识实时性和推理复杂性挑战,搜索智能体(Search Agent)应运而生,但缺乏自我纠错能力。腾讯联合清华提出 ReSeek 框架,引入动态自我修正机制,还构建 FictionalHot 数据集评估,实验效果良好。
给定"标价"的 LLM 智能体,能规划出"最优"路径吗?
在LLM智能体多轮工具使用中,评估成本是难题。来自多所高校的团队推出CostBench基准,围绕旅行规划构建评估环境。评估顶尖模型发现其规划与适应能力有短板,并分析失效根源,还指出下一代智能体演进方向。