「Skills调用能力」共找到 3684 篇相关文章
Show me《指环王》!卡帕西强推大模型评测新基准
大神卡帕西宣称Anthropic用《指环王》给大模型评测上强度,这一‘指环王基准’正接替‘鹈鹕骑自行车’SVG测试。虽Opus 5生成的画面粗糙,但网友测试展现出丰富创意,不过新测试也引发争议。
Claude Code惊人身世曝光!竟脱胎于安全对齐,Boris:才完成1%
Claude Code起源于Anthropic内部安全对齐项目,其发展历经波折。从2021年早期尝试,到2025年正式发布,期间突破重重技术难题。虽已改变硅谷运转方式,但核心开发者Boris称只完成1%。
从答题到做实验:SciAgentGym让大模型进入科学工作流
复旦大学NLP实验室提出SciAgentGym,为科学智能体搭建工作流环境,还设计了评测集SciAgentBench。实验显示模型接入工具能提升成功率,但长流程任务性能下降。论文还提出SciForge构建训练数据,提升了模型表现。
Karpathy投了一家AI记忆公司,撞名DeepSeek Engram记忆架构
新公司Engram完成9800万美元融资,投资人有Andrej Karpathy等。它想为AI构建能持续学习的“记忆层”,解决模型吸收组织内部知识问题,首个产品是面向Agent的API,已与多家合作。
具身智能迈入下半场,RoboMemArena全面评测机器人记忆系统
香港科技大学(广州)等多机构打造具身智能评测基准 RoboMemArena,突破传统局限,构建综合评测体系,配套真机测评。它提供多模态标注,任务长程多样,开源资源易用,PrediMem 在其上表现出色。
DMLR 2026 | RPI Shaowu Pan(潘韶武)团队 Nithin Somasekharan等:CFDLLMBench——首个面向计算流体力学的大语言模型综合基准评测
文章介绍针对CFD领域的综合LLM评测基准CFDLLMBench,构建三层递进挑战体系。实验揭示主流LLM在‘知道’与‘做到’间有差距,多智能体框架可提升成功率,代码与数据集已开源。
24小时、78轮实验、持续迭代,AiScientist自己把最优解一步一步逼出来了
中国人民大学高瓴人工智能学院的AiScientist挑战让AI持续推进研究工程。它采用“thin control over thick state”设计,通过分层编排和File - as - Bus等方式,在多任务上表现出色,为AI科研工程补上关键底座。
AlphaGo 十年:哈萨比斯说,Altman 曾把“坦克”停在我的草坪上,我要反击
3月11日是AlphaGo诞生十周年,其改变了围棋和AI行业节奏。2026年3月10日相关活动上,塞巴斯蒂安·马拉比分享哈萨比斯成长轨迹,与刘铁岩交流AGI机遇挑战,探讨哈萨比斯特质、跨学科背景等话题。
Anthropic工程师都离不开!深夜随手撸出的开源神器,被OpenAl高价收购,23人创业逆袭
昨日 OpenAI 宣布收购 Promptfoo 保障 AI 智能体安全,技术将整合进 OpenAI Frontier。该工具由 Discord 工程师开发,受诸多企业和开发者欢迎。收购后它将保持开源,继续支持现有客户。
AI Agent搞定世纪首次菲尔兹奖成果形式化!一周时间独立完成,20万行代码已公开
Math公司的AI Gauss用5天完成原本需6个月的菲尔兹奖级数学成果形式化证明,一周搞定24维情形,还修正原论文错误。其创始人是xAI联合创始人Christian Szegedy,代码已公开。