「代码能力评测」共找到 4860 篇相关文章
单卡搞定万帧视频理解!智源研究院开源轻量级超长视频理解模型Video-XL-2
智源研究院联合上海交通大学等机构发布新一代超长视频理解模型Video-XL-2。它单卡能处理万帧视频,编码2048帧仅需12秒,在效果、长度和速度上全面优化,已开放模型权重。
AI仅凭“自信”学会推理,浙大校友复刻DeepSeek长思维链涌现,强化学习无需外部奖励信号
UC Berkeley团队提出新训练方法Intuitor,大模型无需接触真实答案,仅优化自身信心就能学会复杂推理。该方法无需外部奖励信号或标注数据,用模型自身置信程度作内在奖励信号,在多任务表现良好。
75页哈工大多模态推理大模型最新综述:感知、推理、思考与规划
哈工大提出75页多模态推理大模型综述,围绕四阶段发展路线图展开,即感知驱动的模块化推理、以语言为中心的短推理、以语言为中心的长推理、迈向原生多模态推理模型,还给出挑战性基准测试和实验案例见解。
一行 Python,生成绝美城市地图海报!
开源君发现宝藏项目`prettymaps`,这是巴西开发者Marcelo Prates的开源作品,能从OpenStreetMap拉取数据画定制地图。它功能丰富,安装简单,可让普通人轻松进行地图视觉创作。
WorkBuddy上线远程控制,国内也有了最丝滑的Agent工作方式。
WorkBuddy更新远程控制功能,因国内直连,体验比Codex还好。其打通PC、App和小程序,实时同步电脑内容。还新增资料库等实用功能,让国内用户有更丝滑的Agent工作方式。
卖Token也不是稳赚不赔!硅基流动招股书来了
硅基流动向港交所提交上市申请,剑指港股「AI Token工厂第一股」。它将异构算力等封装成Token供应服务,2025年营收增653.2%,但亏损也扩大,公有云业务成本压力明显,生意待市场检验。
Routa 桌面版发布:内建 Harness 工程的 AI Coding 研发协作工作台
Routa桌面版发布,它是内建Harness工程的AI Coding研发协作工作台。围绕Routa构建Harness工程框架,Kanban成为任务协议,多Agent沿泳道接力协作,重新定义了‘done’,让AI Coding进入协作与交付问题域。
第 3 章 Agent 核心功能技术详解
本章以Claude Code及其生态为主参照,介绍现代Agent平台提供类似‘操作系统’机制,包括命令、记忆等。面向熟悉Python与LLM的开发者,按是什么、解决什么问题等展开,还分析了Agent工程核心挑战。
AI 行业悄悄统一了一件事:Agent Skills 开放标准全解析
Agent Skills 是一套开放标准格式,超 30 家主流 AI 开发工具已采纳。它结构简洁,有精妙的三层加载机制,解决了 AI Agent 上下文窗口问题。与 MCP 解决不同层面问题,生态正快速成型。
Agent失忆怎么办,Anthropic教你做好工作交接
文章指出AI Agent跨上下文窗口执行长任务时易失败,Anthropic用Opus 4.5实验发现,问题根源是交接差。解决办法是让Agent像人类工程师一样留文档、进度和测试,拆分流程,严格规范,提升测试覆盖率。