「Paper2Agent」共找到 4252 篇相关文章
Gemini 3 编程第一断崖式领先,谷歌 AI Mode 直接装备 G3,反重力的 Antigravity 是啥?
今年 8 月发布的 GPT 5 未达成 AGI,Gemini 3 能力提升明显。谷歌将其塞进 Search 的 AI Mode,AI 普惠意义超能力升级。开发者方面,它是主力型号,编程能力跃升,还加强 Agent 能力并推出新工具 Antigravity。
OCR-Reasoning:揭秘多模态大模型在复杂图文推理中的真实能力
主流OCR评测基准聚焦信息抽取任务,而图文推理任务缺乏系统性评估标准。OCR - Reasoning可系统性评估多模态大模型深度推理能力,还给出多种推理示例,并展示了测评Qwen2.5 - VL - 7B模型的代码。
字节Seed提出序贯策略优化方法,突破同传“质量-延迟”权衡问题
AI字幕质量和延迟难平衡是业界老问题。香港中文大学、字节跳动Seed和斯坦福大学研究团队提出序贯策略优化框架SeqPO - SiMT,在70亿参数规模实现SOTA,翻译质量媲美Qwen - 2.5 - 7B离线水平。
深度研究白菜化?谷歌将Gemini级AI研究能力开源
谷歌推出'gemini-fullstack-langgraph-quickstart'开源项目,用Gemini 2.5与LangGraph结合,可构建本地运行的深度研究智能代理系统。介绍其技术架构、工作流程、开发配置、部署扩展,还展示了现代AI应用开发趋势。
3D版Nano Banana来了!AI修模成为现实,3D生成进入可编辑时代
2026年初市场关注3D生成领域,中国团队Hyper3D发布Rodin Gen - 2 Edit,实现3D模型局部编辑。它支持两种操作路径,将“3D生成”与“3D编辑”整合,还打通主流工作流,源于团队长期技术积累。
刚刚,DeepSeek新模型MODEL1曝光,3处架构升级!
DeepSeek更新FlashMLA时曝光新模型MODEL1,从diff看它在MLA KV-Cache存储与访问方式上和V3/V3.2系列有3个本质差异,如物理排布更紧凑、引入‘extra’两段式cache、头维固定512×512。
火爆全网的Skills,终于有了最简单的打开方式。
扣子更新到2.0版本,上线Skills和长期计划功能。Skills很火但现有支持产品对普通人门槛高,扣子降低了其使用和创建门槛,还提供两种创建方式;长期计划能帮用户定目标做规划,但有一些不足。
拒绝传统 Router“瞎指挥”,多智能体如何实现智能任务分配?
企业级多智能体系统瓶颈常是负责分发任务的传统 Router 太“傻”,搞不定跨域、解不了冲突、跟不上变化。腾讯云开源 TCAR 智能路由模型,它先推理再选 Agent 集合,经多数据集评测表现出色,还提供完整开源范式。
不止是 Claude Code 平替:这个开源 CLI 还支持“多模型协作 + 子代理并行”
Kode 定位是在终端中完成代码库理解、文件编辑、命令执行等开发流程,有三大亮点:将多模型协作设为核心能力;支持 AGENTS.md 文档模式;终端体验好,有强大的补全系统。还介绍了使用方法和适用人群。
GitHub Copilot新代理把「自家人」逼疯了!
GitHub Copilot新智能体Coding Agent公测,官方想让它成协作开发搭子。但在微软仓库使用时问题多,多次提交失败、逻辑不通,未解决关键问题,虽能自动完成繁琐任务,但距‘靠谱搭子’还远。