「高效长上下文建模」共找到 1402 篇相关文章
华为携手中科大发布灵境造物,openJiuwen首发Coordination Engineering全栈支撑
4月25日,中国科学技术大学发布“灵境造物”智能科研云平台,面向全球开放。华为支持的openJiuwen社区与MindSpore社区提供Coordination Engineering技术体系,让AI从“单兵作战”升级为“科研精锐团队”,适配科研全流程需求。
写了 17 年开源代码,我为什么认为 Coding Agents 堆功能是在瞎折腾?
libGDX 创始人、17 年开源老兵 Mario Zechner 吐槽 Claude Code、OpenCode 等工具功能堆叠,带来掌控感丧失等问题。他推出极简主义编程 agent pi,仅含四种工具,有最短系统提示词,扩展性强,能让开发者重拾掌控权。
烧Token成KPI,8.5万Meta员工狂刷60万亿Token,争榜一大哥
硅谷兴起“tokenmaxxing”,将token使用量作为生产力基准和竞争指标。Meta超8.5万员工参与烧token竞赛,30天消耗超60万亿。国内阿里、腾讯也有相关动作,科技大佬推波助澜,Anthropic年化收入破300亿美元。
计算所 x 上交大论文:只用双人数据,也能生成多人动画丨CVPR 2026
中国科学院计算技术研究所与上海交通大学团队提出多人物动画生成框架MultiAnimate,引入身份标识与空间关系建模方法,用双人数据训练,能扩展到多人动画生成,优于现有方法。
18 岁创业者用 OpenClaw 管 16 个 AI Agent,一个人的 Agent 公司怎么运转
18岁无编程背景创业者用OpenClaw搭建多Agent协作平台,16个Agent分工明确,配合Claude、GLM等工具提升生产力。他分享工作流搭建、成本、模型选择等经验,还谈了对OpenClaw发展的看法。
Google 把翻译能力彻底开源了!TranslateGemma:550种语言通吃,还能直接看图翻译!
Google将多年积累的翻译能力灌进开源大模型TranslateGemma,它基于Gemma 3,专为翻译任务调优,有3个规模版本,覆盖550种语言,能直接看图翻译,亮点颇多。
Anthropic 为什么推出 Skills?它会革谁的命!
近期Claude Code出圈,开发者基于其构建应用。Anthropic 作为先驱,在 MCP 后推出 Skills,旨在解决现有技术架构痛点,它是标准化 SOP,有分层设计优势,还推荐了 skill0.atypica.ai 平台。
Stanford、Meta和Google等发现LLM存在五大天花板,再扩算力已无用
论文《On the Fundamental Limits of LLMs at Scale》指出,LLM性能提升有理论天花板,扩展中会遇幻觉、上下文压缩等五大根本限制,源于计算、信息与学习理论,未来应转向‘有限优化’。
Jina Code Embeddings: 为高质量代码搜索而生的0.5B/1.5B向量模型
本文介绍了 Jina AI 开源的代码向量模型 `jina-code-embeddings`,含 0.5B 和 1.5B 规模,有 GGUF 量化版本。它性能顶尖,支持多任务与 15 种语言,还介绍了训练方案、使用方法等。
Karpathy:强化学习「有点问题」,突破还需新算法
前特斯拉AI总监、OpenAI创始团队成员Karpathy发文称,强化学习虽能带来更多收益,但机制「可疑」,不像人类解决智能任务的方式。他提出新算法框架,还指出当前存在诸多待解决的问题。