「V3.1模型」共找到 9149 篇相关文章
整整21个月,豆包大模型正式进入2.0时代!
时隔21个月,豆包大模型2.0正式推出。它在多模态理解、企业级Agent、推理和代码能力上有提升,在多个基准测评中达业界最优。实测显示其在编程、数学问题处理上性能出色,性价比也具优势。
腾讯开源全新动作迁移模型FlexiAct,人物 & 动物都支持
当前动作定制方法在应对多样化主体和场景时适应性差,清华与腾讯提出FlexiAct模型。它引入RefAdapter和FAE,能在空间结构差异大或跨域场景中精准适配动作,保持外观一致,表现优于其他方法。
刚刚,Gemini 2.5 Pro升级,成编程模型新王
Google DeepMind发布Gemini 2.5 Pro (I/O edition),编程能力大幅提升,在编程排行榜超Claude 3.7 Sonnet。用户用一个提示词或草图+描述就能构建应用,谷歌大佬站台,网友实测效果佳。
美团之后,京东也开始自研大模型了
京东发布JoyAI - LLM Flash模型,激活参数小、推理快。它采用混合专家架构等技术,在基础架构、数据加工、强化学习等方面表现出色,还通过多Token预测等技术加速推理,为商业场景落地扫清障碍。
有了它,太丝滑啦,5.3k Star ai-memory!!!
Claude Code 与 Codex 切换时需重述项目情况,5.3k Star 的 ai-memory 解决此问题,它将 Agent 生命周期信息整理成可 Git 管理的 Markdown Wiki,提供可审计的交接班机制。
Manus:3大核心策略,破解AI Agent上下文膨胀难题
当AI Agent调用工具结果大量涌入上下文窗口,LLM性能会下滑。Manus联合创始人拆解其上下文工程逻辑,给出‘减少、卸载、隔离’三大策略及模型选择等方法,还提炼出6条实践启示。
刚刚,字节开源Seed-OSS-36B模型,512k上下文
深夜,字节跳动Seed团队开源Seed-OSS系列模型,含三个版本。其用12万亿tokens训练,在多基准测试表现出色。有灵活推理预算控制等特性,原生支持512K上下文窗口,基准测试成绩佳。
Talking-Critic奖励模型带来更自然的音频驱动肖像
近期音频驱动肖像动画技术发展快,但现有方法存在嘴型声音不对、动作不自然等问题。阿里提出Talking - Critic奖励模型,构建Talking - NSQ数据集,还提出TLPO优化框架,提升多维度表现,实验超现有SOTA方法。
3天狂揽23.1k星!把代码库变成知识图谱,AI编程成本降低35%
CodeGraph是开源本地代码知识图谱工具,提前为项目建索引,组织代码信息,让Agent直接查询。能减少token消耗与工具调用、提高响应速度,数据本地保存,还具备多语言支持等特点。
VGGT4D:无需训练,挖掘3D基础模型潜力,实现4D动态场景重建
香港科技大学(广州)与地平线研究团队提出 VGGT4D,无需训练,通过挖掘 Visual Geometry Transformer 注意力层运动线索,在动态物体分割等任务表现优异,为 4D 重建提供新思路。