大模型训练」共找到 9554 篇相关文章

算法论文8

挑战扩散自回归统治!字节提出视觉生成第三种路线,让模型像人类一样边画边改

五一期间字节商业化技术团队研发出新一代视觉生成模型,其底层架构是全新的第三条路——生成精炼网络GRN。它能让AI像人一样边画边改,解决了现有模型的问题,在多项基准测试中刷新SOTA记录。

量子位
开源动态8

腾讯混元发布并开源图像模型 2.1,支持原生 2K 生图

9月9日深夜,腾讯发布并开源混元生图模型“混元图像2.1”,支持原生2K高清生图,综合能力领先。它在多方面升级,有诸多亮点,评估显示效果优,还同步开源文本改写模型,能满足多样视觉需求。

InfoQ
开源动态7

国产开源LLM爆发,Qwen、Minimax、美团、腾讯~

近期国产开源LLM爆发,Qwen3-VL家族新增模型,有技术亮点且可免费商用;MiniMax-M2为编码和代理任务打造;美团LongCat-Video、LongCat-Audio-Codec各有专长;腾讯混元世界 - 镜像用于3D几何预测。

PaperAgent
算法论文8

首帧的真正秘密被揭开了:视频生成模型竟然把它当成「记忆体」

UMD、USC、MIT研究团队发现视频生成模型会把首帧当作‘概念记忆体’,将视觉实体存于首帧并在后续复用。基于此提出轻量方法FFGo,用少量例子让模型实现SOTA级视频定制。

机器之心
算法论文8

DiffMoE:动态Token选择助力扩散模型性能飞跃,快手&清华团队打造视觉生成新标杆!

清华学和快手可灵团队推出DiffMoE,通过创新的动态token选择机制和全局token池设计,拓展了扩散模型的效率与性能边界。实验表明,DiffMoE在多方面超越现有模型,未来集成先进技术或有新增益。

机器之心
产品应用8

Claude 4发布!AI编程新基准、连续编码7小时,混合模型、上下文能力突破

今天凌晨Anthropic开发者会发布Claude 4,含Claude Opus 4和Claude Sonnet 4。前者是顶尖编码模型,后者是Sonnet 3.7重升级。还发布系列产品,定价不变,已上线Amazon Bedrock。

Founder Park
新闻资讯8

第二代AI预训练范式:预测下个物理状态

英伟达科学家 Jim Fan 发布《第二代预训练范式》,指出当前以 LLM 为代表的第一代范式应用于物理世界时「水土不服」,认为第二代范式是「预测下一个物理状态」,引发机器学习社区讨论。

机器之心
新闻资讯7

全网疯传!Claude最新模型意外曝光:全面碾压Opus 4.6,强到让Anthropic不敢发布

Anthropic“手滑”泄露最强新模型Claude Mythos,它在编程、推理和网络安全测试中表现超Claude Opus 4.6。因模型“黑客能力”强,Anthropic发布谨慎。此外,该公司还意外泄露3000多未发布文件。

AI前线
算法论文8

对话清华商宇丨从生成视频到支撑行动,世界模型需要新的评测标准

文章围绕清华团队提出的 WorldArena 评测框架展开。它针对具身世界模型,对过去沿用视频生成的评测逻辑重新审视,从视觉质量和功能性任务两维度评估,推动世界模型从‘生成世界’迈向‘使用世界’。

AI科技评论
推荐文章8

Manus:3核心策略,破解AI Agent上下文膨胀难题

当AI Agent调用工具结果量涌入上下文窗口,LLM性能会下滑。Manus联合创始人拆解其上下文工程逻辑,给出‘减少、卸载、隔离’三策略及模型选择等方法,还提炼出6条实践启示。

CourseAI