V3.1模型」共找到 9084 篇相关文章

开源动态8

第二代InfLLM开源,同尺寸快三倍!零参数,可训练稀疏注意力

新智元报道,清华、OpenBMB和哈工大提出零额外参数、训练高效的原生稀疏注意力框架InfLLM-V2,仅用5B长文本词元就能完成训练,相比稠密注意力机制有显著加速,性能接近传统稠密模型

新智元
新闻资讯7

忘掉大模型,微软实证:小模型才是Agentic AI的未来!

过去两年大模型在数学竞赛题上靠Test - Time Scaling发展遇天花板。微软rStar2 - Agent让14B小模型学会‘写代码→跑结果→改思路’,表现出色。还介绍了其基础设施、算法、训练配方等方法。

PaperAgent
开源动态8

Transformers v5 中的分词系统:更简洁、更清晰、更模块化

文章聚焦 Transformers v5 分词系统,介绍分词概念、流程、主流算法,对比 transformers 和 tokenizers 库。着重讲 v5 改进,如架构与词表分离,解决 v4 黑盒问题,还能从零训练专属分词器。

Hugging Face
开源动态8

VerseCrafter:给视频世界模型装上4D方向盘,精准运镜控物

复旦大学与腾讯等机构提出VerseCrafter,这是通过显式4D几何控制实现的动态逼真视频世界模型,能精准控镜和指挥物体3D运动。它用独特方法构建4D可控世界模型,实验超现有SOTA方法,代码与模型已开源。

机器之心
新闻资讯7

谷歌开放世界模型一夜刷屏,AI游戏门槛归零时刻来了?

谷歌DeepMind开放世界模型Genie 3的实验性研究原型「Project Genie」,由Genie 3、Nano Banana Pro和Gemini提供技术支撑,有世界草绘、探索、重混三大玩法,但Genie 3仍处早期需改进。

机器之心
产品应用7

The Batch: 954 | Kimi K2.6 挑战开源权重模型领先者

Moonshot AI升级后的Kimi K2.6是1万亿参数的视觉 - 语言模型,专为代码生成设计,性能与Qwen3.6 Max Preview等相当,略逊顶级闭源模型。其功能多,幻觉率低,模型权重可免费下载。

DeeplearningAI
算法论文8

视频模型也能推理,Sora2推理能力超过GPT-5

DeepWisdom团队研究发现视频生成模型能推理,在空间类任务上比图文模型更擅长。团队推出VR - Bench基准测试,构建客观评分体系。实验显示视频模型在空间推理有优势,相关代码和数据集已开源。

量子位
算法论文8

字节Seed新作:模型合并如何改变大模型预训练范式

字节跳动Seed团队在arXiv发表论文,提出预训练模型平均(PMA)技术。该技术将模型合并引入预训练阶段,可提升性能、预测衰减阶段表现,还能解决训练问题。不过,高学习率影响和强化学习应用待研究。

机器之心
开源动态8

空间智能终极挑战MMSI-Video-Bench来了,顶级大模型全军覆没

上海人工智能实验室 InternRobotics 团队推出空间智能视频基准 MMSI-Video-Bench,对主流多模态大模型进行评测。该基准题型全面、问题具挑战性,视频数据多样,能针对性测评。结果显示模型与人类差距显著,明确了能力瓶颈。

机器之心
新闻资讯7

号称1200万token上下文的模型来了,数据亮眼但疑点重重

当地时间5月5日,Subquadratic公司推出模型SubQ,称是LLM智能重大突破,有1200万token上下文。数据亮眼,如在1M token场景比FlashAttention快52倍等,但也引发质疑,有人推测是对开源模型微调,官方未公布详细模型卡。

DeepTech深科技