测试评估集」共找到 2678 篇相关文章

开源动态8

Qwen-Scope:看穿大模型的“小心思”

Qwen-Scope是基于Qwen3和Qwen3.5系列模型训练的可解释性模块,通过在隐藏层插入SAE提取可解释特征。它能分析模型行为、优化模型,应用于推理、数据、训练、评估等场景,可前往Huggingface或魔搭体验。

千问大模型
产品应用7

B站下场自研AI配音!纯正美音版甄嬛传流出,再不用看小红书学英语了(Doge)

B站发布TTS模型IndexTTS2,亮点是实现时长控制时再现符合Prompt的情感特征,支持两种生成方式,经测试多项指标达SOTA。它由三核心模块组成,还可能是代号H的AI创作工具一环。

量子位
产品应用8

美团提出首个语音交互GUI智能体,端到端语音训练能力优于传统文本训练

美团和浙大联合推出GUIRoboTron - Speech,这是首个能利用语音指令和屏幕截图端到端决策的自主GUI智能体。它解决了文本依赖问题,团队经多步骤研发,其性能评估表现佳,还给出招聘信息。

量子位
推荐文章7

[Triton编程][基础]vLLM Triton Merge Attention States Kernel详解

文章详细介绍vLLM中Triton Merge Attention States Kernel的实现,与PyTorch原生实现对比,该Triton kernel最高可实现3 - 5倍以上算子加速。内容涵盖Merge Attention States概念、PyTorch实现、Triton基础算子、分析及性能评估等。

GiantPandaLLM
开源动态7

性能碾压GPT-4.1-mini!Mistral开源Devstral,还能在笔记本上跑

法国AI初创公司Mistral与All Hands AI合作,发布全新开源语言模型Devstral,有240亿参数,所需算力低,可本地部署。它能解决真实GitHub问题,在SWE基准测试中表现优于多个模型,还能通过API访问。

机器之心
新闻资讯8

Ilya交卷!黄仁勋砸50亿押注SSI,首个模型疑本周发布

Ilya Sutskever创立的SSI或本周发布首个重磅模型,引发圈内关注。英伟达砸50亿美元合作,提升其算力。该模型基于测试时训练架构,能边学边进化,或终结大模型“预训练时代”。

新智元
新闻资讯7

AI 太烧钱!微软选择「倒戈」DeepSeek

微软宣布Copilot Cowork全球上线并引入按使用量计费机制,还评估引入DeepSeek V4。Agent普及使AI成本问题凸显,微软进行系统性重构,构建质量保障体系,成本工程化能力成竞争新焦点。

AI科技评论
开源动态8

刚刚,机器人练成了宁次的「白眼」:∞帧画面边看边3D重建我们的世界!

蚂蚁灵波开源的LingBot - Map模型实现无尽流,可看∞帧视频稳定实时3D重建。它打破“既要实时、又要记路、还要省显存”的不可能三角,在多项测试中表现优异,补齐具身智能关键拼图。

量子位
开源动态8

LeRobot v0.5.0 正式发布

LeRobot v0.5.0正式发布,是规模最大的一次发布。在硬件上支持更多机器人,策略模型新增6种,数据处理优化,还推出EnvHub,代码库也全面升级,此外社区与生态建设也有进展。

Hugging Face
算法论文8

罕见!Meta、OpenAI、xAI联合分享了用生产环境提升LLM的最佳实践!

Meta、OpenAI、xAI联合发表成果CharacterFlywheel,聚焦在生产环境提升社交型AI对话能力。团队基于LLaMA 3.1迭代15个版本,7/8的A/B测试显示正向提升,介绍了架构、数据管道、奖励模型等内容。

PaperAgent