「大模型评估」共找到 9355 篇相关文章
不靠海量数据,如何精准喂养大模型?上交Data Whisperer:免训练数据选择法,10%数据逼近全量效果
上海交通大学等团队提出 Data Whisperer,首个免训练的注意力驱动数据选择框架。它利用模型自身能力打分挑数据,无需训练与人工标注,用 10% 数据让微调效果逼近全量数据,在多方面领先传统方法。
全能高手&科学明星,上海AI实验室开源发布『书生』科学多模态大模型Intern-S1 | WAIC 2025
7月26日,上海AI实验室在WAIC 2025上发布并开源科学多模态大模型Intern-S1。它融合多学科知识,首创跨模态科学解析引擎,在多学科任务上超越顶尖闭源模型,还支撑构建了多智能体系统。
独家|RoboScience 机器科学完成10亿元融资,资金将用于强化 VLOA 大模型与本体
AI科技评论独家消息,RoboScience机器科学近日完成10亿元A轮融资,将深化VLOA大模型技术,推进自研机器人本体工程化与量产。其VLOA大模型有创新性架构,能实现通用泛化,还将发布自研机器人本体。
网易游戏 Tmax 平台实践:基于 Fluid 的云原生 AI 大模型推理加速架构
网易游戏打造 Tmax AI 机器学习平台,但大模型推理业务规模爆发带来资源弹性等挑战。经评估,选用 Fluid + AlluxioRuntime 构建三层架构,有自动预热等配置,带来性能、成本等多方面收益。
突破一亿Token极限:EverMind提出MSA架构,实现大模型高效端到端长时记忆
机器之心发布文章介绍,大模型长期记忆能力受限于上下文长度。《MSA: Memory Sparse Attention for Efficient End-to-End Memory Model Scaling to 100M Tokens》提出MSA架构,突破扩展性、精度和效率的不可能三角,实现100M长度的大模型长时记忆框架。
豆包大模型2.0+Claude Skills,3步装好,终于有AI能帮我"看视频做笔记"了!火山引擎全系列可用!
传统视频总结工具只基于音频总结,内容浅显。而豆包大模型2.0是多模态原生模型,能同时处理画面和声音。只需3步安装配置,就能让它真正“看”视频,输出详细笔记。
中大 × MBZUAI重磅开源!A₁:全透明高效 VLA 模型,机器人实时控制成本直降 76% 丨CVPR 2026 Findings
开放世界机器人操作被大模型算力成本和推理延迟难题困住,中大与MBZUAI团队推出全开源的A₁模型,其自适应推理方案降低推理延迟和骨干计算量,性能超主流基线,打破‘高性能=高成本’魔咒。
小红书hi lab首次开源文本大模型,训练资源不到Qwen2.5 72B 的四分之一
6月6日,小红书hi lab团队首次开源文本大模型dots.llm1,采用MIT许可证。该模型激活参数量140亿,总参数量1420亿,上下文长度32K。训练资源不到Qwen2.5 72B的四分之一,在多个测评中表现出色。
全球首个科研LLM竞技场上线!23款顶尖模型火拼:o3夺冠,DeepSeek第四
Ai2耶鲁NYU联合推出科研版「Chatbot Arena」——SciArena,23款顶尖大模型比拼科研任务,OpenAI o3夺冠,DeepSeek第四。该平台解决通用基准测试在科研场景‘失效’问题,但其自动评估系统猜科研人偏好远未及格。
刚刚,智谱正式成“全球大模型第一股”,开盘涨超3%!10位董事7个清华背景,专家:国内IPO抢收“确定性”,OpenAI们豪赌“无限性”
今日,智谱在港交所挂牌上市,成“全球大模型第一股”。其有技术、产品、商业化优势,但未盈利,研发投入高。专家认为其上市早,国内厂商上市为求确定,而OpenAI等是扩展无限。