「大模型评估」共找到 9370 篇相关文章
苹果分享 iOS 26 即将推出的 AI 基础模型的细节
苹果在技术报告中公布 iOS 26 新 AI 基础模型细节。该模型有 3B 参数和更大版本,前者在设备运行,后者用于私有云平台。介绍了架构、评估结果,还强调实现可信赖 AI 的方法。
英伟达GPU被曝严重漏洞,致模型准确率暴跌99.9%
英伟达GPU被白帽黑客发现严重漏洞,通过GPUHammer攻击可使大模型准确率从80%降至0.02%。此攻击属Rowhammer类,直接对显存“物理动手”。英伟达建议的防御措施会使模型性能下降。
The Batch: 894 | 面向生物医学的多模态模型
过去几年联合推理模型进展快,但生物医学领域能力碎片化、脆弱或难解释。2026 年,学术界应推进多模态模型建设,关注深度整合、可解释性、数据效率和适应性及模型在工作流中的整合。
Fable 5榜单第一靠作弊?代码泄露,模型真实身份曝光
黑客泄露Claude Fable 5长达12万字符的系统提示词,揭示它并非大模型,而是伪装成LLM的完整Agent系统。这颠覆了对AI模型的认知,也让Anthropic陷入舆论漩涡,还暴露了其计费黑幕。
如何让AI“看懂”网页?拆解 Browser-Use 的三大核心技术模块
传统Browser - Use难应对界面变化,大模型驱动下正迈向智能化。文章拆解其三大核心技术模块,介绍历史发展、核心功能,分析源码各模块,指出创新点与不足,还提及业界更好解决方案。
奥特曼深夜官宣:OpenAI重回开源!两大推理模型追平o4-mini,号称世界最强
OpenAI深夜推出gpt-oss 20B和120B两款开源模型,性能比肩o3-mini和o4-mini,能在消费级显卡甚至手机运行。有宽松许可证等亮点,还准备了体验网站。这是自GPT - 2后首次开源,降低了部分群体准入门槛。
ICML 2025 Spotlight|华为诺亚提出端侧大模型新架构MoLE,内存搬运代价降低1000倍
华为诺亚和北大研究人员提出端侧大模型新架构MoLE。它解决传统MoE显存开销大、传输延迟高问题,推理时将专家输入改embedding token,用查找表替代矩阵运算,实验显示性能与MoE相当,大幅降推理延迟。
95 后团队做 3D 大模型,拿下头部游戏重磅合作,正在定义 3D 生成的新规则
影眸科技年轻团队携 3D 生成模型 Rodin 获头部游戏合作。其研究入选 SIGGRAPH 最佳论文提名,还完成融资。新模型 Rodin Gen - 2 提升生成质量与可控性,在多领域应用,定义 3D 生成新规则。
狂拿大模型明星订单,一家清华系HPC-AI Infra公司浮出水面
本文介绍清华系计算创业公司是石科技,其93年创始人闫博文不囤算力仍拿下大模型明星公司订单。团队技术实力强,3次获戈登·贝尔奖。公司构建全栈能力,为多领域提供服务,未来想以算力赋能各行业。
哈工大、中科院等利用模型“潜意识”提高推理模型效率,0.6B撬动复杂推理
哈工大、中科院等提出TrajSelector框架,让推理模型‘倾听内心独白’。它利用模型隐藏状态,用0.6B轻量级验证器实现比7B裁判模型更精准选择,在数学竞赛基准测试中表现出色,还能离线筛选数据,但在开放域问答有难题。