模型能力连续体」共找到 9034 篇相关文章

开源动态8

OpenAI 迈出关键一步:LLM 黑盒不再是盲盒

OpenAI开源新研究成果,提出全新范式,训练权重稀疏的Transformer模型以提取人类可理解的电路。该方法分三步,关键结果显示稀疏模型优势多,但也存在训练成本高、规模有限等局限,还给出两条未来路线。

PaperAgent
产品应用7

一家营收千亿美元的公司,如何回应 AI 落地的策略问题

2025年9月19日,Qwen3和DeepSeek v3.1上线Amazon Bedrock。该产品秉持“Choice Matters”理念,为不同业务选适配基础模型,上架超二百余款模型。亚马逊云科技副总裁总结选模型要点,其策略影响AI落地进程。

InfoQ
算法论文8

12个Ai编程Agent同台PK,最贵的不一定是最强的

上海交大和美团联合发布PRDBench论文,将12个主流AI编程Agent放入50个真实Python项目测试。结果显示,基础模型写代码强,商业版调试优势明显;专门训练的裁判模型比通用大模型靠谱。

CourseAI
算法论文8

迈向原生全模态AI智能体:人大&小红书发布OmniGAIA新基准

中国人民大学等团队推出 OmniGAIA 新基准及 OmniAtlas 训练框架。OmniGAIA 含 360 个高难度任务,覆盖多领域。实验显示闭源与开源模型差距大,OmniAtlas 显著提升开源模型表现,并指出未来全模态智能体发展方向。

PaperAgent
新闻资讯7

担心蒸馏问题,Meta限用Claude Code、Codex

据外媒报道,Meta限制员工在AI模型构建中用Claude Code和Codex,因担心涉及模型蒸馏,且随着AI使用成本上升,Meta想让更多开发工作迁至MetaCode,这揭开了AI Coding时代新问题。

机器之心
推荐文章7

Learn to Reason _ The way of Baichuan-M1-ClinicReasoning

前百川智能研究小组负责人阎栋分享大语言模型临床推理。回顾推理技术发展,以Deepseek为例;介绍百川在医疗推理实践,模型达三甲主治水平;还谈及大模型训练困境及与人类智能差异。

InfoQ
新闻资讯7

加一个字母就可以绕过AI围栏,新的漏洞:TokenBreak

提示词注入攻击威胁大模型及应用,当前主要防护方法是用BERT模型检测。HiddenLayer团队发现TokenBreak漏洞,通过加字母绕过检测。研究表明BPE和WordPiece分词策略易受攻击,Unigram不易,建议优先选Unigram类模型

AI与安全
算法论文8

ICML 2025 | M+框架来了,增加LLM隐空间记忆,不再受上下文窗口限制

本文提出M+长期隐空间记忆扩展框架,在MemoryLLM之上,将8B级模型有效记忆跨度从不到20k提升到160k+,显存占用不变。它解决了现有记忆模型冗余、冲突难解等问题,为下一代语言模型提供支撑。

机器之心
产品应用8

AI 时代的 MySQL 数据库运维解决方案

文章指出大模型与MySQL数据库运维结合能改变传统管理方式,提供完整的MySQL大模型运维系统构建路径,涵盖知识库建设、模型选择与调用策略设计、MCP Server开发及监控与优化闭环建立,可提升运维效率与准确性。

阿里云开发者
开源动态8

真实评估!北理发布全球首个「全场景教育」基准,支持4000+情境

北京理工大学高扬老师团队推出EduBench,是全球首个「全场景教育」基准,涵盖9大教育场景、12个评估维度、超4000个情境。团队将数据、模型等全面开源,评估发现大模型在特殊教育场景有不足,还提出多源知识蒸馏等方法。

新智元