性能问题」共找到 4751 篇相关文章

算法论文8

别再卷数据了,LLM也怕「过劳死」!CMU等揭秘灾难性过度训练

CMU、斯坦福等四大名校研究团队挑战“预训练规模越大越好”观点,提出“灾难性过度训练”现象,即增加预训练数据可能导致后训练性能下降,并从现实证据、控制实验、理论分析等方面阐述新研究贡献,还介绍了相关实验及结论。

新智元
新闻资讯8

DeepSeek-R2尚未问世,微软小模型捡漏称王?6000样本炼出「数学作弊器」!

微软推出Phi-4推理模型系列,参数最多14B,能在本地高性能笔记本电脑上流畅运行。Phi-4-mini-reasoning在数学推理上性能超越DeepSeek-R1蒸馏模型,且参数规模更小。文章还介绍了模型特点、训练方法、性能表现及局限性等。

新智元
算法论文8

告别盲选LLM!ICML 2025新研究解释大模型选择的「玄学」

弗吉尼亚理工大学研究团队提出 LensLLM 框架,基于 PAC - 贝叶斯泛化界限揭示 LLM 微调性能“双相演进”,可精准预测微调性能、大幅降低计算成本,为 LLM 选型提供新工具。

机器之心
产品应用8

DeepSeek-V4发布!高效百万上下文智能普惠时代来了

DeepSeek-V4发布,是开源社区关键分水岭。它解决超长文本处理效率痛点,架构与优化有多项突破,降低算力消耗和成本,适配国产芯片,性能比肩顶级闭源模型,推动开源社区两大未来趋势。

AIGC开放社区
开源动态7

1000 行 Java 代码手搓 OpenAI gpt-oss 推理引擎

2025年8月OpenAI发布gpt - oss,作者受相关项目启发,用约1000行Java代码实现gpt - oss推理引擎并发布在亚马逊官方github。文章分享开发体会,介绍模型架构、Java实现、性能优化等内容。

AI前线
新闻资讯7

微软发布了 TypeScript 5.9,延迟导入并增强了开发者体验

微软发布 TypeScript 5.9,带来开发者体验改进、新特性和性能优化,如支持延迟导入、改进默认项目设置、引入新模块选项等,也有性能升级,还透露未来版本计划。

InfoQ
新闻资讯7

Claude神之bug:给自己下指令,还诬赖用户??Hacker News炸了

强如Claude也现诸多bug,如分不清发言角色,把恶意注入指令当用户请求。技术根源是Transformer架构注意力机制盲区。网友给出避坑方案,还吐槽Claude算力调整、计费乌龙等问题

量子位
算法论文8

西交大 x A*STAR 论文:让 AI 学会「保持一致」,多图生成迎来关键突破丨CVPR 2026

西安交大与新加坡A*STAR团队提出论文《PaCo-RL: Advancing Reinforcement Learning for Consistent Image Generation with Pairwise Reward Modeling 》,将一致性问题转为“跨图比较”学习问题,结合强化学习实现能力闭环,提升多图生成一致性。

AI科技评论
新闻资讯7

几月前的伤心事,ChatGPT突然翻出来提醒我?网友当场破防:太会捅刀子了!

今年4月,OpenAI发布ChatGPT「记忆」功能并不断升级,能形成个性化档案,但也带来问题,如提及伤心事、造成社死等,背后有无意的算法残忍和上下文崩塌两类问题

新智元
新闻资讯7

奇点之前,一场关于Physical AI的闭门会议

过去一年,Physical AI成全球AI产业热门方向,诸多关键问题待解。今年9月,上海物理智能与机器人研究院将发起PAIR 2026闭门会议,聚焦未决技术问题,促进多方交流和资本配置。

DeepTech深科技