学习框架」共找到 2759 篇相关文章

新闻资讯8

Mamba-3惊现AI顶会ICLR 2026!CMU知名华人教授一作首代工作AI圈爆红

Transformer有力挑战者Mamba的最新版本Mamba-3进入ICLR 2026盲审。它有三大改进,在长文本处理、实时推理和成本优化有优势。此外,FBAM也从不同角度探索Transformer下一代框架

新智元
算法论文8

清华万引教授:万倍加速催化剂设计,AI突破DFT瓶颈!

清华大学王笑楠团队提出催化剂设计新基础模型SurFF,发表于Nature Computational Science。它无需昂贵实验或耗时DFT计算,实现对金属间化合物表面暴露与形貌的高效、高精度预测,计算速度提升10⁵倍。

新智元
算法论文8

微调已死?Agentic上下文工程登场,无需微调实现模型进化

斯坦福大学等团队提出 Agentic Context Engineering 技术,让语言模型无需微调自我提升。它将上下文视为作战手册,引入三种协作角色与三项创新,实验显示其在两类任务上表现优异,成本和延迟显著下降。

机器之心
推荐文章7

听说,大家都在梭后训练?最佳指南来了

大模型时代,Scaling Law 边际效益递减,业界转向后训练。《Post-training 101》博客可助初学者入门,涵盖从预训练到指令微调、SFT 原理、多种强化学习技术及模型评测方法等内容。

机器之心
算法论文8

1.5B推理模型新SOTA,RL训练新解法打破「简单题过拟合、难题学不动」的魔咒

QuestA通过在训练中注入解题提示,实现两项成果:在1.5B模型上实现Pass@1的SOTA性能,还提升了Pass@k性能。它解决了RL训练中简单与困难任务的权衡问题,为开发强推理模型打开大门。

机器之心
算法论文8

Claude Code被攻破「后门」,港科大&复旦研究曝出TIP漏洞

近期港科大与复旦研究指出,Claude Code命令行工具连接MCP服务器时,TIP可能被劫持致远程代码执行。研究用TEW框架测试验证漏洞,还给出真机案例,最后提出改进方向。

机器之心
算法论文8

谷歌DeepMind曝光首个“AI 经济体”完整架构,Agent催生全新经济体正在悄然成形

谷歌DeepMind论文描绘由AI Agent自主交易和协作的经济体,提出“沙盒经济”框架,分析其起源与隔离程度,指出发展方向及挑战,还给出应用场景、市场机制、设计方案、基础设施层和行动建议。

AI寒武纪
开源动态8

阿里王牌Agent横扫SOTA,全栈开源力压OpenAI!博士级难题一键搞定

阿里昨晚开源通义DeepResearch,在多项权威基准上表现出色,超越OpenAI、DeepSeek。模型、框架、方案全开源,开发者可在相关平台下载。它告别一问一答模式,像研究员一样工作,还构建了独特数据体系。

新智元
新闻资讯7

别误会00后了!美国千人调查揭秘:85%学生都用AI,首要目的不是偷懒

国外机构调查1047名学生,结果显示约85%学生过去一年用生成式AI处理课程作业,主要用于头脑风暴、答疑与备考。学生希望学校规范AI使用,教师用AI教学学生看法不一,AI重塑大学价值评估体系。

新智元
产品应用7

两周干成一天!毕马威用100页Prompt落地企业Agent

毕马威打造税务AI助手TaxBot,将两周的专业咨询工作缩至一天,效率提升超10倍。其构建KPMG Workbench平台,集成多模型,用100页Prompt指导学习,未来或采用Agent Runtime服务。

探索AGI