「端到端加速」共找到 2808 篇相关文章
英伟达笑到最后!训练2000步,1.5B逆袭7B巨兽,Scaling真来了
英伟达团队提出ProRL训练法,将强化学习扩展到超2000步。用此方法训练的15亿参数模型媲美70亿参数的Deepseek - R1 - 7B,在多任务中表现出色,解决了熵崩溃和训练不稳定问题。
MiniMax深夜开源首个推理模型M1,这次是真的卷到DeepSeek了。
MiniMax深夜开源首个推理模型M1,其上下文能力媲美Gemini 2.5 Pro。M1在部分评测中表现中规中矩,但在MRCR(4 - needle)测试中屠榜。它得益于MiniMax - 01基座模型,应用Lightning Attention机制,开源了40K和80K两个版本。
MCP实战|从0到1构建异步 DeepResearch 工具,支持进度推送与超时控制
本文借助开源项目,构建可在MCP Server中异步运行的DeepResearch,支持任务进度推送与超时控制。介绍项目架构、构建步骤、任务管理器实现要点及效果测试,还提及优化方向并给出源码。
从「记忆解题」到「深度推理」:港科大推出首个本科数学动态评测基准 UGMathBench
港科大团队发表在 ICLR 2025 的研究 UGMathBench,是首个本科数学动态评测体系。它涵盖 16 个学科领域,通过变量扰动创建多版本试题,引入创新指标评估模型推理能力,测试结果揭示了当前模型短板。
AI裁员这一刀,终于砍到他们身上!外媒高层一锅端,9年老记者血泪控诉
宣扬「AI变革」的外媒Business Insider宣布裁员21%,全面拥抱AI。此前多名记者被裁,引发读者不满。今年谷歌、微软等大厂也有因AI而裁员情况,有预言称其将致入门级白领岗位消失,企业也想借其淘汰员工。
从亚太到欧美,阿里云瑶池数据库凭何成为中企出海的技术底气?
在中企出海迈向‘深水区’时,阿里云瑶池数据库成关注焦点。它涵盖多版块,能提供全链路生命周期服务。对话负责人薛菲可知,其满足出海数据库需求,在多场景表现出色,融入AI能力,获国际认证,为中企出海提供底气。
机器人杭州上演格斗赛!拳拳到肉,宇树CEO王兴兴:创造了人类历史新时刻
全球首个人形机器人格斗赛在杭州落幕,四支队伍用宇树科技G1机器人参赛,“AI测算师”夺冠。比赛分表演赛和竞技赛,考验机器人多方面能力,背后是软硬件协同升级,引发网友热议。
浙大联合北大开源 Easel:一个 Agent 包办社媒全链路,从热点发现到多平台发布!
浙江大学和北京大学联合开源Easel,这是面向社媒创作者的内容工作台,用一个Agent打通全链路,有画像驱动等六大亮点,还给出清晰的快速上手流程。
冷门新语言AI写不动?IEEE论文:从零到及格线,MoonBit给出完整训练路线
IEEE论文聚焦新语言MoonBit和Gleam,探讨大模型代码生成能力。研究发现大模型零样本生成新语言代码能力差,few - shot和RAG有提升但有限,继续预训练及指令迁移可显著提高模型表现。
不用头显也能看3D:清华团队把裸眼3D视角扩大到150°
清华大学戴琼海、吴嘉敏团队在 Nature Photonics 发表研究,提出“超斯涅尔扫描光场显示(SSS - LiD)”方案,在 150°超宽视角下实现高分辨率裸眼 3D 显示,还分析了裸眼 3D 技术的商业化前景。