动态训练策略」共找到 3055 篇相关文章

算法论文7

VL-LN Bench:模拟「边走边问找具体目标」的真实导航场景

上海人工智能实验室等研究者完成VL - LN Bench,模拟真实导航场景。它构建自动化数据收集管线,依托InternVLA - N1训练评测。结果显示主动对话可提升表现,但当前方法在实例感知对齐等环节有短板。

机器之心
新闻资讯8

马斯克点火全球最大超算,首个1GW狂飙奇点!6万亿Grok 5在训

马斯克官宣全球首个吉瓦级超算Colossus 2上线,狂堆55万块GPU,目标百万。下一代Grok 5已在训练,6万亿参数将引爆智能奇点。同时,全球AI巨头掀起算力军备赛,但美国面临电力短缺难题。

新智元
开源动态8

TinyAI :全栈式轻量级 AI 框架

TinyAI是用Java实现的全栈轻量级AI框架,具有教育友好、模块化等特点。它分层设计,涵盖数学运算、神经网络等模块,支持多种模型架构与并行训练,还有智能体系统,可用于多领域,未来规划丰富。

阿里云开发者
开源动态8

快手Klear-Reasoner登顶8B模型榜首,GPPO算法双效强化稳定性与探索能力!

快手Klear团队推出Klear-Reasoner模型,基于Qwen3 - 8B - Base打造,在多基准测试达同规模SOTA。其核心GPPO算法能强化稳定性与探索能力,团队还对训练流程多环节深入分析,给出优化策略

AI前线
算法论文8

一种基于滑动层合并的高效深度修剪大模型的方法

文章指出深度修剪可加快推理速度,但直接丢层会降低性能。为此提出滑动层合并法,根据相似度阈值融合连续层,简化结构且保持性能。实验显示该方法优于现有技术,还揭示了与宽度修剪结合的潜力。

机器学习AI算法工程
开源动态7

香港科技大学、Manycor开源空间大模型,超3000颗星

香港科技大学、Manycore联合开源空间大模型SpatialLM,用于处理3D点云数据。它结合点云特征提取、对齐和语言生成,实现高效转换。研究团队经多种尝试选定基于点的方法及Sonata编码器,还选Qwen2.5 - 0.5B为基础模型。

AIGC开放社区
开源动态8

杨植麟带 Kimi 团队深夜回应:关于 K2 Thinking 爆火后的一切争议

上周,月之暗面发布并开源 Kimi K2 Thinking,主打“模型即 Agent”,引发广泛关注。今日凌晨,杨植麟等团队成员在 Reddit 开展 AMA 活动,回应 K2 Thinking 相关问题,如 KDA 机制应用、训练成本、速度与准确性平衡等。

AI前线
新闻资讯8

OpenAI发布新模型硬刚Anthropic!Claude Code刚火,就被GPT-5-Codex拍在沙滩上?

9月15日,OpenAI推出新模型GPT - 5 - Codex,是微调的GPT - 5变体,用于AI辅助编程。它增强了代码审查功能,能动态调整思考时间,在多项基准测试中表现优于GPT - 5,发布后引发网络热议,AI编码工具市场竞争激烈。

AI前线
新闻资讯7

成立7个月首发声!百亿美金独角兽万字雄文:攻克LLM推理非确定性难题

估值120亿美元的Thinking Machines Lab成立7个月首次公开研究成果,揭示LLM推理非确定性的真凶是kernel缺乏批处理不变性。介绍了实现批处理不变性的方法,还通过实验展示其效果及对同策略强化学习的意义。

新智元
新闻资讯7

OpenAI最强对手出现!马斯克发布Grok-4,性能碾压Claude 4两倍!

半小时前马斯克发布Grok - 4,虽Grok3.5跳票、直播迟到被吐槽,但它训练量和算力投入大。在多项基准测试中碾压Claude Opus 4,还具备原生工具调用等能力,xAI目标是让其更快更智能。

探索AGI