「任务级奖励」共找到 2957 篇相关文章
股价暴涨32%!GLM-5登顶全球开源第一,25分钟一镜到底搓出完整系统
2026年初,智谱GLM - 5上线,它是全球首个在系统级工程能力上与硅谷巨头正面竞争的开源模型,发布后智谱股价暴涨32%。它能力惊艳,能完成复杂项目,成本可控,还适配国产算力。
训练加速1.8倍,推理开销降78%!精准筛选题目高效加速RL训练丨清华KDD
清华大学THU-IDM团队与慕尼黑大学CompVis团队合作提出MoPPS框架,解决强化微调代价高问题。它精准挑题,预测难度,开销低、动态适应且平衡探索利用,在多任务表现佳,降本增效,有新范式。
揭秘!RLVR/GRPO中那些长期被忽略的关键缺陷
近年来大模型任务突破离不开RLVR关键技术,许多RLVR方法会进行组内优势估计,北航等最新工作揭示其存在系统性偏差,困难题优势被低估,简单题被高估。这会影响训练,论文提出校正算法。
万字拆解:Manus 的 PMF 到底是什么,以及谁在为它一直买单?
本文深入剖析 Manus,探讨其 PMF。分析其使用场景、产品价值,对比与 ChatGPT 差异,勾勒核心用户画像,还发现 AI 工具分工、用户消费特点等,指出 AI 竞争关键,阐明 Manus 边界与行业机会方向。
国产模型开源封神,谷歌Genie3紧急开源?蚂蚁AGI撕开世界模型闭源防线
蚂蚁灵波发布开源SOTA级世界模型LingBot - World,全面对标谷歌Genie 3,部分性能指标超越。它有高保真、长视频生成等优势,还能解决具身智能痛点,发布后引发海外关注,促使Genie将开源。
Qwen3-VL-Embedding系列上新:探索统一多模态表征与排序
2025年6月曾开源Qwen3-Embedding和Qwen3-ReRanker,现推出Qwen3-VL-Embedding和Qwen3-VL-Reranker。它们基于Qwen3-VL构建,能处理多模态输入,在多任务达业界领先,还介绍了特性、评测及使用方法。
DeepSeek-OCR是「长文本理解」未来方向吗?中科院新基准给出答案
DeepSeek-OCR的视觉文本压缩技术降低长文本处理成本,中科院自动化所等团队推出VTCBench基准测试评估模型视觉认知,含三大任务及衍生版本,测试结果有‘U型曲线’,还评测多种尖端模型。
AGI只是硅谷的幻想?!AI科学家盛赞中国,并从物理学角度宣告我们永远造不出AGI
AI科学家Tim Dettmers在博客文章中指出,计算须遵循物理定律,线性进步要指数级资源,硬件升级红利已尽。他认为美国追求AGI和超级智能不切实际,中国重应用普及更务实,AGI难以实现。
普林斯顿大学等Nature揭秘:人类大脑与大语言模型共享同一套语言处理时钟
普林斯顿大学等机构研究发现,大语言模型层级计算序列精确映射人类大脑处理语言的毫秒级时间动态,其与人类大脑理解语言的先后顺序高度一致,为理解大脑和开发神经网络架构开辟途径。
别问树模型了!死磕结构化数据,清华团队把大模型表格理解推到极限
AI 时代处理结构化数据成痛点,LLM 大模型难以满足生产要求。清华大学与稳准智能联合发布的 LimiX 系列模型,做到真正通用,在跑分和实际落地表现出色,其轻量级版本 LimiX - 2M 适合边缘设备和科研场景。