高价值任务」共找到 4181 篇相关文章

算法论文8

ICCV 2025 | 清华&腾讯混元X发现「视觉头」机制:仅5%注意力头负责多模态视觉理解

本文聚焦多模态大模型,提出基于 OCR 任务量化注意力头视觉偏好的方法,发现仅不到 5%“视觉头”主导视觉理解。还提出 SparseMM 策略优化 KV - Cache 资源分配,经多基准评测,性能和效率表现优。

机器之心
新闻资讯7

Karpathy:强化学习「有点问题」,突破还需新算法

前特斯拉AI总监、OpenAI创始团队成员Karpathy发文称,强化学习虽能带来更多收益,但机制「可疑」,不像人类解决智能任务的方式。他提出新算法框架,还指出当前存在诸多待解决的问题。

AGI Hunt
算法论文8

AI"学霸"也解不出中题?耶鲁、复旦发布MMSciBench,揭示AI理科推理能力短板

耶鲁、复旦等推出MMSciBench评测基准,揭示主流模型复杂科学推理短板。它有质量数据、多模态多题型测试和精细知识分类体系。测试发现模型图文融合及推理能力弱,英文推理或效果更好。

深度学习自然语言处理
产品应用7

太牛了~~复杂表格Cell合并、跨页拼接,中文领域96%,甩MonkeyOCR 20%

在PDF文档解析领域,复杂表格解析是难题。今天分享的OCRFlux是基于qwen2.5vl - 3B模型微调的解决方案,有单页解析和跨页段落/表格合并等创新点,测试得分超96%,远超MonkeyOCR等。

PaperAgent
新闻资讯8

180 天狠赚 5.7 亿,8 人团队全员财富自由,最大功臣是 Claude 和 Gemini

海外巨头 Wix 斥 8000 万美元收购成立仅 6 个月的 AI 公司 Base44。其创始人 Shlomo 用 AI 打造“开箱即用”开发平台,采用“全栈原生”理念突围。Shlomo 分享创业经历、工具使用及增长策略等。

InfoQ
开源动态7

2.8K Star!开源免费的离线OCR工具,识别准确率媲美大厂。

在文档数字化和自动化工作流中,离线OCR工具受青睐。GitHub上的TrWebOCR开源、离线,中文识别率,媲美大厂。它亮点多,有快速上手指南和接口调用示例,适用场景广,但两年未更新。

开源星探
产品应用7

R2没来,却等来综合性能更优的DeepSeek R1T2

抱抱脸热门排行榜出现R1变体模型DeepSeek-TNG-R1T2,构建于多个父模型之上,在智能与输出token长度间达新平衡点,速度快且测试表现佳,还给出与不同模型对比的选择建议。

PaperAgent
算法论文8

数学推理热潮下的冷思考!如何训练真正"全能"的推理模型?

论文评估20余个开源推理模型在多领域表现,发现多数模型数学成功难迁移。揭示微调方法(RL vs SFT)决定能力泛化,SFT像‘填鸭’,RL似‘思维健身’,为构建通用推理智能体提供新路径。

深度学习自然语言处理
算法论文8

AI发现医生看不见的隐藏心脏病风险,近90%准确率远超人类专家|Nature子刊

登上《Nature》子刊的研究显示,约翰霍普金斯大学团队开发的多模态AI模型MAARS,用深度学习处理原始MRI图像,实现对心源性猝死风险精度预测,准确率达89%,还能辅助制定个性化医疗方案。

量子位
算法论文8

关键突破:理论验证了 RL for LLM 路线的可行性

传统RLHF依赖人工标注偏好数据训练奖励模型,成本且难扩展。本文发现任何通过Next - token预测训练的LLM内部隐含通用奖励模型,从理论和实验证明其可效实现模型对齐。

深度学习自然语言处理