「多任务学习」共找到 6120 篇相关文章
GPT-5-Thinking新训练方法公开:让AI学会忏悔
OpenAI提出忏悔训练Confessions,让ChatGPT自己“坦白从宽”。在GPT - 5 - Thinking上实验有效,模型犯错后多会坦白,且更诚实,不影响原任务表现。还介绍了训练方法、实验结果及局限性。
Anthropic 发布第四份人类经济指数报告:AI 对全球工作的影响仍然不均衡
Anthropic发布第四份经济指数报告,提出“经济基元”概念,用五个基础指标衡量AI使用情况。报告发现任务越复杂,AI加速效果越明显,不同国家使用方式有差异,还提及“去技能化”等情况及对生产力的影响。
基于DINOv2和SAM2改进的U-Net模型
DSU-Net是基于DINOv2和SAM2改进的U-Net模型,通过多尺度跨模型特征协作和轻量级适配器模块,解决现有图像分割模型在特定下游任务表现不足问题,提升分割精度,降低训练成本。
一个模型装下整个物种树!伯克利GPN-Star斩获基因预测双料冠军
加州大学伯克利分校等机构推出基因组语言模型GPN - Star,可将全基因组比对和物种树信息装进大模型。它克服传统GLMs短板,实现三点升级,在多基准测试表现出色,是强大的全基因组变异解读框架。
MiniMax Agent 再进化!正式走向商业级全栈开发
MiniMax Agent 升级成‘全栈开发师’,建立完整交付标准,构建技术生态。它能完成多任务,配置顺滑,可处理前端问题。还在 MCP 生态、支付集成等方面革新,从工具迈向数字化商业引擎。
让VLM学会「心中有世界」:VAGEN用多轮RL把视觉智能变成「世界模型」推理机器
当前VLM智能体面对复杂视觉任务表现不佳,美国西北大学等机构联合研究成果VAGEN,提出创新强化学习框架,奖励正确思考过程,让VLM在行动前构建内部世界模型,效果超多款闭源大模型。
不只是聊天:Gemini Agent Mode 深度集成 Android Studio,可直接修改项目
谷歌为 Android Studio 推出集成 Gemini 的 Agent Mode,在最新预览版上线。它以整个项目为上下文,能直接修改项目、执行多步骤任务,可通过 MCP 与外部工具交互,但预览版有不足,谷歌正解决。
与DeepSeek-OCR不谋而合,NeurIPS论文提出让LLM像人一样读长文本
NeurIPS 2025 论文提出 VIST 框架,为大语言模型长文本推理提供视觉方案,与 DeepSeek - OCR 理念不谋而合。它模仿人类阅读,有快 - 慢路径协作,在多任务表现优,还让模型‘用眼看文字’,优势明显。
LeCun团队开源首个代码世界模型:能生成代码还能自测自修!传统编程模型一夜成古典
Meta FAIR推出全球首个代码世界模型CWM,它能生成代码、理解语义,还‘懂得’代码执行,能模拟运行过程。在多个代码与推理任务表现出色,开源代码、训练细节等,不过目前仅支持Python。
ICML 2025 Spotlight | 快手、南开联合提出模块化双工注意力机制,显著提升多模态大模型情感理解能力!
情智兼备是人工智能发展方向,但多模态情感数据语义复杂,建模跨模态关联是挑战。快手可灵团队与南开提出模块化双工注意力范式,构建‘摩达’模型,在多任务测试中性能提升,成果被 ICML 2025 收录。