「多任务能力」共找到 7230 篇相关文章
DeepSeek多模态新范式:一张图压缩7056倍,思考能力反超GPT和Claude
DeepSeek上线多模态并开源新范式技术。该研究让AI用视觉原语思考,弥合语言与视觉指代鸿沟。它构建紧凑模型架构,信息压缩率达7056倍,训练分三阶段,测试中表现出色,也存在局限。
社区供稿 | VibeVoice实现90分钟、多角色播客生成,拓展语音合成新边界
微软亚洲研究院提出全新语音生成模型 VibeVoice,采用 next - token diffusion 机制,能将文字脚本转为最长 90 分钟、最多 4 人对话的高质量播客音频,在多方面有显著优势,未来潜力大。
AI如何看懂足球?上海交大团队打造Multi-Agent系统,全面解析“美丽足球”!
现有足球AI研究存在不足,上海交大团队打造Multi - Agent系统。他们构建SoccerWiki知识库、SoccerBench评测基准和SoccerAgent多智能体系统,该系统多工具协作,实验中碾压GPT - 4,数据和代码将开源。
告别 Selenium 痛点!全新升级版 Selenium 自动化框架,斩获10.2K标星!
Selenium 编写 Web 自动化脚本痛点多,SeleniumBase 深度封装 Selenium,内置智能等待等功能,解决诸多问题。它功能强大,安装使用简单,适用于多场景,像“智能助手”让自动化测试变简单。
倒反天罡:「租个人」网站爆火,AI开始雇人「跑腿」了
「rentahuman.ai」网站定位为「AI 的肉身层」,AI 可通过 MCP 协议或 REST API 雇人完成线下任务。网站上线后人力增长快,但也引发付款、任务真实性、安全伦理等疑问。
让推荐学会思考:用强化学习激活大模型的序列推理能力
文章指出推荐系统曾未紧密结合大模型能力,如今正靠近其训练范式。作者基于用户行为序列,用强化学习训练大模型理解序列关系,以预测用户下一个可能点击的资讯,并通过实验验证了该方法的可行性,还探讨了不同数据库中BM25算法的差异。
ICCV 2025 | ECD:高质量合成图表数据集,提升开源MLLM图表理解能力
科研等领域图表是信息核心载体,先进开源MLLMs在高难度图表理解测试准确率低。本文提出ECD数据集,规模大、质量高、风格多样,还设计合成流水线与评测基准ECDBench,为开源MLLM提供支持。
Meta两员大将回流OpenAI,30天爆赚800万?刚入职闪回巢,小扎钞能力失效
Meta成立两月的“梦之队”MSL痛失三位核心研究员,两位前OpenAI员工入职一月回流,另一位因小扎一句话离职,十年老将也将加入OpenAI。Meta高薪挖人,却因内部重组、研发问题等面临人才流失。
Claude Code 新增 /btw 功能:让你在 AI 干活时「插嘴」提问
Anthropic工程师Thariq宣布Claude Code新增`/btw`命令,支持在其执行任务时开启「旁路对话」。该功能不打断任务、不污染主对话历史,能解决提问痛点,反映AI编码工具走向「持续协作」趋势。
Github 8.7K star 厉害!!! 一款轻量好用的web自动化项目!
Nanobrowser是开源Chrome扩展工具,专注AI驱动的网页自动化。免费且本地运行,保护隐私,支持多主流大模型。有多智能体协同等特点,还介绍了安装配置方法,是高效安全的网页自动化之选。