「GPT4.1」共找到 3469 篇相关文章
ICCV 2025 | 打造通用工具智能体的基石:北大提出ToolVQA数据集,引领多模态多步推理VQA新范式
北大团队提出ToolVQA数据集,用于提升基础模型工具使用能力。它含2.3万条样本,贴近真实需求。通过ToolEngine构建,涵盖多工具与任务领域。微调后模型表现佳,代码与模型已开源。
突发!字节开源 36B 模型Seed-OSS
字节跳动Seed团队开源Seed-OSS系列36B模型,用12T tokens训练,采用Apache-2.0许可证。该模型能灵活控制推理预算,有两个基座版本,Instruct版在多方面表现强劲,性能碾压OpenAI开源模型。
刚刚!UCLA杨林团队证明:仅凭提示词,Gemini 2.5 Pro就可以拿到IMO2025金牌
加州大学洛杉矶分校杨林和黄溢辰撰写论文,阐述利用Gemini 2.5 Pro解决2025年IMO竞赛5道题达金牌水平。设计解题者和验证者构成的自我验证流水线,用双提示词系统迭代,还规避数据污染问题。
「CV 铁三角」落定Meta,视觉 AI 如何向多模态演进?
Meta 高薪挖来「CV 铁三角」引关注,其研究成果与视觉 AI 向多模态演进路径高度贴合。他们过往十年协作,研究涵盖 S4L、BiT、ViT 等,构建起现代多模态 AI 基础框架。
抛弃预定义Tool,首次提出通过动态工具生成的Agentic多模态Reasoning,破31%涨幅
视觉推理任务中,传统多模态大模型依赖预定义工具,灵活性与领域适应性差。PyVision 框架首次让 MLLM 在推理中实时生成、执行并迭代 Python 工具,在多类任务中显著提升性能,实现范式跃迁。
谷歌开源Gemma 3n:2G内存就能跑,100亿参数内最强多模态模型
本周五凌晨,谷歌正式发布、开源全新端侧多模态大模型 Gemma 3n。它有多模态设计、专为设备端优化等特性,核心是 MatFormer 架构,还采用了 PLE 技术等,在多方面实现质量提升。
一天 15k 星,代码生成碾压 Claude,连 Cursor 都慌了?谷歌 Gemini CLI 杀疯了
谷歌发布 Gemini CLI,是其 AI 助手终端版,有慷慨免费使用配额。它开源且功能多,支持多平台。接入 Gemini 2.5 Pro 通用模型,开发者反馈其代码生成和修复能力强,谷歌在代码能力上提升明显。
最懂科学的开源基础大模型『书生-S2』发布:科学能力比肩顶尖闭源,通用性能居开源第一梯队
上海人工智能实验室在2026浦江创新论坛发布开源基础大模型书生-S2,该模型科学能力比肩顶尖闭源模型,通用能力居开源第一梯队,创新架构支持专业知识持续扩展,强化长程科研与智能体能力,可为真实科研任务提供支撑。
十四年的「管家」局,科沃斯这回把应用定义权交了出来
2026年世界机器人大会上,科沃斯董事长钱东奇提出「未来应用,由用户定义」。回顾过去,从2012年推「亲宝」到2026年发布「八界」,其发展有迹可循。当前,科沃斯推出创新方案和开源生态欲破具身智能难题。
Claude两个新模型实测流出!空间推理封神,算力直接榨干了
Claude两款新模型“棉花糖”和“甜瓜”实测流出,在3D强化学习和建筑空间布局上性能强大,还能直接理解并生成复杂3D坐标和空间关系。它们对算力吞噬疯狂,引发对其身份的猜测。