图文对」共找到 2213 篇相关文章

算法论文8

GuardAgent:首个专门为LLM agent提供安全Guardrail 的守卫型agent

近年LLM从话工具变为可自主执行任务的agent,但带来安全隐私挑战。传统安全监护其力不从心,为此学者发布GuardAgent,它守卫agent,具通用性、精确判断和免训练部署优势,实验表现佳。

AI科技评论
新闻资讯8

IMO 主席正式宣布:Google DeepMind在国际数学奥赛拿下金牌!

Google DeepMind的Gemini Deep Think模型在2025年IMO竞赛获金牌水平成绩。虽比OpenAI公布晚,但实现用自然语言解题质的飞跃。它采用增强推理模式,成绩经官方认证,后续将向用户开放。

AGI Hunt
新闻资讯7

中国大模型如何破圈?开源不能太“独角戏”,也不是“上传 GitHub 就完事儿”

InfoQ 专访 Linux 基金会 Mark Collier,他分享 AI 时代开源看法。指出开源是协作哲学,AI 开源与传统不同,倡导开放数据,认为商业限制不利生态,还谈及 Agent 与中国大模型开源等问题。

InfoQ
开源动态8

看遍奥斯卡后,VLM达到电影摄影理解新SOTA|上海AI Lab开源

上海人工智能实验室等推出ShotBench、ShotVL及ShotQA,ShotBench含超3.5k问答,ShotQA约7万个问答。ShotVL在ShotBench评测中表现出色,3B参数的ShotVL-3B增益达19.0%,超越GPT - 4o等。

量子位
推荐文章7

月入 5 万美元的 AI 副业靠这几个工具就能跑起来?我把这十类热门工具都试了一遍

知名开发者 Ras Mic 剖析十类热门 AI 工具,如 n8n 非技术人被高估,Claude Code 强大但门槛高,还探讨‘AI 副业月入 5 万美元’话题,指出新工具带来创业新可能。

InfoQ
新闻资讯7

网友:马斯克杀死了人类出生率

Grok推出带二次元虚拟形象的AI伴侣功能,引发网友热议。技术问题修复后,外观、道德等方面遭质疑。一直呼吁提高生育率的马斯克推出此功能,被指是“生育率杀手”,但也有人认为其或提高出生率。

AGI Hunt
开源动态8

OpenAI去年挖的坑填上了!奖励模型首现Scaling Law,1.8B给70B巨兽上了一课

全新奖励模型「POLAR」采用比学习范式,摆脱海量人工标注依赖,有强大Scaling潜力。它衡量训练与目标策略「距离」作奖励信号,用自动化合成数据预训练,小模型能超越大数十倍规模手。

新智元
开源动态8

打破大模型编程「数据污染」与「能力虚胖」困境,Meituan-M17团队构建新一代AI编程评测新标准——OIBench

当前大语言模型编程能力评估体系问题多,如评测集饱和、数据泄漏等。Meituan - M17团队推出OIBench数据集,18个主流大模型评测,揭示模型真实水平,还将举办人机协作编程竞赛。

机器之心
8

AI 陪伴赛道,会诞生下一个「泡泡玛特」吗? | GAIR Live

AI科技评论组织“AI陪伴”线上圆桌,多位从业者探讨AI陪伴是否伪命题、不同人群接受度、产品核心价值等,还讨论IPAI硬件的重要性、硬件与软件优势、是否出海等问题。

AI科技评论
推荐文章7

为什么 AI 搞不定体力活——话清华大学刘嘉:这才是生物智能最难攻克的“万里长征” | 万有引力

本文是清华大学刘嘉教授的访谈。他回顾 AI 研究经历,谈 AI 寒冬、研究错误及第一性原理,还分析学术界与工业界差异、AI 现状与挑战,指出大模型缺创造力,人应与 AI 共进化。

AI科技大本营