「规模化评测」共找到 768 篇相关文章
“软件比白领更先被 AI 击穿”!Anthropic CEO 最新改口,反讽马斯克危言耸听,两大佬隔空互掐
Anthropic获300亿美元G轮融资,马斯克怒怼其AI“厌世、反人类”。Anthropic CEO Dario Amodei暗讽马斯克说法“危言耸听”,还改口称软件比白领更易被AI击穿。此外他还谈了AI在多领域的影响及风险应对。
“软件比白领更先被 AI 击穿”!Anthropic CEO 最新改口,反讽马斯克危言耸听,两大佬隔空互掐
Anthropic获300亿美元G轮融资,马斯克怒怼其AI有“厌世、反人类倾向”。Anthropic CEO Dario Amodei暗讽马斯克“危言耸听”,改口称软件比白领更易被AI击穿,还探讨了AI在医疗、经济、民主等方面的影响及风险。
王小川:30亿现金在手,明年IPO,toC产品马上就发
百川智能CEO王小川明确发展主线,百川开源新一代医疗大模型Baichuan-M3,在医疗评测中表现优异。公司约30亿资金,预计2027年IPO,今年将发两款to C医疗产品,重点在院外诊疗。
实测GPT Image 1.5,拼尽全力还是没能打败Banana。
作者实测OpenAI新发布的GPT Image 1.5,将其与Google的Banana Pro对比,从信息准确性、真实质感、精准编辑、世界知识四个维度评测,发现GPT Image 1.5有提升但仍有不足,Google进化速度惊人。
T2R-Bench发布:业内首个由表格生成报告工业基准
为解决大语言模型将表格信息转化为报告的难题,研究团队提出“表格到报告”任务,构建双语基准T2R - bench,其涵盖多垂域表格,还设计评价指标体系,实验显示大模型在该基准上提升空间大。
告别“炼丹玄学”:上海AI实验室推出首个大模型数据竞技场OpenDataArena
上海人工智能实验室OpenDataLab团队推出开放数据竞技场OpenDataArena,致力于将数据质量评估从“玄学”变为“科学”。它有数据评测榜单和完整可复现的数据价值验证体系,为多类需求提供解决方案,还开源了核心工具。
看遍奥斯卡后,VLM达到电影摄影理解新SOTA|上海AI Lab开源
上海人工智能实验室等推出ShotBench、ShotVL及ShotQA,ShotBench含超3.5k问答对,ShotQA约7万个问答对。ShotVL在ShotBench评测中表现出色,3B参数的ShotVL-3B增益达19.0%,超越GPT - 4o等。
推理正确率下降65.5%!斯坦福、MIT等用「不等式」拷问AI逻辑极限
大语言模型在数学证明常现推理漏洞,斯坦福等高校团队提出IneqMath基准评估其严谨性。用不等式证明题切入,拆解为子任务,构建评测体系,用LLM - as - Judge审查。结果显示模型推理正确率低,存在结构性缺陷。
对话智源王仲远:具身智能“小组赛”才刚刚开打,机器人需要“安卓”而非 iOS
智源研究院院长王仲远在对话中指出大语言模型发展遇瓶颈,AI 需走向物理世界。智源推出“悟界”系列,试图打破具身智能“循环悖论”,做具身智能的“安卓”,还提出大小脑协同策略,认为具身智能“小组赛”未结束。
红杉中国推出 Agent 基准测试「xbench」,双轨评估体系,关注 AI 真实场景的效用
红杉中国开放AI和Agent基准测试工具「xbench」,采用双轨评估体系,构建多维度测评数据集。首期发布两个核心评估集并排名,提出垂类Agent评测方法论。该工具旨在解决现有评估问题,关注AI真实场景效用。