评测报告」共找到 1014 篇相关文章

算法论文8

CL-Bench的故事没有结束,生成式CL-Bench:GENIUS来了

北大团队发布GENIUS,用于评估模型生成式流体智力。它构建含510个样本、20个子任务的评测集,测试模型多方面能力。实验显示当前模型流体智力有短板,还提出免训练注意力校准机制提升性能。

机器之心
新闻资讯7

被Anthropic指控侵权,Clawdbot改名Moltbot

Clawdbot因被Anthropic指控商标侵权,更名为Moltbot。改名过程中问题不断,如GitHub错、账号被抢注用于诈骗。Moltbot虽火,但开发者收益少,还面临安全赏金索要。此外,其交易实验失败,却对特殊群体有价值。

机器之心
新闻资讯8

王小川:30亿现金在手,明年IPO,toC产品马上就发

百川智能CEO王小川明确发展主线,百川开源新一代医疗大模型Baichuan-M3,在医疗评测中表现优异。公司约30亿资金,预计2027年IPO,今年将发两款to C医疗产品,重点在院外诊疗。

量子位
产品应用7

实测GPT Image 1.5,拼尽全力还是没能打败Banana。

作者实测OpenAI新发布的GPT Image 1.5,将其与Google的Banana Pro对比,从信息准确性、真实质感、精准编辑、世界知识四个维度评测,发现GPT Image 1.5有提升但仍有不足,Google进化速度惊人。

数字生命卡兹克
新闻资讯8

原来这届中国AI年轻人,已经卷到业界都惊了

在小红书上,一群热爱技术的年轻人搞了一场为期五个多月的腾讯广算法大赛。赛题是全模态生成式推荐,考验选手探索精神。比赛结束后,表现突出选手将被纳入腾讯“青云计划”。

机器之心
算法论文8

T2R-Bench发布:业内首个由表格生成工业基准

为解决大语言模型将表格信息转化为的难题,研究团队提出“表格到”任务,构建双语基准T2R - bench,其涵盖多垂域表格,还设计评价指标体系,实验显示大模型在该基准上提升空间大。

CourseAI
开源动态8

别“炼丹玄学”:上海AI实验室推出首个大模型数据竞技场OpenDataArena

上海人工智能实验室OpenDataLab团队推出开放数据竞技场OpenDataArena,致力于将数据质量评估从“玄学”变为“科学”。它有数据评测榜单和完整可复现的数据价值验证体系,为多类需求提供解决方案,还开源了核心工具。

量子位
开源动态8

看遍奥斯卡后,VLM达到电影摄影理解新SOTA|上海AI Lab开源

上海人工智能实验室等推出ShotBench、ShotVL及ShotQA,ShotBench含超3.5k问答对,ShotQA约7万个问答对。ShotVL在ShotBench评测中表现出色,3B参数的ShotVL-3B增益达19.0%,超越GPT - 4o等。

量子位
算法论文8

推理正确率下降65.5%!斯坦福、MIT等用「不等式」拷问AI逻辑极限

大语言模型在数学证明常现推理漏洞,斯坦福等高校团队提出IneqMath基准评估其严谨性。用不等式证明题切入,拆解为子任务,构建评测体系,用LLM - as - Judge审查。结果显示模型推理正确率低,存在结构性缺陷。

新智元
新闻资讯8

刚刚!Sam Altman官宣GPT-5今夏登场:超级智能更为重要

在OpenAI官方播客节目中,Sam Altman透露GPT-5今夏或登场,还探讨AGI定义、“星际之门”算力项目、AI硬件等。如模型命名或改,算力项目解决瓶颈,重视超级智能等。

AI寒武纪