AI模型性能」共找到 13995 篇相关文章

算法论文8

对话清华商宇丨从生成视频到支撑行动,世界模型需要新的评测标准

文章围绕清华团队提出的 WorldArena 评测框架展开。它针对具身世界模型,对过去沿用视频生成的评测逻辑重新审视,从视觉质量和功能性任务两维度评估,推动世界模型从‘生成世界’迈向‘使用世界’。

AI科技评论
算法论文8

清华首提通用大模型滤波方法,实现零样本状态估计|NeurIPS'25

清华大学李升波教授团队在NeurIPS 2025提出LLM - Filter通用滤波器,将状态估计融入大语言模型推理框架。它能解决传统方法泛化性差问题,在未见过系统中实现零样本状态估计,有望成基础模型

新智元
新闻资讯7

Karpathy盛赞DeepSeek-OCR“淘汰”tokenizer!实测如何用Claude Code 让新模型跑在N卡上

DeepSeek发布新模型DeepSeek - OCR,在实用场景达SOTA且token消耗最少。Karpathy赞其或淘汰tokenizer,Pleiasfr联合创始人称是里程碑。开发者Simon用Claude Code让模型在NVIDIA Spark上跑通。

InfoQ
新闻资讯7

Anthropic最强网络攻防大模型Mythos,美国国安局早就一直在用了

美国政府准备向多个联邦机构开放Anthropic新模型Mythos的‘修改版’,虽国防部将Anthropic拉黑,但国安局一直在用Mythos。白宫先明确模型接入的权限、用途等边界,再推进接入,各方对其态度有分歧。

新智元
算法论文8

ACL 2025 Oral | 你的模型评测搭子上线:Evaluation Agent懂你更懂AI

上海人工智能实验室与新加坡南洋理工大学合作研发 Evaluation Agent,它能按需评估视觉生成模型,有可定制、高效率等优势。框架分提案和执行两阶段,评估结果佳,未来将拓展功能。

机器之心
开源动态8

狂揽 1.9 万标星!谷歌大神开源的 Agent Skills,直接提升 AI 编程的交付质量!

谷歌Gemini团队主管Addy Osmani开源的Agent Skills项目火了,已揽1.9w+ Star且还在增长。它是AI编程代理人的工程技能库,有20个核心技能,覆盖开发全周期,可提升AI编程交付质量,支持主流编程工具。

开源星探
开源动态9

GitHub 千星项目:把四款 AI 编码工具变成并行科研 Agent!

本文介绍alphaXiv团队开源的千星项目OpenResearch,针对当前AI编码工具不适合科研循环、多Agent并行冲突等痛点,将四款主流AI编码工具包装成可自动运行完整研究循环、支持多Agent并行探索的科研Agent,核心设计简洁实用,覆盖完整科研工作流。

开源星探
开源动态7

智能体安全如何保障?首个企业级AI Agent应用评估标准欢迎共同起草

近期OpenClaw走红,AI智能体从“能理解、能生成”走向“能执行、能协作”,但企业面临智能体上线条件判断难题。智合标准中心组织起草《企业级AI智能体应用效能评估规范》,现公开征集起草单位与起草人。

PaperAgent
产品应用8

整整21个月,豆包大模型正式进入2.0时代!

时隔21个月,豆包大模型2.0正式推出。它在多模态理解、企业级Agent、推理和代码能力上有提升,在多个基准测评中达业界最优。实测显示其在编程、数学问题处理上性能出色,性价比也具优势。

量子位
新闻资讯7

一周休4天!老黄、盖茨站台,网友炸锅:是AI福利,还是裁员信号?

Fortune报道引发网友对3 - 4天工作制热议。Zoom CEO袁征、黄仁勋、比尔·盖茨等大佬认为AI或带来此转变,袁征觉得AI会自动化低价值工作,也有人认为是裁员信号。黄仁勋称未来更忙,且有岗位消失也有新机会。

新智元