独立测评」共找到 344 篇相关文章

新闻资讯8

UCSD谢澎涛创业:用AI搞科研,4小时交付顶刊水平成果,已获数百万美金融资

谢澎涛团队推出面向AI for Science的AIBuildAI Science Agent,在NatureBench评测中排名第一,超多数通用编程智能体。该智能体可独立完成模型研发,效率大幅提升,还探讨了其能力边界、应用及对行业的影响。

DeepTech深科技
开源动态8

升级版Qwen3开源模型深夜来袭,超越Kimi-K2、DeepSeek-V3

深夜阿里千问推出 Qwen3-235B-A22B-Instruct-2507-FP8 版本。新模型通用能力显著提升,在多测评中表现出色,超 Kimi-K2 等模型。还增强多语言知识覆盖等性能,已在魔搭和 HuggingFace 开源。

机器之心
推荐文章7

作为一个AI博主,我劝你先别急着用AI。

作者结合宝玉老师观点,认为想深耕某领域成专家,应在独立练习1000小时后再用AI。还分享自身创作中用AI辅助情况,强调品味重要性,称1000小时练习是建立品味体系的锚定。

数字生命卡兹克
新闻资讯7

告别 CVE?欧洲漏洞数据库 EUVD 正式上线

欧盟网络安全局推出欧洲漏洞数据库(EUVD)测试版,与CVE并行独立运作,旨在提升欧盟内部漏洞处理协调性与透明度。CVE虽为国际标准,但美国政治动向引发其稳定性担忧,EUVD可作备用且有增强功能。

InfoQ
算法论文8

好看不等于会交互!阿里发布基于交互的世界模型基准

阿里等联合推出 Omni - WorldBench 评估框架,指出多数高颜值 AI 视频在物理规律和交互逻辑上有缺陷。该框架含提示词套件和量化评估框架,对 18 款模型测评,为 4D 世界模型研发指明方向。

AIGC开放社区
产品应用7

迟到3个月的美图Agent,RoboNeo居然有一些惊喜?

美图公司推出专注影像与设计的AI智能体RoboNeo,虽来得有点迟,但实战测评中它和星流Agent各有优劣。星流是光影与排版“偏科生”,RoboNeo是细节与执行“实干派”,适配不同需求。

鲸选AI
开源动态8

三大核心创新公开,快手开源多模态Keye-VL 1.5拿下视频理解SOTA,8B力压GPT-4o!

快手开源多模态Keye-VL 1.5,为8B视频理解最强模型,公开3大核心创新技术。它靠Slow-Fast视频编码等,在20+基准屠榜。在多类基准测试和内部测评中表现优异,将业务经验沉淀到开源社区。

PaperAgent
新闻资讯7

1400亿,他带走AI芯片独角兽的核心班底

平安夜英伟达官宣200亿美元与AI芯片初创公司Groq交易,后澄清是技术许可协议。英伟达获技术授权并整合产品,Groq核心团队加入,其继续独立运营,这或为“人才收购”,剑指AI推理市场。

芯师爷
新闻资讯7

ResNet作者任少卿机器人创业!公司注册就独角兽了

知名AI科学家任少卿创立物理AI基础模型和具身智能独立公司,估值达独角兽级别。他虽创业仍在职蔚来,蔚来战略投资并合作。任少卿是业内早押注世界模型实战派,其创业或可视为蔚来机器人试水。

量子位
开源动态8

原生理解生成统一:商汤开源SenseNova U1,用统一架构终结「缝合怪」多模态

商汤开源日日新 SenseNova U1 系列原生理解生成统一模型,采用 NEO-unify 架构,只需 8B 小参数就能实现很多商业闭源模型效果。在多测评维度性能领先,还能实现连续性图文创作输出,解决理解与生成断层问题。

机器之心