科技评价体系」共找到 1517 篇相关文章

新闻资讯7

o3-pro通关“推箱子”,人类怀旧小游戏成了大模型新Benchmark

推箱子、俄罗斯方块等经典小游戏成大模型benchmark,o3 - pro挑战这两款游戏表现出色,突破benchmark上限,成绩远超o3。Lmgame含多款游戏,有不同评价方式,且开源可用于模型测试。

量子位
新闻资讯8

陶哲轩痛诉很缺钱!科研经费暴跌67%十年最低,自掏腰包科研

美国国家科学基金会削减基础科学资助,数学科学领域资助大降。菲尔兹奖得主陶哲轩痛诉经费不足,自掏腰包做科研,还以“开普勒的橙子”说明基础研究虽短期无用,却能助力科技突破。

新智元
新闻资讯8

中国科协重磅回击,NeurIPS含金量一夜归零!AI顶会已死?

NeurIPS以「合规」为由出台歧视性政策,引发强烈不满。其官方回应遭群嘲,中国科协出手将其2026年在中国学术评价体系中「含金量」归零,顶尖学者集体退审,顶会审稿制度也在坍塌。

新智元
算法论文8

一篇19种自进化Agent Skill框架最新综述

这篇来自Rutgers大学和UNC Charlotte的survey,首次系统梳理Agent技能的进化与评估全貌,覆盖19种技能进化方法和10个评估基准。指出当前评估体系有诸多不足,如无法追踪技能多轮反馈后是否变好等。

PaperAgent
产品应用8

AI真能搞钱了!这家公司把大模型玩成闭环赚钱机器

当全行业还在卷大模型参数、烧算力时,零犀科技走出不同路。其自研因果大模型,用AI智能体帮企业提升销售。2025年已实现规模盈利,成为最早跑通商业闭环的大模型应用公司。

量子位
产品应用7

实测美团 LongCat:快到极致,但是别说追平 DeepSeek

AI科技评论实测美团LongCat-Flash-Chat,它是中量级对话模型,主打“快”,几乎零延迟。但在推理、抗污染能力等测试中,相比DeepSeek-V3.1,逻辑链条松散,缺乏清晰判断。速度与逻辑哪个更重要,值得思考。

AI科技评论
推荐文章7

Skill 火了,但它可能只是个过渡品

大家认为给 Agent 装技能包是未来,但云玦科技的“零 Skill Agent”能自己造工具并碾压基于 Gemini 3 Pro 的 Agent。文章回顾 Agent 用工具三阶段,指出 Skill 是过渡品,不过现阶段仍实用,未来会进化。

AI Reading Hub
新闻资讯7

硅谷陷入了对中国的痴迷与羡慕

《纽约时报》称‘硅谷陷入对中国的痴迷与羡慕’,虽有夸张,但中国在AI、基建等领域进展显著,如通义万相2.5视频大模型。a16z风投公司表达焦虑,中美科技竞赛激烈,双方开始相互学习。

MacTalk
推荐文章7

学好基本功,AI才能真正助你一臂之力

作者Manda Putra分享将AI融入日常工作的体验,指出AI处理琐碎任务很强大,但软件开发还需真正的理解力。以同行依赖AI解决基础问题为例,强调开发者应掌握基本功,否则行业知识体系会“崩溃”。

宝玉AI
新闻资讯7

中科闻歌完成新一轮战略融资,引领企业级人工智能技术发展

近日,中科闻歌完成新一轮战略融资,投资方为石景山区产业基金。融资用于自研决策智能操作系统DIOS研发与推广。中科闻歌技术实力强,有全栈自研体系,已服务超千家客户,后续将深耕多领域并拓展海外市场。

量子位