真机评测」共找到 1063 篇相关文章

开源动态8

AIME'25满分炸场!Qwen一波七连发,全家桶大更新

云栖大会上,通义团队成果丰硕。Qwen3-Max性能提升,数学评测满分,多测试成绩优异;Qwen3-VL、Qwen3-Omni等开源,各有亮点;Qwen3-Coder升级。吴泳铭称要发展超级人工智能。

量子位
7

Agentic Enterprise:生成式软件重新定义企业形态|AGIX PM Notes

文章指出软件正从静态代码集合变为“Living Software”,企业是其理想训练环境。还提及市场资金流向、多起企业投资合作事件,如英伟达投资英特尔、OpenAI租服务器等,最后介绍了ETF流动性相关知识。

海外独角兽
算法论文8

苹果传统强项再发力,视觉领域三种模态终于统一

苹果在大模型领域常受挫,但计算视觉研究是其强项。其研究团队提出 ATOKEN,这是首个能在主要视觉模态统一处理的分词器,兼顾重建质量与语义理解,成果朝通用视觉表征迈进一步。

机器之心
开源动态8

o3 Gemini 都翻车?首个可验证长链 GUI 数据集 VeriGUI 重磅开源,探索通用 Agent 能力边界

GUI 智能体发展遇瓶颈,现有数据集难评估其长时程规划能力。2077AI 开源基金会牵头构建的 VeriGUI 应运而生,有长链复杂性与子任务级可验证性特征,论文登 Hugging Face 月榜第三,还证明现有模型瓶颈。

AI科技评论
推荐文章7

未来,你的 Agent 怎么付钱?

借 a16z 文章,探讨 Agent payment 领域进展。实现 Agent 自主支付是未来关键方向,现已有迹象且部分企业推出解决方案,但 Agent 处理支付尚未正自主,还面临角色范围、欺诈、责任归属等难题。

Founder Park
新闻资讯7

「AI 作弊产品」Cluely 创始人 Roy Lee:别再迷信 PMF 了,先传播才是王道

Cluely创始人Roy Lee颇具争议,他开发的AI作弊软件走红。公司主打病毒式传播,获超1500万美元投资,ARR达700万美元。Lee认为Z世代创始人将成主流,主张先传播后开发,还提出半透明AI覆盖层交互形态。

Founder Park
8

豆包 AI 编程:一句话写赛博鱼缸,动嘴皮改富士滤镜

豆包发布全新模型 1.6 后,AI 编程更新,基于此模型在评测集位列第一梯队。它实现低门槛+可用性,能一句话生成网站、工具,还可可视化编辑,目标是让普通人能做产品。

刘言飞语
开源动态8

全球首个历史基准!普林复旦打造AI历史助手,AI破圈人文学科

普林斯顿大学AI实验室与复旦大学历史学系联手推出全球首个历史领域评测基准HistBench及AI助手HistAgent。HistBench含414道题,能检验AI深度认知能力;HistAgent集成多种工具,在测试中表现优异。

新智元
新闻资讯7

OnlyFans和AI女友,谁会是最后的赢家?

OnlyFans以80亿美元估值寻求出售,此时AI女友市场正疯狂扩张。OnlyFans有实性、商业生态等底牌,AI女友有成本和个性化优势。二者各有软肋,未来或市场分化,技术进步或使天平向AI倾斜。

AGI Hunt
开源动态8

搜索智能体也需要「操作系统」:SearchOS 开源多智能体协作框架

人大和蚂蚁的 SearchOS 研究,给出搜索智能体在长程任务中问题的答案。它借鉴数据库理念,做了多项核心设计,在开放信息检索基准评测领先,已提供多种使用方式,值得长程调研尝试。

机器之心