新物质发现」共找到 4393 篇相关文章

新闻资讯8

Claude 5史诗级泄露,史上最强编程模型评测炸裂!核心秘密曝光

Anthropic的Claude Sonnet 5即将发布,已存在于谷歌基础设施中,性能领先谷歌‘Snow Bunny’一代。它价格比Opus 4.5便宜50%,有100万token上下文窗口,SWE - Bench成绩超80.9%,还有自动开发团队模型。

新智元
新闻资讯7

2026 年,全球 CEO 对 AI 的态度,集体变了

普华永道第29届全球CEO调查显示,CEO们对短期增长信心下降,担忧宏观经济等威胁,但仍大力推进AI投资。多数企业AI投入未获财务回报,不少企业跨界探索,CEO需兼顾当下与未来。

特工宇宙
新闻资讯8

Karpathy:20年的编程生涯几周之内被颠覆,80%由AI来写,Claude和Codex跨过某种一致性门槛

OpenAI创始成员Andrej Karpathy分享用Claude编程心得,工作流从80%手动变为80%由AI完成,阐述AI编程优缺点、影响,还对行业未来提出疑问,认为2026年是充满能量的一年。

AI寒武纪
新闻资讯7

“DeepSeek-V3基于我们的架构打造”,欧版OpenAI CEO逆天发言被喷了

欧洲版OpenAI(Mistral)CEO Arthur Mensch在访谈称DeepSeek-V3基于其架构构建,引发网友质疑。经对比,Mixtral与DeepSeek的SMoE论文虽研究方向相同,但架构思路差异大,此前Mistral 3 Large还曾被指照搬架构。

量子位
算法论文8

LLM规划能力飙升79%!Google:内在自我批评技术拿下多项SOTA

Google DeepMind研究《通过内在自我批评提升大语言模型的规划能力》,不借助外部验证器,让LLM反复“自评+重写”,使Blocksworld准确率从49.8%升至89.3%,还介绍了方法及跨模型验证情况。

PaperAgent
开源动态7

FACTS 基准测试套件问世,用于评估大型语言模型的事实准确性

FACTS 基准测试套件由 FACTS 团队与 Kaggle 联合开发,基于原 FACTS Grounding Benchmark 增加三个基准,可从四个维度评估大模型事实性。初步结果显示进展与挑战并存,多模态成难题。

InfoQ
产品应用8

刚刚,喝到了千问APP给我点的奶茶

2026 年初,智能体发展迅猛。Anthropic 发布 Cowork,谷歌联合推出 UCP 标准。1 月 15 日千问 App 上线「任务助理」,打通阿里生态,有 400 多项功能,实测显示其在多场景表现出色。

机器之心
产品应用8

AI开始“动手”了,全世界第一个带头的是阿里千问

阿里千问App上线400多项功能,依托Qwen模型和阿里生态,在全Agent架构下提升AI能力。它能在购物、旅游、办公等场景帮用户办事,使AI具备现实世界落地能力,推动人机交互跃迁。

量子位
新闻资讯8

DeepMind发布SIMA 2!打通「感知-推理-行动-反思」闭环

DeepMind推出的SIMA 2,可让智能体在虚拟环境中边聊天边进行复杂多模态推理。它整合Gemini能力,从指令执行者变为互动伙伴,有强大迁移泛化与自我提升能力,是迈向AGI重要一步,但也面临一些挑战。

新智元
新闻资讯7

AI 美妆 ARR 一年增 14 倍达 5500 万美金;另一 Newsletter 阅读 App 融了 600 万美金

海外创业者做的 Newsletter 聚合阅读 App Perch 融 600 万美金,可聚合内容,有语音朗读和 AI 摘要功能,还有类似 X 的推荐机制。同时,AI 美妆产品一年 ARR 增 14 倍达 5500 万美金。

投资实习所