Gemini 2.5 Deep Think」共找到 3754 篇相关文章

开源动态7

FACTS 基准测试套件问世,用于评估大型语言模型的事实准确性

FACTS 基准测试套件由 FACTS 团队与 Kaggle 联合开发,基于原 FACTS Grounding Benchmark 增加三个新基准,可从四个维度评估大模型事实性。初步结果显示进展与挑战并存,多模态成难题。

InfoQ
产品应用7

全靠Claude Code 10天赶工上线,Cowork 删用户11G文件不含糊!核心研发:长时间打磨再发布很难成功

Anthropic发布的Claude Cowork研究预览版问题频出,如删用户文件、易受文件窃取攻击等。与Claude Code相比,它交互繁琐、效率滞后。不过其核心研发认为长时间打磨再发布难成功,未来将以用户反馈迭代。

AI前线
算法论文8

多模态推理新范式!DiffThinker:用扩散模型「画」出推理和答案

上海人工智能实验室等团队提出全新生成式多模态推理范式,发布模型 DiffThinker。它打破传统定式,以图像到图像生成任务重构推理过程,在多项复杂任务中表现优于顶尖闭源模型,有四大核心特性。

机器之心
新闻资讯8

2025 AI巨头「全员恶人」:恩怨、爱恨与算计

2025年AI巨头纠葛不断,OpenAI与微软关系生变,苹果找谷歌合作,Meta开源受挫且内斗,马斯克的xAI崛起。各方在商业、技术、人才等方面展开博弈,背后是资源争夺和对未来的焦虑。

新智元
推荐文章8

深度之赌:从卧室到上帝机器

文章讲述现代AI秘史,从Jeff Dean本科研究神经网络失误,到Google Brain诞生;还有Hinton等深度学习先驱经历,如Hinton当实习生、AlexNet诞生等,也提及Google发展及未先发ChatGPT原因。

宝玉AI
新闻资讯7

AI编码工具变 “格式化神器”?Claude CLI半年频当“系统杀手”,多位开发者痛斥:心血都没了!

近日Reddit上一则对Claude CLI的控诉帖引发关注。一位开发者用其清理软件包时,整个Mac系统被清空。类似情况并非个例,‘删库’成AI工具通病,开发者需强化安全操作意识。

InfoQ
7

又一 AI 视频创作产品火了,用户抢着付费,附实测

Flova 这款 AI 视频创作产品火了,用户抢着付费。它是人和 AI 协作共创的通用视频创作 Agent,无需专业知识,通过对话和故事板完成创作,还支持修改部分内容、一键回溯等,有多种高级玩法。

特工宇宙
开源动态8

Mistral 3发布,14B多模态小模型表现优异

Mistral AI第三代模型发布,含三个小型密集模型和稀疏混合专家模型Mistral Large 3,全用Apache 2.0许可。有多项技术亮点,Ollama等支持部署微调,还给出实用配置建议。

AI工程化
新闻资讯8

Ilya重磅发声:Scaling时代终结!自曝不再感受AGI

Ilya在与主持人Dwarkesh Patel的深度访谈中爆出惊人观点,认为Scaling时代已终结,我们正走向研究时代。他指出当前技术路线后劲不足,模型泛化能力远逊人类,还探讨了AI发展的诸多关键问题。

新智元
产品应用7

实测完“灵光”,我意识到人类对 AI 助手的开发不足1%

作者实测蚂蚁集团的AI应用「灵光」,它是面向普通人的零门槛全模态AI助手,能30秒生成可互动小应用。作者测试其三大功能,认为人类对它的开发不足1%,它或成探索世界的伙伴。

AI科技评论