Gemini API」共找到 1020 篇相关文章

7

刚刚,GPT-5内测抢先泄露!推理强到离谱,智商被曝140超越人类天才

周五凌晨,GPT-5、GPT-5 Mini和GPT-5 Nano将推出,全网可通过API和ChatGPT访问。GPT-5基准测试结果疯传,实测表现出色。同时,OpenAI发布开放权重模型GPT-oss,登顶开源王座,外媒分析其豪赌开源原因。

新智元
开源动态8

刚刚,小红书开源了首个多模态大模型dots.vlm1,性能直追SOTA!

小红书人文智能实验室(hi lab)低调开源视觉语言模型dots.vlm1。该模型基于自研视觉编码器构建,在视觉理解和推理任务上接近SOTA水平,实测表现惊艳,还介绍了其技术架构、预训练数据布局等内容。

新智元
算法论文7

多模态大模型不会画辅助线?最新评估得分:o3仅25.8%,远低于人类82.3% | 清华腾讯斯坦福联合

清华、腾讯、斯坦福等团队发布RBench - V基准测试,评估大模型视觉推理能力。结果显示,主流大模型如o3、Gemini2.5等准确率远低于人类,开源模型表现更差,暴露出大模型在复杂多模态推理任务中能力不足。

量子位
产品应用8

Qwen3.7:智能体新前沿

阿里云正式发布面向智能体时代的Qwen3.7-Max模型,将通过API提供服务。它能力全面,编程、办公、长周期执行等表现出色,适配多框架,在多场景评测中领先,能驱动生产力跃升,还经多实战测试验证实力。

千问大模型
推荐文章7

Skill 火了,但它可能只是个过渡品

大家认为给 Agent 装技能包是未来,但云玦科技的“零 Skill Agent”能自己造工具并碾压基于 Gemini 3 Pro 的 Agent。文章回顾 Agent 用工具三阶段,指出 Skill 是过渡品,不过现阶段仍实用,未来会进化。

AI Reading Hub
算法论文8

ICLR 2026|原生多模态推理新范式ThinkMorph ,让文字与图像在统一架构中共同演化

NUS、ZJU 等联合提出「ThinkMorph」,主张文字与图像在统一架构「原生协作」。仅用 2.4 万条数据微调 7B 统一模型,视觉推理平均提升 34.74%,多项任务比肩或超 GPT - 4o 和 Gemini 2.5 Flash,还涌现新能力。

机器之心
开源动态8

2.2K 标星的龙虾办公可视化项目!OpenClaw 专属的像素风「赛博办公室」!

由`海幸Hyacinth`和`Simon_阿文`联手打造的Star-Office-UI(龙虾办公室)在GitHub开源,获2.2K标星。它把AI助手工作状态变成像素风看板,打破人机交互冰冷感,还具多亮点及API,上手简单。

开源星探
产品应用8

顶级视频模型半衰期只有 30 天,但生成式媒体 infra 公司的收入却在一年增长了 60 倍

文章聚焦生成式媒体 infra 公司 fal.ai,其借统一 API 和云端平台让开发者高效调用多模态模型。深入分析其成功因素,如早期押注生成式视频、优化算力和成本、构建生态等,还探讨用户使用模式与行业发展趋势。

Founder Park
新闻资讯8

马斯克抢先谷歌一步放大招,Grok 4.1登顶LMArena,创意写作直逼GPT-5.1

谷歌Gemini 3将上线消息正热时,马斯克旗下xAI的Grok 4.1凌晨上线。它有两个“形态”,免费开放且有APP版。在LMArena测试中表现优异,事实稳定性、情商、创意写作等能力提升,实测也有不错表现。

InfoQ
新闻资讯7

Murati翁荔陈丹琦公司发布首个产品,让大模型微调门槛暴降,要重新发明一个OpenAI

Thinking Machines Lab发布首个产品Thinker,让模型微调像改Python代码一样简单。它是用于微调语言模型的灵活API,降低了大模型微调门槛,受到业界关注。此外,该公司还尝试重新发明OpenAI,而OpenAI正打造社交模式。

量子位