「多模态技术」共找到 3554 篇相关文章
首创郎园发布五大举措,构建AIGC视听产业全域创新体系
4月17日,首创郎园总经理赵春燕在北影节发布AIGC视听产业朝阳全域创新生态体系,推出5大核心举措,构建完整文化IP市场,激活创新模式潜力,推动大视听产业高质量发展。
谷歌Gemini 3.1新模型深夜掀桌, 每秒狂飙363 token! 1/4价格暴击Claude
谷歌深夜推出Gemini 3.1 Flash-Lite,输出速度363 token/s,价格仅0.25美元/百万Token,跑分碾压GPT-5 mini和Claude 4.5 Haiku。开发者可通过Google AI Studio体验,企业用户可通过Vertex AI接入。
Cloudflare推出Markdown for Agents:AI抓取网页的方式彻底变了
Cloudflare推出Markdown for Agents功能,允许网站在服务器端将HTML实时转为Markdown。传统AI处理网页内容耗资源、费token,此功能可节省80%。开发者可升级抓取逻辑,还有实用工具markdown.new。
中国突破!20年芯片散热瓶颈问题被击穿
西安电子科技大学郝跃院士团队在半导体材料领域取得关键突破,解决芯片散热与性能瓶颈问题。他们开发“离子注入诱导成核”技术,革新界面热阻,提升器件性能,应用前景广阔。
再造一个10亿爆款!Ins之父卸任Anthropic CPO,空降一线写代码
Anthropic高层大调整,Instagram之父Mike Krieger卸任CPO,转岗加入核心神秘部门Labs成技术团队成员。Anthropic扩展Labs团队,欲围绕Claude快速迭代产品,应对竞争。
欧洲版DeepSeek发布Mistral 3系列模型,多模态端云生态,无差别商用交付给全球开发者
欧洲最强AI公司Mistral AI发布全系开源模型Mistral 3,从675B到3B参数打通智能链路,采用先进架构,与业界合作优化,以Apache 2.0协议交付全球开发者,推动开源智能发展。
Thinking with Video:一种全新的思考范式
在人工智能领域,‘用文本思考’和‘用图像思考’存在局限。复旦大学等团队提出‘用视频思考’范式,通过视频生成模型统一文本与视觉推理,构建VideoThinkBench基准测试Sora - 2,全面解读这一开创性工作。
UC伯克利大牛预警:留给人类能干的活,只剩5年了!
UC伯克利教授Sergey Levine预言,2030年前机器人将进入真实世界,接手厨房、客厅等场景,甚至工厂、仓储和数据中心建设。其基于Robot Foundation Models等进展,认为‘自我进化飞轮’启动后不会停下,还会带来经济冲击。
谷歌推出“神经操作系统”原型,Gemini 2.5 Flash驱动,UI即时生成无需编码
谷歌开发者博客展示由大模型驱动的“神经操作系统”研究原型,由Gemini 2.5 Flash - Lite驱动,屏幕由大语言模型即时生成。介绍了实现UI即时生成等的核心技术理念,虽为原型但应用前景好。
OpenAI官方揭秘:我们这样用Codex写代码「7大核心用法、6条最佳实践首次公开」
本文基于对OpenAI工程师访谈和内部数据,汇编了Codex的7大核心用法,如代码理解、重构与迁移等,还给出6条最佳实践,展示其如何助力团队高效工作、提升质量及管理复杂性。