秒哒2.0」共找到 2586 篇相关文章

新闻资讯8

OpenAI 推出 gpt-realtime:语音智能体进入“回”时代,开发者直呼交互更自然

OpenAI 发布语音对语音模型 gpt - realtime,开放 Realtime API。其结合可端到端处理语音,缩短响应时间。模型语音质量、理解能力、函数调用能力提升,API 全面升级,多家企业已试点,还强化了安全措施。

InfoQ
新闻资讯7

人类懂,AI崩溃:一个简单测试,就让GPT-5、Gemini等顶级模型集体“翻车”

来自多机构研究团队发现,OpenAI的GPT-5等顶级AI模型,面对‘看得见但读不懂’文字时表现极差。VYU团队实验显示,人类能轻松读懂的切分拼接文字,AI却全军覆没,原因是其靠模式匹配,不懂文字结构。

量子位
新闻资讯8

麻省理工AI放王炸!无需说话、懂你的想法,外挂AI大脑来了

今天凌晨2点,麻省理工学院分享突破性研究Alterego。它是可穿戴无声语音交互AI设备,通过捕捉神经肌肉信号实现无声沟通,处理后用骨传导耳机反馈结果,应用场景广泛,还能帮助残疾人交流。

AIGC开放社区
产品应用7

又多了一个哄孩子AI神器,一张破涂鸦竟能变迪士尼动画

年轻父母有了哄娃新法子,用AI可将涂鸦变动画。博主用Midjourney将妈妈30年前涂鸦做成动画,还给出提示词框架。介绍即梦、可灵、谷歌Veo3等工具,它们能快速生成音视频,各有优劣。还提到Meta的Animated Drawings玩法。

机器之心
新闻资讯8

谷歌Nature震撼发文,Gemini教练暴打专家!医学双料冠军,出睡眠报告

谷歌DeepMind把Gemini版大模型PH - LLM调教成「AI健康私教」,将可穿戴设备数据转化为睡眠健身建议,准确率超人类医生。它经两阶段训练,在多项测试中表现优异,或开启预防医学未来。

新智元
开源动态7

以小博大,仅1.7B媲美gemini2.5-pro,达到SOTA文档解析性能

dots.ocr是多语言开源文档解析器,把布局检测和内容识别统一在视觉语言模型中,虽LLM仅1.7B参数,却达SOTA性能。介绍了其预训练三阶段及SFT阶段关键策略。

PaperAgent
开源动态8

代码库的AI觉醒!GitMCP开源神器:实时文档中心级搭建,终结代码幻觉!

AI助手处理项目文档常“幻觉”频发,GitMCP这款开源工具通过MCP将GitHub仓库转变为实时文档中心,让AI直接访问最新文档和代码,消除“代码幻觉”。它功能强大,配置简单,应用场景广泛。

开源星探
新闻资讯8

马斯克偷偷憋了个大招!Grok出《阿凡达》画质,好莱坞瑟瑟发抖?

马斯克又放大招,Grok即将推出「Imagine」视频功能,能加音效、配画面,支持多风格生成,可把图像转换为视频。它挑战谷歌Veo 3,生成速度快,操作体验好,还支持多方式创作。

新智元
新闻资讯7

奥特曼、Ilya演员定了!亚马逊斥2.9亿元揭秘OpenAI「感恩节政变」

亚马逊斥资4000万美元拍电影《Artificial》,聚焦2023年感恩节奥特曼被OpenAI炒鱿鱼又复职事件。Andrew Garfield演奥特曼,Monica Barbaro演CTO,Yura Borisov演Ilya,剧本狠辣搞笑,AI题材影片将增多。

新智元
开源动态8

文档变演讲视频还带配音!开源Agent商业报告/学术论文接近人类水平

澳大利亚和英国多所高校团队提出多模态智能体PresentAgent,能将文档转化为配有语音讲解和同步幻灯片的视频演示。其模块化生成框架有可控性和领域适应性,评估显示它在各指标上接近人类水平。

量子位