内容持续更新中
蚂蚁开源团队正式发布并开源了百灵系列的首个原生多模态大模型 Ling-3.0-flash-VL。该模型基于 Ling-3.0-flash 的 MoE 架构拓展而来,总参数量达到 124B,单次推理激活…
商汤科技正式宣布开源全新的轻量级、原生统一多模态大模型 SenseNova U1.5Lite。作为一款参数量为8B 的轻量化模型,它在多项核心视觉任务中展现出了超越同量级模型的实力,甚至在部分复杂排版…
近日,腾讯混元多模态团队经历了一场深度的人事重组与战略调整。原xAI多模态理解负责人蔺旭东已正式加入腾讯混元,担任多模态内容生成算法负责人。此次变动不仅伴随着原多模态理解负责人胡瀚离职创业、前Open…
在人工智能大模型热潮席卷全球的背景下,不直接研发底层基础大模型,而是专注于模型与终端用户之间的“中间商”能否撑起庞大的资本故事?近期,根据媒体报道,演语科技(Evoken)已正式启动香港IPO筹备工作…
在多模态大模型快速迭代的今天,音频处理能力往往容易被“牺牲”——很多模型在增强音频理解的同时,却导致了文本逻辑能力的下降。近日,NVIDIA 研究团队正式发布了一款名为 Nemotron-Labs-A…
在人工智能视频生成这一技术角逐的前沿阵地,最新的行业排名再次引发关注。7月3日,基于用户盲测反馈的权威排行榜 Video Arena 正式更新,谷歌 DeepMind 推出的文生视频模型 Gemini…
商汤科技近期正秘密研发一款面向“设计”场景的多模态大模型,内部代号为“U1Pro”。该模型作为商汤“日日新”模型家族的新成员,由商汤联合创始人、首席科学家林达华牵头负责,旨在对标OpenAI旗下的 G…
全球人工智能界正迎来一场关于“AI母语”的技术革新。针对当前大模型普遍存在的“以语言为中心、外挂视觉或语音模块”的拼凑式异构架构,大模型研发团队于近日正式发布并开源了全新原生多模态大模型 LongCa…
AI 视频生成与编辑领域迎来底层逻辑的重构。字节跳动商业化技术团队近日正式开源了面向视频生成与视频编辑的统一框架——Bernini。该框架核心主打“先理解、再生成”的协同机制,旨在解决传统模型因无法精…
百度正式发布文心大模型衍生模型PaddleOCR-VL-1.6,在OmniDocBench v1.6权威评测中以96.33%的准确率超越Gemini-3-Pro、GPT-5.2及GLM-OCR等国内外…
阿里正式发布了全新多模态大模型 Qwen3.7-Plus。该模型在 Qwen3.7强大的文本能力基础上,全面升级了视觉-语言能力,并将其统一为一体化的智能体基座。作为一款多模态交互混合智能…
4月10日,国产多模态大模型赛道近期涌现黑马,匿名模型“HappyHorse-1.0”在文本转视频(无音频)权威评测中,以1332的 Elo 积分空降榜首,其领先位居次席的字节跳动 Dreamina …
4 月 3 日,美团技术团队正式发布原生多模态大模型 LongCat-Next。该模型突破了传统“语言基座+插件”的拼凑架构,通过将图像、语音与文本统一转化为同源的离散 Token,让 AI 第一次能…
通义实验室昨晚正式发布全新多模态大模型 Qwen3.5-Omni。相比前代,该模型在理解力、交互感与任务执行力上实现了跨越式进化,标志着 AI 正在从“屏幕内的助手”真正走向“理解物理世界的智能体”。…
阿里通义实验室于3月16日正式发布并开源了影视级多场景配音多模态大模型 Fun-CineForge。该模型旨在解决 AI 配音中长期存在的口型不同步、情感表达缺失以及多角色音色不一致等核心痛点,并同步…
据《白鲸实验室》独家消息,备受期待的 DeepSeek V4 与姚顺雨新混元模型将于 2026 年 4 月正式发布。DeepSeek V4 是由梁文锋主导研发的多模态大模型,经过长期的打磨与提升,预计…
2026年3月9日,小红书Super Intelligence团队正式发布图像编辑模型FireRed-Image-Edit v1.1。此次更新距离1.0版本发布仅过去不足一个月,标志着小红书在多模态大…
微软近日正式发布了全新的开源权重多模态大模型 Phi-4-reasoning-vision-15B。这款模型最大的技术突破在于其具备“自主决定思考时机”的能力——它能够智能判断任务难度,自主选择是快速…
月之暗面近日宣布,旗下最强编程模型、原生多模态大模型 Kimi K2.5正式接入 Kimi Code。为了庆祝这一技术跨越,官方同步推出了限时福利与重磅计费调整,旨在为开发者提供更畅快、更精准的 AI…
2026年1月29日,商汤科技正式宣布开源其多模态自主推理模型 SenseNova-MARS,并同步提供8B 和32B 两个版本。这款模型的发布,标志着多模态大模型在自主推理领域迈出了关键一步。 技术…
企业级AI智能体(AI Agent)赛道迎来高速增长拐点。据最新发布的《2025年Q3全球企业级AI Agent优秀厂商图谱》,神州云动(CloudCC)凭借其多模态大模型融合平台成功入选,成为国内少…
全球多模态大模型竞争格局再更新。近日,权威评测平台SuperCLUE-VLM发布2025年12月多模态视觉语言模型综合榜单,谷歌Gemini-3-Pro以83.64分断层领先,展现其在视觉理解与推理领…
在AI智能体(Agent)向复杂、多步任务演进的关键阶段,开源社区迎来一员新锐猛将。Jan团队今日正式发布 Jan-v2-VL-Max——一款300亿参数的多模态大模型,专为长周期、高稳定性自动化执行…
开源 AI 项目 Jan 团队近日正式推出了全新的多模态大模型 Jan-v2-VL-Max。这款拥有30B 参数的模型并非盲目追求通用性,而是精准锁定在“长周期执行任务”这一核心痛点上,旨在解决 AI…
前字节跳动视觉大模型AI平台负责人潘欣已于本周到岗,出任多模态AI创新业务负责人,直接向美团技术委员会汇报。至此,这家市值千亿港元的生活服务巨头在 2025 年“外卖+AI”战略中补齐了最核心的一块算…
智谱正式并上线开源 GLM-4.6V 多模态大模型系列,含基础版 GLM-4.6V(总参106B,激活12B)与轻量版 GLM-4.6V-Flash(9B)。新模型将上下文窗口提升至128k toke…
12月4日,北京智源人工智能研究院正式发布新一代多模态大模型Emu3.5,被誉为“真正理解物理世界的AI”。与以往图像、视频、文本模型各自为战不同,Emu3.5首次实现“世界级统一建模”,让AI从“会…
当AI生成内容席卷广告行业,虚假宣传、违规素材和恶意诱导也悄然滋生。面对这场由技术催生的新风险,巨量引擎选择用更强大的AI来守护秩序。近日,其首次公开自研的AI广告治理大模型,以“全链路治理”为框架、…