2026.09.25 · 周五开源
←返回首页话题 · Topic
#多模态
共 150 条相关资讯
2026.09.25 · 周五产品功能
Google Gemini Live 上线 Live Avatar,支持实时动画虚拟人对话
2026.09.25 · 周五产品功能
Gemini 3.8 Live 上线 Live Avatar 功能
2026.09.24 · 周四开源
llama.cpp 合并 Ling-3.0-flash-VL 支持:124B 总参数的多模态 MoE 模型可本地推理
2026.09.24 · 周四行业动态
实时视频生成开打:生数科技谈 Vidu S2 与行业窗口期
2026.09.23 · 周三产品功能
爱诗科技发布 PixVerse R2:把通用能力与实时生成统一进同一套因果框架
2026.09.23 · 周三研究论文
可解释超图神经网络用于胶质母细胞瘤生存预测
2026.09.23 · 周三研究论文
Ovis-Embedding:统一全模态嵌入模型,跨四模态刷新基准
2026.09.23 · 周三模型发布
Reka 发布端侧多模态模型 EdgeQ:面向高通骁龙 8 Elite
2026.09.21 · 周一产品功能
Qwen-Image-2.1 登陆 Hugging Face Spaces,一键体验文生图与编辑
2026.09.20 · 周日产品功能
通义 Qwen-Image-2.1 亮相:支持多类图像编辑任务
2026.09.20 · 周日开源
通义 Qwen-Image-2.1 开源权重发布:7B 统一生图与编辑
2026.09.20 · 周日模型发布
阶跃星辰发布 Step 5 Preview:600B 总参数 MoE,支持百万级上下文
2026.09.18 · 周五行业动态
AI 每日速览:9 月 18 日七家厂商集中更新
2026.09.18 · 周五产品功能
用户实测新版 Claude Projects:可处理复杂多模态任务
2026.09.17 · 周四模型发布
阶跃星辰发布首个音乐生成基础模型 StepAudio 3 Music
2026.09.16 · 周三模型发布
MiniMax H3 视频模型上线 Together AI,支持原生立体声
2026.09.16 · 周三模型发布
阶跃星辰发布 StepAudio 3 音频模型家族,含语音、识别与音乐五大能力
2026.09.16 · 周三模型发布
谷歌 DeepMind 发布 Gemini 3.8 Live 与 Extended Thinking
2026.09.15 · 周二模型发布
Flam 发布 26B MoE 模型 Flam Falcon,专注印度语言与 3D 生成
2026.09.15 · 周二产品功能
Gemini 3.8 Live 模型名称现身 GCP 配额页
2026.09.15 · 周二产品功能
ElevenLabs 将创作套件接入 MCP,覆盖 Claude、ChatGPT 与 Cursor
2026.09.14 · 周一行业动态
商汤出席国泰君安秋季论坛,提出AI三大范式转变
2026.09.10 · 周四开源
DeepSeek V4.1 Flash 上线 Hugging Face:552B 参数 MoE 新架构
2026.09.10 · 周四模型发布
DeepSeek 预告 V4.1-Flash:全新架构家族最小成员,原生支持视觉理解
2026.09.03 · 周四研究论文
Runway 公布 GWM Worlds 2:支持实时交互的通用世界模型
2026.09.02 · 周三模型发布
Gemini 3.8 Flash 现身 GCP Agent Studio
2026.09.02 · 周三产品功能
DeepSeek V4 Flash 上线原生视觉,Fireworks 平台首发
2026.08.31 · 周一模型发布
Sori-1B 音频语言模型:从零训练,告别纯文本先验
2026.08.31 · 周一工具
开源 AI 视频剪辑工具 Clips Kitty:本地生成竖屏短片
2026.08.29 · 周六工具
LocalAI 更新:原生生物识别后端与大规模语音能力上线
2026.08.28 · 周五产品功能
Google Omni 1.1 Flash 上线 Runway 平台
2026.08.28 · 周五研究论文
癌症治疗预测基础模型 oFM:效果达传统特征 3 倍
2026.08.28 · 周五模型发布
智谱发布 GLM-5.3 Flash:原生多模态 MoE,320B 参数 1M 上下文
2026.08.28 · 周五模型发布
Gemini Omni 1.1 Flash 上线:面向专业视频生产的可控生成
2026.08.27 · 周四产品功能
Qwen3.8-Flash 上线 OpenRouter,主打编码与长视频理解
2026.08.27 · 周四产品功能
谷歌发布 Gemini 3.5 Transcribe,主打「理解式」语音转写
2026.08.27 · 周四开源
通义千问发布开源权重新模型,被定位为 Qwen4 架构早期预览
2026.08.27 · 周四行业动态
MiniMax H3 亮相 RaySummit,33B 多模态音视频模型将做技术拆解
2026.08.27 · 周四开源
社区发布文生图评测基准,覆盖 52 个模型超 9000 张图
2026.08.27 · 周四模型发布
谷歌推出 Gemini 3.5 Transcribe 语音转写模型
2026.08.26 · 周三开源
智谱开源 GLM-5.3-Flash:320B 多模态 MoE 模型
2026.08.26 · 周三模型发布
智谱发布 GLM-5.3-Flash:320B 稀疏激活多模态模型,MIT 协议开源
2026.08.26 · 周三模型发布
阿里发布 Qwen3.8 Flash 多模态 MoE 模型
2026.08.26 · 周三模型发布
社区爆料:Ox Alpha 实为智谱 GLM-5.3-Flash
2026.08.26 · 周三研究论文
天文基础模型 AION-1 被发现系统性偏置:检测通道压制像素信号
2026.08.25 · 周二模型发布
Runway 上线 WAN 3.0:支持图像、视频、音频多模态参考输入
2026.08.24 · 周一行业动态
顶级 AI 模型扎堆首发,模型分发平台争夺「第二战场」
2026.08.24 · 周一模型发布
阿里视频大模型 Wan3.0 正式上线,单次生成 30 秒、支持文档输入
2026.08.24 · 周一研究论文
技能表示如何影响智能体路由:Tinycloud 多模态视频智能体的案例研究
2026.08.24 · 周一研究论文
StateSight:面向视觉语言模型的空间状态重建基准
2026.08.24 · 周一研究论文
可解释多模态分类新框架:线性判别树集成在情感识别上优于 Transformer
2026.08.24 · 周一研究论文
多模态智能体框架综述:技术、应用与前沿方向
2026.08.22 · 周六行业动态
OpenAI Codex 转向 Agent 平台;DeepSeek 推出多模态实验版
2026.08.22 · 周六开源
dots3-note 开源权重亮相:280B MoE 多模态模型
2026.08.21 · 周五工具
DeepSeek Harness v0.1.1 发布:适配视觉模型并支持原生图像请求
2026.08.21 · 周五模型发布
DeepSeek 上线 V4-Flash-Vision-Exp 多模态实验模型
2026.08.21 · 周五行业动态
触觉进入世界模型:从传感器之争,走向数据与模型的链条竞争
2026.08.21 · 周五工具
Meta 预览多模态智能体评测框架 WildArtifactBench
2026.08.21 · 周五产品功能
Meta 内部部署 Muse Spark,聚焦多模态媒体生成
2026.08.21 · 周五模型发布
Pika 发布音乐生成模型 Pika Music,支持四模态联合输入
2026.08.20 · 周四行业动态
AI 图像编辑的「概念纠缠」:为何模型总爱给撩发加上梳子
2026.08.20 · 周四研究论文
arXiv 综述:大模型在心理健康领域的应用、创新与伦理挑战
2026.08.20 · 周四研究论文
新基准揭示大模型几何作图短板:解题强,构图弱
2026.08.20 · 周四工具
DeepSeek Harness 发布首个重要更新:14 项调整补齐多模态
2026.08.20 · 周四行业动态
快手 Q2 财报:可灵收入超 8.5 亿,视频模型竞争压力陡增
2026.08.19 · 周三行业动态
姚顺雨重塑腾讯混元多模态:靠拢梁文锋
2026.08.19 · 周三产品功能
Pika 拆解音频生成架构:视频与声音在潜空间 token 层面对齐
2026.08.18 · 周二行业动态
AI 电影的「能拍」与「会拍」之间,隔着三重不确定性
2026.08.18 · 周二研究论文
新基准测试暴露多模态AI推理短板:GPT-4o、Gemini 2.5 Pro不足10%
2026.08.14 · 周五开源
Qwen3.8-27B 开源:262K 原生上下文,Apache 2.0 可商用
2026.08.14 · 周五开源
阿里开源 Qwen3.8-27B 多模态模型,262K 上下文支持本地部署
2026.08.14 · 周五开源
通义 Qwen3.8-27B 开源权重正式发布
2026.08.14 · 周五开源
dots3 家族首发开放权重预览模型:280B 总参数、16B 激活
2026.08.13 · 周四行业动态
具身数采进入有效数据稀缺阶段
2026.08.13 · 周四产品功能
Runway 平台上线 Grok Imagine Image 2.0
2026.08.12 · 周三模型发布
Liquid AI 发布 LFM2.5-VL-3B 多模态模型,主打端侧部署
2026.08.12 · 周三模型发布
DeepMind 发布 SL2T 手语翻译模型,落地 Pixel 11 Gboard
2026.08.12 · 周三模型发布
LFM2.5-VL-3B 发布,主打端侧多模态
2026.08.12 · 周三研究论文
紫东太初提出 GMC 核心集剪枝:视觉 Token 减八成仍保多模态性能
2026.08.12 · 周三产品功能
即梦Seedance 2.5 七维实测:AI视频从片段走向叙事
2026.08.12 · 周三模型发布
MiniMax 宣布开源模型 H3:定位跨任务跨模态
2026.08.12 · 周三研究论文
Google AMIE 视频版在临床问诊中达到专家级水平
2026.08.11 · 周二研究论文
USC 研究:音频大模型「听」不如「读」,语音情感理解普遍偏弱
2026.08.11 · 周二研究论文
社区实验:为 DeepSeek V4 Flash 训练视觉连接器
2026.08.10 · 周一模型发布
MiniMax 凭 H3 打翻身仗:开源视频模型跻身全球第一梯队
2026.08.10 · 周一开源
Meta 开源 30B 多模态智能体模型,量化版 17GB 可跑
2026.08.10 · 周一工具
通义千问推出 Qwen-MM-Plugins 多模态插件
2026.08.10 · 周一行业动态
中国视频生成大模型进入「可生产」竞争阶段
2026.08.10 · 周一开源
Om AI 联汇完成数亿元融资,同日开源端侧多模态模型 VLX-Seek 1.5
2026.08.08 · 周六产品功能
xAI 推出 Grok Imagine Image 2.0,主打编辑与文字渲染
2026.08.07 · 周五产品功能
Seedance 2.5 正式接入 Runway,单条最长 30 秒并支持音频
2026.08.06 · 周四产品功能
MiniMax H3 视频模型接入 Luma Agents,支持原生立体声
2026.08.05 · 周三开源
Mistral AI 开源 Shieldstral:30 亿参数多模态安全分类器
2026.08.04 · 周二开源
商汤开源 SenseNova U1:把推理与生图放进同一个流程
2026.08.03 · 周一模型发布
商汤开源 SenseNova U1.5-Lite 预览版,8B 多模态模型
2026.08.01 · 周六模型发布
MiniMax 发布开源模型 H3,主打跨任务与跨模态
2026.08.01 · 周六模型发布
MiniMax H3 视频生成模型上线,支持多模态输入
2026.07.31 · 周五模型发布
MiniMax H3 视频生成模型上线
2026.07.30 · 周四模型发布
Google 发布 Gemini Robotics ER 2 具身推理模型
2026.07.30 · 周四研究论文
Reka 视频推理模型:通过改进评测,赛事选手识别准确率从 39.6% 跃升至 90.9%
2026.07.30 · 周四模型发布
GLM 5.2 视觉版现身 Hugging Face
2026.07.30 · 周四研究论文
CaM-Wolf:首个融合多模态感知的狼人杀 AI 代理
2026.07.30 · 周四研究论文
CLINLENS:面向长程临床编码智能体的多模态基准
2026.07.30 · 周四产品功能
Google Lyria 3.5 上线 Flow Music,新增翻唱与口型同步视频功能
2026.07.29 · 周三产品功能
Google Gemini Notebook 疑似开发「App」生成功能
2026.07.29 · 周三研究论文
ProcAgent:面向边缘设备的程序性任务智能体框架
2026.07.29 · 周三模型发布
微软开源 Mage-VL:4B 多模态模型主打 codec 原生视频流
2026.07.28 · 周二研究论文
Kimi 发布 PerceptionBench:聚焦视觉感知原子能力评测基准
2026.07.27 · 周一模型发布
微软发布 Mage-VL:4B 多模态基础模型主打流式视频理解
2026.07.27 · 周一开源
MiniMax-M3 视觉支持已合并至 llama.cpp
2026.07.26 · 周日工具
本地多卡 AI 实时生成视频讽刺解说:概念原型展示
2026.07.26 · 周日模型发布
GigaChat Audio 10B 发布:原生音频大模型,支持时序定位
2026.07.25 · 周六模型发布
Vivix A1发布:首个实时交互多模态基础模型
2026.07.24 · 周五开源
Swiss AI 发布 Apertus 1.5 全开源多模态模型
2026.07.24 · 周五产品功能
Anthropic 升级 Claude 语音模式,接入三档模型
2026.07.23 · 周四行业动态
腾讯混元多模态理解负责人胡瀚离职,原团队或聚焦世界模型
2026.07.22 · 周三产品功能
Galaxy Unpacked 2026:Gemini 三大更新登陆三星折叠屏、手表与眼镜
2026.07.22 · 周三产品功能
通义 Qwen 演示单图多层嵌套「画中画」生成能力
2026.07.22 · 周三行业动态
教育AI集体转向:从「答案生成」走向「可视化+互动化」
2026.07.22 · 周三模型发布
Vivix 首次揭面纱:估值 13.2 亿美元,两款实时交互模型将上线
2026.07.21 · 周二模型发布
字节发布 Seed Audio 1.0:统一框架下的人声、音效与环境声联合生成
2026.07.20 · 周一行业动态
Meshy完成约4亿美元B轮融资,创AI 3D赛道纪录
2026.07.20 · 周一研究论文
MAR-12:面向恶意幽默 meme 检测的多角度推理框架
2026.07.19 · 周日行业动态
Om AI 联汇 WAIC 发端侧 AI 协同倡议,VLX 开发者社区同步上线
2026.07.19 · 周日模型发布
商汤发布 SenseNova U1 Pro:原生 8K 输出并自检自修
2026.07.19 · 周日行业动态
WAIC 五位首席科学家激辩:多模态是 LLM 外挂还是下一代灵魂
2026.07.17 · 周五模型发布
Together AI 上架 975B 多模态 MoE 开源权重模型
2026.07.17 · 周五模型发布
月之暗面介绍 Kimi K3:融合 3D 推理、编码与视觉能力
2026.07.17 · 周五模型发布
Moonshot 发布 Kimi K3:2.8 万亿参数百万上下文
2026.07.16 · 周四行业动态
MiniMax 将亮相 SIGGRAPH 2026 探讨原生多模态
2026.07.09 · 周四模型发布
Meta AI 展示 Muse Spark 1.1 多模态代理能力
2026.07.08 · 周三研究论文
智源悟界·Orca技术报告发布:先教AI理解世界如何变化
2026.07.08 · 周三开源
Horus Hiero 开源:面向古埃及象形文字的多模态翻译模型
2026.07.08 · 周三产品功能
Meta 测试「超级感知」AI 眼镜:可记录眼前每一刻
2026.07.08 · 周三工具
开源代理 VisionBridge 让纯文本大模型获得视觉能力
2026.07.07 · 周二产品功能
AWS 用 Amazon Nova 2 Lite 构建图像 PII 自动打码流水线
2026.07.06 · 周一模型发布
Fable 5 解禁后实测:1600 行代码生成水下曼哈顿
2026.07.06 · 周一行业动态
国家电网千亿级多模态大模型「光明电力大模型」规模化落地
2026.07.02 · 周四研究论文
首个开源扩散式多语种 ASR:仅 0.16% 参数即可转录六种语言
2026.07.02 · 周四产品功能
科大讯飞发布智能交互三大平台升级,AIUI 向多模态演进
2026.07.02 · 周四工具
SafetyCommander:用多模态大模型当工厂安全员
2026.07.02 · 周四工具
开发者开源 VCCB 基准:测试多模态模型读懂日历截图
2026.07.02 · 周四开源
AMALIA 开源模型发布,主打欧洲葡萄牙语
2026.07.01 · 周三行业动态
谷歌发布 Gemini Omni 多模态创作工具;松下加码 5000 亿日元 AI 业务
2026.07.01 · 周三模型发布
Google 双模齐发:Omni Flash 视频 API 上线,Nano Banana 2 Lite 4 秒出图
2026.07.01 · 周三模型发布
谷歌双模齐发:Omni Flash 开放 API,Nano Banana 2 Lite 4 秒出图
2026.07.01 · 周三产品功能
Runway 接入 Gemini 视频模型,可生成与编辑视频
2026.06.30 · 周二产品功能
智谱公开征集 GLM-5.3 意见,社区齐喊要视觉
2026.06.29 · 周一产品功能
