Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.082 — 2026-09-24
REPO 约 1 分钟

Qwen3.8 Omni Flash补上原生音视频推理

Qwen 首次把原生音视频理解与 Agent 能力装进同一款 Omni 模型。

IMAGE — OpenRouter 新模型上架

让 AI 看一段会议视频,既听懂发言,也结合画面做总结,过去往往要先转字幕、再拆开处理。Qwen3.8 Omni Flash 提供了一个统一入口:它能直接接收文字、图像、音频和视频,联合理解声音与画面,最后输出文字。

据 OpenRouter 的模型页面,这是 Qwen 首次在一款 Omni 模型——统一处理多种媒介的系统——中同时加入原生音视频理解与 Agent 能力。后者指模型不只回答问题,还能调用工具、按 JSON 格式输出结果,并参与 GUI 交互,也就是理解屏幕状态后决定点击或输入。它还支持双声道和四声道空间音频,可区分不同方向或通道里的声音。

这让长视频分析、视听对话、视频制作流程和界面操作多了一个可直接接入的模型。页面标注其上下文窗口为 100 万 token,输入、输出每百万 token 分别为 0.15 和 0.47 美元;但材料没有提供独立基准测试,实际理解质量仍待更多验证。


供稿材料 SOURCES — 1
01
Qwen: Qwen3.8 Omni Flash OpenRouter 新模型上架 · REPO
原文 ↗

← 返回 2026-09-24 · 开源板块