跳至主要內容
← 返回文章列表

Qwen3.8-Omni-Flash 上線:讓影片筆記保留聲音與畫面的分歧

AI Alibaba Qwen Multimodal AI Product Design 新聞觀察

重點摘要

阿里千問開放 1M tokens 上下文的全模態模型,並提供影片轉筆記工具。低價輸入增加處理原始素材的選擇,產品價值仍要看筆記能否保留逐字稿漏掉的畫面證據。

Qwen3.8-Omni-Flash 上線:讓影片筆記保留聲音與畫面的分歧

Qwen3.8-Omni-Flash 開放聲音與畫面一起輸入,提供了一個可驗證的用途:假設教學影片裡,講者說「儲存成功」,畫面卻出現錯誤提示,模型產生的筆記應能留下這項矛盾。若筆記仍只照錄講者的話,使用者付費處理影片,卻沒有取得畫面多提供的證據。

阿里千問於 2026-09-18 上線這款模型,平台發布紀錄與 IT之家當日報導均確認這項交付;RuntimeWire 的報導刊於美國中部時間 9 月 17 日晚間,換算台北時間也是 9 月 18 日。本文以同日台北時間 20:21 為查核截止,沒有把媒體所在地的日期當成另一場發布。發布紀錄 IT之家 RuntimeWire

阿里雲文件列出的輸入包含文字、圖片、音訊與影片,上下文容量為 1M tokens;原生輸出則是文字,並支援函式呼叫與網路搜尋。服務涵蓋新加坡等六個區域,開發者須使用對應區域的 API 金鑰。容量增加讓應用有空間保留較長的素材,但能接收多少內容,與能否正確找出其中的細節,仍須分別判斷。模型文件

實際應用範例可在 Qwen-MM-Plugins 找到:Video2Note 把本地教學影片整理成圖文 PDF,另一項工具能從操作示範提取可重用的 Agent Skill。這些是官方提供的工作流程,來源沒有公布企業採用數或獨立驗證的節省工時。Video2Note 需要雲端金鑰與 ffmpeg;影片轉成檔案的過程仍仰賴周邊軟體,不能把展示成果全算成模型直接輸出。官方程式庫 Video2Note 範例

筆記需要保留操作失敗的畫面

我會優先把這類能力用在操作教學,而非所有錄音的摘要。教學的步驟常出現在畫面上,講者未必逐項念出;只有逐字稿時,後續模型就沒有那些資訊可用。聲音與畫面共同輸入,提供了補回資訊的途徑,是否真的補到,才是採用理由。

回到儲存失敗的假設,筆記如果只留下整理過的成功步驟,下次照做的人可能看不出哪一步出錯。我會讓筆記保留對應時間點與截圖,將講者的說法和畫面結果分開呈現。這會增加一些篇幅,卻讓讀者能回查;產品若只追求把長片縮得更短,反而可能刪掉有用的例外。這是根據輸入能力提出的設計選擇,尚非模型已證明的效果。

低價輸入仍有使用條件

阿里雲新加坡國際區域的定價,為每百萬輸入 tokens USD 0.15,快取命中輸入 USD 0.016,輸出 USD 0.47。這組數字有助於估算同一份素材被反覆查詢時的模型費用;其他區域另有價格,快取價格也不能套用到全部輸入。定價表

對影片筆記服務而言,低輸入單價增加了保留原始素材的餘裕,但每部影片換算多少 tokens、輸出多長,以及是否需要重新處理,都會改變帳單。檔案儲存和人工校對也不包含在這份模型報價裡。現有資料不足以算出一份合格筆記的總成本,更不能用單價推算一般使用者會省下多少時間。

這次交付已讓開發者取得音畫理解 API 和可參考的工具流程。我支持讓筆記保留可回查的差異,而非替互相衝突的內容選一個流暢版本。檢驗時可在有已知音畫分歧的影片上,比較逐字稿方案與新模型漏掉多少處衝突、又誤報多少處;若兩者沒有差別,就沒有足夠理由為這類筆記額外處理畫面。

封面沿用本站阿里巴巴企業照片,非本次模型發布畫面;事件圖片因下載連線失敗未能取得。

來源:

訂閱最新分享

加入電子報,第一時間獲取關於金融 AI Agent 實戰與架構設計的最新文章。不訂閱你會慢別人一個週期!

絕不發送垃圾信。隨時皆可取消訂閱。