等下我們會先在 49.4 立體聲場聽一個作品 — 帶這三個任務進去。
找一個你能指出聲音位置的時刻 — 它在房間哪裡?
不是定位 — 是整體氛圍。那是怎麼做出來的?
找一個非要在這個空間聽的時刻 — 為什麼?
帶這三個觀察進場聆聽,回來用它們接續後面的內容。
先丟一個問題 —
你生活中聽到的所有聲音,
有哪一個是「沒有空間」的?
即使戴耳機,聲音也帶著錄音時的空間殘響。
空間自始為聽覺經驗的本然維度。「空間音訊」之當代意義,在於將此維度重新置於組成的核心。
Localization
Distance
Immersion
1996 · QSound · binaural 經典
戴上耳機
聽完之後 — 你剛才「相信」自己在哪裡?stereo 喇叭播得出這個效果嗎?
在講機器怎麼擺聲音之前 — 先看一下人類怎麼定位聲源
聲音到左右耳時間差(最多約 0.6 ms)。
主導低頻 < 1.5 kHz — 波長比頭大,靠相位差判位
頭擋聲音造成的音量差(head shadow)。
主導高頻 > 1.5 kHz — 波長比頭小,被頭擋住
外耳廓 / 頭 / 軀幹對各方向頻率的染色。
負責垂直 / 前後定位 — 每個人耳廓不同 → HRTF 因人而異
後面講的五種範式,本質都是用喇叭或耳機重現這三組線索:
VBAP / Channel 處理 ILD · Ambisonics 用 SH 模擬完整聲場讓耳朵自己解碼 ITD+ILD+HRTF · Binaural 用 HRTF 卷積直接餵雙耳
Lord Rayleigh 1907 提出 ITD/ILD「Duplex Theory」— 比 stereo 早了 30 年
paradigm 一詞於本講之意涵
範式(paradigm):對「聲音如何存在於空間」的一組根本假設,以及由此假設衍生的訊號表示法與處理流程。
五種範式對「聲音是什麼」給出五種答案:
範式之間的差異屬存有論層次:訊號本體的定義不同,因此 record / mix / decode 的整套流程亦隨之不同。範式內部的演算法選擇(VBAP / MDAP / KNN 等)為後段細分主題。
| 範式 | 核心思路 | 代表系統 |
|---|---|---|
| Channel-based | 每聲道 = 一只喇叭 | Stereo · 5.1 · 7.1.4 Atmos bed |
| Scene-based | 錄整個聲場,事後 decode | Ambisonics(FOA / HOA) |
| Object-based | 聲源 + metadata,渲染端決定 | Dolby Atmos object · MPEG-H |
| Binaural | 模擬雙耳到達差,耳機專用 | HRTF · dummy head |
| WFS / 點聲源陣列 | 重建波前,sweet spot 消失 | IOSONO · Holophonix |
接下來五張,一張講一個。
關鍵詞 — 「擺一堆聲道」
關鍵詞 — 「錄一個聲場」
為什麼 1st order 是 4 聲道、3rd order 變 16 聲道?
每多一階就多一層空間細節 — 麥克風價格也跟著翻倍。
關鍵詞 — 「聲音是物件,不是聲道」
關鍵詞 — 「直接餵雙耳」
開場 Virtual Barber Shop 那段就是 binaural。即使數學完美,HRTF 通用化的個人差異 → 聲音容易卡在頭裡而不是「外面」— 這也是 Apple AirPods 後來導入個人化 HRTF 掃描的原因。
關鍵詞 — 「重建波前」
| 場景 | 常用範式 |
|---|---|
| 戲院 / 家庭劇院 | Channel-based(成熟、便宜) |
| 360 影片 / VR | Scene-based(Ambisonics) |
| 串流跨裝置 | Object-based(Atmos) |
| 耳機體驗 | Binaural(單獨或當其他 paradigm 的 decode 終點) |
| 美術館 / 藝術裝置 / 研究機構 | WFS / 客製化點聲源(少見、貴) |
真實案例常常混搭 — Atmos 內含 channel bed + objects;VR 用 Ambisonics + binaural decode。
同一張 paradigm map 拉細一層 — 每個 paradigm 底下用什麼演算法把聲音「擺到位置上」
| 演算法 | 機制 | 對應範式 | 典型場景 |
|---|---|---|---|
| VBAP | 找最近 3 顆喇叭組三角形,依向量分解分配增益(Pulkki 1997) | Channel-based | 5.1 / 7.1.4 / dome |
| MDAP | VBAP 的延伸 — 把聲源擴成多個虛擬點,分散到更多喇叭,避免單顆過載 / sweet spot 太窄(Pulkki 1999) | Channel-based | 大空間裝置、移動聲源 |
| KNN panning | 找最近 K 顆喇叭(K 可調),用角度倒數加權分配增益、再做能量正規化。不需要三角網,所以不規則 / 缺幾顆喇叭的場域也算得出來 | Channel-based / Object-based | SpatGRIS、Spat~、不規則陣列、藝術裝置 |
| Ambisonic decoder | 把錄好的 SH 聲場依喇叭擺位反算增益(規則 / 不規則陣列都可解) | Scene-based | VR / dome / 任意陣列 |
| WFS | 每顆喇叭算 delay + gain,重建波前(Huygens 原理) | WFS / 點聲源陣列 | 研究機構、IOSONO |
K 是創作參數:K=3 銳利定位、K=8 像 wash 一樣糊掉,可以做「聲音慢慢散開」這類動態效果。
VBAP 需要把球面切成乾淨的三角網(Delaunay triangulation)— 喇叭少幾顆、或上下角度錯落不對稱,三角網就崩了。KNN 不需要拓樸結構,只看角度距離,所以:
SpatGRIS 同時支援 VBAP / KNN / HOA decoder 就是這個原因 — 創作者選工具,不是被工具選。
「聽不到聲源」不是錄音時代的問題
喇叭是現代的簾幕。
把聲源從視覺中移除,是一個 2,500 年的命題 — 只是技術載體從布幕 → 留聲機 → 喇叭 → 耳機。
在 Stockhausen / Chowning / IRCAM 之前,已經有 90 年的累積
| 年 | 事件 | 意義 |
|---|---|---|
| 1881 | Clément Ader · Théâtrophone(巴黎歌劇院舞台兩支麥克風 → 電話線送到觀眾耳機) | 史上第一次「雙耳遠端聆聽」— 比 stereo 唱片早 50 年 |
| 1907 | Lord Rayleigh · Duplex Theory(ITD 主導低頻、ILD 主導高頻) | 現代空間聽覺的物理聲學基礎 — 後面所有 panning 演算法都奠基於此 |
| 1930s | Bell Labs · Oscar 人工頭 · Blumlein stereo 專利(1931) | Stereo 的數學定形 · 第一隻 dummy head → binaural 的工程起點 |
| 1955 | Stockhausen《Gesang der Jünglinge》— 5 組喇叭環繞觀眾 | 第一次把空間當成作曲參數(下一張) |
| 1970s | Gerzon · Ambisonics · Neumann KU80 商用人工頭 | Scene-based 的數學成形 · binaural 進入德國廣播 |
| 1990s– | IRCAM Spat~ · WFS · 商用 surround · HOA | 從學術 → 戲院 → 美術館 → 串流 |
每個範式背後都有百年以上的物理 / 工程 / 美學累積。VR 跟 Atmos 是延續、不是起點。
空間音樂的起點
課堂播 1–2 min 有空間移動感的段落。
算法移動的起點
「移動的幻覺如何被算出來」
空間屬於表演本身,於現場即時成形。
同一首作品,今晚在這個 hall 跟下個月在另一個 hall,diffuse 的人不同,作品就不一樣。
與 C-LAB 的關聯:臺灣聲響實驗室與 IRCAM 簽署合作協議,技術譜系延續至此。
5 MIN
到目前為止,
哪一種 paradigm 最讓你好奇?為什麼?
開放討論。
你的描述,能讓不在場的人重建那個空間嗎?
1955–56 · 5 喇叭環繞 · 電子音樂史第一個
youtube.com/watch?v=nffOJXcJCDg
60 年前的作品,今天聽起來「過時」嗎?
哪些手法現在還有人用?
1972 · 4 喇叭算法移動 · FM synthesis 同時起源
youtube.com/watch?v=kSbTOB5ft5c
「移動」在這作品裡是裝飾還是結構?
拿掉移動,還剩什麼?
YouTube spatial audio test · 戴耳機 + 用手機/筆電轉動視角
youtube.com/watch?v=IURc99o8vQo
當你能控制聽什麼方向,「作者意圖」還在嗎?
這是賦權還是失控?
Dolby 官方 demo · 戴耳機聽
商業電影的「沉浸」跟 Stockhausen 的「空間化」是同一件事嗎?
空間在這四段裡分別扮演什麼角色?
Stockhausen
Chowning
Atmos
商業電影
Ambisonics 360
VR / 互動
你想做哪一種?
內建多聲道環繞聲相器 · 商業 DAW · channel + object
免費開源 Ambisonic 套件 · IEM Graz · scene-based
Max for Live 空間音訊工具包 · 跑在 Ableton
喇叭陣列空間化軟體 · GRIS UdeM × SAT Montréal · speaker-based
Ambisonic 視覺化 plugin · Blue Ripple Sound
放回 paradigm map — 不同工具對應不同範式
| 工具 | 主要範式 | 商業性 | 適合場景 |
|---|---|---|---|
| Ableton Surround | channel + object | 商業 DAW 內建 | 商業製作、Atmos export |
| IEM Plug-in Suite | scene(Ambisonic) | 免費開源 | 學術、Ambisonics 入門 |
| XP4L | channel + scene | 免費(Live 內) | Ableton 用戶想擴展 |
| SpatGRIS | speaker-based | 免費開源 | 美術館、任意陣列 |
| O3A Flare | scene 視覺化 | 商業 plugin | 監聽、教學、debug |
沒有「最好」— 看你要做哪一種空間,住在哪個 DAW 生態系。
在 demo 跟工具之後 — 留一個問題給自己
如果最終都是耳機聆聽,
「Ambisonics → Binaural decoding」 跟 「直接用人工頭錄音」,
各自的優缺點是什麼?
這題沒有標準答案 — 看你做的是「可被重新詮釋的素材」還是「不可重複的時刻」。
進一步研究的起點。
plugins.iem.at/docs · IEM Plug-in Suite manuals
flux.audio/project/spat-revolution · Spat Revolution 官方文件
en.wikipedia.org/wiki/Ambisonics · 歷史 + 數學概覽
ccrma.stanford.edu/~jos/Spatial/ · Smith, JOS 數位濾波器空間音訊章節
Influx — Métamorphoses 2024
第 13 屆雙年 acousmatic 作曲比賽決賽輯(Vande Gorne / Jonty Harrison 評審體系)。2024-10-16 於布魯塞爾「L'Espace du Son」音樂節首演,2025-03 發行。Schaeffer / GRM 譜系於當代之延伸。