校园预约页加了一份场地讲解。学生先听录音,再看平面图,播放十秒钟的短视频,还能进入虚拟房间挑一个座位。管理员准备上传时,却发现原始录像远比最后的播放文件大。同一段讲解,从麦克风采集到扬声器播放,经过了哪些变化?哪些数值可以计算,哪些需要查看实际文件和编码设置?
本节按教材的概述与关键技术展开。先确认媒体名称在描述内容、表示还是设备,再跟着一份素材完成采集、编码、压缩、保存与呈现。后面的计算始终交代采用哪种数据模型;一张图片、一段视频的文件扩展名,不能替我们确定它占用多少字节。
2.7.1 多媒体概述:同一份讲解里的不同对象
听录音时,学生感知到声音;麦克风负责获取声音,扬声器负责再现声音;编码数据存入SSD,也能经光纤送往另一台机器。说这些都叫“媒体”仍不够精确。教材沿用感觉、表示、表现(显示)、存储、传输五类术语,区分所谈的信息形式和物理手段。
| 分类在问什么 | 教材表述与当前例子 |
|---|---|
| 感觉媒体:用户怎样感知 | 本书举视觉、听觉、触觉等感觉形式。学生通过听觉接触讲解,通过视觉查看房间。 |
| 表示媒体:信息怎样表示 | 本书举图像、声音、视频等。进一步讨论数据交换时,需要给出编码表示,如文本字符编码、图像编码和音频编码数据。 |
| 表现/显示媒体:怎样获取或再现 | 物理输入输出设备。麦克风、摄像机获取信息,显示器、扬声器向用户呈现信息。 |
| 存储媒体:数据存在哪里 | 存放表示数据的物理介质,如SSD、光盘、RAM。文件的编码格式与存储它的介质是两个对象。 |
| 传输媒体:数据经什么承载 | 传送数据的物理介质,如电缆、光纤、电磁波。通信协议再规定怎样组织数据传送。 |
ITU-T的历史多媒体网络框架I.374(1993)把表示媒体明确联系到信息的编码形式,把表现媒体联系到输入输出物理设备。这有助于解释“声音内容”“声音编码数据”“音箱”之间的区别。阅读旧题时仍须看题设定义:本书直接将图像、声音、视频列作表示媒体的示例;仅凭几个裸名词,无法证明题库漏印了“编码”,也无法推出所有版本考试都使用另一套固定答案。练习中会给明所问对象。

把文字、图像、声音、动画、视频组织成彼此有联系的应用,才能让学生边查看房间边理解说明。教材的四项特征各看一面:多维化提供多种信息形式;集成性让信息和设备协同;交互性让学生选择章节、暂停或改变视角;实时性提醒我们音视频随时间展开,连续播放与音画关系需要处理。一次页面访问可以同时体现这些特征。音频有时间性,不直接给出硬实时任务的最后期限;后者的判断见2.4的实时调度。
设备、工具与应用怎样协作
录音失败可能来自麦克风、驱动、权限、处理程序或应用中的某一环。教材的系统组成树帮助我们定位职责:硬件包括多媒体计算机、板卡和外部设备;软件包括系统、支持和应用三组。驱动与操作系统提供设备和资源支持,素材制作工具编辑声音和画面,著作工具把素材组织成交互作品,应用最终向学生提供场地讲解。编程语言也在教材的支持软件组中,不能因为叫“语言”就把它移成一块硬件。

教材列出的技术还包括存储与数据库、超文本与超媒体、检索、通信和人机交互。它们在同一作品里服务不同任务:链接使学生从文字跳到对应图像,检索帮他找到需要的说明,存储和数据库管理素材,通信把素材交到客户端。下面集中看决定表示、体积和播放效果的采集与编码环节。
2.7.2 多媒体系统的关键技术:先确定采到什么
麦克风的模拟信号随时间连续变化。采样按时间间隔取幅度,时间变为离散;量化把幅度映射到有限级别,幅度也变为离散;编码再为级别规定比特表示。三个操作分别解决取值时刻、幅度级别和数据表示问题。它们与2.2的模数转换接口相连;后续压缩与封装又有各自任务。
先只问采样能否保留恢复所需的信息。令信号的最高频率为 f_max(Hz),均匀采样率为 f_s(每秒样本数,Hz),间隔为 Δt=1/f_s(s)。在理想带限、无噪、幅度未量化且拥有所需完整样本序列的模型中,采用 f_s>2f_max 可避开含任意边缘正弦相位的等号问题。实际抗混叠滤波器还需要过渡频带;有限录音、量化与噪声的误差也须另看。
自编讲解录音的有效信号已限制在20 kHz以内,选48 kHz均匀采样。求是否满足上述充分条件及采样间隔:先换成 f_max=20000 Hz、f_s=48000 Hz;要求比较的是48000与 2×20000=40000 Hz,故条件满足。间隔 1/48000 s≈0.0000208333 s≈20.8333 μs。微秒结果按四位小数表达,使用近似号。每声道每秒取48000个值,与一秒分成48000个等间隔位置的第二种理解一致。

改变一个条件,采样率降为40 kHz,信号包含 x(t)=sin(2π×20000t)。在 t=n/40000 取样,得 x[n]=sin(πn)=0。有声音的这个数学信号与零信号产生一样的全零样本,说明恰好两倍不能保证任意边缘相位都唯一恢复。旧题给3 kHz采样率、按常见两倍式折算1.5 kHz边界;它缺清晰的另一选项和科目证据,本节不把那一边界值改称现实采集的普遍无失真保证。
再撤掉原来的20 kHz限带条件,让36 kHz余弦进入48 kHz采样器。采样得 cos(2π×36000n/48000)=cos(3πn/2),与12 kHz余弦的 cos(πn/2) 在整数n上相同:前九个值均为 1,0,−1,0,1,0,−1,0,1。不同输入变成同样的样本,就是混叠。提高样本位数不能补回已经混淆的频率;需要在采样前控制输入频带或改变采样安排。

这里的40 kHz是20 kHz信号的两倍速率;48 kHz采样的奈奎斯特频率则为24 kHz。信号上限、采样率及采样率的一半分别回答不同问题。它们也不等于2.5的码元速率与信道容量。
样本多了、每个样本宽了,录音量怎样变化
采样条件给了每秒取值次数,存储还要给每个值占几位。沿用48 kHz,每声道每个样本用16 bit固定字长PCM(Pulse Code Modulation,脉冲编码调制),两个声道连续录10 s。只求紧密排列的未压缩样本载荷,排除文件头、元数据、压缩、额外填充。约定 1 B=8 bit、1 MB=1000000 B、1 MiB=1048576 B。
R = f_s × b × c
R:位率(bit/s);f_s:每声道采样率(样本/s)
b:每个声道样本的存储位数(bit);c:声道数(无量纲)
D = R × T / 8,D为载荷字节数(B),T为时长(s)
R = 48000 × 16 × 2 = 1536000 bit/s
R/8 = 192000 B/s
D = 192000 × 10 = 1920000 B = 1.92 MB ≈ 1.8311 MiB
也可先数样本:每声道 48000×10=480000 个,两声道960000个;16 bit为2 B,得 960000×2=1920000 B。两种推导相同。这只说明载荷需要多少空间,不能单凭48 kHz或16 bit保证录音质量。

只把两个声道改为一个,其余不变,位率变768000 bit/s,载荷 960000 B=0.96 MB,恰为原来一半。只把存储字长改为24 bit紧密排列,则每个声道样本3 B,载荷 960000×3=2880000 B,为16 bit主例的1.5倍。
边界反例是“有效位深24 bit就一定每样本占3 B”:若题设明确每个声道样本放在32 bit存储槽中,其存储字宽是4 B,十秒便占 960000×4=3840000 B。声音精度与存储槽宽度要分开;这里的存储槽不是后文封装音视频文件的容器。类似地,16 bit提供 2¹⁶=65536 种码字,但实际动态范围与误差还取决于量化器、满量程和信号条件;增加声道数也不增加每个样本的码字种数。
平面图按像素计数,文件还可能多出别的字节
同一页的平面图换成空间离散:宽W像素、高H像素,每像素的存储位数为p(bit/pixel)。若各像素紧密排列、无压缩、无行填充且不计文件头或调色板,像素载荷 D=W×H×p/8(B)。这里的像素是图像表示的基本单元,不能将图像像素一律等同于某块屏幕的发光部件。
自编平面图宽640、高480,每像素为RGB三分量、各8 bit,总24 bit,无透明分量。求原始像素载荷:先得 640×480=307200 个像素;每像素24 bit为3 B,故 D=307200×3=921600 B=0.9216 MB=0.87890625 MiB。按行复核,每行 640×3=1920 B,480行同样得921600 B。没有取整,因为每像素和每行都恰为整字节。

保持像素尺寸,改成每像素四个8 bit分量的RGBA32,则 307200×4=1228800 B,比RGB主例增加307200 B,为原来的4/3。透明通道的“可用信息”与实际是否透明、文件压缩后的体积仍是不同问题。
再看公式的边界:若宽改641、高仍480、RGB24,并指定每行向上补齐到4 B整数倍,紧密一行1923 B要补为1924 B;总载荷 1924×480=923520 B。直接算 641×480×3=923040 B 会少480 B。此条件只适用于题给的行对齐存储,不能把它强加给所有图片。
恢复主例的640×480尺寸,改用8 bit索引图,又在计另一件事:每像素存颜色索引,颜色表另存,索引紧密排列、无行补齐。若明确有256个表项、每项4 B,则索引307200 B、颜色表1024 B,合计308224 B,仍未计文件头。不能把“8 bit”直接解释成RGB每个分量8 bit,也不能不看表就把索引载荷当完整文件。将某幅真彩色图改用有限颜色表,还要确认颜色范围或允许的重建变化。
把图片变成录像,新增的时间量放在哪里
十秒短片按25 frame/s保存,每帧沿用640×480紧密RGB24。伴音沿用上面的48 kHz、16 bit、双声道PCM。求未压缩音视频载荷,仍排除头部、时间元数据、行填充和压缩。每帧字节数d=921600 B,帧率r=25 frame/s,时长T=10 s;帧数 N=rT=250,视频量 D_v=dN,总量 D_av=D_v+D_a。
D_v = 921600 B/frame × 250 frame = 230400000 B
D_a = 1920000 B
D_av = 230400000 + 1920000 = 232320000 B = 232.32 MB
按每秒速率复核:
视频:921600 × 25 = 23040000 B/s
伴音:192000 B/s
合计:23232000 B/s × 10 s = 232320000 B
总位率:23232000 × 8 = 185856000 bit/s = 185.856 Mbit/s

只将帧率提高到50 frame/s,十秒有500帧,视频变460800000 B;音频条件保持,所以仍为1920000 B。总量 462720000 B。若把旧总量直接乘2,得464640000 B,额外算了一份原音轨。单位可帮忙发现另一种误用:已得每秒位率185.856 Mbit/s后,要算十秒才乘10 s;不能再把已经乘过时长的232.32 MB乘十秒。
编码、封装与压缩分别改变什么
管理员最后上传的文件比原始录像小,原因需要看采用的编码与具体设置。若源是模拟视音频,先数字化为计算机可处理的表示;已有数字帧可进入后续编码,不必重新采集模拟源。编解码器(Codec)是变换信号或数据流的程序/设备;容器(Container)安排编码数据、轨道与相关时间信息。MP4可装视频与音频轨,选H.264视频和某种音频编码是一套具体配置;扩展名本身没有指定全部内部编码。WAV也属于文件格式,里面可以存未压缩PCM或别的音频格式,不能把WAV和PCM统一当“无损压缩算法”。
音画一起播放需要协调时间。封装的轨道与时间信息帮助接收端按时间安排解码和呈现;某些具体编码流也含时序信息。字幕可以是另一个轨或附加内容,不是所有音画同步必需的元数据。语音识别把语音转为文本,语音合成按文本产生声音;识别出的文字不保留全部声纹、情绪和环境声,两项技术也不承诺互为无损逆过程。

无损压缩要求解压重建的数据与其输入一致;统计、游程、字典等方法利用不同冗余,不能说多数无损算法都是RLE。对很难再压缩的数据,编码和头部开销还可能使输出更大。有损压缩允许重建与输入不同,损失的信息不能仅靠解码恢复。画面是否满足使用要求要看设置、内容与评价,不能由“有损”自动判为肉眼看不出差异。
教材另外从处理时刻区分即时/非即时,从用途讨论数据/文件压缩。本书在后一组里,把有时间性的采集、处理或传送对象称为“数据压缩”,把面向磁盘保存的对象称为“文件压缩”。这是教材按用途的区分:同一编码方法可处理媒体流,也可处理文件,压好的流还可保存下来。边录边压、提前压好再分发,是两种安排;可逆性是另一轴。无损可用于实时处理,有损也可预先离线处理,不能把“实时”“有损”“视频”写成互为定义的类别。
| 名称线索 | 要保留的条件与身份 |
|---|---|
| JPEG、JPEG 2000 | 静态图像编码标准族。常见JPEG基线处理有损,但整个标准族不能概括成只有有损;JPEG 2000也支持不同可逆性配置。 |
| FLAC、PCM、WAV、Ogg | FLAC是无损音频编码;PCM表示样本,常见线性PCM未压缩;WAV和Ogg的封装/文件身份不能替代内部编码的可逆性判断。 |
| MPEG系列 | MPEG制定多项标准,MPEG-1/2/4有不同系统与编码部分;MPEG-7强调媒体描述,MPEG-21提供多媒体框架。不能把所有编号都当同一种视频压缩算法。 |
| H.26L、H.264 | H.26L是发展过程中的项目名称,联合工作形成H.264/AVC;首次正式H.264建议书为2003。教材所列历史信息须与正式版本日期分开。 |
| DVI | 教材此处列出的历史Digital Video Interactive是当时的多媒体压缩/播放系统线索,不能据此把它计为MPEG标准;也要与显示接口同缩写的名字分开。 |
压缩后有多少,传多久,再看计量边界
现在明确给定:这份十秒短片的编码后音视频合计载荷为固定2 Mbit/s,M取十进制;不计封装额外字节。这个数是自编题设中的输出,不由H.264或MP4名称推算。求编码载荷D_c和原始/编码压缩比C:D_c=R_cT/8;R_c单位bit/s,T单位s,C无量纲,并定义为 C=D_raw/D_c。
D_c = 2000000 bit/s × 10 s / 8 = 2500000 B = 2.5 MB
D_raw = 232320000 B
C = 232320000 / 2500000 = 92.928
原始∶编码载荷 = 92.928∶1
编码载荷占原始量约1.0761%,节省约98.9239%
用压缩比回代:2500000×92.928=232320000 B。压缩比、剩余比例与节省比例不同:剩余是C的倒数,节省再用1减去剩余比例。百分数保留四位小数并用近似号。若改成整个封装文件多出100000 B,文件量为2600000 B,以“原始载荷/整文件”比较便约为89.3538∶1;分母变了,不能继续写同一压缩比。
先回到不计额外封装字节、已经完整生成并可读取的2500000 B编码载荷,只求它的发送时间。若有效载荷吞吐恒为4 Mbit/s,忽略握手、传播、排队、重传、编码与采集时间,发送时间 t=8D_c/R_eff,代入 8×2500000/4000000=5 s。按字节速率复核,4 Mbit/s是500000 B/s,2500000/500000=5 s。播放长度十秒与发送五秒可以同时成立,二者计的对象不同;包含额外封装字节的整文件另在下面变式计。

只改变速率条件:4 Mbit/s若是标称值,而题给载荷效率80%,有效率为 4×0.8=3.2 Mbit/s,发送时间 20 Mbit/3.2 Mbit/s=6.25 s。若4 Mbit/s已经是有效率,就不再乘80%。只改变文件边界,发送2600000 B整文件且有效4 Mbit/s,则 8×2600000/4000000=5.2 s。
误用反例是直接 2.5 MB÷4 Mbit/s=0.625 s:字节与比特没有统一,正确结果相差8倍。若改成边拍边发,素材还未产生,不能声称从采集起点五秒后已传完十秒录像;若题给可变码率,只知道峰值也不能以峰值×时长确定总量,应使用实际各段量或平均率。2.5的发送、传播与等待解释为什么载荷发送时间又不等于完整访问响应时间。
媒体通信同时涉及物理承载与数据传送组织。电缆、光纤和无线电波提供承载;基带或频带传输、调制、同步、复用、交换,以及编码、加密和差错控制等方法处理传送中的不同问题。它们可按系统需要组合,通信纠错或加密不能与媒体压缩合成同一个操作。录好的文件可缓冲、分段下载后播放,直播或通话还要处理采集、编码、网络、解码和呈现的时间预算。接收端缓冲可以吸收到达波动,也会增加等待;速率足够并不自动保证延迟、抖动与丢失都合要求。具体重传、纠错和播放策略要按业务容忍度设计。
换呈现环境,再看VR与AR的观察轴
平面图和录像让学生从预先准备的角度了解房间。虚拟现实(Virtual Reality,VR)让计算生成的虚拟环境成为体验和交互的对象;学生可在虚拟房间里转动视角。增强现实(Augmented Reality,AR)把计算信息与现实环境结合:来到真实房间后,设备把座位编号或指引叠到相关位置。AR可通过透视显示或摄像画面实现,不能只凭“戴眼镜”决定类别。
教材把AR的基础概括为图形图像、空间定位和人文智能:前两者生成虚拟信息,并使它与用户所见的现实位置对应。“人文智能”在这里强调传感器、可穿戴计算与人的能力结合,帮助记录、理解和交流经历;它不等于模拟人的智能,也不要求所有AR实现同一种可穿戴设备功能。

教材列桌面式、分布式、沉浸式和增强式四个名字,阅读时把各自判断拆开。普通屏幕与键鼠可提供桌面式虚拟场景;头显及跟踪设备可提供沉浸式体验;网络把多个用户连接进共享虚拟环境,则属于分布式关注。多人联机的沉浸系统可以兼具后两项。增强式在教材中对应AR,比较的是现实与计算信息的结合;这份列表不能机械画成同一轴上的四个互斥盒子。
实现按配置组织采集、数据传送、视点控制或空间跟踪、渲染、显示与交互;本地桌面场景不因此必须联网或跟踪用户的现实位置。全向相机、高速摄像机、激光等可用于相应场景的数据采集。力反馈施加可感知的力或阻力,触觉反馈提供接触、振动等触感;测到手指姿态或温度是输入信息,本身不保证用户收到触觉反馈。系统可按用途选反馈方式,无须每一套都提供五感、数据服或手套。低功耗、低延迟、效率、可靠传输、设备和算力成本须按实际配置评估,不由类别名称自动决定体验优劣。
回到这份场地讲解:先确定媒体在描述什么对象,再区分采样时刻、样本位数、像素位数、帧率与每秒编码量。原始载荷按给定表示计算,文件还要看压缩、封装和额外字节,访问则加入传送与播放条件。把条件写清,就能解释声道或帧率改变时哪些量跟着变,也能说明为什么换一个后缀仍不能直接算出文件大小。系统如何把这些能力组织成完整方案,接着见2.8系统工程。