1. 系统内录音频为什么要单独解决
很多人第一次想录电脑里正在播放的声音时,都会下意识拿起手机对着音箱录,或者开一个录音软件然后发现录下来的全是环境噪音。真正的内录音频,指的是直接抓取电脑声卡输出端送入播放设备的数字或模拟音频信号,完全不经过麦克风,不经过空气传播。这样录出来的声音干净、无底噪、无回声,网课、网络会议、游戏解说、音乐剪辑、播客制作,全都需要这个能力。
但麻烦在于,大多数电脑出厂时并不默认开放“录制系统声音”这个通道。Windows 系统默认的录音设备通常只有麦克风,声卡内部明明有内录能力,却默认被禁用,原因是怕用户误操作把系统声音录下来造成回声或啸叫。Mac 系统更激进,干脆不提供系统级的内录通道。所以“电脑录制系统声音的软件”这个需求,本质上不是软件不够多,而是系统音频通路设了一条路障,得手动把这条路打通。
这篇文章写给三类人:第一类是第一次录课件、录会议回放的新手,需要完整可跟随的步骤;第二类是录歌、录游戏声音却总是录出“空轨”或者人声翻倍的半入门用户;第三类是准备批量录音、需要稳定输出统一格式音频的轻度生产者。我按照实际录音时的操作顺序,整理了七个步骤,每步都解释了为什么这么做、不做会踩什么坑。整套流程跑通之后,以后录内录基本就是三分钟的事,剩下的都是看波形、剪空白、调响度这类收尾工作。
2. 录音前的核心思路:先打通声卡通路,再谈软件
2.1 用“立体声混音”还是“虚拟声卡”
内录音频的第一道分岔,是在录音源的选择上。Windows 系统自带的能力叫做“立体声混音”(Stereo Mix),这本质上是一个让声卡把当前播放信号同时复制到录音通道的功能。如果你的声卡驱动支持,只要在声音设置里把立体声混音设为默认录音设备,然后用任意录音软件选择这个输入源,就能直接录到系统声音,不需要任何额外硬件或虚拟驱动。
但有一个现实问题:很多新电脑的声卡虽然硬件支持立体声混音,驱动里却没有开放这个选项。集成声卡为了减少对普通用户的困扰,把这项隐藏了或者干脆没提供。这时候就需要借助虚拟声卡工具。这类工具的原理是在系统声音输出设备列表里虚拟出一块声卡,把你的播放器、浏览器、会议软件全部指向这块虚拟声卡,它再把声音传给真实声卡或内录软件,等于在音频链条中间插了一个“回路”。虚拟声卡的优点是不依赖硬件驱动,软件更新独立,缺点是会多一步音频路由设置,对新手来说调试成本略高。
我的建议是:先检查立体声混音,能用就用;不能用再装虚拟声卡,不要一上来就上虚拟声卡,多一个设备就多一个出问题的环节。用最小可行方案解决才是最省时间的。
2.2 录音软件选型的取舍
系统声音通路打通以后,剩下的就是选择录音软件。Windows 自带的录音机只能录麦克风和立体声混音,操作最简单,但功能弱,没有电平表、没有暂停恢复、导出格式也受限。如果想录长会议或者做后期编辑,还是建议用专门的多轨录音工具。
我日常用的方案是免费开源的音频编辑器加一个老牌虚拟声卡工具,这套组合覆盖了全部需求。选软件时核心看四点:是否支持 ASIO 或 WDM 音频驱动、是否提供立体声混音输入选择、是否支持多轨录音(录系统声音的同时录麦克风,这对直播切片和解说很重要)、导出格式能否自由选择。很多新手误以为越专业越好,直接上音频工作站,实际上对于内录音频来说,功能越简单越不容易出错,关键是要有音量电平表和静音检测。
工具选型还有一个容易被忽略的细节:驱动兼容性。Windows 升级大版本之后,一些老旧的音频工具会出现驱动不兼容,录音软件打不开声卡,或者录出来的波形是平的。这通常是软件依赖旧的 MME/WDM 接口,而系统新版本里接口行为有变化。遇到这种情况,优先更新录音软件到新版,其次才是调系统设置。
3. 3分钟搞定内录音频的7个详细步骤
3.1 第一步:确认播放设备与默认声音输出
内录的第一步不是打开录音软件,而是先把系统的声音输出路径搞明白。打开系统声音设置,查看当前的默认播放设备是扬声器、耳机还是 HDMI 输出。这一步决定了后续录音通道能不能真正拿到声音。
很多人内录失败,是因为电脑把声音输出到了“耳机放大器”或“HDMI 显示器音频”,而录音软件监听的是“扬声器”路径。两者对不上,录出来的结果就是空轨。正确做法是先把声卡驱动自己的默认扬声器设备设为系统默认播放设备,然后再接耳机。Windows 在插入耳机时通常会自动切换默认设备,这个动作有时会把内录通道也一并切走,导致立体声混音失去输入信号。所以最稳妥的办法是录音期间固定唯一一个播放设备,不要插拔耳机,不要切换蓝牙音箱。
如果系统声音设置里看不到输出设备列表,或者设备状态显示未插入,那说明声卡驱动有问题。优先去设备管理器里检查声音设备驱动是否正常,不行就重装声卡驱动。基础没打好,后面所有步骤都会白费。
3.2 第二步:启用“立体声混音”录音通道
右键点击任务栏音量图标,选择“声音设置”,再进入“更多声音设置”。在弹出的“声音”控制面板中切到“录制”标签页,在空白区域点击右键,勾选“显示禁用的设备”和“显示已断开的设备”。这时应该能看到一个叫“立体声混音”的录制设备,不同声卡驱动的名字可能略有差异,有的叫“混音”、“Wave Out Mix”或“您听到的声音”,但原理一样,都是把 playback 端信号镜像到 record 端。
在这个设备上点击右键,选择“启用”,然后再次右键,选择“设置为默认设备”。注意这一步至关重要:默认录音设备必须是立体声混音,而不是麦克风。如果不做这一步,录音软件即使选了立体声混音,也可能被系统强制用麦克风输入。启用后系统音量混音器里会出现一个独立的“立体声混音”音量滑杆,它控制的是内录输入电平。建议先把声卡总输出音量调到一个适中位置,再去微调这个滑杆,不要让两者都满格,容易出现削波。
如果“录制”标签页里点了“显示禁用的设备”之后仍然看不到立体声混音,说明声卡驱动没有开放此功能。这时候不要卡在这里,直接进入第二条路线——安装虚拟声卡。虚拟声卡安装完成后,录音设备列表里会多出一个虚拟输出和虚拟输入,把系统默认播放设备指向它,录音软件指向相同设备,就能完成内录闭环。
3.3 第三步:调整采样率与位深,匹配统一标准
在立体声混音设备上右键进入“属性”,切换到“高级”选项卡,会看到两行采样率设置:一行是默认格式,一行是独占模式采样率。这两行必须保持一致,否则录音过程中声卡会频繁切换采样率,听感上就是声音忽快忽慢,或者录到一半变调。
采样率怎么选,取决于录音的最终用途。绝大多数网络音频和播客使用 44.1kHz/16bit,这是 CD 品质,文件体积小,处理速度快。如果是为了配视频、后期修音,建议 48kHz/24bit,因为视频工程的标准帧率对应的音频工程通常是 48kHz,24bit 则给动态余量更大的空间,处理爆音时更不怕。不要盲目选 96kHz,内录素材基本都是从网络流、系统播放器或游戏里拿到的,源本身质量就没有那么高,96kHz 不会带来可感知的提升,只会让文件体积翻倍,甚至引起一些编辑软件的处理压力。
位深和采样率选完之后,还要去录音软件的音频设置里做同样的配置。常见的错误是系统里设了 48kHz,录音软件里还默认 44.1kHz,软件会强制重采样,录出来的声音会有轻度的低通感,高频发闷。好的内部监听习惯是:系统、软件、声卡驱动三个地方采样率保持一致,一劳永逸。
3.4 第四步:打开录音软件并选择正确的输入源
这一步开始进入“电脑录制系统声音的软件”的实际操作环节。打开你选的录音工具,进入音频设置面版,把输入设备设为“立体声混音”或虚拟声卡输入。这里我反复强调一个检查顺序:先在录音软件的左上角确认设备名称是对的那个,再去开始录音。
不同录音软件对输入源的命名规则不同,有的叫“立体声混音:硬件输入”,有的叫“麦克风阵列”后面跟着一堆系统设备名。如果界面上有“监听”或“输入监听”开关,建议录音前打开,先用耳机监听一下是否真的能听到系统播放声。监听能听到 ≠ 录音能录到,但监听都听不到基本等于没设对。这里最容易混淆的一点是:麦克风设备在监听里也能听到声音,但是录进去的是室内的环境声,而不是系统干净的声音。所以选输入源时要认准确确切切是“立体声混音”或虚拟声卡输入,别只凭能听到声音就启动。
3.5 第五步:试录 10 秒,检查电平波形与立体声通道
第一次录制无论多么自信都要试录。很多录音软件的音轨上有两个波形显示条:一条是左声道,一条是右声道。内录正常的话,两轨波形应当几乎一致,而且波形峰值控制在 -6dB 到 -12dB 之间比较理想。如果波形顶到最顶边,说明输入电平过高,削波失真已经产生。如果波形几乎是一条直线,说明输入源还是没接对,或者播放设备输出的音量被静音了。
试录时播放一段熟悉的音乐,观察录音软件的电平表。电平表上平均位置如果低于 -18dB,听起来就会感觉气若游丝,后期提音量会连带放大底噪。如果平均位置在 -12dB 到 -6dB 之间,后面做响度标准化的时候余量很充足。这里顺带提一个细节:很多录音软件默认是关闭左右声道单独电平的,需要手动展开轨道才能看到 L/R 表。建议录音前设置成能同时看到左声道和右声道,这样能排查“单声道输出接错”的隐藏问题。
3.6 第六步:正式录音前的音源与混音准备
一切检查完毕之后,把要录的内容准备好:网页提前缓存好,会议软件提前静音通知,游戏里关掉队友语音,把不需要的浏览器标签页全部关闭。然后打开录音软件的主录音按钮,播放心里的“倒计时三秒”再开始正式内容。这倒不是玄学,而是为了给后期裁切时留出静音参考片段,在波形图上看一眼就知道录音是从哪里开始的。
如果使用的是多轨录音,还需要确认系统播放声音与麦克风是否同时录制。很多直播切片需求要求同时录系统音和人声,多轨工作流里需要建两条音轨,一轨的输入源选择立体声混音,另一轨选择麦克风。两个轨道的音量平衡要在录音前调好,不要依赖后期硬拉,因为麦克风拾音的人声在后期拉高音量时会附带明显的房间底噪。录制过程中不要切换采样率,不要拔插录音设备,尽量保持系统状态稳定。
3.7 第七步:导出为统一格式并命名归档
录音结束以后,先不要急着关软件。回放一遍,确认波形完整、没有中途断开、左右声道正常,然后再做导出。导出时格式选择很讲究:如果是准备做二次剪辑,优先导出无损格式如 FLAC、WAV 或 ALAC,保证后期处理空间;如果是直接交付,根据平台要求导出 mp3 或 AAC。做播客的话,建议先导出 WAV 母带,再压一份 MP3 用于试听,不要直接用 MP3 做二次编辑,转一次码就损一次音质。
文件命名归档也值得认真对待。我习惯用“日期_场景_版本”的格式,例如“20250602_课程回放_v2.wav”,这样工程文件后期回溯非常方便。踩过太多坑的人都知道,最惨的不是录坏了,而是录好了忘存档,电脑一崩全没了。录音软件里有项目文件的概念,或者至少提供一个长时间的自动保存选项,最好事先找出来打开。
4. 常见问题与排查技巧实录
4.1 内录出来只有环境声,没有系统声音
如果录出来的文件里全是室内的桌椅碰撞声、空调声,说明录音软件的输入源选到了麦克风,而不是立体声混音。这是最最最常见的错配。排查办法是看录音软件的设备列表,把输入设备手动改成立体声混音,同时确认系统“声音设置”里的默认录制设备也是立体声混音。如果没找到这个设备,回第二步去“显示禁用的设备”里重新启用。
为什么系统里明明启用了立体声混音,录音软件却只能看到麦克风?有时候是录音软件缓存了设备列表,重新启动软件就能解决。有时候是系统默认输入设备没改,录音软件直接沿用系统默认设置。这里我提供一个快速的验证方法:用系统自带的录音机试录,如果自带录音机能录到系统声音而专业软件录不到,问题就出在软件的输入源配置上;反过来,自带录音机也录不到,那就是系统通路没通。
4.2 录出来的声音断断续续或音调变快变慢
声音断断续续,最常见的原因是音频驱动程序缓冲值过小。录音软件的音频设置里通常有缓冲大小(Buffer Size)或延迟(Latency)选项,数值越小延迟越低,但对 CPU 要求越高,处理不过来就会出现爆音和断音。内录场景不是实时直播,对延迟不敏感,直接把缓冲调到 256 或 512 样本,问题基本能解决。
音调变快变慢则很可能是采样率不匹配。系统和录音软件一个用 44.1kHz,一个用 48kHz,软件强制重采样时偶尔会出现变速现象,尤其是某些老驱动环境下。处理办法就是统一所有音频设备与软件的采样率。注意虚拟声卡类工具本身也有自己的采样率设置,容易出现“三方设备来回切”的情况,排查时要连虚拟声卡的控制面板一起看。
4.3 录完声音有回声感或者人声被录了两遍
这种情况几乎都出在“播放设备本身还在发声,然后又通过麦克风或开放式的内录回环进来”。很多人录制会议时开着扬声器,系统声音又通过立体声混音录了一遍,同时麦克风又把扬声器播出的声音拾了进去,两路信号叠加,就产生了极不舒服的相位长发回声。
解决方法是录制期间使用耳机,不要外放。尤其是录网络会议,对方说话的声音通过系统声卡输出,如果外放又被麦克风收进去,这就是经典的“会议回声环”。在录音软件里还有一层保险:把麦克风音轨静音,或者至少把麦克风音量降到一个极低的位置。录系统声音的人声,不需要麦克风参与。
4.4 电平爆红、声音失真,怎么补救
爆音的根源很简单:输入电平超过了 0dB,波形被削平。一旦削波,信息已经丢失,后期几乎无法无损恢复。所以解决办法只有预防,没有补救。录音前先用试录那 10 秒把电平稳在 -6dB 到 -12dB 的区间。如果发现系统声音有些片段瞬时音量很高,可以降低系统播放音量,也可以给录音软件加一个轻度的限幅器,把偶尔的瞬态峰值压住。爆音预防的道具里还有一个隐蔽选项:把 Windows 声音增强里的“响度均衡”关掉,响度均衡会动态压/提音量,虽然听感上更“响亮”,但录音电平会波动得很厉害,后期极难处理。
如果已经录坏了,并且素材不可重录,能用剪裁修补的方式去掉爆音时刻的音头削波,但声音听起来会像是“顿”了一下。条件允许务必重录,这也是经验。
5. 不同场景下的内录实践参考
内录音频不是同一种录法适用于所有场合。不同场景对音质、延迟、双轨需求、参数设置的要求差异非常大,这里我给出一些对号入座的参考。
在线会议、网课回放的录制,最重要的不是音质,而是完整性和清晰度。会议软件中的发言人声音也会被系统声卡处理成独立的音频流,因此只需要内录立体声混音即可。如果会议软件有降噪、虚拟背景等音频处理功能,建议在软件内部做,不要在系统层面额外叠加处理,以免造成音频多次转码。
游戏录制和直播切片,通常需要同时输出游戏声音和解说人声,这时就建议使用多轨录音工作流。如果只是录游戏内声音,比如录个 BGM 或者技能音效素材,单轨内录就够了。但我仍然建议至少开双轨,把游戏声和人声分开录,后面混剪时灵活度高出不少。
音乐播放、网络流媒体翻录,这类情况通常涉及版权问题,我在操作时一般只录自己拥有版权的内容,或者录自己本地文件里的素材。录音参数上建议采用 48kHz/24bit WAV,覆盖后期处理的需求。如果只是做一个在线试听对比,16bit/44.1kHz 就完全够用。
6. 稳定内录的细节习惯与进阶思路
把七个步骤走通之后,你会发现内录真正考验的不是哪一步的操作难度,而是对整体链路稳定性的把握。我个人的习惯是做一个“录音前检查清单”,每次录之前花 30 秒过一遍:默认播放设备是哪个、立体声混音是否启用、采样率三处统一、录音软件输入源确认、静音通知和扬声器外放关闭、试录 10 秒检查波形。这套流程走下来,基本上每次都能一录过,很少返工。
很多有更高内容生产需求的朋友,会进一步考虑加一块外置声卡。外置声卡的驱动往往直接自带内录通道,不需要依赖立体声混音或虚拟声卡,录音的稳定性和延迟表现也更优秀。如果你计划把录视频、录直播做成一个长期坚持的生产力项目,这个投入是值得的。但对于大部分录网课、录会议的需求,系统自带能力加开源软件已经完全够用,不必为“软件不够好”花钱。
还有一个小技巧:录完导出之后,不要马上删除录音软件的原始工程文件。我在剪辑里遇到过好几次导出后发现某句话有口水音,反复调整降噪参数,才发现最好用的是原始无损工程里重新渲染一遍。音频后期是回环迭代的过程,手上有原始素材,才不慌。