返回写作

我发现自己完全低估了语音输出(张嘴说)的价值

我确认,未来的输出绝对不能是在一个无法说话的空间里敲键盘。

01 我的起点:几乎对所有"语音"都说不

我以前完全是回避语音相关的一切。

  • 语音接收:排斥听播客、语音消息

我基本上不跟人通微信电话,所有未知来电基本不接。不喜欢发语音消息,也不喜欢听语音类的消息。所有的一切都尽量通过键盘打字交流和表达。

我一直不能理解播客这类信息输入方式,觉得除了视频教程,大部分都很低效。用眼睛可以一目十行,可以划线标记,但是播客的信息密度很高,又只是听而不是看,一场下来根本不知道听进去了多少东西,不如转成逐字稿总结,但详细的逐字稿消化慢,简洁的逐字稿信息流失。

此外语音类的信息交流在工作场景里面非常不方便。比如你需要跟同事或者跟某个人确认一下信息的时候对方发语音过来,虽然微信的话可以语音转文字,但如果你需要回看这一部分的信息也是需要重新操作,如果是电话更是需要特地录音留记录,还得跟对方再确认一遍。

  • 语音输出:拒绝说话转文字

对语音输出的排斥则可能跟我自己的生活环境有关系,过去我住的地方不是属于我自己的独立空间,比如说家里或者宿舍里,也就是语音输出极有可能被无关的人听到,没有私密感和安全感。如果在公共场所里,则显得很突兀和打扰。

核心问题在于,我把「语音」狭义化成了「语音接收」,并用「低效、不精准、打扰」给它下了定论,完全忽略了「语音输出」作为创作工具的潜力。

02 观点被撼动的三个触发

我为什么改变对于个人语音输出观点的变化受到三个方面的触发。

  • 两个外部案例的冲击。

一是我看到有人把手机和电脑的主要输入方式都切换成语音输入,这让我很震撼:如果一个程序员都认为基础的提效方式之一是全部语音输入,那语音转文字跟 AI 交流,会不会真的比打字更适合某些场景?

二是我认识的优秀自媒体博主 cony,很厉害,她可以出口成章,也就是她只要在说话,跟人说话或者直播,所有语言上的表达都可以转化为她的文字她的文章她的内容素材,然后各种形式分发,她的生产效率是非常高的。

  • 身边人的对照。

我认识的其他的一些不同职业优秀的朋友,他们普遍有着习惯,意识到在跟人表达一些信息的时候,就实时录音,聊完,文字版也就出来了,立马就把这些东西整理成内容,周期非常短。

我妹跟我差六岁,但她非常适应语音输出、手机端操作。自从她可以使用手机平板开始,她在家里写作文或编辑部的内容,都是通过语音转文字的方式完成的。另外一个ENTJ卷王朋友也日常习惯用语音跟人交流,表达能力也很强。

  • 内容创作体验的反转

我非常频繁地使用通义,它有一个实时记录和音频转文字的功能,能够把很长时间的音频信息转换为逐字稿、整理成导图和思维导图。有一次我跟一个朋友聊天时就开了录音,后来把这份对谈内容整理成文章发到公众号上,收获了不错的数据表现。

整个内容的处理时间其实不长,让我意识到通过语言交流的方式进行内容的创作,比如让人跟AI进行对话式创作或者人跟人之间进行对话式创作,然后通过AI进行二次整理,好像是更高效的输出方式。

对于表达能力可能不够高的我来说,语音输出无法「替代打字」,但或许能提供「先说——再结构化」的一条更顺畅的创作路径。

03 亲身实践:我在语音里找到的"流动感"

  • 散步时的思维激活

另外我发现人在散步之中,在说话的时候,他的思维、输出流畅程度会比坐在电脑前面敲键盘更高。

比如说最近我不是焦虑找工作问题吗?越焦虑越觉得脑子里面一片混沌,不知道从什么地方开始,哪怕有自己沉淀的心理疏导prompt文件,通过打字跟AI交流,都无从下手。但是在外面走在路上、就随便乱走的时候再跟AI聊,就发现自己其实还是可以说出不少东西。

  • ENTP的「先说后想清」模式

我在散步的时候思维会更加活跃,比如我经常走在路上脑子里模拟很多事情,想清楚很多事情,这种时候如果不用语音的方式确实很难记录下来,回过头再想可能就没那么流畅了,语音记录是很方便把握住的方式。

同时我是一种先说后想法好像就通了的那种,我的MBTI是ENTP,发散能力很强,我坐在座位前可能卡住,但张嘴说的话只要开个头我可以持续不断地把我的想法先表达出来,可能我在说的过程中就会逐渐想清楚一些东西,这个说的过程可能很混乱,但它转文字后是大量的原始素材,很方便二次整理。

  • 关于「能量」的理解

我一直觉得张嘴的说话是很耗气的,在一个人能量高气足的时候,如果不断张嘴,就会泄掉做事的气,但在一个人能量低的时候,如果张嘴,可能反而能让气流动起来,专注做事。(我不知道这逻辑通不通)

04 我的重新理解:语音输出的四个维度

重新审视语音输出的价值,可以将其归纳为四个维度:

  • 工具维度:降低门槛、快速捕捉

    说话天然比打字门槛低,尤其在移动、分心或卡顿时。语音输出让创作不再受限于「必须坐在电脑前」的场景。

  • 认知维度:语音=思维触媒

    口语是时间线性的,能把「还没完全成形的念头」推着往前走。对于我这种发散型思维的人来说,一旦开始说,联想与论证会自己往前推。

  • 工作流维度:先口述初稿,再AI结构化

    语音→转写→AI提炼大纲/要点→我再精修。这比「从0开始用键盘憋出结构」更省阻力。

  • 媒介维度:内容的保值性

    由于口头说的内容是线性的,我们习惯讲故事>捋结构,那么内容的复用率就会更高,因为它价值不在形式,而在故事中呈现的过程、价值观与信念。

因此我确认,语音输出的价值此前一直被我严重低估,实际上它是降低输出门槛提高生产效率需要把握住的一个很关键的方式。我未来的输出绝对不能限制自己在一个无法说话的空间里敲键盘。

比如我昨天发的内容说「我不如先做个作品集出来」,虽然我已经整理了一份简历,可以对着我的简历去初步规划一下,但我还需要找很多材料出来,那我需要找哪些材料、这些材料如何组织、这些材料背后体现了什么,这些都我在桌前坐不住确认的,但如果走在路上跟AI说,用口头的方式去描述对做过的事情的记忆细节,AI是否就能够基于这些去梳理我的作品集?