首页 > 技术

让 Step 5 Preview 做一个 AI 深夜电台,看看它能自己干到哪一步

2026-09-24 10:37:47      中华网   


  这是阶跃星辰最新的旗舰模型,官方对它的定位很明确,重点就是面向 Agent 真实任务。模型采用 MoE 架构,总参数量 600B,每个 Token 激活 27B 参数,同时支持 100 万 Token 上下文和视觉输入。官方把这个方向称为新一代智能效率的帕累托前沿.

  这次 Step 5 Preview 比较值得关注的地方,就是 Coding 和长任务执行能力。从公开评测到内部测试,Step 5 Preview 在软件工程、Agent、专业工作和金融等多个方向上都取得了有竞争力的结果。

  在成本上这次Step 5 Preview也有比较大的优势,百万tokens输入价格只有7元。

  相比其他国产最新旗舰模型价格上也是具有优势的。

  另外一个我比较感兴趣的点,就是它处理长任务的方式。

  一个项目交给它之后,它可以根据运行结果继续修改、测试,再根据新的结果决定下一步怎么做。这个能力其实很适合放在 WorkBuddy 这种 Agent 环境里面测试。

  所以这次我不准备只让它写一个简单页面。

  我直接做一个稍微完整一点的前端项目:AI 深夜电台。

  在WorkBuddy中选择代码发开任务模块。

  把提示词复制到对话框中,把设计概率图也一同给到模型。

  下面就等待Step-5-preview,制作出第一版网页效果。

  这里可以看到,模型已经把「AI 深夜电台」的页面完整制作出来,并且还进行了实际运行验证。从项目结构也能看出来,这次模型没有把所有功能堆在一个 HTML 里面,而是按照功能进行了拆分。

  除了前端页面之外,项目还拆分了播放器、实时波形、语音识别、AI 对话、语音合成等多个功能模块,同时预留了StepAudio 3的 API 配置。

  还原度很高,基本达到了设计图的要求,因为中间的播放器部分如果要制作出来的话,需要制作3D模型,绑定骨骼才可以正常使用,所以这里模型就处理为了一个正常的播放器页面。

  配色和样子基本上都是按照设计图和提示词来制作的。 试一下功能,点击按住说话成功吊起浏览器的麦克风权限,说明麦克风功能是没有问题的。

  因为现在还是第一版,还没有配置StepAudio 3 语音功能,所以模型进行了降级处理,采用浏览器合成 / Mock合成语音,让demo更有全面,不至于语音功能为空白。

  只不过这个语音就很拉胯了,声音机械感很强,而且回复的内容也很抽象。

  然后我看见模型在WorkBuddy上的任务并没有停止,而是在不断的修改页面的小问题。

  修改完成后模型也没有直接交付项目,而是在不断的测试。这种流程就比较智能了,因为大部分AI写的项目,模型自己会修改bug,但是一旦检测到bug已经被修改后,模型会直接生成交付语句,也就是在Agent中看见的回复内容。

  比如这种

  但 Step 5 Preview,并没有直接进行交付,而是不断在进行测试,测试每一个接口,每一个功能是否正常运行。

  在模型自行测试的过程中不断的修复bug,优化代码。

  虽然这样可能会比较消耗时间,但是从项目完成度上来讲,模型的严谨性还是很强的。

  第一步就制作完成了,然后就是配置语音模型了,语音模型我也采用阶跃的语音模型:StepAudio 3 .

  在阶跃星辰的开发文档里面,把语音配置信息拷贝下来,当然也可以直接把文档的链接丢给WorkBuddy,只要模型可以读取到配置信息即可。

  这里我选择两个官方的音色。

  等待模型识别任务继续后续的开发任务。

  后续开发任务中,模型沿用了前面任务制作流程,先写代码,然后检测bug,再检测无bug后,编写测试案例,功能点通过测试案例后,模型还要删掉没用的文件,最终才形成交付文件。这套流程还是很规范的。

  点击文字发送查看是否可以正常交流。

  OK,文字交流没有问题,而且AI角色也是根据我的问题来进行回复我的,不是demo中固定语句。音色也得到了优化,这一版的人声更加的贴合我们的产品主题,声音温柔知性。

  右边为部分配置信息,可以配置不同的音色,语音识别,还可以制作AI音乐。

  点击语音合成进入到音色配置信息中,可以根据自己想喜好选择不同的音色,当然也使用其他音色,甚至开可以制作自己喜欢的音色(音色克隆),只不过这里还没有迭代到下一个版本。

  音乐生成也是比较简单的AI音乐声场,这里也是可以迭代的,通过提示词来调整音乐的生成。

  最后就是语音识别功能了,实际测试下来识别也没什么问题,到这里整个 Demo 基本就制作完成了。

  总体体验下来,我觉得 Step 5 Preview 做这种前端小项目最大的优点,就是它会自己判断项目当前的问题,并且主动去检测和修改代码。

  很多时候我只需要把需求说清楚,后面的实现、调试、检查基本都可以交给模型自己完成,不需要我再反复提醒哪里有问题、下一步该做什么。

  这样做项目的时候会省事很多,一个需求给下去,模型可以自己把整个流程继续往下推进。

  因为模型Step 5 Preview本身就属于多模态,所以对设计图的理解也很到位,除了中间的留声机模型没办法制作之外,其他部分的网页设计基本上都是按照设计图来开发的。

  后续如果要继续迭代功能的话,那么就需要数据库了,把用户的数据存入进去,然后制作一个简单的知识库保留用户的聊天习惯和重要事项,其次就是增加更多的音色选项和其他功能点,最后加上这个留声机模型增加用户互动感,那么这个demo就可以落地了。

相关阅读

    无相关信息