SkillAgentSearch skills...

Step Audio EditX

A powerful 3B-parameter, LLM-based Reinforcement Learning audio edit model excels at editing emotion, speaking style, and paralinguistics, and features robust zero-shot text-to-speech

Install / Use

npx skills add stepfun-ai/Step-Audio-EditX

Installs into whichever agent you are using.

README

Step-Audio-EditX

<p align="center"> <img src="assets/logo.png" height=100> </p> <div align="center"> <a href="https://stepaudiollm.github.io/step-audio-editx/"><img src="https://img.shields.io/static/v1?label=Demo%20Page&message=Web&color=green"></a> &ensp; <a href="https://arxiv.org/abs/2511.03601"><img src="https://img.shields.io/static/v1?label=Tech%20Report&message=Arxiv&color=red"></a> &ensp; <a href="https://huggingface.co/stepfun-ai/Step-Audio-EditX"><img src="https://img.shields.io/static/v1?label=Step-Audio-EditX&message=HuggingFace&color=yellow"></a> &ensp;

<a href="https://modelscope.cn/models/stepfun-ai/Step-Audio-EditX"><img src="https://img.shields.io/static/v1?label=Step-Audio-EditX&message=ModelScope&color=blue"></a><a href="https://huggingface.co/spaces/stepfun-ai/Step-Audio-EditX"><img src="https://img.shields.io/static/v1?label=Space%20Playground&message=HuggingFace&color=yellow"></a><a href="https://www.stepfun.com/studio/audio?tab=edit"><img src="https://img.shields.io/static/v1?label=Audio%20Studio&message=StepFun&color=blue"></a>

</div>

🔥🔥🔥 News!!!

  • Jan 29, 2026:
    • 🧩 New Model Release:
      • Better performance, with an overall improvement of over 4%.
      • More paralinguistic tags have been added, including exhale, snort, inhale, chuckle, clears throat, giggle.
      • Welcome to try out at StepFun Audio Studio
    • 💻 We release the SFT, DPO and GRPO training code.
    • 🌟 Training and inference for vLLM are now supported. Thanks to the vLLM team!
  • Nov 28, 2025: 🚀 New Model Release: Now supporting Japanese and Korean languages.
  • Nov 23, 2025: 📊 Step-Audio-Edit-Benchmark Released!
  • Nov 19, 2025: ⚙️ We release a new version of our model, which supports polyphonic pronunciation control and improves the performance of emotion, speaking style, and paralinguistic editing.
  • Nov 12, 2025: 📦 We release the optimized inference code and model weights of Step-Audio-EditX (HuggingFace; ModelScope) and Step-Audio-Tokenizer(HuggingFace; ModelScope)
  • Nov 07, 2025: ✨ Demo Page ; 🎮 HF Space Playground
  • Nov 06, 2025: 👋 We release the technical report of Step-Audio-EditX.
<p align="center"> <img src="assets/step-audio-editx_emotion_performance.jpeg" height=200> </p>

Introduction

We are open-sourcing Step-Audio-EditX, a powerful 3B-parameter LLM-based Reinforcement Learning audio model specialized in expressive and iterative audio editing. It excels at editing emotion, speaking style, and paralinguistics, and also features robust zero-shot text-to-speech (TTS) capabilities.

<img src="assets/QRCode.jpeg" height=300> Wechat developer group

📑 Open-source Plan

  • [x] Inference Code
  • [x] Online demo (Gradio)
  • [x] Step-Audio-Edit-Benchmark
  • [x] Model Checkpoints
    • [x] Step-Audio-Tokenizer
    • [x] Step-Audio-EditX
    • [x] Step-Audio-EditX-Int4
  • [ ] Training Code
    • [x] SFT training
    • [x] DPO training
    • [x] GRPO training
    • [ ] PPO training
  • [ ] ⏳ Feature Support Plan
    • [ ] Editing
      • [x] Polyphone pronunciation control
      • [x] More paralinguistic tags ([Cough, Crying, Stress, etc.])
      • [ ] Filler word removal
    • [ ] Other Languages
      • [x] Japanese, Korean
      • [ ] Arabic, French, Russian, Spanish, etc.

Features

  • Zero-Shot TTS

    • Excellent zero-shot TTS cloning for Mandarin, English, Sichuanese, and Cantonese.
    • To use dialect or other languages, just add a [Sichuanese] / [Cantonese] / [Japanese] / [Korean] tag before your text.
    • 🔥 Polyphone pronunciation control, all you need to do is replace the polyphonic characters with pinyin.
      • [我也想过过过儿过过的生活] -> [我也想guo4guo4guo1儿guo4guo4的生活]
  • Emotion and Speaking Style Editing

    • Remarkably effective iterative control over emotions and styles, supporting dozens of options for editing.
      • Emotion Editing : [ Angry, Happy, Sad, Excited, Fearful, Surprised, Disgusted, etc. ]
      • Speaking Style Editing: [ Act_coy, Older, Child, Whisper, Serious, Generous, Exaggerated, etc.]
      • Editing with more emotion and more speaking styles is on the way. Get Ready! 🚀
  • Paralinguistic Editing

    • Precise control over 10 types of paralinguistic features for more natural, human-like, and expressive synthetic audio.
    • Supporting Tags:
      • [ Breathing, Laughter, Surprise-oh, Confirmation-en, Uhm, Surprise-ah, Surprise-wa, Sigh, Question-ei, Dissatisfaction-hnn ]
  • Available Tags

<table> <tr> <td rowspan="8" style="vertical-align: middle; text-align:center;" align="center">emotion</td> <td align="center"><b>happy</b></td> <td align="center">Expressing happiness</td> <td align="center"><b>angry</b></td> <td align="center">Expressing anger</td> </tr> <tr> <td align="center"><b>sad</b></td> <td align="center">Expressing sadness</td> <td align="center"><b>fear</b></td> <td align="center">Expressing fear</td> </tr> <tr> <td align="center"><b>surprised</b></td> <td align="center">Expressing surprise</td> <td align="center"><b>confusion</b></td> <td align="center">Expressing confusion</td> </tr> <tr> <td align="center"><b>empathy</b></td> <td align="center">Expressing empathy and understanding</td> <td align="center"><b>embarrass</b></td> <td align="center">Expressing embarrassment</td> </tr> <tr> <td align="center"><b>excited</b></td> <td align="center">Expressing excitement and enthusiasm</td> <td align="center"><b>depressed</b></td> <td align="center">Expressing a depressed or discouraged mood</td> </tr> <tr> <td align="center"><b>admiration</b></td> <td align="center">Expressing admiration or respect</td> <td align="center"><b>coldness</b></td> <td align="center">Expressing coldness and indifference</td> </tr> <tr> <td align="center"><b>disgusted</b></td> <td align="center">Expressing disgust or aversion</td> <td align="center"><b>humour</b></td> <td align="center">Expressing humor or playfulness</td> </tr> <tr> </tr> <tr> <td rowspan="17" style="vertical-align: middle; text-align:center;" align="center">speaking style</td> <td align="center"><b>serious</b></td> <td align="center">Speaking in a serious or solemn manner</td> <td align="center"><b>arrogant</b></td> <td align="center">Speaking in an arrogant manner</td> </tr> <tr> <td align="center"><b>child</b></td> <td align="center">Speaking in a childlike manner</td> <td align="center"><b>older</b></td> <td align="center">Speaking in an elderly-sounding manner</td> </tr> <tr> <td align="center"><b>girl</b></td> <td align="center">Speaking in a light, youthful feminine manner</td> <td align="center"><b>pure</b></td> <td align="center">Speaking in a pure, innocent manner</td> </tr> <tr> <td align="center"><b>sister</b></td> <td align="center">Speaking in a mature, confident feminine manner</td> <td align="center"><b>sweet</b></td> <td align="center">Speaking in a sweet, lovely manner</td> </tr> <tr> <td align="center"><b>exaggerated</b></td> <td align="center">Speaking in an exaggerated, dramatic manner</td> <td align="center"><b>ethereal</b></td> <td align="center">Speaking in a soft, airy, dreamy manner</td> </tr> <tr> <td align="center"><b>whisper</b></td> <td align="center">Speaking in a whispering, very soft manner</td> <td align="center"><b>generous</b></td> <td align="center">Speaking in a hearty, outgoing, and straight-talking manner</td> </tr> <tr> <td align="center"><b>recite</b></td> <td align="center">Speaking in a clear, well-paced, poetry-reading manner</td> <td align="center"><b>act_coy</b></td> <td align="center">Speaking in a sweet, playful, and endearing manner</td> </tr> <tr> <td align="center"><b>warm</b></td> <td align="center">Speaking in a warm, friendly manner</td> <td align="center"><b>shy</b></td> <td align="center">Speaking in a shy, timid manner</td> </tr> <tr> <td align="center"><b>comfort</b></td> <td align="center">Speaking in a comforting, reassuring manner</td> <td align="center"><b>authority</b></td> <td align="center">Speaking in an authoritative, commanding manner</td> </tr> <tr> <td align="center"><b>chat</b></td> <td align="center">Speaking in a casual, conversational manner</td> <td align="center"><b>radio</b></td> <td align="center">Speaking in a radio-broadcast manner</td> </tr> <tr> <td align="center"><b>soulful</b></td> <td align="center">Speaking in a heartfelt, deeply emotional manner</td> <td align="center"><b>gentle</b></td> <td align="center">Speaking in a gentle, soft manner</td> </tr> <tr> <td align="center"><b>story</b></td> <td align="center">Speaking in a narrative, audiobook-style manner</td> <td align="center"><b>vivid</b></td> <td align="center">Speaking in a lively, expressive manner</td> </tr> <tr> <td align="center"><b>program</b></td> <td align="center">Speaking in a show-host/presenter manner</td> <td align="center"><b>news</b></td> <td align="center">Speaking in a news broadcasting manner</td> </tr> <tr> <td align="center"><b>advertising</b>

Related Skills

View on GitHub
GitHub Stars961
CategoryEducation
Updated4h ago
Forks75

Languages

Python

Security Score

100/100

Audited on Aug 8, 2026

No findings