
怎么讓 Hermes Agent 聽懂語音情緒實戰避坑【免費下載鏈接】hermes-agentThe agent that grows with you項目地址: https://gitcode.com/GitHub_Trending/he/hermes-agent晚上十點Telegram 里連進三條語音客戶語氣明顯不對。一條條點開聽太慢Hermes Agent 的語音轉文字正好派上用場。它把語音轉文字接在消息網關里語音從 Telegram、Discord 等渠道進來先轉成文字情感識別交給模型回復再按需合成為語音發回去。桌面端里各平臺的會話都擺在同一個列表里。語音轉文字是怎么發生的消息網關收到語音附件后會調用語音轉寫STTspeech-to-text后端把音頻交給一個 provider換回一段文字。內置后端共六種本機跑 faster-whisper 的 local、命令型的 local_command再加 Groq、OpenAI、Mistral、xAI 四個云端 API。選哪個由 config.yaml 里的 stt.provider 決定接口契約寫在 語音轉寫接口。轉寫只回答說了什么不回答心情如何。情緒判斷發生在后面模型讀文本的那一步所以不用額外訓練任何模型。情緒是怎么被說回去的模型讀出客戶在抱怨回復自然帶安撫語氣。這條回復要發成語音時走 TTStext-to-speech文本轉語音內置 provider 有 edge、openai、elevenlabs、minimax 等十種tts.provider 指定用哪個接口在 語音合成接口。情感標簽寫在文本里的sigh、laughs這類語氣標記能不能被演出來取決于后端風格控制強的能演只做基礎合成的會把標簽當普通文本讀掉。五步跑通語音轉文字克隆并安裝git clone https://gitcode.com/GitHub_Trending/he/hermes-agent按 安裝說明 走完hermes model選一個大模型hermes config set stt.provider openai配云端語音轉寫本機有 GPU 就設localhermes config set tts.provider edge配免 key 的合成啟動hermes gateway在 Telegram 發一條語音消息看語音轉文字結果新手容易踩的三個坑別找獨立的情感識別模塊Hermes 沒有單獨的情緒分類器情感識別靠底層大模型讀轉寫文本時完成換個更強的模型聽感差別比換轉寫后端更大provider 配置不生效選到云端后端卻沒配 API key工具直接報錯返回內置 provider 名單固定插件頂不掉同名內置項轉寫準確率看環境嘈雜錄音、方言、超長語音都會掉準確率local后端還吃本機性能拿不準就先跑hermes doctor下次客戶再發語音直接丟給網關想摳轉寫分發邏輯打開 agent/transcription_provider.py 看接口契約。【免費下載鏈接】hermes-agentThe agent that grows with you項目地址: https://gitcode.com/GitHub_Trending/he/hermes-agent創作聲明:本文部分內容由AI輔助生成(AIGC),僅供參考