Агенты в VoiceRoom
Что это такое, как подключить своего, как настроить голос и транскрибацию — и как подогнать всё под себя.
Что такое агент
Агент — это ваш личный ИИ-ассистент внутри VoiceRoom. С ним можно переписываться как
с обычным контактом, вести ветки-обсуждения, звонить ему голосом и звать в групповые звонки —
он будет слышать разговор и отвечать, когда к нему обращаются.
Главное отличие от «облачных ботов»: мозг агента работает на вашем компьютере
(например, ИИ-рантайм Hermes или OpenClaw), а VoiceRoom только передаёт сообщения и звук.
Отсюда его суперспособности:
- он видит ваши файлы и может выполнять задачи на вашей машине (код, скрипты, документы);
- всё приватное — история, записи звонков, память — остаётся у вас, а не на чужом сервере;
- модель и характер вы выбираете сами и можете менять в любой момент.
Агенты приватны: вашего личного агента не видит и не может позвать никто, кроме вас.
В группу агента добавляет админ — тогда он появляется в отдельном канале группы.
Подключаем за 5 минут
Понадобится: компьютер (macOS, Linux или Windows), на котором будет жить агент, и
установленный ИИ-рантайм — например Hermes
(подойдёт и OpenClaw, и любой рантайм с OpenAI-совместимым API). Дальше всё делает мастер:
1
В приложении откройте раздел Агенты (иконка в боковой панели) и нажмите
«Подключи своего агента». Придумайте имя — например, Кира.
2
Мастер покажет одну команду (для Windows — вариант в PowerShell). Вставьте её в
терминал на компьютере, где живёт агент. Команда поставит маленького помощника-«мост»:
он сам находит ваш Hermes, держит связь с VoiceRoom и запускается вместе с системой.
Ни открытых портов, ни VPN, ни белого IP не нужно — соединение исходящее.
3
Через несколько секунд мастер скажет «Ты на связи 🎉» и предложит три кнопки:
поздороваться в чате, позвонить голосом или добавить агента в группу.
Готово — агент работает в фоне даже после перезагрузки.
Несколько агентов и аккаунтов. На одной машине может жить несколько агентов
(и агенты разных аккаунтов) — установщик разводит их по отдельным конфигам и службам.
А один и тот же локальный ИИ можно подключить к нескольким аккаунтам VoiceRoom — каждый
создаёт своего агента, указывающего на тот же рантайм.
Настраиваем голос и транскрибацию
Чат работает сразу после подключения. Чтобы агент слышал и говорил, на его компьютере
нужна «речь»: распознавание (STT) и синтез (TTS). Открыть инструкцию можно прямо в приложении:
Агенты → «Голос: как настроить». Варианта два:
Вариант А — ключ OpenAI (проще всего)
Одна строка на компьютере агента — и можно звонить, перезапуск не нужен. Ключ закрывает
и распознавание, и голос:
echo 'OPENAI_API_KEY=sk-...' >> ~/.hermes/.env
Вариант Б — полностью локально (приватно)
Запустите на компьютере агента локальные речевые серверы: распознавание на порту
8090, синтез — на 8091 (простой raw-PCM HTTP-контракт, описан в
README моста). Агент найдёт их сам — и тогда ни звук, ни текст вообще не покидают ваш
компьютер. Подойдут любые движки: например, связка GigaAM (распознавание русского)
+ Silero (синтез) уверенно работает даже на обычном ноутбуке.
Как понять, что голос готов: в панели «Агенты» рядом с агентом горит
зелёный микрофон. Жёлтый значок = речь не настроена — нажмите на него, откроется
та же инструкция. Если что-то не так, звонок честно упадёт с понятной ошибкой на экране
(а не «глухим» агентом).
Транскрибация звонков использует эту же связку: что агент «услышал», то и попадает
в расшифровку. Чем лучше STT — тем точнее записи созвонов.
Звонки с агентом
- 1:1 звонок — кнопка трубки в личном чате с агентом. Он отвечает на всё,
что вы говорите, а расшифровка разговора появляется прямо в этом чате.
- Групповой звонок — агент сидит в голосовом канале, слышит всех, но отвечает
только когда к нему обращаются по имени: «Кира, что мы решили?». Неточное произношение
имени прощается.
- Услышал имя — даёт знать: короткий мягкий сигнал в звонке и статус
«слушает…» на экране, ещё пока вы говорите. Можно спокойно продолжать фразу —
агент уже слушает.
- Во время ответа видно живые субтитры и статус («услышала», «думает», «говорит») —
они нигде не сохраняются.
- Можно говорить долго и с паузами — агент дожидается конца мысли, а мычания
(«м-м», «э-э») просто игнорирует.
- Оставшись в комнате один, агент сам кладёт трубку.
Запись разговора и приватность
Записать групповой звонок можно двумя способами — в обоих случаях агент должен быть
в звонке, потому что именно он и есть «записывающее устройство»:
- голосом: «Кира, начни запись» (остановить — «останови запись»);
- кнопкой записи в интерфейсе звонка.
Включить и выключить запись может только владелец или админ группы. Агент объявляет
о записи вслух, и у всех участников горит красный индикатор — незаметно записать никого нельзя.
Что именно сохраняется — и где
| Что | Где хранится | Сколько |
| Звук (аудио) | Нигде — аудио не записывается вообще | — |
| Текст разговора (кто что сказал) | Только на компьютере владельца агента | пока владелец не удалит |
| Служебная отметка «была запись» (кто и когда включил) | Сервер VoiceRoom | 30 дней |
То есть «запись» — это текстовая расшифровка с именами говорящих. На сервер VoiceRoom
текст не отправляется и никому, кроме владельца агента, не доступен.
Спросить о прошлых созвонах
Расшифровки хранятся у агента, и он умеет находить их сам. Работает и в звонке
(«Кира, что говорил Игорь про рейд?»), и в обычном текстовом чате («О чём был вчерашний
созвон? Дай выжимку») — агент прочитает запись и перескажет темы, участников и детали.
Что ещё умеет агент
- Поиск в интернете — «поищи в интернете …»: агент ищет через поисковый сервис
и при необходимости открывает страницы браузером.
- Таймеры и напоминания — «поставь таймер на 20 минут», «напомни завтра в 9 утра …».
Напоминание придёт сообщением в чат и уведомлением — даже если приложение закрыто.
- Треды — любую мысль агента можно развернуть в отдельную ветку, чтобы не мешать
основному разговору.
- Задачи на своей машине — файлы, код, скрипты: всё, что владелец разрешил.
- Сам может написать первым — результат долгой задачи или сработавшее напоминание
прилетят уведомлением.
Настроить под себя
Всё ниже — про рантайм на вашем компьютере (примеры для Hermes; у других рантаймов —
свои аналоги). VoiceRoom подхватывает изменения сам, ничего перепривязывать не нужно.
| Что настроить | Как |
| Характер и правила поведения | Файл ~/.hermes/SOUL.md — обычный текст: «отвечай кратко», «зови меня по имени», постоянные инструкции. Агент читает его в каждом разговоре. |
| Модель (мозг) | hermes model или hermes setup — любая поддерживаемая модель/провайдер (GLM, GPT, Gemini, локальные через Ollama и т.д.). |
| Поиск в интернете | hermes tools — выбрать поисковый бэкенд (DuckDuckGo без ключа, Brave/Tavily/Exa по ключу и др.). |
| Инструменты и навыки | hermes tools и папка скиллов — включать/выключать возможности (браузер, картинки, память…). |
| Голос | Вариант А/Б из раздела про голос; движки STT/TTS можно менять на любые совместимые. |
| Память | У Hermes есть долговременная память — агент запоминает факты о вас между разговорами (можно отключить в конфиге). |
После правок конфига перезапустите рантайм (hermes gateway restart) — мост
переподключится сам.
Если что-то не работает
- Агент офлайн (серый в панели): проверьте, что компьютер агента включён и в сети.
Мост стартует сам; если сносили его вручную — просто повторите команду из мастера
(Агенты → ваш агент → переподключить).
- Звонок не проходит / агент «глухой»: жёлтый микрофон в панели Агентов → откройте
гид и настройте вариант А или Б. Ошибка на экране звонка подскажет, какой «ноги» не хватает.
- Агент долго думает — это нормально для сложных задач: соединение живёт, пока
агент работает; в чате виден статус.
- Напоминание не пришло: проверьте, что компьютер агента не выключался в момент
срабатывания — таймеры исполняет он.
Приватность — коротко
- Аудио звонков не записывается и не сохраняется никогда.
- Текст групповых записей — только на компьютере владельца агента; сервер хранит лишь факт записи (30 дней).
- Запись всегда видна: голосовое объявление + красный индикатор у всех.
- Личные агенты приватны: чужой личный агент нельзя увидеть или позвать.
- Субтитры и статусы в звонке — эфемерные, нигде не хранятся.
- При полностью локальной речи (вариант Б) звук и текст не покидают компьютер владельца.
Agents in VoiceRoom
What they are, how to connect your own, how to set up voice and transcription — and how to make it yours.
What is an agent
An agent is your personal AI assistant inside VoiceRoom. You can message it like a regular
contact, branch discussions into threads, call it by voice, and invite it into group calls —
it hears the conversation and answers when addressed.
The key difference from cloud bots: the agent's brain runs on your computer
(an AI runtime such as Hermes or OpenClaw) — VoiceRoom only relays messages and audio.
That's where its superpowers come from:
- it can see your files and do real work on your machine (code, scripts, documents);
- everything private — history, call recordings, memory — stays with you, not on someone else's server;
- you pick the model and personality yourself and can change them anytime.
Agents are private: nobody but you can see or call your personal agent. A group admin can
add an agent to a group — it then gets its own channel there.
Connect one in 5 minutes
You'll need a computer (macOS, Linux or Windows) where the agent will live, with an AI
runtime installed — e.g. Hermes
(OpenClaw or any runtime with an OpenAI-compatible API works too). The wizard does the rest:
1
In the app, open Agents (sidebar icon) and tap “Connect your agent”.
Pick a name — say, Kira.
2
The wizard shows one command (a PowerShell variant on Windows). Paste it into a
terminal on the agent's computer. It installs a small “bridge” helper that finds your
runtime, keeps the connection to VoiceRoom, and starts with the system. No open ports,
no VPN, no public IP — the connection is outbound.
3
A few seconds later the wizard says “You're live 🎉” and offers three buttons:
say hi in chat, call by voice, or add the agent to a group.
Done — the agent keeps running in the background, across reboots.
Multiple agents & accounts. One machine can host several agents (even for
different accounts) — the installer keeps their configs and services separate. And the
same local AI can serve several VoiceRoom accounts: each account creates its own agent
pointing at the same runtime.
Set up voice & transcription
Chat works right after pairing. For the agent to hear and speak, its computer needs
speech: recognition (STT) and synthesis (TTS). The in-app guide lives at
Agents → “Voice: how to set up”. Two options:
Option A — an OpenAI key (easiest)
One line on the agent's computer — then just call; no restart needed. The key covers both
recognition and voice:
echo 'OPENAI_API_KEY=sk-...' >> ~/.hermes/.env
Option B — fully local (private)
Run local speech servers on the agent's computer: recognition on port 8090,
synthesis on 8091 (a simple raw-PCM HTTP contract, described in the bridge
README). The agent detects them automatically — and then neither audio nor text ever
leaves your computer. Any engines work; e.g. GigaAM (Russian STT) + Silero (TTS) run
comfortably on a regular laptop.
How to know voice is ready: the Agents panel shows a green microphone next
to the agent. A yellow icon = speech isn't set up — click it to open the same guide.
If something's off, the call fails fast with a clear on-screen error (never a “deaf” agent).
Call transcription uses the same stack: whatever the agent “hears” is what lands in the
transcript. Better STT → more accurate call records.
Calls with the agent
- 1:1 call — the call button in your private chat. The agent responds to everything
you say, and the transcript of the conversation appears right in that chat.
- Group call — the agent sits in the voice channel, hears everyone, but only answers
when addressed by name: “Kira, what did we decide?”. Slightly mangled names still work.
- It acknowledges its name: a soft chime in the call and a “listening…” status
on screen while you are still talking — keep going, it's got you.
- While answering you see live captions and a status (“heard”, “thinking”, “speaking”) —
never stored anywhere.
- Long, pause-y speech is fine — the agent waits for the thought to finish and ignores
filler hums (“uh”, “hmm”).
- Left alone in a room, the agent hangs up by itself.
Call recording & privacy
A group call can be recorded in two ways — in both cases the agent must be in the
call, because the agent itself is the recorder:
- by voice: “Kira, start recording” (stop with “stop recording”);
- with the record button in the call UI.
Only the group owner or an admin can start or stop a recording. The agent announces it out
loud and every participant sees a red indicator — nobody can be recorded silently.
What exactly is stored — and where
| What | Where | How long |
| Audio | Nowhere — audio is never recorded | — |
| Transcript text (who said what) | Only on the agent owner's computer | until the owner deletes it |
| “A recording happened” marker (who started it, when) | VoiceRoom server | 30 days |
So a “recording” is a speaker-labelled text transcript. The text never reaches the
VoiceRoom server and is not visible to anyone but the agent's owner.
Ask about past calls
Transcripts live with the agent, and it can find them on its own. Works both in a call
(“Kira, what did Igor say about the raid?”) and in plain text chat (“What was yesterday's
call about? Give me a summary”) — the agent reads the recording and recaps topics, people
and details.
What else it can do
- Web search — “search the web for …”: the agent uses a search service and opens
pages in a browser when needed.
- Timers & reminders — “set a timer for 20 minutes”, “remind me tomorrow at 9am”.
The reminder arrives as a chat message plus a notification — even with the app closed.
- Threads — branch any agent reply into its own thread to keep the main chat clean.
- Tasks on its machine — files, code, scripts: whatever its owner allowed.
- It can reach out first — a finished long task or a fired reminder arrives as
a notification.
Make it yours
Everything below concerns the runtime on your computer (examples are for Hermes; other
runtimes have their own equivalents). VoiceRoom picks changes up automatically — no re-pairing.
| What | How |
| Personality & standing rules | The ~/.hermes/SOUL.md file — plain text: “keep answers short”, “call me by name”, any permanent instructions. Read on every conversation. |
| The model (brain) | hermes model or hermes setup — any supported model/provider (GLM, GPT, Gemini, local via Ollama, …). |
| Web search | hermes tools — pick a search backend (DuckDuckGo keyless; Brave/Tavily/Exa with a key; etc.). |
| Tools & skills | hermes tools and the skills folder — enable/disable capabilities (browser, images, memory…). |
| Voice | Option A/B from the voice section; swap the STT/TTS engines for any compatible ones. |
| Memory | Hermes has long-term memory — the agent remembers facts about you between conversations (can be disabled in config). |
After config edits, restart the runtime (hermes gateway restart) — the bridge
reconnects on its own.
Troubleshooting
- Agent offline (grey in the panel): make sure the agent's computer is on and online.
The bridge autostarts; if you removed it, just re-run the command from the wizard.
- Call fails / agent seems deaf: yellow microphone in the Agents panel → open the
guide and set up option A or B. The on-screen call error says which leg is missing.
- The agent thinks for a long time — normal for hard tasks: the connection stays
alive while it works, and the chat shows its status.
- A reminder didn't arrive: check the agent's computer wasn't off at fire time —
timers run there.
Privacy in short
- Call audio is never recorded or stored.
- Group transcripts stay on the agent owner's computer; the server keeps only the fact of recording (30 days).
- Recording is always visible: a spoken announcement + a red indicator for everyone.
- Personal agents are private: you can't see or invite someone else's personal agent.
- In-call captions and statuses are ephemeral and never stored.
- With fully local speech (option B) audio and text never leave the owner's computer.