I wanted one hotkey. Press it, talk, let the assistant look at my screen, and get an answer without opening six tabs or explaining what was already in front of me. Simple, right? In my head, the architecture looked like this: microphone → l...
Я хотел одну горячую клавишу.
Нажимайте, говорите, позвольте ассистенту посмотреть на мой экран и получите ответ, не открывая шесть вкладок и не объясняя, что уже было передо мной.
Просто, правда?
В моей голове архитектура выглядела так:
микрофон → местная магия искусственного интеллекта → полезный ответ
В коде это выглядело примерно так:
глобальный ярлык
→ аудиомагнитофон
→ обнаружение голосовой активности
→ модель преобразования речи в текст
→ снимок экрана
→ сжатие изображений
→ локальный LLM-сервер
→ потоковый интерфейс
→ преобразование текста в речь
→ прерываемое воспроизведение текста в речь
Модели были самой легкой частью.
Заставить их всех вести себя как один быстрый и спокойный помощник — вот что стало интересным.
Я построил это, готовясь один к экзаменам. Я продолжал переключаться между своей работой и вкладкой чат-бота, копируя контекст, задавая вопрос, копируя ответ обратно, и постепенно терял желание продолжать.
Я также платил за программное обеспечение для диктовки, потому что говорить быстрее, чем печатать. Диктант сработал, но остановился на тексте. Оно могло слышать меня. Это не могло мне помочь.
Итак, я начал создавать то, что действительно хотел: голосовой слой поверх рабочего стола.
SpeakoFlow начинался как ответвление Handy, что дало мне прочную основу для локальной диктовки.
