Призрак в браузере: как один стартап переосмысливает ИИ-агента
Всё началось с голосовой заметки. Год назад в комнате, наполненной гулом мощных MacBook и запахом остывшего кофе, четверо инженеров собрались, чтобы понять, почему самые передовые технологии в истории человечества до сих пор не могут забронировать авиабилет или организовать таблицу без постоянного контроля со стороны человека. Они записали свой спор — необработанный обмен идеями, который впоследствии стал чертежом Manus. Сегодня, оглядываясь на эти расшифровки, можно увидеть точный момент рождения идеи настоящего ИИ-агента — не чат-бота, который говорит о работе, а цифровой сущности, которая действительно её выполняет.
Термин «ИИ-агент» стал новым любимым модным словом технологической отрасли, однако большинство людей всё ещё затрудняется объяснить, что он на самом деле означает. Это просто более умная версия Siri? Скрипт, работающий в фоновом режиме? По словам Чжана Тао и его команды в Manus, ИИ-агент — нечто гораздо более глубокое: это продолжение человеческого разума. Это программное обеспечение, способное ориентироваться в беспорядочном, непредсказуемом мире открытого интернета с той же самостоятельностью и настойчивостью, что и человек-стажёр, но без потребности во сне или медицинской страховке.
В этом подробном разборе мы исследуем внутреннюю философию и технические препятствия, обсуждавшиеся на той основополагающей встрече. Мы рассмотрим, как команда разрешала противоречие между созданием «универсального» и «специализированного» решения, почему «облачный браузер» станет секретным оружием следующего десятилетия и как меняется экономика интеллекта. Это не просто история стартапа, а дорожная карта эпохи, в которой у каждого человека на Земле будет собственный ИИ-агент, всегда готовый прийти на помощь.
Переход от генеративного ИИ к автономному ИИ-агенту представляет собой самый значительный сдвиг в вычислительной технике со времён изобретения графического пользовательского интерфейса. Мы переходим от мира, в котором указываем компьютерам, «как» что-то делать (программирование), к миру, в котором сообщаем им, «что» должно быть достигнуто (намерение). Но команда Manus быстро поняла: заставить машину понять намерение — простая часть задачи; настоящая борьба разворачивается при его выполнении в раздробленном пространстве современного интернета.
Парадокс универсальности: от Hao123 к новому интернету
Одним из самых оживлённых споров на стартовой встрече Manus стал стратегический выбор: создать специализированный инструмент для конкретных задач или универсальный механизм? Red Peak, один из ключевых мыслителей проекта, использовал блестящую историческую аналогию. Он сравнил нынешнее состояние ИИ с ранними днями китайского интернета, в частности с соперничеством Hao123 и Baidu.
Hao123 был каталогом — набором ссылок, заранее отобранных и организованных людьми. Он работал, потому что интернет был небольшим. Аналогичным образом многие ранние инструменты ИИ основаны на ссылках. Они подключаются к отдельному API Spotify, другому API Google Calendar и ещё одному API Slack. Но такой подход изначально ограничен. Можно делать только то, что разработчик заранее интегрировал. Если вы хотите, чтобы ИИ-агент выполнил задачу, о которой разработчик не подумал, вам не повезло. Эта модель интеллекта, ориентированная на предложение, не ведёт к настоящей автономности.
С другой стороны, «модель Baidu» (или модель Google) начиналась с поискового робота. Он не просил разрешения, а просто учился читать и перемещаться по всему интернету. Сначала создав универсальную поисковую систему, разработчики смогли впоследствии оптимизировать её под конкретные запросы. Команда Manus решила, что её ИИ-агент должен идти именно этим путём. Это не набор плагинов, а цифровая сущность, умеющая пользоваться браузером так же, как вы. Если она видит кнопку, то может её нажать. Если видит форму, то может её заполнить.
- Каталожный подход: ограничен заранее заданными интеграциями; высокая надёжность, но низкая гибкость.
- Подход поискового робота: способен работать с любым сайтом; высокая гибкость, но требуется глубокое «визуальное» понимание.
- Гибридная цель: использовать универсальные возможности, чтобы понять, чего на самом деле хотят пользователи, а затем встроить быстрые решения для наиболее частых задач.
- Преимущество масштабируемости: универсальному ИИ-агенту не нужно ждать, пока компания выпустит API, чтобы начать приносить пользу.
Решение поставить универсальность выше вертикальной оптимизации смело. Это означает, что ИИ-агенту придётся справляться с хаосом «дикого» интернета — всплывающими окнами, капчами и постоянно меняющейся вёрсткой. Но команда утверждала: если решить универсальную задачу, частные задачи решатся сами собой. Они создавали не просто инструмент, а платформу для цифрового труда.
Инфраструктура автономности: облачный браузер
Если философия Manus связана с универсальной агентностью, то техническим сердцем проекта является «облачный браузер». На встрече Чжан Тао и Фань Бинь подробно обсуждали, как ИИ-агент будет взаимодействовать с реальным миром. Нельзя просто дать LLM терминал и ожидать, что она забронирует отель. Большая часть ценности современного мира скрыта за графическими пользовательскими интерфейсами, созданными для человеческих глаз и пальцев.
Решением стала архитектура «браузер в браузере». Вместо того чтобы незаметно собирать данные в фоновом режиме, ИИ-агент фактически управляет полноценным экземпляром браузера, работающим на удалённом сервере. Когда вы просите ИИ-агента найти дом на Zillow, он не просто вызывает API: он буквально открывает браузер в облаке, переходит по URL и начинает прокрутку страницы. Пользователь может наблюдать за работой агента в реальном времени, что создаёт уровень доверия, недостижимый для текстовых ботов.
Однако это создаёт серьёзную техническую проблему, связанную с задержкой. Как передавать окно браузера высокой чёткости с сервера на ноутбук пользователя так, чтобы всё не выглядело ужасно медленным? Чжан Тао указал на технологии вроде XPRA, использующие интеллектуальную передачу пикселей. Передавая только изменившиеся участки экрана, ИИ-агент может выглядеть так, будто работает прямо перед глазами пользователя, даже если все тяжёлые вычисления происходят за тысячи километров, в дата-центре.
| Функция |
Традиционный API-бот |
ИИ-агент Manus |
| Интерфейс |
Скрытый/только текст |
Живой визуальный облачный браузер |
| Совместимость |
Требуется официальный API |
Работает с любым сайтом |
| Контроль пользователя |
Отсутствует (чёрный ящик) |
Интерактивный режим перехвата управления |
| Сохранение состояния |
Только в рамках сессии |
Полное состояние и память авторизации |
Такой визуальный подход также решает проблему «галлюцинаций». Если обычный чат-бот сообщает, что забронировал авиабилет, остаётся только поверить ему на слово. Если ИИ-агент Manus показывает экран подтверждения в окне браузера в реальном времени, у вас есть доказательство. Такая прозрачность необходима инженеру, которому нужно отлаживать процесс, и руководителю, которому важно лишь знать, что задача выполнена.
Проблема постоянства: почему ИИ нужна память
Одним из самых глубоких выводов стартовой встречи Manus стало понимание, что ИИ-агент без памяти — всего лишь сложный калькулятор. Peak указал на серьёзный недостаток нынешних лидеров рынка, таких как Devin: они работают по принципу «одна сессия — одна задача». После завершения сессии агент фактически страдает цифровой амнезией. Он забывает ваши пароли, созданные им файлы и то, как вы предпочитаете оформлять таблицы.
Чтобы быть настоящим посредником человека, ИИ-агент должен сохранять состояние. Это означает, что агенту нужна собственная цифровая идентичность. Ему требуется защищённое хранилище для cookies и локального хранилища, чтобы оставаться авторизованным в вашей учётной записи Amazon или GitHub. Нужна постоянная файловая система, где он сможет сохранить черновик отчёта в понедельник и вернуться к нему в четверг. Без этого «агентность» ИИ-агента — иллюзия.
Команда обсуждала создание виртуального «дома» для каждого агента. В этой среде будут переменные окружения, защищённые ключи и выделенное рабочее пространство. Представьте себе цифровой офис, в который ИИ-агент «входит» каждый раз, когда вы его вызываете. Такое постоянство позволяет выполнять долгие задачи, занимающие часы или дни, а агенту — периодически сообщать пользователю о ходе работы.
«Настоящая агентность — это не просто решение задачи; это владение рабочим пространством, в котором эта задача решается. Если ИИ-агент не может помнить, кто я, между сессиями, то это не помощник, а незнакомец».
Но создание постоянной памяти дорого и сложно. Оно требует огромных объёмов высокопроизводительных вычислений и бесшовного доступа к лучшим в мире большим языковым моделям. Здесь в игру вступает экономика индустрии ИИ-агентов. Чтобы запустить универсального агента, способного думать, видеть и помнить, разработчикам нужна инфраструктура, которая не разорит их.
Экономика интеллекта: GPT Proto и итоговая стоимость
Когда обсуждение перешло от вопроса «что» к вопросу «как», на первый план вышла стоимость моделей. Работа сложного ИИ-агента требует постоянного потока взаимодействий с большим количеством токенов. Каждый раз, когда агент «смотрит» на веб-страницу или «рассуждает» над многоэтапной задачей, он расходует дорогие кредиты API. Чтобы масштабироваться, стартап вроде Manus не мог позволить себе зависеть от розничных цен крупных поставщиков моделей.
Именно здесь платформы глубокой интеграции, такие как GPT Proto, меняют правила игры для разработчиков ИИ-агентов. Предоставляя единый интерфейс к самым мощным моделям мира — включая OpenAI, Claude и Google — со скидкой до 60% от стандартных цен, GPT Proto позволяет разработчикам сосредоточиться на агентности, а не на счетах. Когда ИИ-агенту требуется сложная задача, требующая глубокого рассуждения, он может переключиться на производительную модель; когда нужно лишь обобщить веб-страницу — перейти в экономичный режим.
Команда Manus поняла, что интеллектуальное планирование — возможность динамически переключаться между моделями в зависимости от сложности задачи — является ключевым конкурентным преимуществом. Используя систему вроде GPT Proto, ИИ-агент может стать мультимодальной мощной системой, получая доступ к обработке текста, изображений и даже видео через единый стандартный интерфейс. Именно такая гибкость превращает прототип в устойчивую бизнес-модель.
- Экономичность: существенные скидки позволяют проводить долгие сессии агента, которые иначе были бы слишком дорогими.
- Мультимодальные возможности: единый доступ к специализированным моделям для зрения (навигация в интернете) и текста (рассуждение).
- Единые стандарты: упрощают код, необходимый для управления ИИ-агентом в разных форматах моделей.
- Глобальная надёжность: API с высоким временем доступности гарантируют, что агент не «умрёт» посреди критически важной задачи.
Для пользователя это означает, что ИИ-агент становится доступнее и функциональнее. Это разница между роскошным инструментом для технологической элиты и повсеместной утилитой для широкой публики. Оптимизируя «цепочку поставок интеллекта», Manus может гарантировать, что цифровые помощники всегда быстры, умны и доступны.
Философия UX: сила интерактивного перехвата управления
Одна из наиболее ориентированных на человека частей обсуждения Manus касалась того, что происходит, когда ИИ-агент терпит неудачу. И не сомневайтесь: даже лучший ИИ-агент иногда столкнётся с препятствием. Это может быть запрос двухфакторной аутентификации, сложная капча или сайт с нестандартным интерфейсом — бывают моменты, когда человеческая интуиция всё ещё необходима. Большинство современных ИИ-инструментов просто завершают работу с ошибкой или просят пользователя исправить код.
Manus предложила более элегантное решение: интерактивный перехват управления. Поскольку ИИ-агент работает в облачном браузере, транслируемом пользователю, переход от управления ИИ к управлению человеком может быть мгновенным. Если агент застрял на экране входа, пользователь может просто щёлкнуть в окне, ввести пароль или решить капчу, а затем нажать кнопку «Продолжить», чтобы вернуть управление ИИ-агенту.
Это создаёт совместный цикл работы. ИИ-агент выполняет 90% повторяющихся и скучных задач, а человек выступает руководителем на высоком уровне для тех 10%, которые требуют творческого или защищённого ввода. Такой подход устраняет тревогу перед «чёрным ящиком», которую многие испытывают при использовании ИИ. Вы не просто скрещиваете пальцы и надеетесь, что бот поступит правильно; вы находитесь рядом и готовы вмешаться при необходимости.
Сам интерфейс следует философии «постепенного раскрытия». Команда критиковала подход «стены текста», характерный для многих технических инструментов. Для руководителя ИИ-агент Manus должен выглядеть как простая и аккуратная панель управления. Но инженер, который хочет видеть происходящие процессы, может открыть терминал, журналы браузера и файловую систему в виде независимых плавающих окон. Это операционная система эпохи ИИ.
Аналогия с EVE Online: управление сложностью
В неожиданный момент встречи команда начала обсуждать EVE Online — массовую многопользовательскую игру, известную невероятно сложными экономическими и политическими системами. Почему? Потому что EVE представляет предел возможностей человеческого когнитивного управления. Игрокам часто приходится одновременно управлять десятками таблиц, торговыми маршрутами и дипломатическими альянсами. Эту игру нередко описывают как «таблицы в космосе».
PanPan и Чжан Тао увидели в этом идеальный полигон для испытания ИИ-агента. Если агент может помочь игроку ориентироваться в сложностях смоделированной галактической экономики, он наверняка сможет помочь владельцу малого бизнеса справляться с глобальной логистикой, налоговым регулированием и цифровым маркетингом. ИИ-агент — не просто помощник, а «буфер сложности». Он поглощает беспорядочные данные мира с высокой энтропией и представляет пользователю понятные варианты и выполненные действия.
Люди печально известны своей неспособностью долго сохранять концентрацию при высокой интенсивности работы. Мы устаём, упускаем детали и подвержены «предвзятости опыта» — склонности делать всё по-старому, даже если существует лучший способ. ИИ-агент, напротив, может работать исходя из первых принципов. Он способен просканировать все доступные варианты в интернете, сравнить цены у 500 продавцов и найти кратчайший путь к цели, не скучая и не отвлекаясь. В этом смысле он действительно становится продолжением нашей силы воли.
Преодоление разрыва в экспертизе
Фань Бинь поднял важный вопрос: сможет ли универсальный ИИ-агент когда-нибудь конкурировать со специалистом, использующим профессиональное программное обеспечение? Например, действительно ли агент сможет пользоваться Final Cut Pro для монтажа видео? Или он всегда будет неуклюжей версией человека-монтажёра? Ответ команды был одновременно скромным и амбициозным. Они признали, что в области «компьютерного управления» — способности ИИ видеть и нажимать элементы в приложениях, не относящихся к вебу, — ещё предстоит пройти долгий путь.
Однако команда утверждала, что большая часть профессиональной работы перемещается в интернет. От Figma для дизайна до Google Workspace для документов и Salesforce для CRM — браузер становится универсальной операционной системой. Освоив браузер, ИИ-агент осваивает 80% современной офисной работы. Разрыв в экспертизе связан не со знанием каждой кнопки в конкретной программе, а со способностью агента на лету изучать новый интерфейс.
Так появилась идея обучения агента. Подобно человеку, который осваивает новый инструмент, читая инструкцию и экспериментируя, ИИ-агент Manus способен к самокоррекции. Если он нажимает кнопку и получает неожиданный результат, то не просто прекращает работу. Он анализирует новое состояние экрана, ищет подсказки и пробует другой подход. Этот цикл рассуждений отличает статичный скрипт от настоящего ИИ-агента.
| Когнитивная задача |
Ограничение человека |
Сильная сторона ИИ-агента |
| Поиск информации |
Медленный, подвержен предвзятости |
Исчерпывающее сканирование в реальном времени |
| Продолжительность концентрации |
Снижается через несколько часов |
Неограниченная работа 24/7 |
| Выполнение процессов |
Ручное, подвержено ошибкам |
Точность скрипта в сочетании с рассуждением |
| Принятие решений |
Эмоциональное/эвристическое |
Основанное на данных/первых принципах |
Цель — поднять человека на более высокий уровень создания ценности. Вместо роли «водителя» программного обеспечения человек становится «архитектором» результата. Вы не объясняете ИИ-агенту, как двигать мышью; вы описываете, как должен выглядеть конечный продукт, и привносите вкус и суждение, чтобы определить, хорош ли результат.
Безопасность и доверие: этический рубеж
Невозможно говорить об ИИ-агенте, у которого есть ваши учётные данные и информация о банковской карте, не затрагивая тему безопасности. Это, вероятно, была самая серьёзная часть встречи. Если агент будет скомпрометирован, вся цифровая жизнь пользователя окажется под угрозой. Команда Manus посвятила много времени обсуждению изоляции таких агентов, чтобы даже при взломе одного экземпляра остальная система оставалась защищённой.
Доверие строится на прозрачности. Решение сделать действия ИИ-агента видимыми в облачном браузере было не только выбором в пользу удобства, но и решением в области безопасности. Позволяя пользователю видеть, что именно делает агент, Manus создаёт журнал аудита. Если агент начинает переходить на подозрительный сайт, пользователь видит это и может завершить сессию. Модель «что видишь, то агент и делает» критически важна для массового внедрения автономных агентов.
Кроме того, команда обсуждала инкапсуляцию учётных данных. Идея заключается в том, что ИИ-агент никогда не «видит» ваш настоящий пароль. Вместо этого он использует защищённый токен сессии или управляемое хранилище. Это ограничивает масштаб потенциального инцидента безопасности. В эпоху, когда ИИ-агент будет распоряжаться нашими деньгами и данными, эти «скучные» детали инфраструктуры на самом деле становятся важнейшими функциями.
Будущее: продолжение разума для каждого
Встреча завершилась ощущением тихого воодушевления. Записи показывают команду, понимавшую, что находится в начале марафона, а не спринта. Они перешли от абстрактной идеи «ИИ» к конкретной реальности функционального ИИ-агента — постоянного, визуального и способного цифрового сотрудника. Команда осознала, что успех Manus будет измеряться не количеством людей, которые с ним общаются, а количеством часов ручного труда, которые он сэкономит.
Мы вступаем в исторический период, когда граница между «думать» и «делать» стирается. В прошлом, если у вас появлялась отличная идея для исследовательской работы или бизнес-плана, всё равно приходилось тратить сотни часов на рутину — поиск, форматирование, переписку и ввод данных. ИИ-агент создан, чтобы уничтожить эту рутину. Он позволяет человеческому духу оставаться в состоянии потока творчества, пока машина берёт на себя логистику выполнения.
По мере превращения Manus из набора протоколов встреч в живой продукт он сохраняет философию той первой дискуссии: технология должна быть не просто инструментом, которым мы пользуемся, а партнёром, который нас понимает. Будь то управление сложным проектом, бронирование путешествия мечты или навигация в запутанном мире цифровых финансов — ИИ-агент всегда готов превратить ваше намерение в реальность.
Заключение
Путь от голосовой записи в тесном офисе до ИИ-агента мирового класса свидетельствует о силе ясной продуктовой философии. Отвергнув модель Hao123 с её ограниченными интеграциями и приняв модель Baidu с универсальными возможностями, Manus встал на путь переосмысления наших отношений с компьютерами. Используя облачные браузеры, постоянную память и модель взаимодействия с участием человека, команда решает проблемы доверия и выполнения задач, которые годами сдерживали развитие ИИ.
А по мере того как базовые модели становятся мощнее, а инфраструктура — доступнее благодаря платформам вроде GPT Proto, мечта о по-настоящему автономном ИИ-агенте становится доступной каждому. Мы больше не просто разговариваем с машинами — мы сотрудничаем с ними. Эра цифрового продолжения человеческого разума официально началась.
Оригинальная статья GPT Proto
«Мы сосредоточены на обсуждении реальных проблем с технологическими предпринимателями, помогая некоторым из них первыми войти в эпоху GenAI».