В условиях развития LLM, оценка AI-агентов становится ключевым этапом внедрения. HumanSignal делает ставку на эту область, приобретая Erud AI и запуская Frontier Data Labs. Фокус смещается с маркировки данных на проверку эффективности AI-систем.
📋 Обзор
С развитием больших языковых моделей (LLM) в индустрии разгораются дискуссии о необходимости в специализированных инструментах для маркировки данных. LLM все чаще способны работать с различными типами данных самостоятельно. Компания HumanSignal, ведущий разработчик open-source решения Label Studio, придерживается иного мнения: спрос на маркировку данных не уменьшается, а растет.
Новый этап развития AI
Ранее в этом месяце HumanSignal приобрела компанию Erud AI и открыла Frontier Data Labs для сбора новых данных. Однако создание данных – лишь половина задачи. Сегодня компания решает следующую проблему: как доказать, что AI-системы, обученные на этих данных, действительно работают. Новые мультимодальные возможности оценки агентов позволяют предприятиям валидировать сложные AI-агенты, генерирующие приложения, изображения, код и видео.
Экспертная оценка как гарантия качества
Сооснователь HumanSignal отмечает, что для корпоративных AI-решений необходима оценка, что по сути является маркировкой данных, выполняемой людьми, и, что еще важнее, экспертами. Это особенно актуально для сложных задач, где цена ошибки высока. В качестве аналогии можно привести систему автоматической проверки кредитных заявок в банке: даже если алгоритм способен обрабатывать большие объемы данных, финальное решение часто принимает кредитный эксперт, чтобы минимизировать риски. То же самое справедливо и для других областей, таких как медицина или юриспруденция, где AI используется для поддержки принятия решений, но не заменяет полностью человеческий опыт.
Значение для России
В России, где активно развивается направление AI, также наблюдается тенденция к усилению контроля качества AI-систем. Многие российские компании, разрабатывающие и внедряющие AI-решения, сталкиваются с проблемой валидации и оценки эффективности своих моделей. Особенно это актуально для проектов в сфере беспилотного транспорта, медицины и безопасности. В связи с этим, опыт HumanSignal может быть полезен для российских разработчиков и компаний, стремящихся к созданию надежных и эффективных AI-систем. Важно не только обучить модель, но и убедиться в ее корректной работе в реальных условиях.
Заключение
Переход от data labeling к evaluation показывает, что зрелость рынка AI растет. Компании осознают, что просто собрать и разметить данные недостаточно – необходимо убедиться в том, что AI-системы действительно решают поставленные задачи. HumanSignal делает ставку на этот тренд, предлагая инструменты для валидации и оценки AI-агентов. Это важный шаг на пути к широкому внедрению AI в различных отраслях экономики, в том числе и в России.
Источник: Аналитические данные и отраслевые отчеты
Следите за новостями технологий в нашем Telegram-канале и не пропускайте важные обновления!
Источник: venturebeat.com