Принятие ИИ в настоящее время препятствует высокие затраты на токены и отсутствие предварительной ясности в ценообразовании для запросов на ИИ, что приводит к неконтролируемым чрезмерным расходам на токены.Этот риск резко усиливается агентами ИИ., которые в настоящее время работают без встроенных ограничений на стоимость токенов и могут вызвать экстремальные взрывы затрат.
В этой статье объясняется, что такое токены ИИ, как работает ценообразование токенов и применимые стратегии предотвращения катастрофических расходов на токены.Хорошо задокументированный случай предприятия показал, что организация накопила $500,000Отдельно, инженерная команда Uber, как сообщается, исчерпала весь свой бюджет на ИИ 2026 года раньше, чем планировалось.Токены - это фундаментальные единицы, которые используют крупные языковые модели (LLM) и чат-боты для расчёта запросов на человеческий язык и создания согласованных результатов ИИ.
Например, запрос на ввод Tell me about sedimentation
- Скажи.
- Я.
- Около
-осадок
-ация
Эта пятизначная разбивка для одного слова "осаждение" помогает LLM точно интерпретировать структуру и значение слов.Разделение корня ?? осадок ?? и суффикса ation позволяет модели распознать последовательное использование суффикса , включая капитализацию, компьютеризацию и налогообложение.сокращение времени обработки вместо сканирования каждого слова, содержащего суффикс, отдельно.
Как основные единицы данных, токены преобразуются в векторные встраивания математические числовые строки, которые кодируют семантический смысл и хранятся в индексах модели.модель генерирует несколько векторов для представления своих многомерных атрибутовЭти уникальные наборы векторов отличают кота от неодушевленных объектов, других видов животных, таких как собаки и тигры,и синтетические игрушки для кошек.
Гипотетическое пятимерное встраивание вектора для термина "cat" может быть выражено как [1.5-0.4, 7.219 лет.6, 20.2).
Все векторные данные существуют в едином векторном пространстве, что позволяет моделям идентифицировать семантически схожий контент путем измерения пространственной близости между точками вектора.
После преобразования в векторы токены обрабатываются на дорогостоящих серверах GPU, оснащенных памятью с высокой пропускной способностью.NVIDIA DGX SuperPOD с 32 узлами и 256 общими графическими процессорами стоит от 12 до 20 миллионов долларовБолее продвинутая эталонная архитектура с 140 узлами DGX H100, сетью Quantum-2 InfiniBand, полной хранилищем и сетевой инфраструктурой и вспомогательными системами может превышать $100 млн.Эти значительные затраты на инфраструктуру напрямую отражаются на схемах ценообразования основных моделей фондов..
Ведущие поставщики LLM и чатботов, включая OpenAI и Anthropic, используют модели счета на основе токенов с предсказуемыми правилами конвертации токенов для текстового контента.один английский токен равен примерно четырем символам или 0.75 слов, что означает, что 750 слов соответствуют примерно 1000 токенов.,Выпуск ИИ из 000 слов потребляет в общей сложности примерно 3667 токенов.
Высокое потребление токенов напрямую увеличивает задержку ответа ИИ. Все токены от одной сессии быстрого ответа содержатся в контекстуальном окне с конечной емкостью.Контекстовое окно с 000-токенами может вместить около 751000 английских слов, что эквивалентно 300-страничной книге.
Недостаточная емкость контекстного окна приводит к потере контекстной информации LLM, что приводит к неполному или неточному выходу ИИ. По мере развития базовых моделей размеры контекстных окон продолжают расширяться:GPT-4o поддерживает до 128,000 токенов, Claude 3.5 Sonnet достигает 200 000 токенов, а выбранные пользователи Gemini 1.5 Pro могут получить доступ к контекстуальному окну с 2 миллионами токенов.
Цена токенов варьируется в зависимости от поставщиков моделей.
Согласно Intuition Labs, API ChatGPT OpenAI работает на чистой структуре выставления счетов на основе токенов.с выходной токены, как правило, стоит больше. Цены также колеблются в зависимости от состояния ответа в кэше. Каждый вызов API влечет за собой две различные сборы: один за токены быстрого ввода и один за токены вывода, генерируемые ИИ. В качестве практического примера,использование модели с ценой 10 долларов за миллион выпускных токенов для 100 входных токенов и 400 выходных токенов приводит к затратам на ввод 10 × 100/1,000, 000) и затраты на производство в размере 10 × 400/1,000, 000), причем общие расходы равны сумме этих двух цифр.
Предприятия могут внедрять целенаправленный контроль управления для ограничения расходов на токены, включая квоты на пользователя или на место, ограничение трафика на основе использования, лимиты расходов на проект,и ограничения уровня моделиЭта область управления быстро развивается, поскольку поставщики ИИ конкурируют за оптимизацию качества услуг, балансирование потоков доходов и конкуренцию с моделями ИИ с открытым исходным кодом.
Без строгих операционных ограждений автономные агенты могут вызвать массовое, незапланированное потребление токенов.Специалисты рекомендуют относиться к агентам ИИ как к цифровым сотрудникам, с командами FinOps, осуществляющими строгий круглосуточный мониторинг расходов для предотвращения экономических катастроф.
Пекинская компания Qianxing Jietong Technology Co., Ltd.
Сэнди Янг, директор по глобальной стратегии
WhatsApp / WeChat: +86 13426366826
Электронная почта: yangyd@qianxingdata.com
Сайт: www.qianxingdata.com/www.storagesserver.com
Бизнес фокус:
Распространение ИКТ-продуктов/интеграция систем и услуги/решения инфраструктуры
Имея более 20-летний опыт распространения ИТ, мы сотрудничаем с ведущими мировыми брендами для предоставления надежных продуктов и профессиональных услуг.
Использование технологий для создания интеллектуального мира Ваш надежный поставщик услуг ИКТ-продуктов!