То, как люди и искусственный интеллект (ИИ) обрабатывают информацию, существенно различается. В то время как люди читают, используя запасенный в памяти словарный запас, машины интерпретируют более мелкие единицы, называемые токенами, которые по сути являются блоками с числовыми метками.
Токены составляют язык, понятный большим языковым моделям (LLM), таким как ChatGPT, Claude и Gemini. Процесс преобразования человеческого языка в машинный язык называется токенизацией, а обратное преобразование токенов в понятную форму — детокенизацией.
Эта концепция напрямую связана со стоимостью подписок на платформы, поскольку обработка этих блоков требует потребления энергии и вычислительной мощности. Компании используют подсчет потребленных токенов — как в запросе, так и в ответе ИИ — для определения стоимости системы, установления лимитов памяти для каждой модели и выставления счета за услугу.
Чтобы ИИ мог понять сообщение, будь то текст, аудио или изображение, он должен сегментировать его на блоки, или токены. По словам Фабрисиу Карраро, менеджера программ Alura, токен можно понимать как подслово. Он приводит пример, что такие слова, как 'счастливый', 'грустный' и 'делимый', могут быть отдельными токенами.
Причина, по которой их называют подсловами, кроется в составных словах; например, в словах 'несчастливый' или 'неделимый' используется токен 'in'. Этот токен 'in' имеет определенный номер в словаре модели, как и токен 'счастливый' (номер 352). Вместе токен 'in' и токен 'счастливый' образуют слово 'несчастливый'.
В ядре ИИ, LLM, он получает последовательность пронумерованных блоков (подсказку) и выполняет сложные вычисления, чтобы предсказать, какие должны быть выходные блоки (ответ ИИ). Однако при взаимодействии с такими платформами, как ChatGPT, пользователь не получает доступ к движку напрямую, а к внешнему программному слою, называемому harness.
Harness функционирует как система управления для LLM, координируя поток токенизации и детокенизации. Карраро объясняет, что этот компонент берет вопрос пользователя и раскладывает его на возможные второстепенные вопросы для формирования ответа. Вместо немедленного ответа он внутренне генерирует и разрешает эти подвопросы, и только после завершения этого внутреннего рассуждения окончательный ответ представляется пользователю, в момент которого происходит расход токенов.
Еще один важный фактор во взаимодействиях с ИИ — это контекстное окно, которое неразрывно связано с токенами. Это окно можно сравнить с пространством рабочего стола, представляя собой 'кратковременную память' ИИ, а токены — это бумаги с информацией, разбросанные по этому столу.
Более технически, контекстное окно устанавливает максимальное количество токенов (суммируя входные подсказки и выходные ответы ИИ), которые модель может обрабатывать одновременно. Если разговор остается в пределах этого лимита, ИИ сохраняет память обо всей беседе. Если лимит превышен, некоторая информация теряется.
Хотя токен связан со стоимостью подписок на ИИ, таких как планы Go ChatGPT и Plus Gemini, он сам по себе не является валютой ИИ. Он является единицей измерения обработки данных, служа метрикой потребления. Компании оценивают вычислительные усилия и операционные расходы на основе объема входящих (подсказок) и исходящих (ответов) токенов.
Например, в Claude Fable 5 компания Anthropic взимает плату в размере 10 долларов США за миллион входных токенов и 50 долларов США за миллион выходных токенов. Карраро подчеркивает, что хотя миллион токенов кажется большим, для задачи программирования это может быть потреблено всего несколькими подсказками, в зависимости от сложности. Он добавляет, что для большинства используемых кодовых баз этот объем не является чрезмерным, но стоимость вывода может быстро возрасти.
