AI-организация Ant Group InclusionAI представила Ling 3.0 Flash, активирующий только 5,1 миллиарда токенов из общего числа 124 миллиарда параметров. Объем версии FP8 квантования составляет около 128 ГБ, что вдвое меньше, чем у версии BF16. Исходная версия Ling 3.0 Flash BF16 и версия FP8 квантования доступны на Hugging Face и ModelScope под лицензией MIT и могут быть распространены с помощью SGLang или vLLM. Эта модель использует структуру смешанной экспертизы (Mixture-of-Experts, MoE), которая вызывает только некоторые экспертные сети в зависимости от входных данных, что позволяет сократить объем вычислений. Она поддерживает контекстное окно размером 256K и может быть расширена до 1M токенов. В высокочастотных задачах модель нацелена на пиковую скорость вывода до 1000 токенов в секунду и время ответа на первый токен менее 100 мс. Согласно официальной документации, Ling 3.0 Flash применяет гибридную линейную структуру внимания с перекрестным размещением слоев KDA и MLA в соотношении 5 к 1. Ling 3.0 Flash будет предоставляться бесплатно с 1:00 23 июля по 0:59:59 7 августа по корейскому времени, а в августе будет действовать скидка 75%, после чего обычная цена составит 0,40 юаня за 1 миллион входных токенов и 1,20 юаня за 1 миллион выходных токенов.
Этот контент предоставляется исключительно в общих информационных целях и не является финансовым, инвестиционным, юридическим или налоговым советом. Любые мероприятия, вознаграждения, онлайн-акции или связанная с ними информация, упомянутые в настоящем документе, не должны рассматриваться как рекомендация, приглашение к покупке, продаже, торговле или иной сделке с какими-либо криптоактивами. Криптоактивы очень волатильны и могут привести к убыткам. Доступность услуг, продуктов WEEX и связанных с ними событий может варьироваться в зависимости от региона. Вы несете ответственность за обеспечение того, чтобы ваше участие соответствовало применимым местным законам и нормативным актам.





























