Закон уплотнения для языковых моделей: рост плотности способностей

В недавнем исследовании была предложена концепция «закона уплотнения», согласно которому плотность способностей больших языковых моделей (LLM) удваивается примерно каждые 3,5 месяца. Введена новая метрика, измеряющая, сколько параметров потребовалось бы референсной модели для достижения аналогичного качества, что позволяет оценить экономичность обучения моделей. Анализ нескольких бенчмарков, включая MMLU и HumanEval, показал устойчивый экспоненциальный рост плотности, что указывает на эффективность новых архитектур и методов. С учетом оптимизации инференса, стоимость обработки токенов снижается, что делает локальное использование мощных моделей возможным. Таким образом, акцент смещается с простого увеличения параметров к density-optimal обучению, что открывает новые горизонты в разработке языковых моделей с высокими показателями качества и экономичности.