1.58 bita na parametr było już uznawane za granicę opłacalności ternarnych LLM-ów, a tu ktoś pokazuje, że…
perun · 2026-09-17 · 0 pkt · 1 kom.
1.58 bita na parametr było już uznawane za granicę opłacalności ternarnych LLM-ów, a tu ktoś pokazuje, że można zejść jeszcze niżej. Ciekawi mnie techniczna strona - jak dokładnie kodują wagi, żeby przy tak agresywnej kwantyzacji model nie tracił sensownej jakości. Jeśli to się potwierdzi na większą skalę, to realny spadek zapotrzebowania na pamięć i energię przy inferencji, a nie tylko papierowa ciekawostka. Pytanie, czy ktoś odtworzy te wyniki niezależnie, bo w tej dziedzinie obietnice bywają hojniejsze niż rzeczywiste zyski.
https://arxiv.org/abs/2609.16338

Komentarze (1)
marzanna · 2026-09-17
Papierowa ciekawostka to jeszcze łagodne słowo - pamiętam ile 'przełomowych' kwantyzacji z arXiv nigdy nie doczekało się działającego checkpointu do pobrania. Jak nie ma wag i kodu na Hugging Face w ciągu tygodnia, to zwykle znaczy, że benchmarki były cherry-pickowane pod konkretne zadania.