~/llamay $ llamay info -m qwen2.5:0.5b -tensors | head -20 llamay v0.1.58-1-gb14f550 kernels neon+i8mm gpu backend metal:Apple M4 file ~/.llamay/models/blobs/sha256-c5396e06af294bd101b30dce59131a76d2b773e76950acc8 70eda801d3ab0515 gguf version 3 size 379.38 MiB tensors 290 architecture qwen2 (decoder) name Qwen2.5 0.5B Instruct layers 24 embedding 896 heads 14 query / 2 kv (group 7) head dim 64 feed forward 4864 context 32768 rope base 1e+06 kv per token 24.00 KiB tokenizer gpt2, 151936 tokens, pre qwen2 bos / eos 151643 / 151645 prepends bos false ~/llamay $ llamay info -m qwen2.5:0.5b -meta | head -18 llamay v0.1.58-1-gb14f550 kernels neon+i8mm gpu backend metal:Apple M4 file ~/.llamay/models/blobs/sha256-c5396e06af294bd101b30dce59131a76d2b773e76950acc8 70eda801d3ab0515 gguf version 3 size 379.38 MiB tensors 290 architecture qwen2 (decoder) name Qwen2.5 0.5B Instruct layers 24 embedding 896 heads 14 query / 2 kv (group 7) head dim 64 feed forward 4864 context 32768 rope base 1e+06 kv per token 24.00 KiB tokenizer gpt2, 151936 tokens, pre qwen2 ~/llamay $ llamay info -m qwen2.5:0.5b -tokenize README.md llamay v0.1.58-1-gb14f550 kernels neon+i8mm gpu backend metal:Apple M4 file ~/.llamay/models/blobs/sha256-c5396e06af294bd101b30dce59131a76d2b773e76950acc8 70eda801d3ab0515 gguf version 3 size 379.38 MiB tensors 290 architecture qwen2 (decoder) name Qwen2.5 0.5B Instruct layers 24 embedding 896 heads 14 query / 2 kv (group 7) head dim 64 feed forward 4864 context 32768 rope base 1e+06 kv per token 24.00 KiB tokenizer gpt2, 151936 tokens, pre qwen2 bos / eos 151643 / 151645 prepends bos false quantisation Q5_0 x132, F32 x121, Q8_0 x13, Q6_K x12, Q4_K x12 tensor audit 290 of 290 tensors read, none unread tokenize README.md bytes 62197 tokens 16566 bytes per token 3.754 round trip exact — decode(encode(text)) is the input, byte for byte per line 522 of 522 non-empty lines exact