{"as_of":"2026-08-10T12:05:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f5395f61b93bc3fa54c3ca248200d4f509c79d62810b889d29e6f0caf5d9d393","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T17:18:51.559897Z","state":"measured"},{"denominator":50,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":50,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T13:34:08.346536Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T16:25:49.759745Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.00922","last_updated":"2025-02-02T21:23:42Z","snapshot_observed_at":"2026-08-09T17:10:43.456007Z","submitted_at":"2025-02-02T21:23:42Z","title":"Huff-LLM: End-to-End Lossless Compression for Efficient LLM Inference","version":1},"cited_work":{"arxiv_id":"2502.00922","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.00922","snapshot_observed_at":"2026-07-01T16:25:49.759745Z","title":"Q., Joshi, S., Hegde, C., et al","venue":null,"work_id":"c43105af-5e02-495e-ada7-78197602377d","year":2025},"citing_paper":{"arxiv_id":"2601.21198","last_updated":"2026-05-22T06:53:25Z","snapshot_observed_at":"2026-08-09T02:36:25.829599Z","submitted_at":"2026-01-29T02:51:59Z","title":"ZipMoE: Efficient On-Device MoE Serving via Lossless Compression and Cache-Affinity Scheduling","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-25T07:43:24.937953Z"},"links":{"cited_paper":"/paper/2502.00922","citing_paper":"/paper/2601.21198"},"observation_digest":"sha256:8ac108450bad485cf264a865d458fbe01d6ee8a79b51ae158bf137de7be2507f","observation_id":"e1dfcaf3-3b2c-476f-8f79-2ca47a43a852","resolution":{"observed_at":"2026-05-25T07:45:29.195963Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.00922","last_updated":"2025-02-02T21:23:42Z","snapshot_observed_at":"2026-08-09T17:10:43.456007Z","submitted_at":"2025-02-02T21:23:42Z","title":"Huff-LLM: End-to-End Lossless Compression for Efficient LLM Inference","version":1},"cited_work":{"arxiv_id":"2502.00922","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.00922","snapshot_observed_at":"2026-07-01T16:25:49.759745Z","title":"Q., Joshi, S., Hegde, C., et al","venue":null,"work_id":"c43105af-5e02-495e-ada7-78197602377d","year":2025},"citing_paper":{"arxiv_id":"2604.03298","last_updated":"2026-04-07T13:42:14Z","snapshot_observed_at":"2026-08-02T08:21:56.727699Z","submitted_at":"2026-03-28T16:11:56Z","title":"ENEC: A Lossless AI Model Compression Method Enabling Fast Inference on Ascend NPUs","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-14T21:56:38.684104Z"},"links":{"cited_paper":"/paper/2502.00922","citing_paper":"/paper/2604.03298"},"observation_digest":"sha256:10828a1f5990baaea190821af2ba80924d8d729ef33ca7cf1b3a450ca7143bbc","observation_id":"fb484879-642c-4585-888e-3487ebe49ece","resolution":{"observed_at":"2026-05-14T21:58:03.058558Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.00922","last_updated":"2025-02-02T21:23:42Z","snapshot_observed_at":"2026-08-09T17:10:43.456007Z","submitted_at":"2025-02-02T21:23:42Z","title":"Huff-LLM: End-to-End Lossless Compression for Efficient LLM Inference","version":1},"cited_work":{"arxiv_id":"2502.00922","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.00922","snapshot_observed_at":"2026-07-01T16:25:49.759745Z","title":"Q., Joshi, S., Hegde, C., et al","venue":null,"work_id":"c43105af-5e02-495e-ada7-78197602377d","year":2025},"citing_paper":{"arxiv_id":"2605.01708","last_updated":"2026-06-23T19:13:16Z","snapshot_observed_at":"2026-07-31T09:20:58.765957Z","submitted_at":"2026-05-03T04:22:51Z","title":"SplitZip: Ultra Fast Lossless KV Compression for Disaggregated LLM Serving","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-09T16:59:58.809897Z"},"links":{"cited_paper":"/paper/2502.00922","citing_paper":"/paper/2605.01708"},"observation_digest":"sha256:eb9222eb36bcec8678bae891c48055ee96b0f18c9e99457fbfdf69228f56fa95","observation_id":"403395a6-6800-428f-b105-edc52095be6c","resolution":{"observed_at":"2026-05-11T16:26:08.754295Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.00922","last_updated":"2025-02-02T21:23:42Z","snapshot_observed_at":"2026-08-09T17:10:43.456007Z","submitted_at":"2025-02-02T21:23:42Z","title":"Huff-LLM: End-to-End Lossless Compression for Efficient LLM Inference","version":1},"cited_work":{"arxiv_id":"2502.00922","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.00922","snapshot_observed_at":"2026-07-01T16:25:49.759745Z","title":"Q., Joshi, S., Hegde, C., et al","venue":null,"work_id":"c43105af-5e02-495e-ada7-78197602377d","year":2025},"citing_paper":{"arxiv_id":"2605.01708","last_updated":"2026-06-23T19:13:16Z","snapshot_observed_at":"2026-07-31T09:20:58.765957Z","submitted_at":"2026-05-03T04:22:51Z","title":"SplitZip: Ultra Fast Lossless KV Compression for Disaggregated LLM Serving","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-12T01:15:06.859289Z"},"links":{"cited_paper":"/paper/2502.00922","citing_paper":"/paper/2605.01708"},"observation_digest":"sha256:074944cdcf89bba8698b16ef58491180158633c3a03bc6f936102568c06305f0","observation_id":"8f590228-6923-4cd6-9777-d30678fc3d88","resolution":{"observed_at":"2026-05-12T08:21:23.650906Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.00922","last_updated":"2025-02-02T21:23:42Z","snapshot_observed_at":"2026-08-09T17:10:43.456007Z","submitted_at":"2025-02-02T21:23:42Z","title":"Huff-LLM: End-to-End Lossless Compression for Efficient LLM Inference","version":1},"cited_work":{"arxiv_id":"2502.00922","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.00922","snapshot_observed_at":"2026-07-01T16:25:49.759745Z","title":"Q., Joshi, S., Hegde, C., et al","venue":null,"work_id":"c43105af-5e02-495e-ada7-78197602377d","year":2025},"citing_paper":{"arxiv_id":"2605.01708","last_updated":"2026-06-23T19:13:16Z","snapshot_observed_at":"2026-07-31T09:20:58.765957Z","submitted_at":"2026-05-03T04:22:51Z","title":"SplitZip: Ultra Fast Lossless KV Compression for Disaggregated LLM Serving","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-01T00:58:28.798369Z"},"links":{"cited_paper":"/paper/2502.00922","citing_paper":"/paper/2605.01708"},"observation_digest":"sha256:f12e862eafe5e8808f9631d66102e2def39de87bd48b4917125763f38dbdc8de","observation_id":"983e8689-bffa-4257-8f33-69b430b335a2","resolution":{"observed_at":"2026-07-01T13:15:45.375310Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.00922","last_updated":"2025-02-02T21:23:42Z","snapshot_observed_at":"2026-08-09T17:10:43.456007Z","submitted_at":"2025-02-02T21:23:42Z","title":"Huff-LLM: End-to-End Lossless Compression for Efficient LLM Inference","version":1},"cited_work":{"arxiv_id":"2502.00922","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.00922","snapshot_observed_at":"2026-07-01T16:25:49.759745Z","title":"Q., Joshi, S., Hegde, C., et al","venue":null,"work_id":"c43105af-5e02-495e-ada7-78197602377d","year":2025},"citing_paper":{"arxiv_id":"2605.26558","last_updated":"2026-05-26T05:12:44Z","snapshot_observed_at":"2026-08-02T18:18:56.704933Z","submitted_at":"2026-05-26T05:12:44Z","title":"Cassandra: Enabling Reasoning LLMs at Edge via Self-Speculative Decoding","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-07-01T16:19:54.910430Z"},"links":{"cited_paper":"/paper/2502.00922","citing_paper":"/paper/2605.26558"},"observation_digest":"sha256:6becc095f36b711abe9a9fa0e20edf53b8db030d959212c57cd0942b07a55780","observation_id":"d2d39926-d8ed-4696-a386-0251e0c1bfae","resolution":{"observed_at":"2026-07-01T16:25:49.761209Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.00922","last_updated":"2025-02-02T21:23:42Z","snapshot_observed_at":"2026-08-09T17:10:43.456007Z","submitted_at":"2025-02-02T21:23:42Z","title":"Huff-LLM: End-to-End Lossless Compression for Efficient LLM Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.00922","snapshot_observed_at":"2026-08-04T13:34:08.346536Z","title":"arXiv preprint arXiv:2502.00922 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02162","last_updated":"2026-08-03T12:42:55Z","snapshot_observed_at":"2026-08-09T08:28:15.894048Z","submitted_at":"2026-08-03T12:42:55Z","title":"Lossless Tensor Compression as Program Synthesis","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-04T13:34:08.346536Z"},"links":{"cited_paper":"/paper/2502.00922","citing_paper":"/paper/2608.02162"},"observation_digest":"sha256:ed1b434403edd1a61a872c284e292564642d5706b601515fa73f6779364e098e","observation_id":"99a6d1d4-d55e-4205-8c80-fc89ebb29591","resolution":{"observed_at":"2026-08-04T13:34:08.346536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2502.00922/citation-record","integrity":"/paper/2502.00922/integrity","json":"/paper/2502.00922/citation-record.json","paper":"/paper/2502.00922"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.00456","last_updated":"2024-10-29T11:09:12Z","snapshot_observed_at":"2026-08-09T17:23:32.399243Z","submitted_at":"2024-03-30T19:20:06Z","title":"QuaRot: Outlier-Free 4-Bit Inference in Rotated LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00456","snapshot_observed_at":"2026-08-09T17:18:51.401236Z","title":"L., Li, B., Cameron, P., Jaggi, M., Alistarh, D., Hoefler, T., and Hensman, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00922","last_updated":"2025-02-02T21:23:42Z","snapshot_observed_at":"2026-08-09T17:10:43.456007Z","submitted_at":"2025-02-02T21:23:42Z","title":"Huff-LLM: End-to-End Lossless Compression for Efficient LLM Inference","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-09T17:18:51.401236Z"},"links":{"cited_paper":"/paper/2404.00456","citing_paper":"/paper/2502.00922"},"observation_digest":"sha256:735b758a59a0a736a96e410a6c6e382bc281dbfd98424984fbc811a38aa7837c","observation_id":"0b6211d1-20cb-4f17-aac3-77fa40756c16","resolution":{"observed_at":"2026-08-09T17:18:51.401236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:18:54.149610Z","title":"B., Muralimanohar, N., Shafiee, A., and Srinivas, V","venue":null,"work_id":"d76bf2f2-74af-4151-a6c0-483ee97a8d08","year":2017},"citing_paper":{"arxiv_id":"2502.00922","last_updated":"2025-02-02T21:23:42Z","snapshot_observed_at":"2026-08-09T17:10:43.456007Z","submitted_at":"2025-02-02T21:23:42Z","title":"Huff-LLM: End-to-End Lossless Compression for Efficient LLM Inference","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-09T17:18:51.406018Z"},"links":{"citing_paper":"/paper/2502.00922"},"observation_digest":"sha256:16a7c891f5f68094cea4a0f69147e1afad611e84c4313ddb149382a2ba3fc442","observation_id":"497d3a6e-d881-4038-a9ba-c831f6a46599","resolution":{"observed_at":"2026-08-09T17:18:54.153310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:18:54.138192Z","title":"S., and Sze, V","venue":null,"work_id":"09ecc9fd-9e1d-46b5-a957-a19a5749ac8a","year":2016},"citing_paper":{"arxiv_id":"2502.00922","last_updated":"2025-02-02T21:23:42Z","snapshot_observed_at":"2026-08-09T17:10:43.456007Z","submitted_at":"2025-02-02T21:23:42Z","title":"Huff-LLM: End-to-End Lossless Compression for Efficient LLM Inference","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-09T17:18:51.410365Z"},"links":{"citing_paper":"/paper/2502.00922"},"observation_digest":"sha256:07baa7755f5ab0ed08abff5d5b75ef80c654c3024bed62997629a86b6314dcd6","observation_id":"39175179-70b4-42d0-a441-12f5585cd0d6","resolution":{"observed_at":"2026-08-09T17:18:54.142123Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:18:51.414132Z","title":"E., Stoica, I., and Xing, E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00922","last_updated":"2025-02-02T21:23:42Z","snapshot_observed_at":"2026-08-09T17:10:43.456007Z","submitted_at":"2025-02-02T21:23:42Z","title":"Huff-LLM: End-to-End Lossless Compression for Efficient LLM Inference","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-09T17:18:51.414132Z"},"links":{"citing_paper":"/paper/2502.00922"},"observation_digest":"sha256:e193c5ec96b0e0d569119243d0dc9b4816f5731ca48e8b3f371713248ab92497","observation_id":"0df24379-621e-4e64-bbd0-786c816a7e30","resolution":{"observed_at":"2026-08-09T17:18:51.414132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:18:54.119483Z","title":"B., O’Connor, M., Erez, M., Pool, J., Nellans, D., and Keckler, S","venue":null,"work_id":"34f69090-a030-4c65-b43d-ab4b8b88f3de","year":2020},"citing_paper":{"arxiv_id":"2502.00922","last_updated":"2025-02-02T21:23:42Z","snapshot_observed_at":"2026-08-09T17:10:43.456007Z","submitted_at":"2025-02-02T21:23:42Z","title":"Huff-LLM: End-to-End Lossless Compression for Efficient LLM Inference","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-09T17:18:51.417709Z"},"links":{"citing_paper":"/paper/2502.00922"},"observation_digest":"sha256:f0893da67dacabf63e63baee8efbd35e883cf866d5e50928f3958dcf704e42e7","observation_id":"186dc68c-d741-4e6d-9d13-4ae72cd31c86","resolution":{"observed_at":"2026-08-09T17:18:54.123443Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-09T17:18:51.421395Z","title":"Think you have solved question answering? try arc, the ai2 reasoning challenge","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.00922","last_updated":"2025-02-02T21:23:42Z","snapshot_observed_at":"2026-08-09T17:10:43.456007Z","submitted_at":"2025-02-02T21:23:42Z","title":"Huff-LLM: End-to-End Lossless Compression for Efficient LLM Inference","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-09T17:18:51.421395Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2502.00922"},"observation_digest":"sha256:c0d0d9441350e7b1c2481c5dd399ab523686df0c3be0c16e8dae3a255083f669","observation_id":"5d581117-3a82-41e7-92a0-6d96e4d5d955","resolution":{"observed_at":"2026-08-09T17:18:51.421395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:18:51.425873Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.00922","last_updated":"2025-02-02T21:23:42Z","snapshot_observed_at":"2026-08-09T17:10:43.456007Z","submitted_at":"2025-02-02T21:23:42Z","title":"Huff-LLM: End-to-End Lossless Compression for Efficient LLM Inference","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-09T17:18:51.425873Z"},"links":{"citing_paper":"/paper/2502.00922"},"observation_digest":"sha256:221ffa801f8a17c9e004f6b158795588a50e9559f2fbc27ef51323c0fb6a6e79","observation_id":"d98a464e-7071-45a2-a9d3-a9a054ff5b11","resolution":{"observed_at":"2026-08-09T17:18:51.425873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-09T17:18:51.429444Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00922","last_updated":"2025-02-02T21:23:42Z","snapshot_observed_at":"2026-08-09T17:10:43.456007Z","submitted_at":"2025-02-02T21:23:42Z","title":"Huff-LLM: End-to-End Lossless Compression for Efficient LLM Inference","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-09T17:18:51.429444Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2502.00922"},"observation_digest":"sha256:8444d59a5a46493b790930a8fd5a2570c4a63c1cec2179f947d323bbe66088e0","observation_id":"db0ee736-faeb-4c5d-bb65-6c7abe8b9028","resolution":{"observed_at":"2026-08-09T17:18:51.429444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.09141","last_updated":"2024-07-12T10:19:02Z","snapshot_observed_at":"2026-08-09T09:48:13.752561Z","submitted_at":"2024-07-12T10:19:02Z","title":"Accuracy is Not All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.09141","snapshot_observed_at":"2026-08-09T17:18:51.432553Z","title":"Accuracy is not all you need","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00922","last_updated":"2025-02-02T21:23:42Z","snapshot_observed_at":"2026-08-09T17:10:43.456007Z","submitted_at":"2025-02-02T21:23:42Z","title":"Huff-LLM: End-to-End Lossless Compression for Efficient LLM Inference","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-09T17:18:51.432553Z"},"links":{"cited_paper":"/paper/2407.09141","citing_paper":"/paper/2502.00922"},"observation_digest":"sha256:451359c0651f0e75480356098610702f5fe043e6283770b0f93ce889ed33fd4e","observation_id":"f0da55fd-4ea4-4a84-965c-c9b1d98d74dd","resolution":{"observed_at":"2026-08-09T17:18:51.432553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.17323","last_updated":"2023-03-22T13:10:47Z","snapshot_observed_at":"2026-08-07T08:38:54.025062Z","submitted_at":"2022-10-31T13:42:40Z","title":"GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.17323","snapshot_observed_at":"2026-08-09T17:18:51.436104Z","title":"Gptq: Accurate post-training quantization for generative pre-trained transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.00922","last_updated":"2025-02-02T21:23:42Z","snapshot_observed_at":"2026-08-09T17:10:43.456007Z","submitted_at":"2025-02-02T21:23:42Z","title":"Huff-LLM: End-to-End Lossless Compression for Efficient LLM Inference","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-09T17:18:51.436104Z"},"links":{"cited_paper":"/paper/2210.17323","citing_paper":"/paper/2502.00922"},"observation_digest":"sha256:0c2bfef4f4ad28cba854c261213e5df412b6a492b5a52b639f90b0986b2d43ba","observation_id":"88038bfb-7d00-4cc3-a2d0-d1b65072ce7d","resolution":{"observed_at":"2026-08-09T17:18:51.436104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:18:54.100678Z","title":"Does reduced precision hurt? Blog post, 2024","venue":null,"work_id":"83c09ed9-d5bf-4023-935a-8073fe1289ed","year":2024},"citing_paper":{"arxiv_id":"2502.00922","last_updated":"2025-02-02T21:23:42Z","snapshot_observed_at":"2026-08-09T17:10:43.456007Z","submitted_at":"2025-02-02T21:23:42Z","title":"Huff-LLM: End-to-End Lossless Compression for Efficient LLM Inference","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-09T17:18:51.440045Z"},"links":{"citing_paper":"/paper/2502.00922"},"observation_digest":"sha256:3d52aac4eae629ba1c699c021ef065d54489f928e062db202b4e3db26c57e09c","observation_id":"39d89a7e-e826-4183-bfae-52ca8ac13d3f","resolution":{"observed_at":"2026-08-09T17:18:54.104745Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1510.00149","last_updated":"2016-02-15T06:25:40Z","snapshot_observed_at":"2026-08-04T16:59:47.843960Z","submitted_at":"2015-10-01T09:03:44Z","title":"Deep Compression: Compressing Deep Neural Networks with Pruning, Trained Quantization and Huffman Coding","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1510.00149","snapshot_observed_at":"2026-08-09T17:18:51.443586Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.00922","last_updated":"2025-02-02T21:23:42Z","snapshot_observed_at":"2026-08-09T17:10:43.456007Z","submitted_at":"2025-02-02T21:23:42Z","title":"Huff-LLM: End-to-End Lossless Compression for Efficient LLM Inference","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-09T17:18:51.443586Z"},"links":{"cited_paper":"/paper/1510.00149","citing_paper":"/paper/2502.00922"},"observation_digest":"sha256:31235038591904838837ca0bcd67abe7c49824c517050c05ad4ca745632d3dd2","observation_id":"52288120-1fcf-4d33-8116-68bb996df7f7","resolution":{"observed_at":"2026-08-09T17:18:51.443586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20650","last_updated":"2024-10-28T01:12:20Z","snapshot_observed_at":"2026-08-03T13:26:49.608015Z","submitted_at":"2024-10-28T01:12:20Z","title":"NeuZip: Memory-Efficient Training and Inference with Dynamic Compression of Neural Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.20650","snapshot_observed_at":"2026-08-09T17:18:51.447148Z","title":"Neuzip: Memory-efficient training and inference with dynamic compression of neural networks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00922","last_updated":"2025-02-02T21:23:42Z","snapshot_observed_at":"2026-08-09T17:10:43.456007Z","submitted_at":"2025-02-02T21:23:42Z","title":"Huff-LLM: End-to-End Lossless Compression for Efficient LLM Inference","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-09T17:18:51.447148Z"},"links":{"cited_paper":"/paper/2410.20650","citing_paper":"/paper/2502.00922"},"observation_digest":"sha256:bdc861b870e6ef86a941ebfa879d06df30955439bbd4cd1ecfbf41fec586a324","observation_id":"c5cb69f3-2a45-4c8c-a276-0dcbc753bf1a","resolution":{"observed_at":"2026-08-09T17:18:51.447148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-09T10:28:06.906299Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-09T17:18:51.450902Z","title":"Measuring massive multitask language understanding","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2502.00922","last_updated":"2025-02-02T21:23:42Z","snapshot_observed_at":"2026-08-09T17:10:43.456007Z","submitted_at":"2025-02-02T21:23:42Z","title":"Huff-LLM: End-to-End Lossless Compression for Efficient LLM Inference","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-09T17:18:51.450902Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2502.00922"},"observation_digest":"sha256:235edb79de5f402d2bff7d0a66e8364e0b5d9453563048ff66464ca4b65fd878","observation_id":"24224d4b-9e44-4677-86db-9cca85038bbb","resolution":{"observed_at":"2026-08-09T17:18:51.450902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.05239","last_updated":"2025-06-04T15:59:06Z","snapshot_observed_at":"2026-07-06T19:47:12.646290Z","submitted_at":"2024-11-07T23:28:23Z","title":"ZipNN: Lossless Compression for AI Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.05239","snapshot_observed_at":"2026-08-09T17:18:51.455245Z","title":"Zipnn: Lossless compression for ai models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00922","last_updated":"2025-02-02T21:23:42Z","snapshot_observed_at":"2026-08-09T17:10:43.456007Z","submitted_at":"2025-02-02T21:23:42Z","title":"Huff-LLM: End-to-End Lossless Compression for Efficient LLM Inference","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-09T17:18:51.455245Z"},"links":{"cited_paper":"/paper/2411.05239","citing_paper":"/paper/2502.00922"},"observation_digest":"sha256:d1bce3985ac018e7954785c021bc74f1b56d2992cfb4f5dd6ca454d6561a11c9","observation_id":"13f2b916-e420-45f9-86c6-38e9454a6290","resolution":{"observed_at":"2026-08-09T17:18:51.455245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.15447","last_updated":"2024-06-04T05:40:12Z","snapshot_observed_at":"2026-07-06T17:49:11.762370Z","submitted_at":"2024-03-18T01:38:19Z","title":"Decoding Compressed Trust: Scrutinizing the Trustworthiness of Efficient LLMs Under Compression","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.15447","snapshot_observed_at":"2026-08-09T17:18:51.459650Z","title":"Decoding compressed trust: Scrutinizing the trustworthiness of efficient llms under compression","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00922","last_updated":"2025-02-02T21:23:42Z","snapshot_observed_at":"2026-08-09T17:10:43.456007Z","submitted_at":"2025-02-02T21:23:42Z","title":"Huff-LLM: End-to-End Lossless Compression for Efficient LLM Inference","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-09T17:18:51.459650Z"},"links":{"cited_paper":"/paper/2403.15447","citing_paper":"/paper/2502.00922"},"observation_digest":"sha256:cb50882d528a72955f53f389e464e30a8ffce6545bdc9e7fd973e32536938af6","observation_id":"faf66d4a-73f0-4672-bcef-a72f4ce154ff","resolution":{"observed_at":"2026-08-09T17:18:51.459650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:18:53.847168Z","title":"S., Choi, Y., Kim, C., Kim, Y., Yu, H., Abdel-Aziz, H., Park, J.-S., Lee, H., Lee, D., Kim, M","venue":null,"work_id":"e176181a-1580-4ffc-af63-99f99b5e9c3e","year":2021},"citing_paper":{"arxiv_id":"2502.00922","last_updated":"2025-02-02T21:23:42Z","snapshot_observed_at":"2026-08-09T17:10:43.456007Z","submitted_at":"2025-02-02T21:23:42Z","title":"Huff-LLM: End-to-End Lossless Compression for Efficient LLM Inference","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-09T17:18:51.464502Z"},"links":{"citing_paper":"/paper/2502.00922"},"observation_digest":"sha256:f7456e21e2c5f5179b7e0df28a9343528537dcb0d9a56d7cfdc701f7f5bfe693","observation_id":"9b83baf2-131f-4e76-bdd9-97215c84da27","resolution":{"observed_at":"2026-08-09T17:18:53.851033Z","resolver_source":"arxiv_id_nonexistent","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:18:53.673711Z","title":"G., Zimmer, B., Dally, W","venue":null,"work_id":"7e9337f6-e10c-4a5d-b7af-40ff713691eb","year":2022},"citing_paper":{"arxiv_id":"2502.00922","last_updated":"2025-02-02T21:23:42Z","snapshot_observed_at":"2026-08-09T17:10:43.456007Z","submitted_at":"2025-02-02T21:23:42Z","title":"Huff-LLM: End-to-End Lossless Compression for Efficient LLM Inference","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-09T17:18:51.468359Z"},"links":{"citing_paper":"/paper/2502.00922"},"observation_digest":"sha256:9d199370627d8bd02a59843c41c8abaca2b530542b82deea1ab60eda3ccd5633","observation_id":"c5d10bca-e45a-493e-856c-d855a22457bf","resolution":{"observed_at":"2026-08-09T17:18:53.677618Z","resolver_source":"arxiv_id_nonexistent","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:18:54.089596Z","title":"Bit-plane compression: Transforming data for better compression in many-core architectures","venue":null,"work_id":"84a3df8e-32ac-453e-8a0f-badd699812a0","year":2016},"citing_paper":{"arxiv_id":"2502.00922","last_updated":"2025-02-02T21:23:42Z","snapshot_observed_at":"2026-08-09T17:10:43.456007Z","submitted_at":"2025-02-02T21:23:42Z","title":"Huff-LLM: End-to-End Lossless Compression for Efficient LLM Inference","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-09T17:18:51.472747Z"},"links":{"citing_paper":"/paper/2502.00922"},"observation_digest":"sha256:0eac423947e137d333fd939a50f27f833af038b874a4faa9a425275a6cd706b7","observation_id":"06fd14a6-0be5-47d4-8133-13c3a327a963","resolution":{"observed_at":"2026-08-09T17:18:54.093391Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:18:54.078866Z","title":"Cerebras architecture deep dive: First look inside the hardware/software co-design for deep learning","venue":null,"work_id":"d70cec5c-6f06-4039-aa67-68865665ffac","year":2023},"citing_paper":{"arxiv_id":"2502.00922","last_updated":"2025-02-02T21:23:42Z","snapshot_observed_at":"2026-08-09T17:10:43.456007Z","submitted_at":"2025-02-02T21:23:42Z","title":"Huff-LLM: End-to-End Lossless Compression for Efficient LLM Inference","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-09T17:18:51.476815Z"},"links":{"citing_paper":"/paper/2502.00922"},"observation_digest":"sha256:264ea71b71e7c7bf64dbabe3f74988e0a509935bbcd7c0b142c4588b41c8b0b8","observation_id":"544b551d-9f22-46a9-92d3-77aac1f6f33c","resolution":{"observed_at":"2026-08-09T17:18:54.082633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:18:51.480864Z","title":"Awq: Activation-aware weight quantization for on-device llm compression and acceleration","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00922","last_updated":"2025-02-02T21:23:42Z","snapshot_observed_at":"2026-08-09T17:10:43.456007Z","submitted_at":"2025-02-02T21:23:42Z","title":"Huff-LLM: End-to-End Lossless Compression for Efficient LLM Inference","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-09T17:18:51.480864Z"},"links":{"citing_paper":"/paper/2502.00922"},"observation_digest":"sha256:c2d497139191d678aa072de3064f0cdfbd188e371c206606cd82dc66752546e8","observation_id":"89a7859f-4c67-47aa-8cbf-fcdf1e3a6091","resolution":{"observed_at":"2026-08-09T17:18:51.480864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03211","last_updated":"2024-10-12T17:26:41Z","snapshot_observed_at":"2026-08-04T00:22:45.107343Z","submitted_at":"2024-07-03T15:39:40Z","title":"How Does Quantization Affect Multilingual LLMs?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.03211","snapshot_observed_at":"2026-08-09T17:18:51.484484Z","title":"How does quantization affect multilingual llms? arXiv preprint arXiv:2407.03211, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00922","last_updated":"2025-02-02T21:23:42Z","snapshot_observed_at":"2026-08-09T17:10:43.456007Z","submitted_at":"2025-02-02T21:23:42Z","title":"Huff-LLM: End-to-End Lossless Compression for Efficient LLM Inference","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-09T17:18:51.484484Z"},"links":{"cited_paper":"/paper/2407.03211","citing_paper":"/paper/2502.00922"},"observation_digest":"sha256:dcaee3ed8db099f40943dc1dc52e7c3625a7c440693bfd83abd042ff5525f87f","observation_id":"76ad177f-f306-4596-b79c-60b751e0cc29","resolution":{"observed_at":"2026-08-09T17:18:51.484484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:18:54.061736Z","title":"and Mutyam, M","venue":null,"work_id":"7ad38e8c-32bf-4abf-8aba-757d22783920","year":2024},"citing_paper":{"arxiv_id":"2502.00922","last_updated":"2025-02-02T21:23:42Z","snapshot_observed_at":"2026-08-09T17:10:43.456007Z","submitted_at":"2025-02-02T21:23:42Z","title":"Huff-LLM: End-to-End Lossless Compression for Efficient LLM Inference","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-09T17:18:51.488227Z"},"links":{"citing_paper":"/paper/2502.00922"},"observation_digest":"sha256:5a0201eb69aeb37588cf66bfb7093fd3b97868a4b9bc84ca2633b286c5e1633c","observation_id":"2c3a6913-b377-46a5-acec-ed3e0f8d94b7","resolution":{"observed_at":"2026-08-09T17:18:54.065251Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:18:53.510118Z","title":"S., Chen, Y.-H., Ying, V","venue":null,"work_id":"e4dc5db0-35eb-4a6d-bbbe-47ed6fff7e6e","year":2019},"citing_paper":{"arxiv_id":"2502.00922","last_updated":"2025-02-02T21:23:42Z","snapshot_observed_at":"2026-08-09T17:10:43.456007Z","submitted_at":"2025-02-02T21:23:42Z","title":"Huff-LLM: End-to-End Lossless Compression for Efficient LLM Inference","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-09T17:18:51.491858Z"},"links":{"citing_paper":"/paper/2502.00922"},"observation_digest":"sha256:391aac2a9ed0a247aecce9cb17f2b96d79a552b9575bb1e6cb817e3d3b14904c","observation_id":"eccdb6a4-6572-4238-b29b-1f48900cdbc1","resolution":{"observed_at":"2026-08-09T17:18:53.514198Z","resolver_source":"arxiv_id_nonexistent","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:18:53.344905Z","title":"Arrayflex: A systolic array architecture with configurable transparent pipelining","venue":null,"work_id":"23da041c-fa3c-4f47-a339-ac2ed1754071","year":2023},"citing_paper":{"arxiv_id":"2502.00922","last_updated":"2025-02-02T21:23:42Z","snapshot_observed_at":"2026-08-09T17:10:43.456007Z","submitted_at":"2025-02-02T21:23:42Z","title":"Huff-LLM: End-to-End Lossless Compression for Efficient LLM Inference","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-09T17:18:51.495866Z"},"links":{"citing_paper":"/paper/2502.00922"},"observation_digest":"sha256:6f2f68545da2cf29698ed94a3fd5bb32219e4d7186ead8b843ed14cb99726cf1","observation_id":"dbd0fc17-7f86-4d95-ba8a-5b423af1eec2","resolution":{"observed_at":"2026-08-09T17:18:53.348934Z","resolver_source":"arxiv_id_nonexistent","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:18:53.192290Z","title":"M., Zhu, Y., Whatmough, P., Mattina, M., and Krishna, T","venue":null,"work_id":"637eaa8e-0be1-4c0b-b904-f8c9d9b52503","year":2020},"citing_paper":{"arxiv_id":"2502.00922","last_updated":"2025-02-02T21:23:42Z","snapshot_observed_at":"2026-08-09T17:10:43.456007Z","submitted_at":"2025-02-02T21:23:42Z","title":"Huff-LLM: End-to-End Lossless Compression for Efficient LLM Inference","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-09T17:18:51.499709Z"},"links":{"citing_paper":"/paper/2502.00922"},"observation_digest":"sha256:8303a4472d382adb125e1ee58a44bf35f828d5c8590042a7ba355b8b8bc986d2","observation_id":"5ca734ab-e616-4df4-83f6-da58ce0372d8","resolution":{"observed_at":"2026-08-09T17:18:53.196253Z","resolver_source":"arxiv_id_nonexistent","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:18:54.050958Z","title":"S., Reagen, B., Wei, G.-Y., and Brooks, D","venue":null,"work_id":"b542d561-c595-430f-a53b-788afd0f6818","year":2014},"citing_paper":{"arxiv_id":"2502.00922","last_updated":"2025-02-02T21:23:42Z","snapshot_observed_at":"2026-08-09T17:10:43.456007Z","submitted_at":"2025-02-02T21:23:42Z","title":"Huff-LLM: End-to-End Lossless Compression for Efficient LLM Inference","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-09T17:18:51.503608Z"},"links":{"citing_paper":"/paper/2502.00922"},"observation_digest":"sha256:cf846e00c06bc94f0e70b388540b2996512e18d5dac81b62fff61cb30e92a48b","observation_id":"a4da60c4-3f85-4183-8837-66e36c6d6340","resolution":{"observed_at":"2026-08-09T17:18:54.054810Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:18:53.028879Z","title":"S., Clemons, J., Venkatesan, R., Zimmer, B., Fojtik, M., Jiang, N., Keller, B., Klinefelter, A., Pinckney, N., Raina, P., Tell, S","venue":null,"work_id":"5aa36adc-1900-48fa-85d2-9a724d37de02","year":2019},"citing_paper":{"arxiv_id":"2502.00922","last_updated":"2025-02-02T21:23:42Z","snapshot_observed_at":"2026-08-09T17:10:43.456007Z","submitted_at":"2025-02-02T21:23:42Z","title":"Huff-LLM: End-to-End Lossless Compression for Efficient LLM Inference","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-09T17:18:51.507466Z"},"links":{"citing_paper":"/paper/2502.00922"},"observation_digest":"sha256:2a3c1ad9a5795e98d9a7afdcb47b828d639431d3274b0101cebadde076a2065a","observation_id":"48ac90d6-2c7c-4844-b235-e3c4b65aed84","resolution":{"observed_at":"2026-08-09T17:18:53.032808Z","resolver_source":"arxiv_id_nonexistent","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:18:54.039809Z","title":"The nvidia deep learning accelerator","venue":null,"work_id":"0a6c4871-873e-4def-a567-dd951d0b3651","year":2018},"citing_paper":{"arxiv_id":"2502.00922","last_updated":"2025-02-02T21:23:42Z","snapshot_observed_at":"2026-08-09T17:10:43.456007Z","submitted_at":"2025-02-02T21:23:42Z","title":"Huff-LLM: End-to-End Lossless Compression for Efficient LLM Inference","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-09T17:18:51.510907Z"},"links":{"citing_paper":"/paper/2502.00922"},"observation_digest":"sha256:8775c2205e766025958ae020c3b6ba26a739af110654e66ad0a204b0d3c59d12","observation_id":"6ddde6e5-8229-4f70-9da0-ad8bb8de5360","resolution":{"observed_at":"2026-08-09T17:18:54.043556Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1145/3670404","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Q., Gomez, J., Khwa, W.-S., Sarwar, S","venue":"ACM Transactions on Design Automation of Electronic Systems","work_id":"21f612d3-6a9d-4a9c-8b67-a88e1200d322","year":2024},"citing_paper":{"arxiv_id":"2502.00922","last_updated":"2025-02-02T21:23:42Z","snapshot_observed_at":"2026-08-09T17:10:43.456007Z","submitted_at":"2025-02-02T21:23:42Z","title":"Huff-LLM: End-to-End Lossless Compression for Efficient LLM Inference","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-09T17:18:51.514086Z"},"links":{"citing_paper":"/paper/2502.00922"},"observation_digest":"sha256:d0beea5e77537317f8b770817702d9ea32764739b942763a217fa92851a52d19","observation_id":"f3e699c8-7458-4341-bb9c-e14c2b39b7e5","resolution":{"observed_at":"2026-08-09T17:18:51.593843Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:18:54.028314Z","title":"Google coral edge tpu board vs nvidia jetson nano dev board hardware comparison, 2020","venue":null,"work_id":"2dbcfa10-105e-456e-9ef7-5dd39f2e9efd","year":2020},"citing_paper":{"arxiv_id":"2502.00922","last_updated":"2025-02-02T21:23:42Z","snapshot_observed_at":"2026-08-09T17:10:43.456007Z","submitted_at":"2025-02-02T21:23:42Z","title":"Huff-LLM: End-to-End Lossless Compression for Efficient LLM Inference","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-09T17:18:51.518081Z"},"links":{"citing_paper":"/paper/2502.00922"},"observation_digest":"sha256:67264d79fa2a53e3585a965f14887521f3e405c8090c993d31ba6b8f41fe5584","observation_id":"84d6e910-77b1-4637-8770-53fafc06b513","resolution":{"observed_at":"2026-08-09T17:18:54.032560Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:18:54.016229Z","title":"Llama3.1 model quality evaluation: Cerebras, groq, sambanova, together, and fireworks","venue":null,"work_id":"2f263b5f-5cbb-4704-bb22-a8092e07d8f6","year":2024},"citing_paper":{"arxiv_id":"2502.00922","last_updated":"2025-02-02T21:23:42Z","snapshot_observed_at":"2026-08-09T17:10:43.456007Z","submitted_at":"2025-02-02T21:23:42Z","title":"Huff-LLM: End-to-End Lossless Compression for Efficient LLM Inference","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-09T17:18:51.521058Z"},"links":{"citing_paper":"/paper/2502.00922"},"observation_digest":"sha256:f7c3dfeb83abeeb521016ea17267f8a53847d91805fe7d5c19ac6ec9f3b75271","observation_id":"28fef51e-1b3b-4d36-9759-1671562d4210","resolution":{"observed_at":"2026-08-09T17:18:54.020042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:18:52.748596Z","title":"S., Wang, M., Clemons, J., Dai, S., Fojtik, M., Keller, B., Klinefelter, A., Pinckney, N., Raina, P., Zhang, Y., Zimmer, B., Dally, W","venue":null,"work_id":"f5fadf47-5366-4347-a1a2-5af9935a4c34","year":2019},"citing_paper":{"arxiv_id":"2502.00922","last_updated":"2025-02-02T21:23:42Z","snapshot_observed_at":"2026-08-09T17:10:43.456007Z","submitted_at":"2025-02-02T21:23:42Z","title":"Huff-LLM: End-to-End Lossless Compression for Efficient LLM Inference","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-09T17:18:51.524265Z"},"links":{"citing_paper":"/paper/2502.00922"},"observation_digest":"sha256:c8e23a15b33f91230150cc0cc54a788dac9fec4972c82acae2abbe6584b8eed7","observation_id":"13900705-0c5e-4824-b43d-9cf2bc913a95","resolution":{"observed_at":"2026-08-09T17:18:52.752480Z","resolver_source":"arxiv_id_nonexistent","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:18:54.004928Z","title":"Spatten: Efficient sparse attention architecture with cascade token and head pruning","venue":null,"work_id":"cf1785ea-1687-4e2f-9195-9b257784cdf3","year":2021},"citing_paper":{"arxiv_id":"2502.00922","last_updated":"2025-02-02T21:23:42Z","snapshot_observed_at":"2026-08-09T17:10:43.456007Z","submitted_at":"2025-02-02T21:23:42Z","title":"Huff-LLM: End-to-End Lossless Compression for Efficient LLM Inference","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-09T17:18:51.527838Z"},"links":{"citing_paper":"/paper/2502.00922"},"observation_digest":"sha256:c4b4fb1b2646b3d1a777be7fd00c95680acd93bfa9c9923f20352a70c6709a81","observation_id":"f6d8a82c-08b5-4783-b062-57f30f0e6988","resolution":{"observed_at":"2026-08-09T17:18:54.008849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:18:53.993409Z","title":null,"venue":null,"work_id":"dca63ad5-4913-4fca-99b6-072b83bd82ab","year":1984},"citing_paper":{"arxiv_id":"2502.00922","last_updated":"2025-02-02T21:23:42Z","snapshot_observed_at":"2026-08-09T17:10:43.456007Z","submitted_at":"2025-02-02T21:23:42Z","title":"Huff-LLM: End-to-End Lossless Compression for Efficient LLM Inference","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-09T17:18:51.531468Z"},"links":{"citing_paper":"/paper/2502.00922"},"observation_digest":"sha256:f86e10e5cc71dd163ed3392ff3bcb7ad3f554324e4945dea7129f33d8856cff8","observation_id":"4aa3a4ab-ec52-4e97-a1b2-a5744c3ace34","resolution":{"observed_at":"2026-08-09T17:18:53.997080Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:18:51.782006Z","title":"The roofline model: A pedagogical tool for program analysis and optimization","venue":null,"work_id":"86853c16-4dff-428e-ba32-b6bdfb27165d","year":2008},"citing_paper":{"arxiv_id":"2502.00922","last_updated":"2025-02-02T21:23:42Z","snapshot_observed_at":"2026-08-09T17:10:43.456007Z","submitted_at":"2025-02-02T21:23:42Z","title":"Huff-LLM: End-to-End Lossless Compression for Efficient LLM Inference","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-09T17:18:51.535139Z"},"links":{"citing_paper":"/paper/2502.00922"},"observation_digest":"sha256:0c12a3105595b457d09f50a467f55ef688053252d1c0834f3ef27e0990128135","observation_id":"2add9484-be78-4852-8edb-f4ea43b8cc38","resolution":{"observed_at":"2026-08-09T17:18:51.788060Z","resolver_source":"arxiv_id_nonexistent","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04965","last_updated":"2024-10-11T22:43:36Z","snapshot_observed_at":"2026-08-05T05:39:32.019510Z","submitted_at":"2024-07-06T05:56:22Z","title":"Beyond Perplexity: Multi-dimensional Safety Evaluation of LLM Compression","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04965","snapshot_observed_at":"2026-08-09T17:18:51.538529Z","title":"Beyond perplexity: Multi-dimensional safety evaluation of llm compression","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00922","last_updated":"2025-02-02T21:23:42Z","snapshot_observed_at":"2026-08-09T17:10:43.456007Z","submitted_at":"2025-02-02T21:23:42Z","title":"Huff-LLM: End-to-End Lossless Compression for Efficient LLM Inference","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-09T17:18:51.538529Z"},"links":{"cited_paper":"/paper/2407.04965","citing_paper":"/paper/2502.00922"},"observation_digest":"sha256:7d294f6d2b4f1fc71a337615b6e1f02fc76bc150099e7b88b3dac550998bc251","observation_id":"f05c421a-88d6-45f8-a4cf-923223872d26","resolution":{"observed_at":"2026-08-09T17:18:51.538529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-09T17:18:51.542155Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00922","last_updated":"2025-02-02T21:23:42Z","snapshot_observed_at":"2026-08-09T17:10:43.456007Z","submitted_at":"2025-02-02T21:23:42Z","title":"Huff-LLM: End-to-End Lossless Compression for Efficient LLM Inference","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-09T17:18:51.542155Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2502.00922"},"observation_digest":"sha256:763f99d20558754931b1556254473dacc5b61cf022441bccfe875824b924f84d","observation_id":"294af4e8-a8bf-4134-b83c-e97dec1d7de7","resolution":{"observed_at":"2026-08-09T17:18:51.542155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:18:53.981672Z","title":"Zeroquant: Efficient and affordable post-training quantization for large-scale transformers","venue":null,"work_id":"6e060048-2d73-4363-8990-aaa85070efe2","year":2022},"citing_paper":{"arxiv_id":"2502.00922","last_updated":"2025-02-02T21:23:42Z","snapshot_observed_at":"2026-08-09T17:10:43.456007Z","submitted_at":"2025-02-02T21:23:42Z","title":"Huff-LLM: End-to-End Lossless Compression for Efficient LLM Inference","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-09T17:18:51.545813Z"},"links":{"citing_paper":"/paper/2502.00922"},"observation_digest":"sha256:4f239269a8972c66d4ceead4d099f0588b22aca3fc93165055079453029ecbae","observation_id":"12ec46ef-eeb0-4e0b-9780-4187f5e6b99f","resolution":{"observed_at":"2026-08-09T17:18:53.985520Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:18:53.970504Z","title":"15.1 a 0.795 fj/bit physically-unclonable function-protected tcam for a software-defined networking switch","venue":null,"work_id":"6a06fe05-01b6-4838-ae20-53f7e58a990c","year":2024},"citing_paper":{"arxiv_id":"2502.00922","last_updated":"2025-02-02T21:23:42Z","snapshot_observed_at":"2026-08-09T17:10:43.456007Z","submitted_at":"2025-02-02T21:23:42Z","title":"Huff-LLM: End-to-End Lossless Compression for Efficient LLM Inference","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-09T17:18:51.549387Z"},"links":{"citing_paper":"/paper/2502.00922"},"observation_digest":"sha256:109274db08e2d48d1bc342d7e9015e2abd7cf4fae9cfc384bccc9536c59645fb","observation_id":"a00658f7-e833-4828-ae7b-f6cbf34132b1","resolution":{"observed_at":"2026-08-09T17:18:53.974529Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-08-06T03:13:37.403059Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-08-09T17:18:51.552602Z","title":"V., et al","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.00922","last_updated":"2025-02-02T21:23:42Z","snapshot_observed_at":"2026-08-09T17:10:43.456007Z","submitted_at":"2025-02-02T21:23:42Z","title":"Huff-LLM: End-to-End Lossless Compression for Efficient LLM Inference","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-09T17:18:51.552602Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2502.00922"},"observation_digest":"sha256:a03dee0a31114002f675826c963d568bf4ca5bc9e791547d1d1bba0e633b0b6c","observation_id":"a3fa07f6-ec20-41a8-b086-fd63779593c6","resolution":{"observed_at":"2026-08-09T17:18:51.552602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16454","last_updated":"2025-03-21T06:37:37Z","snapshot_observed_at":"2026-07-06T19:37:24.895623Z","submitted_at":"2024-10-21T19:28:37Z","title":"Catastrophic Failure of LLM Unlearning via Quantization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.16454","snapshot_observed_at":"2026-08-09T17:18:51.556165Z","title":"Does your llm truly unlearn? an embarrassingly simple approach to recover unlearned knowledge","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00922","last_updated":"2025-02-02T21:23:42Z","snapshot_observed_at":"2026-08-09T17:10:43.456007Z","submitted_at":"2025-02-02T21:23:42Z","title":"Huff-LLM: End-to-End Lossless Compression for Efficient LLM Inference","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-09T17:18:51.556165Z"},"links":{"cited_paper":"/paper/2410.16454","citing_paper":"/paper/2502.00922"},"observation_digest":"sha256:8c70687ca65c93a762f584f58e616b5059b02a96a0263f9ed9b3c161914ebc18","observation_id":"8a9fe5e5-78ad-43ad-a1e4-79127df8e422","resolution":{"observed_at":"2026-08-09T17:18:51.556165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:18:51.559897Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00922","last_updated":"2025-02-02T21:23:42Z","snapshot_observed_at":"2026-08-09T17:10:43.456007Z","submitted_at":"2025-02-02T21:23:42Z","title":"Huff-LLM: End-to-End Lossless Compression for Efficient LLM Inference","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-09T17:18:51.559897Z"},"links":{"citing_paper":"/paper/2502.00922"},"observation_digest":"sha256:1f6b7d730460092813a9c9ac4ccce5f4848ad0b0d3f125db20074f31fbdd31d3","observation_id":"3a7a4bc4-b2e2-4205-a348-932c9ca58099","resolution":{"observed_at":"2026-08-09T17:18:51.559897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.00922","last_updated":"2025-02-02T21:23:42Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T17:10:43.456007Z","submitted_at":"2025-02-02T21:23:42Z","title":"Huff-LLM: End-to-End Lossless Compression for Efficient LLM Inference"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":20,"verified_exact":9,"verified_fuzzy":14},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 7 inbound Pith citation observations for arXiv:2502.00922."}