{"as_of":"2026-08-21T22:36:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:912d1c514bc6496a683162bd5a2b2306061baed9109945c8b53109200780b56c","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T11:25:34.557499Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2504.15721/citation-record","integrity":"/paper/2504.15721/integrity","json":"/paper/2504.15721/citation-record.json","paper":"/paper/2504.15721"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-16T11:25:34.338551Z","title":"Language models are few-shot learners,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2504.15721","last_updated":"2025-04-22T09:11:21Z","snapshot_observed_at":"2026-08-21T18:17:30.901704Z","submitted_at":"2025-04-22T09:11:21Z","title":"BBAL: A Bidirectional Block Floating Point-Based Quantisation Accelerator for Large Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T11:25:34.338551Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2504.15721"},"observation_digest":"sha256:5fcb1c343fab828d9236cc0fa7054223fb3eeb91278bf8546954cbadd75bac01","observation_id":"9e35b5ae-67ea-4d41-a7a9-0c2e5c71d0b4","resolution":{"observed_at":"2026-08-16T11:25:34.338551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:25:34.344392Z","title":"Photorealistic text-to-image diffusion models with deep language understanding,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.15721","last_updated":"2025-04-22T09:11:21Z","snapshot_observed_at":"2026-08-21T18:17:30.901704Z","submitted_at":"2025-04-22T09:11:21Z","title":"BBAL: A Bidirectional Block Floating Point-Based Quantisation Accelerator for Large Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T11:25:34.344392Z"},"links":{"citing_paper":"/paper/2504.15721"},"observation_digest":"sha256:0935ea3c4c62592aa29a112c5aa00c7aa8b2328933c7ec04331075c5bfd9f36e","observation_id":"d7c484a1-15c9-494a-90b6-7d5b78837b29","resolution":{"observed_at":"2026-08-16T11:25:34.344392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:25:35.232027Z","title":"Prestu: Pre-training for scene-text understanding,","venue":null,"work_id":"19269c15-ffa5-402a-95d9-4dafb333b4a8","year":2023},"citing_paper":{"arxiv_id":"2504.15721","last_updated":"2025-04-22T09:11:21Z","snapshot_observed_at":"2026-08-21T18:17:30.901704Z","submitted_at":"2025-04-22T09:11:21Z","title":"BBAL: A Bidirectional Block Floating Point-Based Quantisation Accelerator for Large Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T11:25:34.349479Z"},"links":{"citing_paper":"/paper/2504.15721"},"observation_digest":"sha256:4f5db670cc770772aeda11b8cf02ede32a184560a6a55af7a2b06aa0cf889725","observation_id":"39e220f7-e918-4ce2-ab79-d98dcf966a1d","resolution":{"observed_at":"2026-08-16T11:25:35.237190Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01181","last_updated":"2024-04-02T01:56:56Z","snapshot_observed_at":"2026-08-18T13:08:12.265047Z","submitted_at":"2023-05-02T03:27:27Z","title":"A Paradigm Shift: The Future of Machine Translation Lies with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.01181","snapshot_observed_at":"2026-08-16T11:25:34.355297Z","title":"New trends in machine translation using large language models: Case examples with chatgpt,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.15721","last_updated":"2025-04-22T09:11:21Z","snapshot_observed_at":"2026-08-21T18:17:30.901704Z","submitted_at":"2025-04-22T09:11:21Z","title":"BBAL: A Bidirectional Block Floating Point-Based Quantisation Accelerator for Large Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T11:25:34.355297Z"},"links":{"cited_paper":"/paper/2305.01181","citing_paper":"/paper/2504.15721"},"observation_digest":"sha256:455ef66daba4f148a2840bda9a1611c6a4dc62765a9f894df2246344218c8178","observation_id":"613618c0-137e-42b4-93e0-f3651bb7f706","resolution":{"observed_at":"2026-08-16T11:25:34.355297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-16T11:25:34.360696Z","title":"Llama: Open and efficient foundation language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.15721","last_updated":"2025-04-22T09:11:21Z","snapshot_observed_at":"2026-08-21T18:17:30.901704Z","submitted_at":"2025-04-22T09:11:21Z","title":"BBAL: A Bidirectional Block Floating Point-Based Quantisation Accelerator for Large Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T11:25:34.360696Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2504.15721"},"observation_digest":"sha256:3619634a9f8794332bd0089f685b773a4f37612def14112e1d7c8868680ae534","observation_id":"21fdf74d-d39d-46fd-b6a3-39d449f36be5","resolution":{"observed_at":"2026-08-16T11:25:34.360696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14294","last_updated":"2024-07-19T04:47:36Z","snapshot_observed_at":"2026-07-06T18:03:47.096406Z","submitted_at":"2024-04-22T15:53:08Z","title":"A Survey on Efficient Inference for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14294","snapshot_observed_at":"2026-08-16T11:25:34.366056Z","title":"A survey on efficient inference for large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15721","last_updated":"2025-04-22T09:11:21Z","snapshot_observed_at":"2026-08-21T18:17:30.901704Z","submitted_at":"2025-04-22T09:11:21Z","title":"BBAL: A Bidirectional Block Floating Point-Based Quantisation Accelerator for Large Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T11:25:34.366056Z"},"links":{"cited_paper":"/paper/2404.14294","citing_paper":"/paper/2504.15721"},"observation_digest":"sha256:2b7e7c8e13d3f73a08beeea0fd098712a5416b6643f68bff2f7348477879f3fc","observation_id":"e6bed82c-e099-41e4-8b86-42808825b167","resolution":{"observed_at":"2026-08-16T11:25:34.366056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03384","last_updated":"2024-09-05T09:43:25Z","snapshot_observed_at":"2026-08-21T08:17:53.713745Z","submitted_at":"2024-09-05T09:43:25Z","title":"Hardware Acceleration of LLMs: A comprehensive survey and comparison","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.03384","snapshot_observed_at":"2026-08-16T11:25:34.372035Z","title":"Hardware acceleration of llms: A comprehen- sive survey and comparison,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15721","last_updated":"2025-04-22T09:11:21Z","snapshot_observed_at":"2026-08-21T18:17:30.901704Z","submitted_at":"2025-04-22T09:11:21Z","title":"BBAL: A Bidirectional Block Floating Point-Based Quantisation Accelerator for Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T11:25:34.372035Z"},"links":{"cited_paper":"/paper/2409.03384","citing_paper":"/paper/2504.15721"},"observation_digest":"sha256:0cd162da50f964d833c64210df1ece23822fc70350bbbdbaa258f45eecd9eafe","observation_id":"0657d70c-d9d3-486f-849e-0f069ac08e59","resolution":{"observed_at":"2026-08-16T11:25:34.372035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1510.00149","last_updated":"2016-02-15T06:25:40Z","snapshot_observed_at":"2026-08-04T16:59:47.843960Z","submitted_at":"2015-10-01T09:03:44Z","title":"Deep Compression: Compressing Deep Neural Networks with Pruning, Trained Quantization and Huffman Coding","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1510.00149","snapshot_observed_at":"2026-08-16T11:25:34.377373Z","title":"Deep compression: Compressing deep neural networks with pruning, trained quantization and huffman coding,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2504.15721","last_updated":"2025-04-22T09:11:21Z","snapshot_observed_at":"2026-08-21T18:17:30.901704Z","submitted_at":"2025-04-22T09:11:21Z","title":"BBAL: A Bidirectional Block Floating Point-Based Quantisation Accelerator for Large Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T11:25:34.377373Z"},"links":{"cited_paper":"/paper/1510.00149","citing_paper":"/paper/2504.15721"},"observation_digest":"sha256:558709061214ffa98118ba1bd5120382724be225528930593182b8dcb3da1525","observation_id":"49985ea2-facb-4b19-bce2-f7d1f880acab","resolution":{"observed_at":"2026-08-16T11:25:34.377373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04291","last_updated":"2024-05-15T13:55:12Z","snapshot_observed_at":"2026-08-16T14:21:05.484802Z","submitted_at":"2024-02-06T09:26:34Z","title":"BiLLM: Pushing the Limit of Post-Training Quantization for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04291","snapshot_observed_at":"2026-08-16T11:25:34.382890Z","title":"Billm: Pushing the limit of post-training quantization for llms,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15721","last_updated":"2025-04-22T09:11:21Z","snapshot_observed_at":"2026-08-21T18:17:30.901704Z","submitted_at":"2025-04-22T09:11:21Z","title":"BBAL: A Bidirectional Block Floating Point-Based Quantisation Accelerator for Large Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T11:25:34.382890Z"},"links":{"cited_paper":"/paper/2402.04291","citing_paper":"/paper/2504.15721"},"observation_digest":"sha256:4c19394092f08b74fd5e44ecb2fd253f385b80f12a9fa4d47512362129a7b1f8","observation_id":"484ca925-0908-4034-98ef-c2f8bde5a069","resolution":{"observed_at":"2026-08-16T11:25:34.382890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:25:34.387988Z","title":"Gpt3. int8 (): 8-bit matrix multiplication for transformers at scale,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.15721","last_updated":"2025-04-22T09:11:21Z","snapshot_observed_at":"2026-08-21T18:17:30.901704Z","submitted_at":"2025-04-22T09:11:21Z","title":"BBAL: A Bidirectional Block Floating Point-Based Quantisation Accelerator for Large Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T11:25:34.387988Z"},"links":{"citing_paper":"/paper/2504.15721"},"observation_digest":"sha256:65675a060b85984cfd91c97fe85e781318a345d6e4fe51ae08f846a668e18631","observation_id":"9f704969-ddb0-4ce4-a7a0-522cf204d750","resolution":{"observed_at":"2026-08-16T11:25:34.387988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.01089","last_updated":"2023-05-17T10:07:33Z","snapshot_observed_at":"2026-08-16T15:43:09.896060Z","submitted_at":"2023-04-03T15:46:15Z","title":"RPTQ: Reorder-based Post-training Quantization for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.01089","snapshot_observed_at":"2026-08-16T11:25:34.392958Z","title":"Rptq: Reorder-based post-training quantization for large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.15721","last_updated":"2025-04-22T09:11:21Z","snapshot_observed_at":"2026-08-21T18:17:30.901704Z","submitted_at":"2025-04-22T09:11:21Z","title":"BBAL: A Bidirectional Block Floating Point-Based Quantisation Accelerator for Large Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T11:25:34.392958Z"},"links":{"cited_paper":"/paper/2304.01089","citing_paper":"/paper/2504.15721"},"observation_digest":"sha256:ae598d0b4f5dabb4a5caa1919411e0338ed2dfb2626986910dc67a26c7c5fdd2","observation_id":"1cb4e4ee-6ad2-465d-9ec0-2a44c7aa4d31","resolution":{"observed_at":"2026-08-16T11:25:34.392958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-16T11:25:34.398184Z","title":"Gpt-4 technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.15721","last_updated":"2025-04-22T09:11:21Z","snapshot_observed_at":"2026-08-21T18:17:30.901704Z","submitted_at":"2025-04-22T09:11:21Z","title":"BBAL: A Bidirectional Block Floating Point-Based Quantisation Accelerator for Large Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T11:25:34.398184Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2504.15721"},"observation_digest":"sha256:b84cb5194ab9f27f68ff4725d1ec2f502a5da5ee34f649d0dccd51c315896145","observation_id":"beda1e26-dc25-43c3-bb44-ff4ee26f2367","resolution":{"observed_at":"2026-08-16T11:25:34.398184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:25:35.205761Z","title":"Bfloat16 processing for neural networks,","venue":null,"work_id":"c2a7f075-065b-47db-b07f-78adc8945217","year":2019},"citing_paper":{"arxiv_id":"2504.15721","last_updated":"2025-04-22T09:11:21Z","snapshot_observed_at":"2026-08-21T18:17:30.901704Z","submitted_at":"2025-04-22T09:11:21Z","title":"BBAL: A Bidirectional Block Floating Point-Based Quantisation Accelerator for Large Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T11:25:34.402997Z"},"links":{"citing_paper":"/paper/2504.15721"},"observation_digest":"sha256:c74ee19801227565ff5c860c04763c78e9420bc5f842a23428f400fc0f49db76","observation_id":"e1ed57a6-a9a1-404d-a479-0fc9532604be","resolution":{"observed_at":"2026-08-16T11:25:35.210357Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.05433","last_updated":"2022-09-29T20:47:07Z","snapshot_observed_at":"2026-08-14T05:39:52.416140Z","submitted_at":"2022-09-12T17:39:55Z","title":"FP8 Formats for Deep Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.05433","snapshot_observed_at":"2026-08-16T11:25:34.407823Z","title":"Fp8 formats for deep learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.15721","last_updated":"2025-04-22T09:11:21Z","snapshot_observed_at":"2026-08-21T18:17:30.901704Z","submitted_at":"2025-04-22T09:11:21Z","title":"BBAL: A Bidirectional Block Floating Point-Based Quantisation Accelerator for Large Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T11:25:34.407823Z"},"links":{"cited_paper":"/paper/2209.05433","citing_paper":"/paper/2504.15721"},"observation_digest":"sha256:d861fbb89c77c31c6b0f70706971f5f3cde2e919cc3fb2cb30eb84fecf308328","observation_id":"53c5d014-df9b-4116-aa47-3516b3d3e275","resolution":{"observed_at":"2026-08-16T11:25:34.407823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05079","last_updated":"2023-10-21T12:38:52Z","snapshot_observed_at":"2026-08-16T14:54:07.281307Z","submitted_at":"2023-10-08T09:05:14Z","title":"Revisiting Block-based Quantisation: What is Important for Sub-8-bit LLM Inference?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05079","snapshot_observed_at":"2026-08-16T11:25:34.412775Z","title":"Revisiting block-based quantisation: What is important for sub-8-bit llm inference?","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.15721","last_updated":"2025-04-22T09:11:21Z","snapshot_observed_at":"2026-08-21T18:17:30.901704Z","submitted_at":"2025-04-22T09:11:21Z","title":"BBAL: A Bidirectional Block Floating Point-Based Quantisation Accelerator for Large Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T11:25:34.412775Z"},"links":{"cited_paper":"/paper/2310.05079","citing_paper":"/paper/2504.15721"},"observation_digest":"sha256:8ed3433d54c71339056396de8f652d27891e9117b369d9dbd7765110a3ca5be6","observation_id":"52ea92a6-a352-4b9d-9ecc-3d40eaec762a","resolution":{"observed_at":"2026-08-16T11:25:34.412775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:25:35.189713Z","title":"Be like water: Adaptive floating point for machine learning,","venue":null,"work_id":"06dcd225-9a0f-4e40-acbc-ceed579df759","year":2022},"citing_paper":{"arxiv_id":"2504.15721","last_updated":"2025-04-22T09:11:21Z","snapshot_observed_at":"2026-08-21T18:17:30.901704Z","submitted_at":"2025-04-22T09:11:21Z","title":"BBAL: A Bidirectional Block Floating Point-Based Quantisation Accelerator for Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T11:25:34.417554Z"},"links":{"citing_paper":"/paper/2504.15721"},"observation_digest":"sha256:46e563fdad160caf9bc325ae04656f21572c531ef513cfb439109cc56391f0f0","observation_id":"6a1259f5-b035-4696-ace1-d103768c3f71","resolution":{"observed_at":"2026-08-16T11:25:35.195068Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:25:34.422444Z","title":"A block mini- float representation for training deep neural networks,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.15721","last_updated":"2025-04-22T09:11:21Z","snapshot_observed_at":"2026-08-21T18:17:30.901704Z","submitted_at":"2025-04-22T09:11:21Z","title":"BBAL: A Bidirectional Block Floating Point-Based Quantisation Accelerator for Large Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T11:25:34.422444Z"},"links":{"citing_paper":"/paper/2504.15721"},"observation_digest":"sha256:41d6db38c203603f5639cb09c93170fd30150982523818103decca239ec01ae0","observation_id":"1a96266c-2268-45d7-bd20-6bfa1928b2df","resolution":{"observed_at":"2026-08-16T11:25:34.422444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:25:35.162625Z","title":"Bie: Bi-exponent block floating-point for large language models quantization,","venue":null,"work_id":"6bcddda0-001a-4597-9194-bad3dfbb8a26","year":2024},"citing_paper":{"arxiv_id":"2504.15721","last_updated":"2025-04-22T09:11:21Z","snapshot_observed_at":"2026-08-21T18:17:30.901704Z","submitted_at":"2025-04-22T09:11:21Z","title":"BBAL: A Bidirectional Block Floating Point-Based Quantisation Accelerator for Large Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T11:25:34.427559Z"},"links":{"citing_paper":"/paper/2504.15721"},"observation_digest":"sha256:e8dbcf3664ba26466e8f48987526920aebdb08e5f14a6f02c60859ddb34d0072","observation_id":"6202a589-7db0-4ce8-8bda-3896bff0a77a","resolution":{"observed_at":"2026-08-16T11:25:35.167745Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:25:35.146423Z","title":"Fpga-based convolutional neural network accel- erator with resource-optimized approximate multiply-accumulate unit,","venue":null,"work_id":"e8010f52-42a7-4203-ad55-0b0b93f4b259","year":2021},"citing_paper":{"arxiv_id":"2504.15721","last_updated":"2025-04-22T09:11:21Z","snapshot_observed_at":"2026-08-21T18:17:30.901704Z","submitted_at":"2025-04-22T09:11:21Z","title":"BBAL: A Bidirectional Block Floating Point-Based Quantisation Accelerator for Large Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T11:25:34.432785Z"},"links":{"citing_paper":"/paper/2504.15721"},"observation_digest":"sha256:bdc76b9d64c2b5059f9f8518683abb2696e5bd01d6e6265c3a776a08f09fa520","observation_id":"1cd7edd2-6eef-4b58-920e-79701994f99d","resolution":{"observed_at":"2026-08-16T11:25:35.151517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:25:35.131129Z","title":"High-performance acceleration of 2-d and 3-d cnns on fpgas using static block floating point,","venue":null,"work_id":"8a3cb084-6b46-406d-bb4c-8e7aea291576","year":2021},"citing_paper":{"arxiv_id":"2504.15721","last_updated":"2025-04-22T09:11:21Z","snapshot_observed_at":"2026-08-21T18:17:30.901704Z","submitted_at":"2025-04-22T09:11:21Z","title":"BBAL: A Bidirectional Block Floating Point-Based Quantisation Accelerator for Large Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T11:25:34.437579Z"},"links":{"citing_paper":"/paper/2504.15721"},"observation_digest":"sha256:f3db6876994002414c21650939356b2222cbc4c198146bfd5f49fb489149e51a","observation_id":"507b34e2-4294-4127-b61e-c1528e147ba5","resolution":{"observed_at":"2026-08-16T11:25:35.136034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:25:35.115069Z","title":"Computation error analysis of block floating point arithmetic oriented convolution neural network accelerator design,","venue":null,"work_id":"1d6034be-9204-4625-9c0a-fbe6c7e1bd9a","year":2018},"citing_paper":{"arxiv_id":"2504.15721","last_updated":"2025-04-22T09:11:21Z","snapshot_observed_at":"2026-08-21T18:17:30.901704Z","submitted_at":"2025-04-22T09:11:21Z","title":"BBAL: A Bidirectional Block Floating Point-Based Quantisation Accelerator for Large Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T11:25:34.442325Z"},"links":{"citing_paper":"/paper/2504.15721"},"observation_digest":"sha256:80ea40b6bcc95cfa1ea0c2709bba5a410e2f6a2a7419e5a0a89f01adf06faba8","observation_id":"3e8a14af-00ae-4913-b2ea-dabc2639bb80","resolution":{"observed_at":"2026-08-16T11:25:35.120122Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:25:35.099017Z","title":"Attention is all you need. advances in neural information processing systems,","venue":null,"work_id":"15c953e8-03a5-40ea-a26e-7e58ee0a0f3a","year":2017},"citing_paper":{"arxiv_id":"2504.15721","last_updated":"2025-04-22T09:11:21Z","snapshot_observed_at":"2026-08-21T18:17:30.901704Z","submitted_at":"2025-04-22T09:11:21Z","title":"BBAL: A Bidirectional Block Floating Point-Based Quantisation Accelerator for Large Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T11:25:34.447220Z"},"links":{"citing_paper":"/paper/2504.15721"},"observation_digest":"sha256:d34031888edda0598e99053f1ac16cbf0fac15ffce264ca50a5d83e24272324b","observation_id":"b86dedc2-a213-4235-ac30-e7adea9ac2c1","resolution":{"observed_at":"2026-08-16T11:25:35.103984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:25:34.452166Z","title":"Softermax: Hardware/software co-design of an efficient softmax for transformers,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.15721","last_updated":"2025-04-22T09:11:21Z","snapshot_observed_at":"2026-08-21T18:17:30.901704Z","submitted_at":"2025-04-22T09:11:21Z","title":"BBAL: A Bidirectional Block Floating Point-Based Quantisation Accelerator for Large Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T11:25:34.452166Z"},"links":{"citing_paper":"/paper/2504.15721"},"observation_digest":"sha256:cf5191917b23aacef086fcb2246f203bf10676c8515e354f89d4d3a09de8a92e","observation_id":"fcb56abd-b5eb-4121-bd41-a88ee93b3e0c","resolution":{"observed_at":"2026-08-16T11:25:34.452166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-08-06T03:13:37.403059Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-08-16T11:25:34.457197Z","title":"Opt: Open pre-trained transformer language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.15721","last_updated":"2025-04-22T09:11:21Z","snapshot_observed_at":"2026-08-21T18:17:30.901704Z","submitted_at":"2025-04-22T09:11:21Z","title":"BBAL: A Bidirectional Block Floating Point-Based Quantisation Accelerator for Large Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T11:25:34.457197Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2504.15721"},"observation_digest":"sha256:358123923d3a24ee30e340a7fcfe9b35a36e1f6d3c81dfe7873570fc41a84862","observation_id":"3e7c7b01-b98c-4954-89ce-1214b746c4bd","resolution":{"observed_at":"2026-08-16T11:25:34.457197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.16836","last_updated":"2023-10-25T17:59:32Z","snapshot_observed_at":"2026-08-17T18:13:02.704471Z","submitted_at":"2023-10-25T17:59:32Z","title":"LLM-FP4: 4-Bit Floating-Point Quantized Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.16836","snapshot_observed_at":"2026-08-16T11:25:34.462176Z","title":"Llm-fp4: 4-bit floating-point quantized transformers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.15721","last_updated":"2025-04-22T09:11:21Z","snapshot_observed_at":"2026-08-21T18:17:30.901704Z","submitted_at":"2025-04-22T09:11:21Z","title":"BBAL: A Bidirectional Block Floating Point-Based Quantisation Accelerator for Large Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T11:25:34.462176Z"},"links":{"cited_paper":"/paper/2310.16836","citing_paper":"/paper/2504.15721"},"observation_digest":"sha256:d929ba1cf94e92e124f8e38864dd9a3faf290f9bca47413ce7166e7b8f0eb71f","observation_id":"bf87f6a6-3364-494c-817e-3ff8d29ebd7d","resolution":{"observed_at":"2026-08-16T11:25:34.462176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17849","last_updated":"2024-06-05T15:26:58Z","snapshot_observed_at":"2026-08-18T01:18:47.871484Z","submitted_at":"2024-05-28T05:56:11Z","title":"I-LLM: Efficient Integer-Only Inference for Fully-Quantized Low-Bit Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17849","snapshot_observed_at":"2026-08-16T11:25:34.467393Z","title":"I- llm: Efficient integer-only inference for fully-quantized low-bit large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15721","last_updated":"2025-04-22T09:11:21Z","snapshot_observed_at":"2026-08-21T18:17:30.901704Z","submitted_at":"2025-04-22T09:11:21Z","title":"BBAL: A Bidirectional Block Floating Point-Based Quantisation Accelerator for Large Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T11:25:34.467393Z"},"links":{"cited_paper":"/paper/2405.17849","citing_paper":"/paper/2504.15721"},"observation_digest":"sha256:f79833974bdfd6e467d953274f297763391192641e69c654f1a9d82fbf08fbe1","observation_id":"5bc6836b-e31e-4d00-8b76-50e3d29b0e42","resolution":{"observed_at":"2026-08-16T11:25:34.467393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:25:34.472453Z","title":"Smoothquant: Accurate and efficient post-training quantization for large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.15721","last_updated":"2025-04-22T09:11:21Z","snapshot_observed_at":"2026-08-21T18:17:30.901704Z","submitted_at":"2025-04-22T09:11:21Z","title":"BBAL: A Bidirectional Block Floating Point-Based Quantisation Accelerator for Large Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T11:25:34.472453Z"},"links":{"citing_paper":"/paper/2504.15721"},"observation_digest":"sha256:c27c80905dd70e288df22051c8717beb4c1ccc3beac3ad0cb57b0bee32e6c174","observation_id":"b7ed3b85-23aa-49a1-b336-e65518f3e384","resolution":{"observed_at":"2026-08-16T11:25:34.472453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.17323","last_updated":"2023-03-22T13:10:47Z","snapshot_observed_at":"2026-08-16T07:57:19.216626Z","submitted_at":"2022-10-31T13:42:40Z","title":"GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.17323","snapshot_observed_at":"2026-08-16T11:25:34.477242Z","title":"Gptq: Accurate post-training quantization for generative pre-trained transformers,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.15721","last_updated":"2025-04-22T09:11:21Z","snapshot_observed_at":"2026-08-21T18:17:30.901704Z","submitted_at":"2025-04-22T09:11:21Z","title":"BBAL: A Bidirectional Block Floating Point-Based Quantisation Accelerator for Large Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T11:25:34.477242Z"},"links":{"cited_paper":"/paper/2210.17323","citing_paper":"/paper/2504.15721"},"observation_digest":"sha256:a765ad6915984577d4afb01345e0c6d040cb75d6752129857a4e954823fe6062","observation_id":"79099c03-2991-478d-8852-fdd06a4c2567","resolution":{"observed_at":"2026-08-16T11:25:34.477242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:25:34.482269Z","title":"Post-training quantization for vision transformer,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.15721","last_updated":"2025-04-22T09:11:21Z","snapshot_observed_at":"2026-08-21T18:17:30.901704Z","submitted_at":"2025-04-22T09:11:21Z","title":"BBAL: A Bidirectional Block Floating Point-Based Quantisation Accelerator for Large Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T11:25:34.482269Z"},"links":{"citing_paper":"/paper/2504.15721"},"observation_digest":"sha256:0f985b5500f31c203b7f04af8e1ff94a2ba8ede9ac40d694e8874cba557e2270","observation_id":"2dd6cbaa-7014-45ef-aef1-ad8307be7d12","resolution":{"observed_at":"2026-08-16T11:25:34.482269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:25:34.487209Z","title":"Q8bert: Quantized 8bit bert,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.15721","last_updated":"2025-04-22T09:11:21Z","snapshot_observed_at":"2026-08-21T18:17:30.901704Z","submitted_at":"2025-04-22T09:11:21Z","title":"BBAL: A Bidirectional Block Floating Point-Based Quantisation Accelerator for Large Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T11:25:34.487209Z"},"links":{"citing_paper":"/paper/2504.15721"},"observation_digest":"sha256:d5d40f84435ac518f941c5af794608be55831e5e806357e0137caea2dda0a662","observation_id":"cc48e24d-4ad2-476c-8083-5c462c3d32d4","resolution":{"observed_at":"2026-08-16T11:25:34.487209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:25:35.039498Z","title":"Roundoff errors in block-floating-point systems,","venue":null,"work_id":"e9ae136d-b018-49ad-a71a-b88b8c0a7bbc","year":1996},"citing_paper":{"arxiv_id":"2504.15721","last_updated":"2025-04-22T09:11:21Z","snapshot_observed_at":"2026-08-21T18:17:30.901704Z","submitted_at":"2025-04-22T09:11:21Z","title":"BBAL: A Bidirectional Block Floating Point-Based Quantisation Accelerator for Large Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T11:25:34.492187Z"},"links":{"citing_paper":"/paper/2504.15721"},"observation_digest":"sha256:558c5a31b4e11fa9d9f2ab2d7b0886a7ece832b925dbf636210bb3368215c0cd","observation_id":"fb03534d-8518-4aca-a69e-46e7d9d3534a","resolution":{"observed_at":"2026-08-16T11:25:35.045398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:25:35.023530Z","title":"A pseudo-softmax function for hardware-based high speed image classification,","venue":null,"work_id":"d44fb45c-ed02-4c50-b6e6-7d349161696f","year":2021},"citing_paper":{"arxiv_id":"2504.15721","last_updated":"2025-04-22T09:11:21Z","snapshot_observed_at":"2026-08-21T18:17:30.901704Z","submitted_at":"2025-04-22T09:11:21Z","title":"BBAL: A Bidirectional Block Floating Point-Based Quantisation Accelerator for Large Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T11:25:34.496937Z"},"links":{"citing_paper":"/paper/2504.15721"},"observation_digest":"sha256:8a0ecdb91ae185f5c00b496e26fe0a2805967b849f40d7a17f3bc375b82dfe2d","observation_id":"ad8f230e-d3ff-46b8-a1d0-288fd713c850","resolution":{"observed_at":"2026-08-16T11:25:35.028683Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:25:35.007116Z","title":"High- precision method and architecture for base-2 softmax function in dnn training,","venue":null,"work_id":"b81b820d-11e3-4d38-b667-26a51f2ba357","year":2023},"citing_paper":{"arxiv_id":"2504.15721","last_updated":"2025-04-22T09:11:21Z","snapshot_observed_at":"2026-08-21T18:17:30.901704Z","submitted_at":"2025-04-22T09:11:21Z","title":"BBAL: A Bidirectional Block Floating Point-Based Quantisation Accelerator for Large Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T11:25:34.502215Z"},"links":{"citing_paper":"/paper/2504.15721"},"observation_digest":"sha256:f91568f902710f771be361bf01069be9a2a512844969baf1dbc50199b93ad440","observation_id":"14982851-8f09-4422-8054-42ac34536d95","resolution":{"observed_at":"2026-08-16T11:25:35.012206Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-16T11:25:34.507306Z","title":"Llama 2: Open foundation and fine-tuned chat models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.15721","last_updated":"2025-04-22T09:11:21Z","snapshot_observed_at":"2026-08-21T18:17:30.901704Z","submitted_at":"2025-04-22T09:11:21Z","title":"BBAL: A Bidirectional Block Floating Point-Based Quantisation Accelerator for Large Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T11:25:34.507306Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2504.15721"},"observation_digest":"sha256:78ab73018da8af07093f6aff52086a292acb715c992c97f708fa5cc8046d92b3","observation_id":"35c169c6-a241-4ca2-a017-6681ad152d6a","resolution":{"observed_at":"2026-08-16T11:25:34.507306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:25:34.990277Z","title":"Meta llama 3: Advancing generative ai responsibly,","venue":null,"work_id":"624c7ada-db27-4055-bf5c-60695d4d04c0","year":2024},"citing_paper":{"arxiv_id":"2504.15721","last_updated":"2025-04-22T09:11:21Z","snapshot_observed_at":"2026-08-21T18:17:30.901704Z","submitted_at":"2025-04-22T09:11:21Z","title":"BBAL: A Bidirectional Block Floating Point-Based Quantisation Accelerator for Large Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T11:25:34.512904Z"},"links":{"citing_paper":"/paper/2504.15721"},"observation_digest":"sha256:70115129a039f91503f50ee860cec13e1d9f0d8db0140d3de37d2cc1ef40bac2","observation_id":"dbb42179-12f6-47c8-9529-edafe4d19bce","resolution":{"observed_at":"2026-08-16T11:25:34.995309Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.07843","last_updated":"2016-09-26T04:06:13Z","snapshot_observed_at":"2026-08-17T01:46:43.513643Z","submitted_at":"2016-09-26T04:06:13Z","title":"Pointer Sentinel Mixture Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.07843","snapshot_observed_at":"2026-08-16T11:25:34.518041Z","title":"Pointer sentinel mixture models,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2504.15721","last_updated":"2025-04-22T09:11:21Z","snapshot_observed_at":"2026-08-21T18:17:30.901704Z","submitted_at":"2025-04-22T09:11:21Z","title":"BBAL: A Bidirectional Block Floating Point-Based Quantisation Accelerator for Large Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T11:25:34.518041Z"},"links":{"cited_paper":"/paper/1609.07843","citing_paper":"/paper/2504.15721"},"observation_digest":"sha256:d023f6d8e2c54000aaf03cf5c32848d26de530a5fbe4c4491bad364c85337cdf","observation_id":"5956a184-b1c5-455d-917f-3468cfe1c587","resolution":{"observed_at":"2026-08-16T11:25:34.518041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.13137","last_updated":"2024-03-18T05:33:22Z","snapshot_observed_at":"2026-08-19T19:41:30.005565Z","submitted_at":"2023-08-25T02:28:35Z","title":"OmniQuant: Omnidirectionally Calibrated Quantization for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.13137","snapshot_observed_at":"2026-08-16T11:25:34.523844Z","title":"Omniquant: Omnidirectionally calibrated quan- tization for large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.15721","last_updated":"2025-04-22T09:11:21Z","snapshot_observed_at":"2026-08-21T18:17:30.901704Z","submitted_at":"2025-04-22T09:11:21Z","title":"BBAL: A Bidirectional Block Floating Point-Based Quantisation Accelerator for Large Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T11:25:34.523844Z"},"links":{"cited_paper":"/paper/2308.13137","citing_paper":"/paper/2504.15721"},"observation_digest":"sha256:38fb32223e9a3d49e54606cddc2e887ce17ff3ea3f9ea4655f133f972bf74db8","observation_id":"d22831c2-b271-4ff3-9397-15098d2b1193","resolution":{"observed_at":"2026-08-16T11:25:34.523844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:25:34.973200Z","title":"Oltron: Algorithm-hardware co-design for outlier-aware quantization of llms with inter-/intra-layer adaptation,","venue":null,"work_id":"ce2cf57a-3ade-4ab6-930a-a97a45fca79a","year":2024},"citing_paper":{"arxiv_id":"2504.15721","last_updated":"2025-04-22T09:11:21Z","snapshot_observed_at":"2026-08-21T18:17:30.901704Z","submitted_at":"2025-04-22T09:11:21Z","title":"BBAL: A Bidirectional Block Floating Point-Based Quantisation Accelerator for Large Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T11:25:34.530381Z"},"links":{"citing_paper":"/paper/2504.15721"},"observation_digest":"sha256:4a5140e92ee1c8c3d66da27743289296e142a44cb502a68c5229101518c983a7","observation_id":"bfbcd621-962a-49cb-a730-f47c6af68ae7","resolution":{"observed_at":"2026-08-16T11:25:34.978939Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:25:34.535521Z","title":"Olive: Accelerating large language models via hardware- friendly outlier-victim pair quantization,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.15721","last_updated":"2025-04-22T09:11:21Z","snapshot_observed_at":"2026-08-21T18:17:30.901704Z","submitted_at":"2025-04-22T09:11:21Z","title":"BBAL: A Bidirectional Block Floating Point-Based Quantisation Accelerator for Large Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T11:25:34.535521Z"},"links":{"citing_paper":"/paper/2504.15721"},"observation_digest":"sha256:4a55f8deec4e322962472bdb391ae1284489a5a9cf0fd3ba47d0a5bf2ed190a7","observation_id":"5fac0286-68d1-4f26-879d-706b30560c9f","resolution":{"observed_at":"2026-08-16T11:25:34.535521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:25:34.540610Z","title":"Chisel: constructing hardware in a scala embedded language,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2504.15721","last_updated":"2025-04-22T09:11:21Z","snapshot_observed_at":"2026-08-21T18:17:30.901704Z","submitted_at":"2025-04-22T09:11:21Z","title":"BBAL: A Bidirectional Block Floating Point-Based Quantisation Accelerator for Large Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T11:25:34.540610Z"},"links":{"citing_paper":"/paper/2504.15721"},"observation_digest":"sha256:b7273f978b45f5cb984a2740e8bd1a98305533186b85ea364e41de066e63edb7","observation_id":"1e868da2-a803-4b6c-ac0b-3dc3fd7156f1","resolution":{"observed_at":"2026-08-16T11:25:34.540610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:25:34.546798Z","title":"Kurup and T","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2504.15721","last_updated":"2025-04-22T09:11:21Z","snapshot_observed_at":"2026-08-21T18:17:30.901704Z","submitted_at":"2025-04-22T09:11:21Z","title":"BBAL: A Bidirectional Block Floating Point-Based Quantisation Accelerator for Large Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T11:25:34.546798Z"},"links":{"citing_paper":"/paper/2504.15721"},"observation_digest":"sha256:b2f29a6f14b128de77e2ba655bd7e5ce01d83ea7f146e1ea7eec2e772d94ea65","observation_id":"ff1166d4-5689-4299-81f7-0a71c8abd3ad","resolution":{"observed_at":"2026-08-16T11:25:34.546798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:25:34.552197Z","title":"Cacti 6.0: A tool to model large caches,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2504.15721","last_updated":"2025-04-22T09:11:21Z","snapshot_observed_at":"2026-08-21T18:17:30.901704Z","submitted_at":"2025-04-22T09:11:21Z","title":"BBAL: A Bidirectional Block Floating Point-Based Quantisation Accelerator for Large Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T11:25:34.552197Z"},"links":{"citing_paper":"/paper/2504.15721"},"observation_digest":"sha256:b600119b1898b99de11416b886253cbe443a6bd862f1293b062cc5a8c2c1907b","observation_id":"1efb1af5-2283-4839-9372-7e92570c7d3d","resolution":{"observed_at":"2026-08-16T11:25:34.552197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:25:34.911412Z","title":"Dnnweaver: From high-level deep network models to fpga acceleration,","venue":null,"work_id":"4b2d93c3-150b-4619-bcf2-42a1c8870471","year":2016},"citing_paper":{"arxiv_id":"2504.15721","last_updated":"2025-04-22T09:11:21Z","snapshot_observed_at":"2026-08-21T18:17:30.901704Z","submitted_at":"2025-04-22T09:11:21Z","title":"BBAL: A Bidirectional Block Floating Point-Based Quantisation Accelerator for Large Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-16T11:25:34.557499Z"},"links":{"citing_paper":"/paper/2504.15721"},"observation_digest":"sha256:9c3632b525d5c03d93650e85c0d3c4d3ce304ebf21cdfae3643fc20ad86f7677","observation_id":"1d5b1a50-c411-4cfa-89f2-a06bdfd898c1","resolution":{"observed_at":"2026-08-16T11:25:34.918108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2504.15721","last_updated":"2025-04-22T09:11:21Z","latest_version":1,"primary_category":"cs.AR","snapshot_observed_at":"2026-08-21T18:17:30.901704Z","submitted_at":"2025-04-22T09:11:21Z","title":"BBAL: A Bidirectional Block Floating Point-Based Quantisation Accelerator for Large Language Models"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":29,"verified_exact":0,"verified_fuzzy":14},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 0 inbound Pith citation observations for arXiv:2504.15721."}