{"as_of":"2026-08-08T12:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c9d6e5e6cf5bdbda1d62724f4bbecd8a318e5455cb05050c7e2aab6dfd458fb4","coverage":[{"denominator":69,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":69,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T16:03:38.453321Z","state":"measured"},{"denominator":69,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":69,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2508.19087/citation-record","integrity":"/paper/2508.19087/integrity","json":"/paper/2508.19087/citation-record.json","paper":"/paper/2508.19087"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.12712","last_updated":"2023-04-13T20:41:31Z","snapshot_observed_at":"2026-08-03T04:49:15.195814Z","submitted_at":"2023-03-22T16:51:28Z","title":"Sparks of Artificial General Intelligence: Early experiments with GPT-4","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.12712","snapshot_observed_at":"2026-08-05T16:03:29.940257Z","title":"Sparks of artificial general intelligence: Early exper- iments with gpt-4,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T23:09:15.767029Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:29.940257Z"},"links":{"cited_paper":"/paper/2303.12712","citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:bf09376a744832b5cbbdfa472cd45f370aae8602d5f2212282cd77fd9bba98a6","observation_id":"2c0249ee-648e-420a-b3af-852c7066a201","resolution":{"observed_at":"2026-08-05T16:03:29.940257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-05T16:03:30.103343Z","title":"The llama 3 herd of models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T23:09:15.767029Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:30.103343Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:7196fee73ceee3728f7aae230258946232274cff3afacf3d40fca57feb7a6031","observation_id":"0699aa5c-7ee9-4474-839f-22467db1afb1","resolution":{"observed_at":"2026-08-05T16:03:30.103343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-05T16:03:30.247494Z","title":"Deepseek-v3 technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T23:09:15.767029Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:30.247494Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:09978a7866b24d27ac3c5918fa169b78cde1a285091e3433afb49be54d980455","observation_id":"f1046ed7-e9ae-4b3d-8fc0-ad7eac3940fa","resolution":{"observed_at":"2026-08-05T16:03:30.247494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T16:03:30.430398Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T23:09:15.767029Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:30.430398Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:11215151a779ce6185488c7dcc4630e07dad123995c7f07a14cb0cb6428f84a9","observation_id":"20b2debd-4947-433b-b75d-e7d68e19e71d","resolution":{"observed_at":"2026-08-05T16:03:30.430398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:03:52.602114Z","title":"Jumping nlp curves: A review of natural language processing research,","venue":null,"work_id":"7a4a88a5-8a65-4eb6-8058-cde7be7d1052","year":2014},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T23:09:15.767029Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:30.620469Z"},"links":{"citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:74c092e0496ddd18027dbd6bb0f89c48e8d39ece88d536b8a27b89b49c0707a4","observation_id":"de9a7b54-2bdf-4117-ad18-fa77863d036e","resolution":{"observed_at":"2026-08-05T16:03:52.699089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-05T16:03:30.727386Z","title":"Scaling laws for neural language models,","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T23:09:15.767029Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:30.727386Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:ec08276ed9164a785d75889d03bcdd9e673b780bb1b925c375c4b5e8ceaf1d43","observation_id":"21a7223a-8da9-4462-b25f-84ba27760508","resolution":{"observed_at":"2026-08-05T16:03:30.727386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:03:52.277302Z","title":"Chateda: A large language model powered autonomous agent for eda,","venue":null,"work_id":"1d8809b2-19b4-4e9e-957a-b15f2f9d1e11","year":2024},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T23:09:15.767029Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:30.864703Z"},"links":{"citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:5405a77236d83b565b98fb2d65fe87c9b62c6e3a0e1b15059678c007ff90d91d","observation_id":"3a9c9fab-7b3c-42e3-a932-c722a16c76a3","resolution":{"observed_at":"2026-08-05T16:03:52.411263Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:03:52.099646Z","title":"Dtatrans: Leveraging dynamic token-based quantization with accuracy compensation mechanism for efficient transformer archi- tecture,","venue":null,"work_id":"ca98d0fe-5099-498a-b0b3-9bb14620a746","year":2022},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T23:09:15.767029Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:30.971935Z"},"links":{"citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:ae2878bb44e4db836c8b98eddc7f47aed624cfd9b25cb526e0dd81ec64882b7d","observation_id":"97ec05cb-66d7-42cd-be3c-4883c458397a","resolution":{"observed_at":"2026-08-05T16:03:52.188830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:03:51.804631Z","title":"Qlora: Efficient finetuning of quantized llms,","venue":null,"work_id":"564b550b-623d-4337-a22e-455c71f2cf4e","year":2023},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T23:09:15.767029Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:31.093906Z"},"links":{"citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:281f52fecb43b55fd92205ed9df4b0fb52f41eec83c3e1011db785a3c15b70f3","observation_id":"285e7a34-e16c-40b1-9d04-e41ec4daf6e7","resolution":{"observed_at":"2026-08-05T16:03:51.958128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:03:51.581058Z","title":"Optq: Accurate quantization for generative pre-trained transformers,","venue":null,"work_id":"b5b170c0-c462-4279-8036-679070f01efb","year":2023},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T23:09:15.767029Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:31.247082Z"},"links":{"citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:77055c6450befd17e23a90d0b09ccfeb1c3a5609768da41626f0c976e7cb71aa","observation_id":"2a09aa32-f0e9-43b3-892a-b2d5ffa42574","resolution":{"observed_at":"2026-08-05T16:03:51.665625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:03:51.438665Z","title":"A precision-scalable risc-v dnn processor with on- device learning capability at the extreme edge,","venue":null,"work_id":"adc24fcb-21ec-4d2a-b7fb-5c247dd17878","year":2024},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T23:09:15.767029Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:31.362494Z"},"links":{"citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:4577db77628c092512bc26ce1990c7c87ca18ec0e9ef564bf5a3e2df19ff3e1f","observation_id":"53251243-f0e0-4ebd-ac71-deab2d1b995a","resolution":{"observed_at":"2026-08-05T16:03:51.518375Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:03:51.197889Z","title":"Token-scaled logit distillation for ternary weight gen- erative language models,","venue":null,"work_id":"33eefc41-28a8-4b87-ad7c-c05a38eb5cbb","year":2024},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T23:09:15.767029Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:31.478915Z"},"links":{"citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:40df7a719f1389bbde4fb9840efeae0608a212e2d6da87c13ade7f3887ff58a6","observation_id":"e942cdf7-30a4-4ea2-8417-6779523368fe","resolution":{"observed_at":"2026-08-05T16:03:51.335615Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11295","last_updated":"2024-11-29T11:47:55Z","snapshot_observed_at":"2026-07-06T17:31:37.574049Z","submitted_at":"2024-02-17T14:26:57Z","title":"OneBit: Towards Extremely Low-bit Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11295","snapshot_observed_at":"2026-08-05T16:03:31.642699Z","title":"Onebit: Towards extremely low-bit large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T23:09:15.767029Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:31.642699Z"},"links":{"cited_paper":"/paper/2402.11295","citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:0b635d25af6c8da6c304ce80375cafa2198c60d384b90fa5bad35cd8620c3ad9","observation_id":"7715ab1b-072b-4683-af15-09bc88d460a3","resolution":{"observed_at":"2026-08-05T16:03:31.642699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:03:50.943277Z","title":"Smoothquant: Accurate and efficient post-training quantization for large language models,","venue":null,"work_id":"22daa5a4-0e94-4a0e-b532-2fbceb472672","year":2023},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T23:09:15.767029Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:31.776902Z"},"links":{"citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:7a0eee94806b409bd83ca2b726dc0322a915095f5b26cfbe154d6d479e68ed7c","observation_id":"34a9228e-f7c6-4f26-9ea9-ffa5b255dbc8","resolution":{"observed_at":"2026-08-05T16:03:51.062987Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:03:50.659888Z","title":"Omniquant: Omnidirectionally calibrated quantization for large language models,","venue":null,"work_id":"abb3de9b-a1e6-49ac-8701-0efba08433e0","year":2024},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T23:09:15.767029Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:31.837782Z"},"links":{"citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:627be1a0215063fcda7e2f1e8511607158dde213343cae49bb56b4a0fa9191b2","observation_id":"2dbe31b4-d068-44b5-8d19-b14b892fff01","resolution":{"observed_at":"2026-08-05T16:03:50.801835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:03:50.299543Z","title":"Holes: Boosting large language models efficiency with hardware-friendly lossless encoding,","venue":null,"work_id":"f89c4fd7-1e62-4b4b-8ea4-be1ac113c7b1","year":2024},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T23:09:15.767029Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:31.893683Z"},"links":{"citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:f117dbd6719ed02852acaa19fb269af720c86bd78224829a917354b78dc7bf7e","observation_id":"e29de1d8-be67-4cc6-a866-00e42673bd77","resolution":{"observed_at":"2026-08-05T16:03:50.513827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:03:50.090249Z","title":"Quantization via distillation and contrastive learning,","venue":null,"work_id":"c5a755e7-ae47-4946-9674-ba1e21c75861","year":2024},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T23:09:15.767029Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:32.017450Z"},"links":{"citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:9ba89fcb84555da3f5ec63b1b30d6cb373178e77d7861b1e07b03ea05efb00d8","observation_id":"81e59714-90dc-4fd5-b33f-69d73af0889c","resolution":{"observed_at":"2026-08-05T16:03:50.218760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:03:49.799274Z","title":"Atom: Low-bit quantization for efficient and accurate llm serving,","venue":null,"work_id":"d1722dbe-05a8-4610-85e0-83ed1ad99c80","year":2024},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T23:09:15.767029Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:32.133751Z"},"links":{"citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:93be741d2d70c3fd19850c2542872d7659c459191b5e34679d1948f5ec4cf03b","observation_id":"a347db84-0d13-4c1c-bfb1-733796f494e4","resolution":{"observed_at":"2026-08-05T16:03:49.940044Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:03:49.517494Z","title":"Nvidia a100 tensor core gpu: Performance and innovation,","venue":null,"work_id":"3728f8bb-2889-4d5f-b348-b09b66279695","year":2021},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T23:09:15.767029Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:32.231960Z"},"links":{"citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:ac4891ac48823a8837f0075aaaf958488e402839845f7d13ffeeaf1817cc05c6","observation_id":"78e738c1-ebaa-4270-bd8e-f0f32a7b3542","resolution":{"observed_at":"2026-08-05T16:03:49.644008Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:03:49.214126Z","title":"Rtx on—the nvidia turing gpu,","venue":null,"work_id":"f1800657-9004-488b-a411-4482065360ad","year":2020},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T23:09:15.767029Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:32.311442Z"},"links":{"citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:25a224131bf41b3f6c16098a2e42da4c2122e5eb8d3c0f0ecf83abc9f8a28703","observation_id":"8b2eb790-87f0-4345-95e9-5dad8cc06a8c","resolution":{"observed_at":"2026-08-05T16:03:49.365835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:03:48.872778Z","title":"Dissecting tensor cores via microbenchmarks: Latency, throughput and numeric behaviors,","venue":null,"work_id":"0f6fb2de-f67e-41c8-aaba-9b880d7b8f78","year":2022},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T23:09:15.767029Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:32.488863Z"},"links":{"citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:4878c92c19bfca5f02fd1b24c76ac5102779b8719a0281d70d6c76b3d8233053","observation_id":"61402a7a-7864-4591-806f-256035d61ed8","resolution":{"observed_at":"2026-08-05T16:03:49.070155Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04532","last_updated":"2025-05-01T02:14:05Z","snapshot_observed_at":"2026-08-08T04:42:16.973896Z","submitted_at":"2024-05-07T17:59:30Z","title":"QServe: W4A8KV4 Quantization and System Co-design for Efficient LLM Serving","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04532","snapshot_observed_at":"2026-08-05T16:03:32.624554Z","title":"Qserve: W4a8kv4 quantization and system co-design for efficient llm serving,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T23:09:15.767029Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:32.624554Z"},"links":{"cited_paper":"/paper/2405.04532","citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:434307fdb114ff32ac6ee30817b645b32991cb498edc05b3e2d5734d643be35d","observation_id":"f6e2c64e-11de-4867-be05-59d2e3d3b060","resolution":{"observed_at":"2026-08-05T16:03:32.624554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:03:48.572685Z","title":"G-blastn: accelerating nucleotide alignment by graphics processors,","venue":null,"work_id":"67f54d37-b2f5-4da7-8757-1bcf6e83e54d","year":2014},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T23:09:15.767029Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:32.713355Z"},"links":{"citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:12f5c6f4471691a511293501b213e4e202c03880ca914e0aab46e0b614a1179c","observation_id":"02687371-529f-495d-bdff-b1680de5b07c","resolution":{"observed_at":"2026-08-05T16:03:48.703589Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:03:48.302744Z","title":"Accelerating performance of gpu-based workloads using cxl,","venue":null,"work_id":"a76e96b4-9ac7-40fc-9b20-5e2e8d1f9c03","year":2023},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T23:09:15.767029Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:32.816745Z"},"links":{"citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:52ccaa06528ad11046c31cf2acaf70d9c991f7e1658b22f6e3130d40b06db9e2","observation_id":"972eb02e-45bf-4945-8ff3-c7891e9db510","resolution":{"observed_at":"2026-08-05T16:03:48.438897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:03:48.020987Z","title":"Superneurons: Dynamic gpu memory management for training deep neural networks,","venue":null,"work_id":"1c7bba4d-f611-4706-a300-8b7b3a136c14","year":2018},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T23:09:15.767029Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:32.903184Z"},"links":{"citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:8733602e329b326dc27df5526a53507bfc1cc911cfe83d0e438544c375c47107","observation_id":"0d767571-b9e6-4997-b49f-ecf36bb09708","resolution":{"observed_at":"2026-08-05T16:03:48.156464Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:03:47.654761Z","title":"Gpt3. int8 (): 8-bit matrix multiplication for trans- formers at scale,","venue":null,"work_id":"b65550c6-d27c-4fd5-b35f-7e6eaedabfeb","year":2022},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T23:09:15.767029Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:33.026595Z"},"links":{"citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:bf143c1322b67b8fdc22f2635e10593afacfde3541c24472399ec8d7b84f7e87","observation_id":"862a8792-8b7c-43a0-9836-96f2dbbd69e9","resolution":{"observed_at":"2026-08-05T16:03:47.803596Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:03:47.281746Z","title":"Quant-llm: Accelerating the serving of large language models via fp6-centric algorithm-system co-design on modern gpus,","venue":null,"work_id":"f0060fc2-55d3-425d-a444-29a66ca8eed1","year":2024},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T23:09:15.767029Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:33.175416Z"},"links":{"citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:497e95b628a738307bf2cd2e854a0b692d84d901dca7ac6fd6cd07ac77474bb4","observation_id":"a7457989-dce0-4e7f-9a58-7ff4d12c6b58","resolution":{"observed_at":"2026-08-05T16:03:47.454561Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:03:46.895776Z","title":"Tsm2x: High-performance tall-and-skinny matrix– matrix multiplication on gpus,","venue":null,"work_id":"c7924025-46be-4974-ba6c-dc021bfa153e","year":2021},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T23:09:15.767029Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:33.298313Z"},"links":{"citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:e91fc04c940f03549c74cdb8bf9dcfb7f1afe875cab0eabb967ae5d0bc8d7a8f","observation_id":"caa6ff66-940d-461e-992b-d09fa11ae585","resolution":{"observed_at":"2026-08-05T16:03:47.084547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:03:46.530870Z","title":"Stream-k: Work-centric parallel decomposition for dense matrix-matrix multiplication on the gpu,","venue":null,"work_id":"6814978a-1eb1-4555-9f83-36c2000c90ba","year":2023},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T23:09:15.767029Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:33.396338Z"},"links":{"citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:abe17401fcbfa71e7c18f630ba787ac381de3d776aefe4ecef8d4efbdff2011e","observation_id":"73a8173f-ae2d-4e27-a9a0-f835c17507ed","resolution":{"observed_at":"2026-08-05T16:03:46.669641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:03:46.122321Z","title":"Warp-aware adaptive energy efficiency calibration for multi-gpu systems,","venue":null,"work_id":"6909f9f0-8f80-4ec5-95a6-f5dd85a0aeac","year":2023},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T23:09:15.767029Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:33.509043Z"},"links":{"citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:ebdc620376c2189d0bef66eb30679e5a2a13acf3fb914236bda44fb08bc13cdc","observation_id":"efedc03e-0a91-4e01-9a05-fab1cfa26ab3","resolution":{"observed_at":"2026-08-05T16:03:46.295684Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:03:45.758101Z","title":"Dg-replace: A dataflow-driven gpu-accelerated an- alytical global placement framework for machine learning accelerators,","venue":null,"work_id":"6987816b-9a83-4fcf-a6fe-26cbe3c0b7ca","year":2025},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T23:09:15.767029Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:33.711616Z"},"links":{"citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:20e25417681706d9ef7cf5c26c1178c15464b484aca927e5f89669ffff40bbba","observation_id":"c55015c0-a37a-4ba3-991e-9e6c536392ab","resolution":{"observed_at":"2026-08-05T16:03:45.883712Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:03:45.388995Z","title":"Enabling efficient sparse multiplications on gpus with heuristic adaptability,","venue":null,"work_id":"0834983d-3893-4c36-a150-009894402517","year":2024},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T23:09:15.767029Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:33.821701Z"},"links":{"citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:4ee735e1be2b817c3efa6d7e46a57c6dd069103ea0f0f117438b2d14e7050859","observation_id":"6a408321-96c9-44fb-8927-41f1b0f5f099","resolution":{"observed_at":"2026-08-05T16:03:45.519740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:03:45.092689Z","title":"Bstc: A novel binarized-soft-tensor-core design for acceler- ating bit-based approximated neural nets,","venue":null,"work_id":"becfc3d2-e32e-4dac-a180-3162268ab0ba","year":2019},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T23:09:15.767029Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:33.927448Z"},"links":{"citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:ed7272fb1b518c2f6ff514579ad078398e6772d31bd3b68760e669ade6d73aa8","observation_id":"f204c8cb-b910-4361-9f64-5ac40004a4c5","resolution":{"observed_at":"2026-08-05T16:03:45.169637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:03:44.802968Z","title":"Accelerating binarized neural networks via bit-tensor-cores in turing gpus,","venue":null,"work_id":"6c5225c4-e697-4c14-aa43-283bb67aa9d4","year":2020},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T23:09:15.767029Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:34.072475Z"},"links":{"citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:8442658588baa0cbb76a83595d07101ddcfc96515b65012d561c267c160e86de","observation_id":"1f0e1a3d-b951-4eec-9265-5029184e20fe","resolution":{"observed_at":"2026-08-05T16:03:44.917241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:03:44.554069Z","title":"Demystifying the nvidia ampere architecture through microbenchmarking and instruction-level analysis,","venue":null,"work_id":"5fad2146-3f53-4de1-86b7-9f25dfc15492","year":2022},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T23:09:15.767029Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:34.214076Z"},"links":{"citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:5e565ed0e4ef9c9b9dc8688969665dd366b2db022a8018759cff52eba3cd73f0","observation_id":"a7657730-372d-442d-9efe-85a35fbaa7d5","resolution":{"observed_at":"2026-08-05T16:03:44.637710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1903.07486","last_updated":"2019-03-18T14:45:46Z","snapshot_observed_at":"2026-08-06T14:02:49.634846Z","submitted_at":"2019-03-18T14:45:46Z","title":"Dissecting the NVidia Turing T4 GPU via Microbenchmarking","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1903.07486","snapshot_observed_at":"2026-08-05T16:03:34.362212Z","title":"Dissecting the nvidia turing t4 gpu via microbenchmark- ing,","venue":null,"work_id":null,"year":1903},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T23:09:15.767029Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:34.362212Z"},"links":{"cited_paper":"/paper/1903.07486","citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:072fb4d3c96bf5bf480741ef16cdaca01bbb7fdd4b77da90f5d19bb777778a5e","observation_id":"ddd27145-4aa4-4b4e-bd39-8a1262afe34b","resolution":{"observed_at":"2026-08-05T16:03:34.362212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:03:43.912640Z","title":"Gtco: Graph and tensor co-design for transformer-based image recognition on tensor cores,","venue":null,"work_id":"de9bac7d-1d66-4aac-8557-b6c11c4a2c3d","year":2024},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T23:09:15.767029Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:34.545982Z"},"links":{"citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:fa08c6d20a8b197395e6ca54ac7a78dcc13f48d7ecea0bfe0bfec28b62ba6261","observation_id":"c1cfc1ed-d322-48d7-9a5a-b4352db32e67","resolution":{"observed_at":"2026-08-05T16:03:44.121829Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:03:43.676996Z","title":"Reducing shared memory footprint to leverage high throughput on tensor cores and its flexible api extension library,","venue":null,"work_id":"d0fdfcb3-0b0e-44be-901f-d6e8bcdad543","year":2023},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T23:09:15.767029Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:34.626516Z"},"links":{"citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:4ea29759ef46258ce77fd77c5c51ecbd6208b82304f8d98d6a434e449d455fd1","observation_id":"10a85451-0f7f-44a6-b720-0855114b9c2a","resolution":{"observed_at":"2026-08-05T16:03:43.817709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:03:43.406316Z","title":"Tc-gnn: Bridging sparse gnn computation and dense tensor cores on gpus,","venue":null,"work_id":"ea3084ba-f683-4b54-91c9-b0a224be9479","year":2023},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T23:09:15.767029Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:34.781504Z"},"links":{"citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:3bf0784b8129b2fda806473b46f5268a12fc1c6927d6733708784bf0ee22dd45","observation_id":"d3ba3b1d-64d2-4aac-80b0-1c17207ef002","resolution":{"observed_at":"2026-08-05T16:03:43.542363Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14294","last_updated":"2024-07-19T04:47:36Z","snapshot_observed_at":"2026-07-06T18:03:47.096406Z","submitted_at":"2024-04-22T15:53:08Z","title":"A Survey on Efficient Inference for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14294","snapshot_observed_at":"2026-08-05T16:03:34.877201Z","title":"A survey on efficient inference for large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T23:09:15.767029Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:34.877201Z"},"links":{"cited_paper":"/paper/2404.14294","citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:db106e9630d9ba279cafa772e2cba1c140355c9c3c9bf503f2aea1ffb73a9349","observation_id":"bc41d50c-520f-4568-b483-fee0d23a90d6","resolution":{"observed_at":"2026-08-05T16:03:34.877201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13388","last_updated":"2024-03-12T00:32:05Z","snapshot_observed_at":"2026-07-06T17:33:08.817655Z","submitted_at":"2024-02-20T21:34:56Z","title":"Transformer tricks: Precomputing the first layer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13388","snapshot_observed_at":"2026-08-05T16:03:35.015302Z","title":"Transformer tricks: Precomputing the first layer,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T23:09:15.767029Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:35.015302Z"},"links":{"cited_paper":"/paper/2402.13388","citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:7fd7183ce1fb41d6882b11d31b700518b760645a8373dcee0cf3ea9633782c39","observation_id":"936e10d2-b8f9-432d-b9d3-406727c0d6b3","resolution":{"observed_at":"2026-08-05T16:03:35.015302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01801","last_updated":"2024-10-29T18:26:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-03T05:17:08Z","title":"Model Tells You What to Discard: Adaptive KV Cache Compression for LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01801","snapshot_observed_at":"2026-08-05T16:03:35.155547Z","title":"Model tells you what to discard: Adaptive kv cache compression for llms,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T23:09:15.767029Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:35.155547Z"},"links":{"cited_paper":"/paper/2310.01801","citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:cf9d58b9b60e4971a360706e5ea27b2e2f1d8d5256d6f1414aac4635077a154d","observation_id":"20028b8c-8e9b-4be8-9aad-7f086a53eca0","resolution":{"observed_at":"2026-08-05T16:03:35.155547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:03:43.145616Z","title":"Efficiently scaling transformer inference,","venue":null,"work_id":"776d6edb-5594-49ed-bd40-53f6821feeb8","year":2023},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T23:09:15.767029Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:35.276363Z"},"links":{"citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:a526290f9f0619c96afc8d8ee74bdbcfaab2b78a89d88f98e5bdf76a812a8b65","observation_id":"0384a01f-6700-410c-b846-6077e1f05f29","resolution":{"observed_at":"2026-08-05T16:03:43.271413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16363","last_updated":"2024-05-01T20:42:28Z","snapshot_observed_at":"2026-08-01T22:52:35.092898Z","submitted_at":"2024-02-26T07:33:05Z","title":"LLM Inference Unveiled: Survey and Roofline Model Insights","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16363","snapshot_observed_at":"2026-08-05T16:03:35.382312Z","title":"Llm inference unveiled: Survey and roofline model insights,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T23:09:15.767029Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:35.382312Z"},"links":{"cited_paper":"/paper/2402.16363","citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:dc556a236f8c0ababf22751f8bcc4135af7986c88d05149634586d34a7008f06","observation_id":"50dbda44-73ad-4c8c-b464-a047058de65d","resolution":{"observed_at":"2026-08-05T16:03:35.382312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:03:42.880222Z","title":"Squeezellm: Dense-and-sparse quantization,","venue":null,"work_id":"22fed89e-9414-47c8-bc80-f6e497307653","year":2024},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T23:09:15.767029Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:35.525034Z"},"links":{"citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:6b7e84911a7651b770727afd730158e4fff5a97874d1476fa448fd3823f0eeea","observation_id":"23f16808-6923-48eb-9bd2-dbfd81312a1f","resolution":{"observed_at":"2026-08-05T16:03:42.979238Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:03:42.613821Z","title":"Quantsr: accurate low-bit quantization for efficient image super-resolution,","venue":null,"work_id":"0526e3f9-4636-4b7f-9075-18a9862c2f15","year":2023},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T23:09:15.767029Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:35.654288Z"},"links":{"citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:74326c74857c5bca54dcdaec21ad111530cf646e97f7b9381c9a7dc93c28cb7d","observation_id":"602f8122-5394-423d-9363-362753a53a0f","resolution":{"observed_at":"2026-08-05T16:03:42.735145Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:03:42.314009Z","title":"Accurate lora-finetuning quantization of llms via infor- mation retention,","venue":null,"work_id":"edb4efe4-ab49-4820-8b3d-d09bbfa40b1e","year":2024},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T23:09:15.767029Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:35.740233Z"},"links":{"citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:051eda60453de299e2c3dd720876bb6dc02f0c69697af048724851b61177941c","observation_id":"8c9c4e4d-e22e-4f6a-a269-72f65297aff9","resolution":{"observed_at":"2026-08-05T16:03:42.456579Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:03:42.022553Z","title":"Bimatting: Efficient video matting via binarization,","venue":null,"work_id":"9321b125-ce60-48fa-90e9-813a566cd36e","year":2023},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T23:09:15.767029Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:35.795656Z"},"links":{"citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:fbfd27436aaea1cde397c86e29d3fe43ebfabfd717c847a000b3ab7b559222ed","observation_id":"aa6adcfe-69e2-4d00-bdd2-aa522c72ac1a","resolution":{"observed_at":"2026-08-05T16:03:42.173545Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:03:41.706454Z","title":"Bibert: Accurate fully binarized bert,","venue":null,"work_id":"0692e35e-c8a5-4b3c-9513-a6a90c02992b","year":2022},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T23:09:15.767029Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:35.926778Z"},"links":{"citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:bf94f98bc34a81b36ce7e6b2cff9040284c6771d84c6ce25df892e66b781be68","observation_id":"dc0e5c26-be37-45c6-a541-59cffa191625","resolution":{"observed_at":"2026-08-05T16:03:41.854183Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:03:41.398739Z","title":"Bebert: Efficient and robust binary ensemble bert,","venue":null,"work_id":"061ddde6-acec-4688-bc4f-6e8cadfcff86","year":2023},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T23:09:15.767029Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:36.063989Z"},"links":{"citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:20e324a5606a77acaddc588343c6ee4380fc88d63b75a43b35ac7695a7b0dc52","observation_id":"6b77b327-62a3-4095-bb3d-bf53d3e02ad0","resolution":{"observed_at":"2026-08-05T16:03:41.556430Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:03:41.183086Z","title":"Anda: Unlocking efficient llm inference with a variable- length grouped activation data format,","venue":null,"work_id":"8c5f037b-c4cc-4501-bd94-e247aabf4b97","year":2025},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T23:09:15.767029Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:36.192211Z"},"links":{"citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:cd22cacb43d7f084161642fa0124cdf54892edd76ed166e13cd1c7fec9e6e65d","observation_id":"febe2237-c4f7-4ba0-bdb7-eb4f062c9e7f","resolution":{"observed_at":"2026-08-05T16:03:41.285241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:03:40.915286Z","title":"Binaryconnect: Training deep neural networks with binary weights during propagations,","venue":null,"work_id":"64bd0c3d-3c09-4325-b12a-e3aa1a8a437a","year":2015},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T23:09:15.767029Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:36.289139Z"},"links":{"citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:09fa9e7af3601d5d9168a175e9306d2ba28a47f10d20568eec97890be0757f87","observation_id":"e934cee2-b33f-4156-9766-e77fc31f79e5","resolution":{"observed_at":"2026-08-05T16:03:41.038528Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:03:40.660270Z","title":"Apnn-tc: Accelerating arbitrary precision neural net- works on ampere gpu tensor cores,","venue":null,"work_id":"641133cd-3129-4ef7-999a-fa8901c9a52e","year":2021},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T23:09:15.767029Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:36.427395Z"},"links":{"citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:bdb5d97d5c1155d13e0e2bb133c2d07af7a39ccc2687ae06fad157868f863899","observation_id":"32badd89-5357-4eb1-bf96-f3abad82b614","resolution":{"observed_at":"2026-08-05T16:03:40.746968Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:03:40.417863Z","title":"O3bnn: An out-of-order architecture for high- performance binarized neural network inference with fine-grained prun- ing,","venue":null,"work_id":"39508b3c-4ead-4b69-b000-ee9653be6953","year":2019},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T23:09:15.767029Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:36.587831Z"},"links":{"citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:4c703c0189d959e901db2439ef2c1dba5b6fb40010de8b99a2e73a2d271241ac","observation_id":"85c7506c-6611-476b-bd56-2eafefebde65","resolution":{"observed_at":"2026-08-05T16:03:40.550324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:03:40.168263Z","title":"O3bnn-r: An out-of-order architecture for high- performance and regularized bnn inference,","venue":null,"work_id":"f3fd10a3-2a1e-40b0-beb6-38cdebd0a684","year":2020},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T23:09:15.767029Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:36.716924Z"},"links":{"citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:00b121e40fc627136d51e82b7374955604cb02569e7f8f3b7f26dd110a5d9e29","observation_id":"2e159bb0-57f2-4c08-8b4a-a89501d8ca9f","resolution":{"observed_at":"2026-08-05T16:03:40.290730Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1510.00149","last_updated":"2016-02-15T06:25:40Z","snapshot_observed_at":"2026-08-04T16:59:47.843960Z","submitted_at":"2015-10-01T09:03:44Z","title":"Deep Compression: Compressing Deep Neural Networks with Pruning, Trained Quantization and Huffman Coding","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1510.00149","snapshot_observed_at":"2026-08-05T16:03:36.820892Z","title":"Deep compression: Compressing deep neural networks with pruning, trained quantization and huffman coding,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T23:09:15.767029Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:36.820892Z"},"links":{"cited_paper":"/paper/1510.00149","citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:aef53186c48ecc9c88001732e3829344e69746c707897d427ff960953d8d56f0","observation_id":"a82f4c78-4e48-4753-9e7d-fca5a7664637","resolution":{"observed_at":"2026-08-05T16:03:36.820892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:03:39.922884Z","title":"Energy-efficient neural network accelerator based on outlier-aware low-precision computation,","venue":null,"work_id":"7cac18ee-d07e-459c-8bae-aa7902197a2e","year":2018},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T23:09:15.767029Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:36.973470Z"},"links":{"citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:e3c1003cfdcd62696abdeb1be0ed9aa9165e52ee1e441db3bc4373d39b7bbffc","observation_id":"d6f7676a-04bf-4c3b-9020-9fc997bb10ac","resolution":{"observed_at":"2026-08-05T16:03:40.054971Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:03:39.744337Z","title":"Haq: Hardware-aware automated quantization with mixed precision,","venue":null,"work_id":"4431fd04-ba72-481f-aa04-abe54f1cd8c9","year":2019},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T23:09:15.767029Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:37.059456Z"},"links":{"citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:d96eee243c679efc89e9b17646b4d4283218108d913c146d266a9b40cd4daccb","observation_id":"beb297e3-6573-4407-8cf0-a383adc8e25b","resolution":{"observed_at":"2026-08-05T16:03:39.822948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:03:39.411740Z","title":"Lq-nets: Learned quantization for highly accurate and compact deep neural networks,","venue":null,"work_id":"7b4252bf-2fff-4668-b237-5a6fabbece38","year":2018},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T23:09:15.767029Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:37.163159Z"},"links":{"citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:74863c51527899dad150ece0314ca1ee0711bcc856f191b23eb982562399e222","observation_id":"2f35f174-06ed-4ec5-90b4-044f816a4ede","resolution":{"observed_at":"2026-08-05T16:03:39.574486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.06160","last_updated":"2018-02-02T01:43:54Z","snapshot_observed_at":"2026-07-06T05:00:35.763958Z","submitted_at":"2016-06-20T15:02:31Z","title":"DoReFa-Net: Training Low Bitwidth Convolutional Neural Networks with Low Bitwidth Gradients","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.06160","snapshot_observed_at":"2026-08-05T16:03:37.317001Z","title":"Dorefa-net: Training low bitwidth convolutional neural networks with low bitwidth gradients,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T23:09:15.767029Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:37.317001Z"},"links":{"cited_paper":"/paper/1606.06160","citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:454941f769a0be3ee090cd9a0982426e7eae6f0655f73f07b5b66cb24c0ccb3a","observation_id":"ed54c9ca-a242-4b44-ad33-9e83c77fd0f8","resolution":{"observed_at":"2026-08-05T16:03:37.317001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11453","last_updated":"2023-10-17T17:59:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-17T17:59:15Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11453","snapshot_observed_at":"2026-08-05T16:03:37.480444Z","title":"Bitnet: Scaling 1-bit transformers for large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T23:09:15.767029Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:37.480444Z"},"links":{"cited_paper":"/paper/2310.11453","citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:7ce2788b22420cf4e222bb194a9f6ed16d65653d2240afbb726714c2aadc568a","observation_id":"64b701fa-203f-4860-86af-cb433ba3e196","resolution":{"observed_at":"2026-08-05T16:03:37.480444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:03:39.202548Z","title":"CUTLASS,","venue":null,"work_id":"4dbfa243-3c2f-46c0-989a-ade59dd67329","year":2023},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T23:09:15.767029Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:37.615424Z"},"links":{"citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:f7c271cadc1a36b4ac95b2f2acfe471c0582a16d20060d1bb47ed88fd48988e4","observation_id":"c4a7e274-a1e0-4630-8f06-594cc0e859fa","resolution":{"observed_at":"2026-08-05T16:03:39.296976Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16954","last_updated":"2024-11-25T21:47:23Z","snapshot_observed_at":"2026-07-06T19:56:57.022021Z","submitted_at":"2024-11-25T21:47:23Z","title":"Understanding GEMM Performance and Energy on NVIDIA Ada Lovelace: A Machine Learning-Based Analytical Approach","version":1},"cited_work":{"arxiv_id":"2411.16954","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.16954","snapshot_observed_at":"2026-08-05T16:03:38.623641Z","title":"Understanding GEMM Performance and Energy on NVIDIA Ada Lovelace: A Machine Learning-Based Analytical Approach","venue":"cs.DC","work_id":"c9afeed8-6303-40f6-9d86-7fb673750811","year":2024},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T23:09:15.767029Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:37.761446Z"},"links":{"cited_paper":"/paper/2411.16954","citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:fce5d8dadd27baf459cafecd01a9fac5506930815e627edac751525273252bba","observation_id":"8b8e1fab-3214-4f98-ab05-99f3338c3ecd","resolution":{"observed_at":"2026-08-05T16:03:38.709223Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:03:44.270389Z","title":"Benchmarking and dissecting the nvidia hopper gpu architecture,","venue":null,"work_id":"426559fa-bb71-4f04-9ae5-810a21011805","year":2024},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T23:09:15.767029Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:37.863736Z"},"links":{"citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:6ed3d24f5a38fa1b00702cb4ee359e465ddf10d7fa84329efcf2e27b990ff885","observation_id":"647c40c9-853c-4d34-83ae-be0dbcf3c981","resolution":{"observed_at":"2026-08-05T16:03:44.427189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-05T16:03:37.961793Z","title":"Qwen2. 5 technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T23:09:15.767029Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:37.961793Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:a1c41d134243134fc7d50800bac3df0ed89717d635f877e6cb8f11d87c82fbe5","observation_id":"218ea8a5-470c-47c8-9151-ce529186440c","resolution":{"observed_at":"2026-08-05T16:03:37.961793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-08-06T03:13:37.403059Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-08-05T16:03:38.057130Z","title":"Opt: Open pre-trained transformer language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T23:09:15.767029Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:38.057130Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:f5635a578159f62b898cb1a2f233c8fbeaa5d54591452fe8f01b503f113e5b04","observation_id":"23525f4e-8c54-465c-9ef4-0e17cad9dccd","resolution":{"observed_at":"2026-08-05T16:03:38.057130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.05100","last_updated":"2023-06-27T09:57:58Z","snapshot_observed_at":"2026-08-04T18:56:03.233715Z","submitted_at":"2022-11-09T18:48:09Z","title":"BLOOM: A 176B-Parameter Open-Access Multilingual Language Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.05100","snapshot_observed_at":"2026-08-05T16:03:38.218549Z","title":"Bloom: A 176b-parameter open-access multilingual language model,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T23:09:15.767029Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:38.218549Z"},"links":{"cited_paper":"/paper/2211.05100","citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:25b227a79313e661bf05c70a76cc1d4f156332fb93a4d3085ece01756ff2b76a","observation_id":"372fa1e2-d486-4352-ad8f-e8c613a2b8e1","resolution":{"observed_at":"2026-08-05T16:03:38.218549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:03:38.985231Z","title":"Quarot: Outlier-free 4-bit inference in rotated llms,","venue":null,"work_id":"c67129d5-c1a5-4913-93e2-873ad1169d8f","year":2024},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T23:09:15.767029Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:38.331692Z"},"links":{"citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:3683c26373b467122d5ba9d606a4016a99be1ce7265f690ec30ded44fe644eb6","observation_id":"831a1e11-38ba-443b-8d03-a72fe0122d8c","resolution":{"observed_at":"2026-08-05T16:03:39.050426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.07843","last_updated":"2016-09-26T04:06:13Z","snapshot_observed_at":"2026-07-06T05:12:10.387914Z","submitted_at":"2016-09-26T04:06:13Z","title":"Pointer Sentinel Mixture Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.07843","snapshot_observed_at":"2026-08-05T16:03:38.453321Z","title":"Pointer sentinel mixture models,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T23:09:15.767029Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:38.453321Z"},"links":{"cited_paper":"/paper/1609.07843","citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:73f6035e61b83203104c373691028d4c9748c47deb52bf9a7708174d95e65e9a","observation_id":"90c16b91-f1f3-4421-860f-f5104b84fcdd","resolution":{"observed_at":"2026-08-05T16:03:38.453321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T23:09:15.767029Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration"},"reference_resolution":{"displayed":69,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":19,"verified_exact":1,"verified_fuzzy":49},"total_outbound_references":69},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 69 of 69 outbound references and 0 inbound Pith citation observations for arXiv:2508.19087."}