{"as_of":"2026-08-14T20:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:89190e6031a12d3e5310632c149b838de72a07e71bd26c57cc49e0601c8b4b3e","coverage":[{"denominator":79,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":79,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-18T00:16:27.497363Z","state":"measured"},{"denominator":81,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":81,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T09:52:39.415504Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-08-12T17:04:39.851863Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.06838","snapshot_observed_at":"2026-08-03T09:52:39.415504Z","title":"P3-llm: An integrated npu-pim accelerator for llm infer- ence using hybrid numerical formats,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.12298","last_updated":"2026-01-18T07:58:23Z","snapshot_observed_at":"2026-08-13T06:26:02.713975Z","submitted_at":"2026-01-18T07:58:23Z","title":"CD-PIM: A High-Bandwidth and Compute-Efficient LPDDR5-Based PIM for Low-Batch LLM Acceleration on Edge-Device","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T09:52:39.415504Z"},"links":{"cited_paper":"/paper/2511.06838","citing_paper":"/paper/2601.12298"},"observation_digest":"sha256:729fbc95b5acb9e677bb9253e3bf4bcffabfabd07242c169e65869c31462b884","observation_id":"6e5d9942-adc4-496a-9eb2-3d3afd6144d7","resolution":{"observed_at":"2026-08-03T09:52:39.415504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-08-12T17:04:39.851863Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.06838","snapshot_observed_at":"2026-07-31T22:36:29.218635Z","title":"P3-llm: An integrated npu-pim accelerator for llm inference using hybrid numerical formats.arXiv preprint arXiv:2511.06838, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24148","last_updated":"2026-07-27T08:29:05Z","snapshot_observed_at":"2026-08-14T02:14:33.077085Z","submitted_at":"2026-07-27T08:29:05Z","title":"A Motion-Aware Vector Quantization Framework with Centroid Reuse for Efficient VLA Inference","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-31T22:36:29.218635Z"},"links":{"cited_paper":"/paper/2511.06838","citing_paper":"/paper/2607.24148"},"observation_digest":"sha256:76d064d476ffe71e90e3121f663571e48a598198852796388d43d96263dda4ef","observation_id":"3c97f8a5-465f-478d-86b0-258194387a0e","resolution":{"observed_at":"2026-07-31T22:36:29.218635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2511.06838/citation-record","integrity":"/paper/2511.06838/integrity","json":"/paper/2511.06838/citation-record.json","paper":"/paper/2511.06838"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"AMD INSTINCT™ MI350X GPU","venue":null,"work_id":"f8b357d5-6efe-4d30-9a4c-e01cf2eab664","year":null},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-08-12T17:04:39.851863Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:29610b5bce74384b4fa9ab00f6a18bf230b6b9afcd84ca48690faf102df85790","observation_id":"91c0cbda-410f-4f64-9607-3dcedc025466","resolution":{"observed_at":"2026-05-18T00:20:33.381545Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"QuaRot: Outlier-Free 4-Bit Inference in Rotated LLMs","venue":null,"work_id":"618c37e2-8bd4-4868-8ac6-6e40b798d0a2","year":2024},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-08-12T17:04:39.851863Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:958354fa9276bfccacac666c1c443c52693d0f0477d86807c033520ff3f87e14","observation_id":"0466a4a0-b073-41c4-90d2-aa0ad4611b80","resolution":{"observed_at":"2026-05-18T00:20:33.385570Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":"2308.12966","doi":"10.48550/arxiv.2308.12966","metadata_source":"pith","pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","venue":"cs.CV","work_id":"cbc2bb21-b6bb-46c0-80bf-107e195ffe10","year":2023},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-08-12T17:04:39.851863Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:ea0b66d5a83f35ae661b70f124b176015a3af1f23e535e51acfd417b8150c3f7","observation_id":"5ffe8591-3f1b-422f-be20-b97d8420901e","resolution":{"observed_at":"2026-05-18T00:20:32.193780Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"LongBench: A Bilingual, Multitask Benchmark for Long Context Understanding","venue":null,"work_id":"a8d18c76-2481-463a-ae4a-1b3876a36b53","year":2024},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-08-12T17:04:39.851863Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:2dd89a53d9ef4bb4c2e0bb46ad5f1ade9d0385b174947d42daa2839fd0111464","observation_id":"c9058645-61af-400b-9d8b-72c2ae33df5f","resolution":{"observed_at":"2026-05-18T00:20:33.388138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"CACTI 7: New tools for interconnect exploration in innovative off-chip memories","venue":null,"work_id":"91e421d1-f6c0-4325-a1fc-fdb26ef1f837","year":2017},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-08-12T17:04:39.851863Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:b8beaed737b85449e07c5dc8818074b3934f402f41686919d3ca7995083f83da","observation_id":"8ca165b9-7a3c-442c-ad7f-7a252ee8e115","resolution":{"observed_at":"2026-05-18T00:20:33.473674Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Language Models are Few-Shot Learners","venue":null,"work_id":"2d64e5ff-f6b8-4d6b-a84e-ff2e2b8e245b","year":2020},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-08-12T17:04:39.851863Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:22416fc7b1ec6caf32e8dbff560b403338dcb8227aa667f2bc79ed52b0d72081","observation_id":"86fd75e1-3aa8-4d7a-be30-4c2a9b166c8f","resolution":{"observed_at":"2026-05-18T00:20:33.358350Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"BitMoD: Bit-serial Mixture-of- Datatype LLM Acceleration","venue":null,"work_id":"557ec5d1-c816-4507-baff-53389de911a1","year":2025},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-08-12T17:04:39.851863Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:55e80060df9d944148210506d9a5383c7af359cdb473141113f5106be2871d24","observation_id":"94742906-3c9b-4726-92fd-5aafa83d2ef5","resolution":{"observed_at":"2026-05-18T00:20:33.501615Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ecco: Improving Memory Band- width and Capacity for LLMs via Entropy-Aware Cache Compression","venue":null,"work_id":"74e1f8c3-faf4-439a-99a8-db72ae9d44fd","year":2025},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-08-12T17:04:39.851863Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:51b839fe84e1ed4c26dc1cd566493b65ced203cf7d6974728b80b0c4ac5d59f0","observation_id":"3bfbabd8-5e52-45fe-956a-2cf4d8fd5442","resolution":{"observed_at":"2026-05-18T00:20:33.476680Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-08-14T19:36:07.505691Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":"1803.05457","doi":"10.1162/tacl_a_00448.https://aclanthology.org/2022.tacl-1.5","metadata_source":"pith","pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","venue":"cs.AI","work_id":"28ea1282-d657-4c61-a83c-f1249be6d6b1","year":2018},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-08-12T17:04:39.851863Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:6be117cb9d45dab736ba45cdd19011238ecfd083746fde8d513fbe2574160f7d","observation_id":"5b80588a-b746-4f55-9cb6-9fa6eb4302f7","resolution":{"observed_at":"2026-05-18T00:20:32.226910Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"DeepSeek R1","venue":null,"work_id":"39eb3f41-d99a-4c78-8d1a-3920c7f3e087","year":null},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-08-12T17:04:39.851863Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:f1b9e8821b11a40435d2a6822e7069ae7325871b14e63e436b2a95fa79ec761a","observation_id":"0a46fa4d-337c-4a22-a73d-0f95d19bc213","resolution":{"observed_at":"2026-05-18T00:20:33.351770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.07339","last_updated":"2022-11-10T18:14:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-08-15T17:08:50Z","title":"LLM.int8(): 8-bit Matrix Multiplication for Transformers at Scale","version":2},"cited_work":{"arxiv_id":"2208.07339","doi":"10.18653/v1/2020.findings-emnlp.314","metadata_source":"pith","pith_arxiv_id":"2208.07339","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLM.int8(): 8-bit Matrix Multiplication for Transformers at Scale","venue":"cs.LG","work_id":"98201f98-f4e5-4d1c-9ed7-b795e3c8f76c","year":2022},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-08-12T17:04:39.851863Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"cited_paper":"/paper/2208.07339","citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:ff438eef14863baa8f9527ee97326d507debfb926a470b2ed403d35c435d6c66","observation_id":"7ce4bcba-230c-4174-a0e2-6326a867e548","resolution":{"observed_at":"2026-05-18T00:20:32.221843Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The true Processing In Memory accelerator","venue":null,"work_id":"49a6cdab-3408-4e35-93c3-13bb4dd3cf07","year":2019},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-08-12T17:04:39.851863Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:45d05b7ebd022e9dda0d9db14828a13c5965e11f12945a298c4c92595cb63202","observation_id":"d89f3c01-9891-409b-ae6c-ab27d4be13f7","resolution":{"observed_at":"2026-05-18T00:20:33.344619Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Documenting large webtext corpora: A case study on the colossal clean crawled corpus","venue":null,"work_id":"2208e3af-80a8-412d-ac7d-51a2698658d3","year":2021},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-08-12T17:04:39.851863Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:f3d53613686f3a8e480f2b0b8e4b32e47535731f6440c24140bfe33bfe2a91d4","observation_id":"0aa2b922-6b06-47ce-a15c-99b451485171","resolution":{"observed_at":"2026-05-18T00:20:33.349072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning from Students: Applying t-Distributions to Explore Accurate and Efficient Formats for LLMs","venue":null,"work_id":"7d9049f4-8f43-4236-8dbc-25eb3f479e92","year":2024},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-08-12T17:04:39.851863Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:62610f4fe718741ca8e123624ca908c77633f8c540eb276042993f9a8be07a64","observation_id":"4d617caa-5ed4-4368-a3c5-f0e4732d6285","resolution":{"observed_at":"2026-05-18T00:20:33.342113Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Anda: Unlocking Efficient LLM Inference with a Variable-Length Grouped Activation Data Format","venue":null,"work_id":"c053ab65-1592-4413-92d9-119751af37cd","year":2025},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-08-12T17:04:39.851863Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:11c9324077f5ae5194341e18bf78f5115826bc26c786c6fda2c500a8378e5e8d","observation_id":"92c72bcc-f4ed-4cf7-82c9-048c642bef3b","resolution":{"observed_at":"2026-05-18T00:20:33.433912Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"GPTQ: Accurate Post-training Compression for Generative Pretrained Transformers","venue":null,"work_id":"52a36ff0-8528-4b5c-9094-ab43fdf255d5","year":2023},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-08-12T17:04:39.851863Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:ce487ae89c9f408d88d8b473f9b13b14d099be4c7416ec37d51450b0240070e0","observation_id":"fd0a485e-3ccd-4422-9514-ede7d9e78e35","resolution":{"observed_at":"2026-05-18T00:20:33.338936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00027","last_updated":"2020-12-31T19:00:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-12-31T19:00:10Z","title":"The Pile: An 800GB Dataset of Diverse Text for Language Modeling","version":1},"cited_work":{"arxiv_id":"2101.00027","doi":"10.1117/1.jmi.10.6.061104","metadata_source":"pith","pith_arxiv_id":"2101.00027","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The Pile: An 800GB Dataset of Diverse Text for Language Modeling","venue":"cs.CL","work_id":"9b10667a-da61-4358-aceb-10578234d45d","year":2020},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-08-12T17:04:39.851863Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"cited_paper":"/paper/2101.00027","citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:daccb0075c395b5842a9ab33075d8a9cb4ec804ebef130a9e5e9b7ba2ed605ba","observation_id":"fe1e1bfc-e012-415b-a232-62872a374461","resolution":{"observed_at":"2026-05-18T00:20:32.232926Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"records/1260860","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T14:47:14.558044Z","title":"He, B., Yin, L., Zhen, H.-L., Liu, S., Wu, H., Zhang, X., Yuan, M., and Ma, C","venue":null,"work_id":"e7e9d443-273d-4722-8ec7-59adb893de0e","year":2024},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-08-12T17:04:39.851863Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:aa6812130d570695a4bf4a2844b3babf3081370d5f0df49f6c0138b114d8d519","observation_id":"a7d3720c-d2c1-4338-80dc-2e0477ee3806","resolution":{"observed_at":"2026-05-18T00:20:32.211612Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Energy Cost Modelling for Optimizing Large Language Model Inference on Hardware Accelerators","venue":null,"work_id":"b89cd754-85e3-4ed3-bbe7-2ee96d53e48d","year":2024},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-08-12T17:04:39.851863Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:59410f1336f8e6198f861511a86c75dfad192063ac611719c41dfbd32f1bf594","observation_id":"730c8e44-014a-4199-bf83-7497416de775","resolution":{"observed_at":"2026-05-18T00:20:33.391034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"OliVe: Accelerating Large Language Models via Hardware-friendly Outlier-Victim Pair Quantization","venue":null,"work_id":"f0a3a08a-e258-4e1d-a0ef-7e41a0af9ed3","year":2023},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-08-12T17:04:39.851863Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:7b065b9af71ce0269c89974d26a610f19de74f336681554d7bd08989d9b1cc92","observation_id":"b3e9ca14-f00a-4855-871a-65d16eeecdcd","resolution":{"observed_at":"2026-05-18T00:20:33.403649Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ANT: Exploiting Adaptive Numerical Data Type for Low-bit Deep Neural Network Quantization","venue":null,"work_id":"e6577c0a-86f1-4c2f-9738-e9a095b3c4df","year":2022},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-08-12T17:04:39.851863Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:91c937b87f6a1746835934cf8db9bac675018c6d2e805ac0f0b72f0f0c135ca0","observation_id":"a301124c-f97e-48c7-bce5-84946469ebf0","resolution":{"observed_at":"2026-05-18T00:20:33.555058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Newton: A DRAM-maker’s Accelerator-in- Memory (AiM) Architecture for Machine Learning","venue":null,"work_id":"29461282-729f-45ac-8411-9a61a9a50e51","year":2020},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-08-12T17:04:39.851863Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:e1b1494a9b5335846a68aa77450206097c3d68148565e62f59881b80d3a47272","observation_id":"f4ae97eb-9a0a-448a-a701-865a7cfd32ab","resolution":{"observed_at":"2026-05-18T00:20:33.557822Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"LP-Spec: Leveraging LPDDR PIM for Efficient LLM Mobile Speculative Inference with Architecture- Dataflow Co-Optimization","venue":null,"work_id":"b81abb32-6018-48b7-aa7f-898813351a9d","year":2025},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-08-12T17:04:39.851863Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:70012779b07896bce3ab777966297cae55d72080df2b04656320441df9f0fb8f","observation_id":"4258aa8e-5cc0-4a2e-89a0-78261b683fac","resolution":{"observed_at":"2026-05-18T00:20:33.562943Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.52202/068431-1349","metadata_source":"crossref","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"How Would the Viewer Feel? Estimating Wellbeing from Video Scenarios","venue":"Advances in Neural Information Processing Systems 35","work_id":"05596c6d-8f18-44cf-b887-1077e7ca1ad3","year":2022},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-08-12T17:04:39.851863Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:b84048e955eaf3e7b01b5f08f405333d88a8eb9fab19536255b8cc3dc62fdd90","observation_id":"7636e3b1-8978-4041-a7ac-96c90721699b","resolution":{"observed_at":"2026-05-18T00:20:33.547004Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"NeuPIMs: NPU-PIM Heterogeneous Acceleration for Batched LLM Inferencing","venue":null,"work_id":"b1e8d98b-385e-426c-98aa-ba97c74f5d6e","year":2024},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-08-12T17:04:39.851863Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:a1dc8ff4a1f39be409ab9c9bb95016222dacc93e974a6970558367db033beec6","observation_id":"223b3dd1-693a-4b74-bb2a-7b2810876f34","resolution":{"observed_at":"2026-05-18T00:20:33.549665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","venue":null,"work_id":"e945eda3-fb23-4cc0-869a-3feb7695244b","year":2024},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-08-12T17:04:39.851863Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:f205921249467403199d731f3a3972295ffa7fece427ef72d9787b41f095691b","observation_id":"ec386510-1f74-4678-8581-679a8b1da606","resolution":{"observed_at":"2026-05-18T00:20:33.565565Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"M-ANT: Efficient Low-bit Group Quantization 13 for LLMs via Mathematically Adaptive Numerical Type","venue":null,"work_id":"4ff8e270-cbf4-43ca-aade-3fdeaf988e6e","year":2025},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-08-12T17:04:39.851863Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:d02a52f74542c53ae1f57e182cc8f53bfe635be26accf7b026850293f5916034","observation_id":"b18f5743-db24-4491-acf6-16b565ecb9f0","resolution":{"observed_at":"2026-05-18T00:20:33.537830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"PLAIN: Leveraging High Internal Bandwidth in PIM for Accelerating Large Language Model Inference via Mixed-Precision Quantization","venue":null,"work_id":"f422fe14-9cd9-46db-8902-e34b77a9e1ab","year":2025},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-08-12T17:04:39.851863Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:2eecfe8a91832b9098fb953d9782889b86647b9f3882631ea549d8cf547ab8dc","observation_id":"80654548-de0e-471d-8be6-49fe29b618bc","resolution":{"observed_at":"2026-05-18T00:20:33.543646Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"FIGNA: Integer unit-based accelerator design for fp-int gemm preserving numerical accuracy","venue":null,"work_id":"7c7b7351-13c5-44f3-8c6b-8cb819060499","year":2024},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-08-12T17:04:39.851863Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:5217cf85dd29501887bbf6732178d6a62c17428ed06d11a66a17c5f852bef3ac","observation_id":"51813f2e-16d3-4639-ac90-41c9a433f04b","resolution":{"observed_at":"2026-05-18T00:20:33.531034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"BlockDialect: Block-wise Fine-grained Mixed Format Quantization for Energy-Efficient LLM Inference","venue":null,"work_id":"cc57d9cd-c73c-4709-98e1-ba2f9edfcae2","year":2025},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-08-12T17:04:39.851863Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:1a6f4ebdf395639d18f6afa41d32c463d6e5aee5023b53d489dfb741d5ca3c19","observation_id":"4d924579-6091-423b-b186-3eb49ad1d2e8","resolution":{"observed_at":"2026-05-18T00:20:33.533641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"High Bandwidth Memory DRAM","venue":null,"work_id":"606681c9-785d-414b-b1ea-1e5abd03abc8","year":2021},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-08-12T17:04:39.851863Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:196114f9348c32dd084b21dc588b44143d8c43da518dd86863fb50241f279163","observation_id":"da94f300-dd5a-4261-a94a-4a3b8d313b0b","resolution":{"observed_at":"2026-05-18T00:20:33.525525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"High Bandwidth Memory (HBM3) DRAM","venue":null,"work_id":"bbba0016-b1be-4625-99f6-ca0b1ea4a0af","year":2025},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-08-12T17:04:39.851863Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:0f89cbe572b26a8a17a25195cea4a363642742a65f9d88f4023e8ea5eb99fd8c","observation_id":"2529d643-ad30-41e9-8c70-a908eea353ea","resolution":{"observed_at":"2026-05-18T00:20:33.516901Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"High Bandwidth Memory (HBM4) DRAM","venue":null,"work_id":"e3b2e1e8-3b86-4820-b6bf-ebf38047fa7f","year":2025},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-08-12T17:04:39.851863Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:7ec8d5a2a01202292eb6ac1556b2f8e4208a4bf88c5dc4b9d8c3dfb5d5bcbf88","observation_id":"b29bf160-1749-4b53-921e-7d66abece790","resolution":{"observed_at":"2026-05-18T00:20:33.519297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":"2310.06825","doi":"10.48550/arxiv.2310.06825","metadata_source":"pith","pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mistral 7B","venue":"cs.CL","work_id":"eb5e1305-ad11-4875-ad8d-ad8b8f697599","year":2023},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-08-12T17:04:39.851863Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:1292f7bfff541d7e6f006237de685c89f8fbc61568eefd51f65726259d15f790","observation_id":"3200a273-e128-414a-9922-878b8eddc9a0","resolution":{"observed_at":"2026-05-18T00:20:32.203892Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-10T22:08:12.954417+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-10T22:08:12.954417+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ten Lessons From Three Generations Shaped Google’s TPUv4i: Industrial Product","venue":null,"work_id":"0eea97d0-5631-4188-8fa9-7526406c9d22","year":2021},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-08-12T17:04:39.851863Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:c51fe0dc71f6bed1677882928ed8a1c7b96e02379d72e0e9bf3a177c6310056f","observation_id":"57c2c5a6-3de8-43ed-80b8-51209280a230","resolution":{"observed_at":"2026-05-18T00:20:33.510404Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"SK Hynix AI-Specific Computing Memory Solution: From AiM Device to Heterogeneous AiMX-xPU System for Comprehensive LLM Inference","venue":null,"work_id":"baf1229a-738c-4832-a469-be1ceb73ffb2","year":2024},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-08-12T17:04:39.851863Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:6064221eeb705b8973110e29633d67a650f469b2dbbbe173bce669c6d9b96033","observation_id":"18815ced-57ba-4c65-9637-f4cad0e07032","resolution":{"observed_at":"2026-05-18T00:20:33.512917Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Samsung PIM/PNM for Transfmer Based AI : Energy Efficiency on PIM/PNM Cluster","venue":null,"work_id":"68924669-fab8-468c-96c0-139a8b2d859d","year":2023},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-08-12T17:04:39.851863Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:669db77392a214241be7475db3b55e37f0ce589ae9182f829cc27a326258066e","observation_id":"98a5828b-bcab-47f5-b38c-8744fa088213","resolution":{"observed_at":"2026-05-18T00:20:33.521864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Oaken: Fast and Efficient LLM Serving with Online-Offline Hybrid KV Cache Quantization","venue":null,"work_id":"0a4b72fe-9917-4569-81da-35e7e99a1f89","year":2025},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-08-12T17:04:39.851863Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:df00d3445f3904dcbc8d993610ab91567b89b3dc07fb66d7f5a0b42680ddcde1","observation_id":"4119634a-03db-4c84-8e7c-bf3219ed4ba0","resolution":{"observed_at":"2026-05-18T00:20:33.540602Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pimba: A Processing- in-Memory Acceleration for Post-Transformer Large Language Model Serving","venue":null,"work_id":"8450649a-e7ec-4775-b543-4c85f2f0763a","year":2025},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-08-12T17:04:39.851863Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:9f42824e077292686adab6edc9126792f84169f95c1ad9347e32dd210cbe5729","observation_id":"13268a75-31ce-41c5-afb3-3b5db08816e7","resolution":{"observed_at":"2026-05-18T00:20:33.560520Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tender: Accelerating Large Language Mod- els via Tensor Decomposition and Runtime Requantization","venue":null,"work_id":"85695d3d-74a6-4813-834c-6c382437b898","year":2024},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-08-12T17:04:39.851863Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:5cdba090d74b81ab5026582af1d6d2e90f71a27bcdd2a5e281b388d6507554ae","observation_id":"4bed79c1-8e12-4a1a-9097-fb40f4493735","resolution":{"observed_at":"2026-05-18T00:20:33.495865Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"MX+: Pushing the Limits of Microscaling Formats for Efficient Large Language Model Serving","venue":null,"work_id":"98dfb53f-a41f-4227-b739-b9bee6593908","year":2025},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-08-12T17:04:39.851863Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:a536f1e7244659506148d8192ed956d9481a4013e58a310043e99da93ef5ddc4","observation_id":"2d268b78-fc49-4542-b8da-6d5404da4f2d","resolution":{"observed_at":"2026-05-18T00:20:33.505237Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A 1ynm 1.25V 8Gb 16Gb/s/Pin GDDR6- Based Accelerator-in-Memory Supporting 1TFLOPS MAC Operation and Various Activation Functions for Deep Learning Application","venue":null,"work_id":"d6cc8505-db8d-4210-9df0-4bbabf13052a","year":2023},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-08-12T17:04:39.851863Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:2f6335a631339ec0b1a36f22503b630e4df8c2be94f4b2f539393d21b6b6d72b","observation_id":"cfe3a37d-6b99-4a4b-9a51-624b39404277","resolution":{"observed_at":"2026-05-18T00:20:33.491616Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hardware Architecture and Software Stack for PIM Based on Commercial DRAM Technology: Industrial Product","venue":null,"work_id":"2b1b2bdb-c8b8-46a2-8013-059c34203ecf","year":2021},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-08-12T17:04:39.851863Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:43c82f00593d71ca5b8b48fcb7a6ca65bb5a530927c73c184d3c4535e66d2530","observation_id":"86221d5b-e162-42e8-ab32-738c4119ca63","resolution":{"observed_at":"2026-05-18T00:20:33.486287Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"H2-LLM: Hardware-Dataflow Co-Exploration for Heterogeneous Hybrid-Bonding-based Low-Batch LLM Inference","venue":null,"work_id":"9c881444-2b6e-4aa2-b24a-63e60a15872c","year":2025},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-08-12T17:04:39.851863Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:492175172fd3b26de7b3b4e9ae78306410d5c09a08e39109b0eac61c37e67f23","observation_id":"910caeb7-a98b-4182-a0ef-9451d363122b","resolution":{"observed_at":"2026-05-18T00:20:33.488924Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ORCHES: Orchestrated Test-Time- Compute-based LLM Reasoning on Collaborative GPU-PIM HEteroge- neous System","venue":null,"work_id":"81157be2-edfb-40de-8b2c-b8e736491d6d","year":2025},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-08-12T17:04:39.851863Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:ce628731b95577caeb36db4f9d6f36a51878a875218095c82ff5649836271d89","observation_id":"f029eb9a-5252-4338-bc54-5c292db6e0fe","resolution":{"observed_at":"2026-05-18T00:20:33.507758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"AWQ: Activation-aware Weight Quan- tization for LLM Compression and Acceleration","venue":null,"work_id":"a092739b-df90-4f08-acb7-802b4d947c00","year":2024},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-08-12T17:04:39.851863Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:3f3a52ccf7ef91aaf6b36073ff9da5155b8e213c84e66777d8ef47dada11ed4a","observation_id":"a7c7dd20-0c88-4026-adb0-4a3e17011c33","resolution":{"observed_at":"2026-05-18T00:20:33.483421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"QServe: W4A8KV4 Quantization and System Co-design for Efficient LLM Serving","venue":null,"work_id":"33f54e8e-3a99-4037-84be-89d260d77b79","year":2025},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-08-12T17:04:39.851863Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:12bc82d8a3b8da6ddc3e77d464a2a5fae012e15148e2ac6f553569cede75708f","observation_id":"7eb3f5a8-fed2-4360-b683-6b1fbe435314","resolution":{"observed_at":"2026-05-18T00:20:33.463754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"SPARK: Scalable and Precision-Aware Acceleration of Neural Networks via Ef- ficient Encoding","venue":null,"work_id":"deb0bf5f-6d10-4f2c-abc9-40170f9e1e1f","year":2024},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-08-12T17:04:39.851863Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:e13759323db193b28e5702b0f4811bf672c8411dadcf451f8b90a9b41b484865","observation_id":"d00ef8dd-72a6-4f6e-aa24-477d713a4d0a","resolution":{"observed_at":"2026-05-18T00:20:33.467168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"KIVI: A Tuning-Free Asymmetric 2bit Quantization for KV Cache","venue":null,"work_id":"15d3c6a4-df66-4df7-ba9c-96731fc7e22b","year":2024},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-08-12T17:04:39.851863Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:6c7d63f88a843cb33cf059ab61a8c5ae22980657b67fdf608142f9b7fd486f55","observation_id":"4b9b8b7c-91c6-44dc-a0c2-0e6b37189d8c","resolution":{"observed_at":"2026-05-18T00:20:33.470279Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ramulator 2.0: A Modern, Modular, and Extensible DRAM Simulator","venue":null,"work_id":"eea7a6d2-2f9d-4fcc-80b5-bcfbb1efc269","year":2023},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-08-12T17:04:39.851863Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:c4ffda7e1f5292f03a08224f562ac2c508711ab088626d2e2bd394cd6405d83a","observation_id":"370a2073-acda-4e41-a9a1-f4bbd43360f2","resolution":{"observed_at":"2026-05-18T00:20:33.479541Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pointer sentinel mixture models","venue":null,"work_id":"4a8c0ec2-0aa7-433f-bedf-fae1cd536378","year":2017},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-08-12T17:04:39.851863Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:5eca2a5306f4b1891f4e597a428ceebd18a6472934a3a99ee2ea9405f10b34cb","observation_id":"f560dd81-1e11-4663-be9e-d10ed09d5862","resolution":{"observed_at":"2026-05-18T00:20:33.498845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Introducing Llama 3.1: Our most capable models to date","venue":null,"work_id":"4612e6e9-f284-4124-a126-d863daa5c963","year":null},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-08-12T17:04:39.851863Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:24b148bf0c4c2554d31f6016a4908f8cb55798310b9b9ff46c4d09ed51ece119","observation_id":"04b1a893-0387-4d43-9ed3-4cbe65cf78bd","resolution":{"observed_at":"2026-05-18T00:20:33.452529Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Llama-3.2-90B-Vision-Instruct","venue":null,"work_id":"43cfdbf5-214c-46b2-83ca-600fe3d430ac","year":null},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-08-12T17:04:39.851863Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:736efa00713262dd152d0fabe717f8c8f93ca21522cae20cbbd071fc18b0f721","observation_id":"5b87c798-2369-44d1-8b9a-d1c7a15dd751","resolution":{"observed_at":"2026-05-18T00:20:33.458550Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Llama 3.2: Revolutionizing edge AI and vision with open, customizable models","venue":null,"work_id":"2d8664f6-63c4-4d12-bcd8-2d12202c6720","year":2024},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-08-12T17:04:39.851863Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:b2193b328d8b93322e46993eda5baf9eda90d0512fc38efab5e6974382c54439","observation_id":"b2b80751-7dd5-49d2-8f89-c2600d8ab179","resolution":{"observed_at":"2026-05-18T00:20:33.448130Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Meta Llama 2","venue":null,"work_id":"f9e7d852-f149-46a7-9325-bfad0d983083","year":null},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-08-12T17:04:39.851863Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:5561349da0768c8620565d6ba6fc4643e3c805c2476e8a5e7d2fbcda9b220ab9","observation_id":"e16d8a53-e957-4f1f-8ae8-234a62a67c34","resolution":{"observed_at":"2026-05-18T00:20:33.455706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The Llama 4 herd: The beginning of a new era of natively multimodal AI innovation","venue":null,"work_id":"4f5a009a-b2e6-42d2-b412-0c7f57cdeb95","year":null},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-08-12T17:04:39.851863Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:c0535af8bc0cdfb3db4541f9bd2cd2e6e06252305dffc01069b5bc98096706a4","observation_id":"474e1aa6-4ec8-40a1-b4fe-a129476d8109","resolution":{"observed_at":"2026-05-18T00:20:33.528443Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.05433","last_updated":"2022-09-29T20:47:07Z","snapshot_observed_at":"2026-08-14T05:39:52.416140Z","submitted_at":"2022-09-12T17:39:55Z","title":"FP8 Formats for Deep Learning","version":2},"cited_work":{"arxiv_id":"2209.05433","doi":"10.48550/arxiv.2209.05433","metadata_source":"pith","pith_arxiv_id":"2209.05433","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FP8 Formats for Deep Learning","venue":"cs.LG","work_id":"c7217bc9-e53d-40c5-a437-25a74abc36cd","year":2022},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-08-12T17:04:39.851863Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"cited_paper":"/paper/2209.05433","citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:f68c3e19b13f6f3e502108e41c19d961e656dafa5ccb9768803bd599acd71a08","observation_id":"bb3509a2-068d-4a9b-b2d5-f5c029e1ec85","resolution":{"observed_at":"2026-05-18T00:20:32.216570Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:35.618396+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:35.618396+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Introducing NVFP4 for Efficient and Accurate Low-Precision Inference","venue":null,"work_id":"51e5d2a7-da5f-4960-a5d4-84358cd1fbdb","year":null},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-08-12T17:04:39.851863Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:ac5e0f88f8ee1827b21cfa14bb5d53328261fc7600072139d0bac7f7f40cad24","observation_id":"5093e4e9-adfc-4cd1-828d-101a3284c8da","resolution":{"observed_at":"2026-05-18T00:20:33.437286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"NVIDIA Blackwell GPU Architecture","venue":null,"work_id":"9a510f83-c1ae-4dd8-a55c-df8f9ba50836","year":null},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-08-12T17:04:39.851863Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:22deb7d9f827183f862ebb5b5ab825f23a56502d82e466e178d71fd9810b8c16","observation_id":"c1b5315e-0c17-41a2-9933-d09ccb181804","resolution":{"observed_at":"2026-05-18T00:20:33.441718Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Openai o3-mini","venue":null,"work_id":"092cc02e-7806-4c94-9e70-8b0c45c167f6","year":null},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-08-12T17:04:39.851863Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:a264d8786a28b146e86cac4256645d44476ec9049c263c2dadb6495173d4b0b8","observation_id":"ac45eb04-401d-49ec-99e3-160476b0c899","resolution":{"observed_at":"2026-05-18T00:20:33.429274Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gsm8k dataset","venue":null,"work_id":"4bb0b0f0-35ce-439e-a76f-222dbe8f766f","year":null},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-08-12T17:04:39.851863Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:c3c1d889faa8a6f19d62bcedd888a6a9230636a0e171e99438ab49b28ae4c068","observation_id":"93764bbe-b56a-4fb8-91c1-507055548e46","resolution":{"observed_at":"2026-05-18T00:20:33.426603Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"FIGLUT: An Energy-Efficient Accelerator Design for FP-INT GEMM Using Look-Up Tables","venue":null,"work_id":"24e06716-9535-4e4d-b274-98670c043db0","year":2025},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-08-12T17:04:39.851863Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:75a1cb385f63f8fef1c76af8e6581e0573373c497eb671077bb3a6fada25eb2e","observation_id":"ec768789-ed4b-46d9-b381-57899850a37f","resolution":{"observed_at":"2026-05-18T00:20:33.393649Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"AttAcc! Unleashing the Power of PIM for Batched Transformer- based Generative Model Inference","venue":null,"work_id":"4586b3f9-523b-4c08-b6af-ba9ec733b4bd","year":2024},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-08-12T17:04:39.851863Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:77daddec826174eb4c43eaac7f1142d2fe53c193e93e960fdbacad9b34517e3a","observation_id":"93f03422-2c83-4024-b65d-1f3bfbff073f","resolution":{"observed_at":"2026-05-18T00:20:33.444850Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"MicroScopiQ: Ac- celerating Foundational Models through Outlier-Aware Microscaling Quantization","venue":null,"work_id":"53168261-8aca-4366-886c-17b724462db1","year":2025},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-08-12T17:04:39.851863Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:965c2c6d3733f8a00852f98105695c840ff890cd3261ba29bd5a8c970ba78af5","observation_id":"913f3582-5df7-48b6-83e0-a79860ba73bc","resolution":{"observed_at":"2026-05-18T00:20:33.354666Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"With Shared Microexponents, A Little Shifting Goes a Long Way","venue":null,"work_id":"141f2004-9ca4-4a19-af02-7c85f5dc41e2","year":2023},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-08-12T17:04:39.851863Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:75fc844b7c1c4502db6180684a9933b531351d6b6dfe6b1ff9d4e3e4861be013","observation_id":"82a7c380-c6ea-4179-8f22-dd0fa2eceba7","resolution":{"observed_at":"2026-05-18T00:20:33.421658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"IANUS: Integrated Accelerator based on NPU-PIM Unified Memory System","venue":null,"work_id":"142272af-04dc-4fa8-a2dd-b6b68aa8bd00","year":2024},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-08-12T17:04:39.851863Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:797732b5f9387342efa5f9d7fbe5d94220577dc85fda3e213f00b34e033260e8","observation_id":"bf252da6-c9db-4ab1-a5d5-5bf9851bd74e","resolution":{"observed_at":"2026-05-18T00:20:33.424042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"OmniQuant: Omnidirectionally Calibrated Quantization for Large Language Models","venue":null,"work_id":"60897690-93d6-4073-a9eb-133f55dc3f18","year":2024},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-08-12T17:04:39.851863Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:057090c9d571eba2c340e1114a100e44d27078c47aed9d3ec6c5fafd1b9824c5","observation_id":"bbb88c1a-9395-482d-8aad-0a3394ea7e9c","resolution":{"observed_at":"2026-05-18T00:20:33.418893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"RoFormer: Enhanced Transformer with Rotary Position Embedding","venue":null,"work_id":"e10abbac-ace9-4966-a035-c8b123cb32ff","year":2024},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-08-12T17:04:39.851863Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:baefc03cce8ca0218255d5b511a6fa5440876edf2ed2f941253cbc0ac99ebdd3","observation_id":"dfc59e7d-6eae-497f-9578-b4905e295fd1","resolution":{"observed_at":"2026-05-18T00:20:33.361607Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":"2302.13971","doi":"10.48550/arxiv.2302.13971","metadata_source":"pith","pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaMA: Open and Efficient Foundation Language Models","venue":"cs.CL","work_id":"c018fc23-6f3f-4035-9d02-28a2173b2b9d","year":2023},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-08-12T17:04:39.851863Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:ed808433ac3712d0b90bbbed223e67e5261e508a26a66446a425ab795d49a6d0","observation_id":"461f9047-e068-43af-98fe-113a9a93a2bf","resolution":{"observed_at":"2026-05-18T00:20:32.170271Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:17.350515+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:17.350515+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.17951","last_updated":"2023-06-15T08:14:02Z","snapshot_observed_at":"2026-08-13T12:12:37.645920Z","submitted_at":"2023-03-31T10:29:17Z","title":"FP8 versus INT8 for efficient deep learning inference","version":2},"cited_work":{"arxiv_id":"2303.17951","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2303.17951","snapshot_observed_at":"2026-07-02T02:06:26.126499Z","title":"van Baalen, A","venue":null,"work_id":"c1042045-61e3-424f-89ce-fae064220f68","year":2023},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-08-12T17:04:39.851863Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"cited_paper":"/paper/2303.17951","citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:509dc515576dca5d99858fcbc802b7529b7919edd69215c975f286ceaad50ccb","observation_id":"a0879e73-781c-4dcd-a536-8001cd9782b6","resolution":{"observed_at":"2026-05-18T00:20:32.176875Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09782","last_updated":"2023-07-20T18:47:20Z","snapshot_observed_at":"2026-08-14T10:12:16.498090Z","submitted_at":"2023-07-19T06:58:03Z","title":"ZeroQuant-FP: A Leap Forward in LLMs Post-Training W4A8 Quantization Using Floating-Point Formats","version":2},"cited_work":{"arxiv_id":"2307.09782","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2307.09782","snapshot_observed_at":"2026-07-03T04:37:36.371757Z","title":"ZeroQuant-FP: A Leap Forward in LLMs Post-Training W4A8 Quantization Using Floating-Point Formats","venue":null,"work_id":"1c9e9bbd-5ff2-40e0-a4e0-1e34f93c7895","year":2023},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-08-12T17:04:39.851863Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"cited_paper":"/paper/2307.09782","citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:5d3f87bdf0a5ef8e07c27a4ed13554f9d039c60787514a80e720ec7a6de203ea","observation_id":"3c4815e1-f3c6-4828-9b6f-ad776c5e7580","resolution":{"observed_at":"2026-05-18T00:20:32.183663Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"SmoothQuant: Accurate and Efficient Post-Training Quantization for Large Language Models","venue":null,"work_id":"10cb6af3-dd1e-42ba-9684-9eadb5327957","year":2023},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-08-12T17:04:39.851863Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:a116c986a141790d528f9c6f32fe8f58b3d6825f398038ba4cd9134f4db4070a","observation_id":"49cc89dc-9e41-440a-8596-e2db780c35d4","resolution":{"observed_at":"2026-05-18T00:20:33.413716Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Amove: Accelerating LLMs through Mitigating Outliers and Salient Points via Fine-Grained Grouped Vectorized Data Type","venue":null,"work_id":"0724c7de-40da-46d6-b5b0-0f33d6ec5440","year":2025},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-08-12T17:04:39.851863Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:ae3cfa51e7d8d39de4b1c860bbc222af62800e0752bc35c506cd991e82dd6b64","observation_id":"2a03912f-72ba-44c6-9c7c-0db39722b8e6","resolution":{"observed_at":"2026-05-18T00:20:33.416502Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2412.15115","doi":"10.1145/3581783.3612503","metadata_source":"pith","pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5 Technical Report","venue":"cs.CL","work_id":"d8432992-4980-4a81-85c7-9fa2c2b87f85","year":2024},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-08-12T17:04:39.851863Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:660b0767aa63950a4dd2f852b00747e251b46cffa76ca2b71f193df617efc9b2","observation_id":"5eb34fdd-7deb-4ff6-aee9-ffd31afc069a","resolution":{"observed_at":"2026-05-18T00:20:32.188473Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"FlashInfer: Efficient and Customizable Attention Engine for LLM Inference Serving","venue":null,"work_id":"8a0f501c-6a65-419c-abe2-0fa97bd52eb8","year":2025},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-08-12T17:04:39.851863Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:5ebfe9960c8e001c3be0661d27b924b4d40cb86e1c17caf8a66e03bdd9a443f5","observation_id":"6aca5194-9473-4521-8077-568ed4212ed6","resolution":{"observed_at":"2026-05-18T00:20:33.411176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Duplex: A Device for Large Language Models with Mixture of Experts, Grouped Query Attention, and Continuous Batch- ing","venue":null,"work_id":"7239c0ae-d930-4e77-9d96-0bd8e49c432a","year":2024},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-08-12T17:04:39.851863Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:e8dcb85fa123c038a1723fac1f3ef98587650783f46d1a51035d843c31de2ec6","observation_id":"a23971a4-014b-412e-b08c-da7d65ce5ceb","resolution":{"observed_at":"2026-05-18T00:20:33.400872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"SageAttention: Accurate 8-Bit Attention for Plug-and-play Inference Acceleration","venue":null,"work_id":"55e01fba-fac8-4d95-abce-8a681cdf945c","year":2025},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-08-12T17:04:39.851863Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:e0f75ae4776ec1ec734417f6708b7cd1f6fd6b8376d92f3ebb1db0bc87a295b0","observation_id":"7cce09f4-7b68-494d-bc38-8972158ae4e1","resolution":{"observed_at":"2026-05-18T00:20:33.396613Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"DistServe: Disaggregating Prefill and Decoding for Goodput- optimized Large Language Model Serving","venue":null,"work_id":"3c1b0cc6-393f-4fae-b69a-51a29fecb908","year":2024},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-08-12T17:04:39.851863Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:96d948acf9b1ad6edf72a88fadf5f45c047a1f0f0a54abf1e50c93de104b1cb2","observation_id":"0e81c5fb-20f9-4e49-a0a4-3ed5e59f177f","resolution":{"observed_at":"2026-05-18T00:20:33.406530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14294","last_updated":"2024-07-19T04:47:36Z","snapshot_observed_at":"2026-07-06T18:03:47.096406Z","submitted_at":"2024-04-22T15:53:08Z","title":"A Survey on Efficient Inference for Large Language Models","version":3},"cited_work":{"arxiv_id":"2404.14294","doi":"10.48550/arxiv.2404.14294","metadata_source":"pith","pith_arxiv_id":"2404.14294","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A Survey on Efficient Inference for Large Language Models","venue":"cs.CL","work_id":"4e58b7d0-2870-4ddb-955f-798b34deb447","year":2024},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-08-12T17:04:39.851863Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"cited_paper":"/paper/2404.14294","citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:88b33c07f838fb94ea486806cc8a9d3bd39b7db32c76e87ca79862e3f994f527","observation_id":"f067f8df-4765-48fc-aab2-61a31f82e5ad","resolution":{"observed_at":"2026-05-18T00:20:32.198469Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-05-24T00:53:38.535897+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T00:53:38.535897+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","latest_version":4,"primary_category":"cs.AR","snapshot_observed_at":"2026-08-12T17:04:39.851863Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats"},"reference_resolution":{"displayed":79,"state_counts":{"malformed_identifier":0,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":0,"verified_exact":10,"verified_fuzzy":66},"total_outbound_references":79},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 79 of 79 outbound references and 2 inbound Pith citation observations for arXiv:2511.06838."}