{"as_of":"2026-08-21T10:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:594e065ac33dc71c1887beb06d1ce201ccfd6169f930fc99b9f933a5afeec21b","coverage":[{"denominator":68,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":68,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T17:07:38.016961Z","state":"measured"},{"denominator":68,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":68,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.06989/citation-record","integrity":"/paper/2608.06989/integrity","json":"/paper/2608.06989/citation-record.json","paper":"/paper/2608.06989"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:39.057857Z","title":"cublas docs,","venue":null,"work_id":"daa27e4d-d9ad-439b-b3e3-72ce679248ec","year":2024},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-19T11:12:00.406566Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.695553Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:22a9e3721e19a5498d7584f74e8838cd25874e38b33d89b5d2983e0152462225","observation_id":"080f7c07-e0e8-47ca-b1b9-04d6b9377184","resolution":{"observed_at":"2026-08-10T17:07:39.062564Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:39.042453Z","title":"High bandwidth memory dram (hbm1, hbm2) jesd235d,","venue":null,"work_id":"439f96dd-8f5e-490e-8d3d-68f24a4241c6","year":2020},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-19T11:12:00.406566Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.700788Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:ccf79ee3ef3a967f6ef5a4b40f3945f801ba41582b112b4391f603722e1ac69b","observation_id":"3b74aec1-f5df-4baa-8530-498f67f321dd","resolution":{"observed_at":"2026-08-10T17:07:39.047523Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:37.705355Z","title":"Analyzing cuda workloads using a detailed gpu simulator,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-19T11:12:00.406566Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.705355Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:a171d59a1a71ebfc51d2b945b12663e2329182c910c95d16f1e22ff5512f22ba","observation_id":"7468b991-2e9c-4c07-bbf3-33ac2f79386e","resolution":{"observed_at":"2026-08-10T17:07:37.705355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:37.711044Z","title":"Moe-lightning: High-throughput moe inference on memory-constrained gpus,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-19T11:12:00.406566Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.711044Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:22f3ef4b2e3819fe8d052e04607be302bd7fb1a3141f8f2c25fa0eb04caa7444","observation_id":"378b0234-3b45-48ff-a9de-f7567c195570","resolution":{"observed_at":"2026-08-10T17:07:37.711044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:37.715953Z","title":"Vicuna: An open-source chatbot impressing gpt-4 with 90%* chatgpt quality,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-19T11:12:00.406566Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.715953Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:4be81eabecb3a7abf70133b36ef7c3b262874cec448726d2af51e3084f52d994","observation_id":"444dc580-08d2-4c80-a5a2-a38ff775be57","resolution":{"observed_at":"2026-08-10T17:07:37.715953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:37.720747Z","title":"Palm: Scal- ing language modeling with pathways,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-19T11:12:00.406566Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.720747Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:bdd25fb35d08574b04e71b5a461b75f7d91343144102f5a07fc40fc3f7682733","observation_id":"e90bd290-db89-4fdc-9e77-870ed6ebfafc","resolution":{"observed_at":"2026-08-10T17:07:37.720747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:37.726009Z","title":"Asap7: A 7-nm finfet predictive process design kit,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-19T11:12:00.406566Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.726009Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:a53f049a59cd0dfaa1db144c0d3c801896547664033ed30817af8a64e1fc72fd","observation_id":"4e7cea13-109a-4cc0-89e2-fe66b3d6da83","resolution":{"observed_at":"2026-08-10T17:07:37.726009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:38.977158Z","title":"Projects – COIN-OR: Computational infrastruc- ture for operations research,","venue":null,"work_id":"99b061ae-21c3-40a4-8121-644cef559c5b","year":2025},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-19T11:12:00.406566Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.730812Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:fae7c9b327dcfab1f315e7b40d34aef726a87c092b295b916268e13c4d652a5d","observation_id":"20fef4f4-2bdd-4f8d-9c9b-1bbd8eb785b5","resolution":{"observed_at":"2026-08-10T17:07:38.983040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:38.960052Z","title":"Deepseekmoe: Towards ultimate expert special- ization in mixture-of-experts language models,","venue":null,"work_id":"7023bc37-9705-4879-8f25-65b9523f7899","year":2024},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-19T11:12:00.406566Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.735097Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:165a1d0a8e17433e06ecc3b8caa2aa392f12c2d418da0f26647f8fb9f549c275","observation_id":"57bb3874-8eea-4b32-99e2-08dbf80f3092","resolution":{"observed_at":"2026-08-10T17:07:38.965110Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:37.739364Z","title":"The true processing in memory accelerator,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-19T11:12:00.406566Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.739364Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:a57cac06b6e7a2057e1de3174cd4dda7bc52c839c42a83b612e2170b36b83424","observation_id":"7d215e54-60af-4e43-ac25-35cb46e632be","resolution":{"observed_at":"2026-08-10T17:07:37.739364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2504.06319","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:38.258911Z","title":"Accelerating llm inference throughput via asynchronous kv cache prefetching,","venue":null,"work_id":"7d9abf81-05a9-4796-98d2-adde95218249","year":2025},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-19T11:12:00.406566Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.743717Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:cfecb62e324b57a3e3ecfc13cc7c46155e0cf5a9c6b36e1b73889fccf4316e45","observation_id":"b71ffb43-2818-4c36-af5b-cf38e62eec34","resolution":{"observed_at":"2026-08-10T17:07:38.266524Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-10T17:07:37.748311Z","title":"The llama 3 herd of models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-19T11:12:00.406566Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.748311Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:5f5f42346dc961d5cc0602eb873d91db98dc28c4a9993e433628e63d03f48ff1","observation_id":"50e9a289-18c4-43d8-9783-6937f46a02a9","resolution":{"observed_at":"2026-08-10T17:07:37.748311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:38.931250Z","title":"Klotski: Efficient mixture-of-expert inference via expert- aware multi-batch pipeline,","venue":null,"work_id":"2190ccc7-17e4-469b-9e64-84237ae139f0","year":2025},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-19T11:12:00.406566Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.753254Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:b62182df474cc50f47f166a560a557a2a4b5db5544360b4eefd529aa36f4e5c0","observation_id":"2b136343-57ca-44f0-93c7-7c43136ff078","resolution":{"observed_at":"2026-08-10T17:07:38.936738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:37.758985Z","title":"Switch transformers: Scaling to trillion parameter models with simple and efficient sparsity,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-19T11:12:00.406566Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.758985Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:a0e46f4a9dd3b045f3fac57de9ff47bd9d498c6a65b77ef6dd1494f57ea18e7a","observation_id":"235f5503-dd76-40d3-b23f-ff66dc40534a","resolution":{"observed_at":"2026-08-10T17:07:37.758985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:38.903289Z","title":"The future of low-latency memory: Why near memory requires a new interface,","venue":null,"work_id":"4705fb05-db22-4d56-ac2c-179b3ad41374","year":2021},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-19T11:12:00.406566Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.763452Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:d96420673d2362e20ec455cd0c26f5e1899ded33622ada0701ead384f5968023","observation_id":"d274dc01-2f97-413f-ab86-9d08951e2c2c","resolution":{"observed_at":"2026-08-10T17:07:38.908916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:38.886962Z","title":"Papi: Exploiting dynamic parallelism in large language model decoding with a processing-in-memory-enabled computing system,","venue":null,"work_id":"f232a899-e231-478a-af0e-dab96c17bb76","year":2025},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-19T11:12:00.406566Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.767957Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:4b6d4d07e8cd4d1775d9d8249d98b6594532df921d32baa6046cf5abc4eaeb0c","observation_id":"3ff899c6-eaac-45f7-8bf5-314a966c18ac","resolution":{"observed_at":"2026-08-10T17:07:38.892099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:38.872099Z","title":"Neupims: Npu-pim heterogeneous acceleration for batched llm inferencing,","venue":null,"work_id":"20730e84-5533-4275-8c87-2b9ab0b478f4","year":2024},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-19T11:12:00.406566Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.772704Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:56d53046003f0c358c8c87b5c4085ba58adaa9de1039b676c7e3a6b45d1fdf09","observation_id":"b22b43ca-6b2c-4ab5-bd37-ff753a166092","resolution":{"observed_at":"2026-08-10T17:07:38.876912Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:38.856909Z","title":"Lightllm: A versatile large language model for predictive light sensing,","venue":null,"work_id":"7bc5787d-c411-4cd4-b134-7a3775420005","year":2025},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-19T11:12:00.406566Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.778011Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:d3b7618a547d1b31902fb103610692db1b6d126b25bf5f78d11550bcc0c5d1db","observation_id":"4d57ed89-8e91-4723-b661-49ead71d38c0","resolution":{"observed_at":"2026-08-10T17:07:38.862011Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:38.841628Z","title":"Decoding llm performance—prefill phase is compute bound on npu,","venue":null,"work_id":"aca4a95b-6b1b-4d89-9106-f7539baab0b1","year":2025},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-19T11:12:00.406566Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.782728Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:23847cb3377ab579b2c51185d5b97d58ad700a3f52891860396bb7e56de8ebbd","observation_id":"d50537ad-5740-4fbb-94c1-ee347a01d742","resolution":{"observed_at":"2026-08-10T17:07:38.846499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-13T19:43:49.936776Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-10T17:07:37.787253Z","title":"Mixtral of experts,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-19T11:12:00.406566Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.787253Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:bced3dece683662f5cb4e404bc1a5cc3639cc165bb591f2468afd4dade48bf33","observation_id":"705e2e2a-8662-45f5-9cdc-ad0240330214","resolution":{"observed_at":"2026-08-10T17:07:37.787253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:38.827120Z","title":"The battle of chatbot giants: an ex- perimental comparison of chatgpt and bard,","venue":null,"work_id":"818a0070-0de6-460b-8e48-d0ea311dd825","year":2024},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-19T11:12:00.406566Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.792301Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:65da4fac6845fd874f6fa32e00b9c930e700da96d6309cf5b740218d4edcf5b5","observation_id":"ae003cce-039d-4a6a-aa1f-6631b5566e1d","resolution":{"observed_at":"2026-08-10T17:07:38.831974Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:37.796835Z","title":"Accel-sim: An extensible simulation framework for validated gpu modeling,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-19T11:12:00.406566Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.796835Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:7f9da49e8aeab33b48c9702bad9ea1ad7428b3f6f4a53f1dcebbfcf298c840b9","observation_id":"c3281b42-77ec-45ea-bdbe-1c02dcc7cb58","resolution":{"observed_at":"2026-08-10T17:07:37.796835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:37.801418Z","title":"Sk hynix ai-specific computing memory solution: From aim device to heterogeneous aimx-xpu system for comprehensive llm inference,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-19T11:12:00.406566Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.801418Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:65219ccc2b5cac257c2a70d41412ed7b0ab251fe112154bc759b68f96afead7b","observation_id":"7933b684-d142-41de-a549-86ffa7766c08","resolution":{"observed_at":"2026-08-10T17:07:37.801418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:38.792572Z","title":"Monde: Mixture of near-data experts for large-scale sparse models,","venue":null,"work_id":"d8c8451f-d417-4eef-8b97-69a54bc12ab1","year":2024},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-19T11:12:00.406566Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.806290Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:7766d03f0f3c3966b87bf86b73d1cf1673dccba9012fb68ce5b3805a9e7e50be","observation_id":"afacd144-eb5c-4f26-9bca-40082e3e05fc","resolution":{"observed_at":"2026-08-10T17:07:38.797868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:37.810685Z","title":"Efficient memory management for large language model serving with pagedattention,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-19T11:12:00.406566Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.810685Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:e68b8fc37b007b6af01c7abb73d9e13d53e0d1f6ccbea457eaa13430d3e1f5f5","observation_id":"afe5b5f9-c85c-48ec-ba8e-8fde1e61f319","resolution":{"observed_at":"2026-08-10T17:07:37.810685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:38.766345Z","title":"vllm: Easy, fast, and cheap llm serving for everyone","venue":null,"work_id":"b25571bb-b2e3-4239-ba28-ec004784df36","year":2023},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-19T11:12:00.406566Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.815171Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:88db4bf117cab6ecee05683d075d83766a65df420f710b75fddb9d21ca16deee","observation_id":"6b992dcc-1456-4ffe-9245-e8a383c00909","resolution":{"observed_at":"2026-08-10T17:07:38.771604Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:37.819794Z","title":"A 1ynm 1.25 v 8gb, 16gb/s/pin gddr6-based accelerator-in-memory supporting 1tflops mac operation and various activation functions for deep-learning applications,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-19T11:12:00.406566Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.819794Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:a7ed3da5f4438df3dbe9cfb95b8532b0baca946404ad7e4864a257a0b7e0f44e","observation_id":"1b98ec61-3a59-4a96-bfbc-b047e080cf63","resolution":{"observed_at":"2026-08-10T17:07:37.819794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:37.825298Z","title":"Hardware architecture and software stack for pim based on commercial dram technology: Industrial product,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-19T11:12:00.406566Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.825298Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:82ce330f12030f9dccbc7e049e8ad9f298589e78a0b7e57dd536170aefa01cc0","observation_id":"42c4c93d-eb61-4471-be5a-5da3eb13c67a","resolution":{"observed_at":"2026-08-10T17:07:37.825298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:38.731291Z","title":"H2-llm: Hardware-dataflow co-exploration for heterogeneous hybrid-bonding-based low-batch llm inference,","venue":null,"work_id":"ffaf0f55-2fad-4043-8a8d-5df3462b6e15","year":2025},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-19T11:12:00.406566Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.829870Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:43bac3d18b6d17a20e469c7c7885232a3730d945265b9ecc27721c146abc41c8","observation_id":"e8f5c68a-4265-4551-9b81-93b293924ff5","resolution":{"observed_at":"2026-08-10T17:07:38.736234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:37.834220Z","title":"Ascend: a scalable and unified architecture for ubiquitous deep neural network computing: Industry track paper,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-19T11:12:00.406566Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.834220Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:6367438d0b2727972dc5977c068dae56d08e738aee31c8309acc136768392c40","observation_id":"bf29786f-762f-4bd4-adeb-e0dace7d7ac5","resolution":{"observed_at":"2026-08-10T17:07:37.834220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:37.838777Z","title":"Davinci: A scalable architecture for neural network computing,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-19T11:12:00.406566Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.838777Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:c1a838ebe748ed1224f45e2cca143b872ed284dddf3719d30dfbd246ca56e8b7","observation_id":"d54ef2b4-5686-4447-8c92-cb43a559cf07","resolution":{"observed_at":"2026-08-10T17:07:37.838777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-18T18:18:37.449517Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-10T17:07:37.843266Z","title":"Deepseek-v3 technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-19T11:12:00.406566Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.843266Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:b8f73b53a13d3516dfabceacd56ca852f35eaf03718d673c3e33950c60dd65a9","observation_id":"883731a9-3936-4704-9b81-bae3e3063d8e","resolution":{"observed_at":"2026-08-10T17:07:37.843266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:37.848227Z","title":"Ramulator 2.0: A modern, modular, and extensible dram simulator,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-19T11:12:00.406566Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.848227Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:4f515fbc4805e30b64751b3a0fde8daa1908eeb27feb52dd188ad20d310f48f5","observation_id":"04065920-91ef-4545-b53e-51ced19f61f5","resolution":{"observed_at":"2026-08-10T17:07:37.848227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:37.852810Z","title":"The design process for google’s training chips: Tpuv2 and tpuv3,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-19T11:12:00.406566Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.852810Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:12d887abf0edbf59f6db76edda0d4d8afcf6dc96b8effa8a992692f52e38f87e","observation_id":"3eeb1b74-e7fd-49a2-88cd-ca2bc0b4e623","resolution":{"observed_at":"2026-08-10T17:07:37.852810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:38.673847Z","title":"Nvidia a100 tensor core gpu architecc ture,","venue":null,"work_id":"663b2b79-bb24-48ca-9619-acfebd8b0595","year":2020},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-19T11:12:00.406566Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.857378Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:0af1b2b09aa0bab2ecee40f91bc094d4e32aacf41dc74d2eb8ce86048531023c","observation_id":"168726cf-77ee-4eea-8682-0b9035b2d1a5","resolution":{"observed_at":"2026-08-10T17:07:38.678996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:38.657915Z","title":"Introduction to the nvidia dgx a100 system,","venue":null,"work_id":"7ec91a82-9071-4b81-a565-a60769700f62","year":2021},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-19T11:12:00.406566Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.862209Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:ef6ae6d48ed68831a9986a5d4485ed31e4a83c5ae9f5db2b5fc45c83feb05af8","observation_id":"2cbc5a3e-9369-4398-9bdb-33fc15fed075","resolution":{"observed_at":"2026-08-10T17:07:38.663185Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:38.642532Z","title":"Nvidia h100 tensor core gpu architecture,","venue":null,"work_id":"aeb25942-73e3-4c15-b27d-29299fd97fe6","year":2023},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-19T11:12:00.406566Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.867070Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:0b04bb910d0aa1eeb9171dc4a2f3f3053c6265a8226e331f877277b83ae5b491","observation_id":"617a579e-4348-4adb-9dd0-e10c31e98954","resolution":{"observed_at":"2026-08-10T17:07:38.647557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:38.627060Z","title":"Chatgpt,","venue":null,"work_id":"9bbf0817-ecd3-42bf-9d0d-f552699113a1","year":2023},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-19T11:12:00.406566Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.871919Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:e15aaace46c32451b2c5eb0de22967f3c95d356c7f899b14dd463a7a4db223a1","observation_id":"acc7508a-f626-4fb4-bf34-0cabf49df959","resolution":{"observed_at":"2026-08-10T17:07:38.631915Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:38.611879Z","title":"Gpt-oss-120b,","venue":null,"work_id":"799ad780-0424-49bc-b081-4f72ba6795cd","year":2025},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-19T11:12:00.406566Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.877248Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:11398dde5ff5f431a42bd78a8bda2d67b2d7ad7d227efb6d03a86c911c070d36","observation_id":"f63776a2-4a47-46c1-8ed1-6407f5661d28","resolution":{"observed_at":"2026-08-10T17:07:38.616441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1701.03499","last_updated":"2017-02-14T07:58:57Z","snapshot_observed_at":"2026-08-17T20:07:03.678123Z","submitted_at":"2017-01-12T20:31:53Z","title":"VESPA: VIPT Enhancements for Superpage Accesses","version":2},"cited_work":{"arxiv_id":"1701.03499","doi":null,"metadata_source":"pith","pith_arxiv_id":"1701.03499","snapshot_observed_at":"2026-08-10T17:07:38.119205Z","title":"VESPA: VIPT Enhancements for Superpage Accesses","venue":"cs.AR","work_id":"a519d08e-77a9-4ed2-8176-4ab29a067a56","year":2017},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-19T11:12:00.406566Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.882236Z"},"links":{"cited_paper":"/paper/1701.03499","citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:fc5fa9a8d852af1d934724a89db8a979edf9a603cb5874b137880cf367ca035a","observation_id":"498eb86c-0d7a-4e71-95d6-6352ef7bec5f","resolution":{"observed_at":"2026-08-10T17:07:38.126461Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:37.887482Z","title":"Attacc! unleashing the power of pim for batched transformer- based generative model inference,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-19T11:12:00.406566Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.887482Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:f742ea4a25edd9b9df470b44694caee1f1a0d5a2a6a4bc439a7a6b441f432841","observation_id":"c8ed4d31-0f97-4ba3-ac9b-152c07ca6a22","resolution":{"observed_at":"2026-08-10T17:07:37.887482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:37.892413Z","title":"Pytorch: An imperative style, high-performance deep learning library,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-19T11:12:00.406566Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.892413Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:605431cb78e178ed16e2774cc44cb151cdd4e8b8b49f84c557b176409c7070c3","observation_id":"c7f2f9ad-fd01-4eeb-b859-ee9cb25b790f","resolution":{"observed_at":"2026-08-10T17:07:37.892413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:37.896797Z","title":"Splitwise: Efficient generative llm inference using phase splitting,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-19T11:12:00.406566Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.896797Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:b8e240ce810c3dd290da4cc2e0a968b7dc4b85bd2204895b00925484050a9b5a","observation_id":"adcbebf4-df7a-45c7-aab6-28ec5758aefd","resolution":{"observed_at":"2026-08-10T17:07:37.896797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:37.901598Z","title":"{DRAMA}: Exploiting{DRAM}addressing for{Cross-CPU}at- tacks,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-19T11:12:00.406566Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.901598Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:f5fa43996ff245b0b60819817e169faab048297e7df7c22132eddfccd18869db","observation_id":"05ba398e-7adb-45ab-ba9c-aa9d5b2a9f79","resolution":{"observed_at":"2026-08-10T17:07:37.901598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12950","last_updated":"2024-01-31T19:47:26Z","snapshot_observed_at":"2026-08-18T03:59:39.242039Z","submitted_at":"2023-08-24T17:39:13Z","title":"Code Llama: Open Foundation Models for Code","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12950","snapshot_observed_at":"2026-08-10T17:07:37.906475Z","title":"Code llama: Open foundation models for code,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-19T11:12:00.406566Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.906475Z"},"links":{"cited_paper":"/paper/2308.12950","citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:619f6b738375dbb29e4e383529165744a8f57b9090d86822b38e6d872e01f390","observation_id":"99cb3109-344e-4acf-91cc-a742c7736005","resolution":{"observed_at":"2026-08-10T17:07:37.906475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:38.557074Z","title":"Ramulator 2.0,","venue":null,"work_id":"a2d82db8-01b3-41c5-8b87-32ad1a30fc65","year":2023},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-19T11:12:00.406566Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.911242Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:3126f31bee19a9415b42dacec6379163c51c0f30f87db30937ef2a0b3f9a9664","observation_id":"1ca98075-9a99-47dd-82d6-f1495de28c4a","resolution":{"observed_at":"2026-08-10T17:07:38.562417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:38.541724Z","title":"Khaa44801b-mc16: 8gb hbm2e flashbolt,","venue":null,"work_id":"542e19a1-a043-4b79-b59a-8606084d0199","year":null},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-19T11:12:00.406566Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.915869Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:4635ebac58f39617557bb7f372b88d5a585991aa10a0fc2bf8e267b70fa0f96e","observation_id":"b8f15562-cb00-4ea5-b30e-e32804b6858b","resolution":{"observed_at":"2026-08-10T17:07:38.546657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:38.510031Z","title":"Ianus: Integrated accelerator based on npu-pim unified memory system,","venue":null,"work_id":"e39e7686-d7b4-4b81-a828-2b04369d35d3","year":2024},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-19T11:12:00.406566Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.925266Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:b6c503d985457669a4cec18430b2d9e3147a5e5e5ea092a06c4b7e26f268a41f","observation_id":"3cd728a0-7f39-48ec-a0e5-4e529ffa946f","resolution":{"observed_at":"2026-08-10T17:07:38.515151Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:37.929827Z","title":"Facil: Flexible dram address mapping for soc-pim cooperative on-device llm inference,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-19T11:12:00.406566Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.929827Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:bfaae789a76008c86ad4f4b3b9cf875c76b6fa0eb57edf6dd5e2ef7c3ce43f8e","observation_id":"81964d28-58fe-4e09-9d97-aef75e69b67e","resolution":{"observed_at":"2026-08-10T17:07:37.929827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:38.484914Z","title":null,"venue":null,"work_id":"825f6fef-165e-43cd-840d-b96081c577c8","year":2024},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-19T11:12:00.406566Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.934297Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:b1c310eae9b4a1929066f4178451f50f7f295063da174d58c4fd38c14e9a3391","observation_id":"b49f68be-cefb-4d46-b4dd-8d348a120514","resolution":{"observed_at":"2026-08-10T17:07:38.489538Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:38.470049Z","title":"Design compiler,","venue":null,"work_id":"22bf43c2-a419-4c6b-b96d-991aad3f59cc","year":null},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-19T11:12:00.406566Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.939466Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:de72f4638710dd6ef16ed7be0f0769fa6e4211982260eae18258fba765e8f5b5","observation_id":"b5b64ee8-ab0d-4c2a-9d06-970ec14438ff","resolution":{"observed_at":"2026-08-10T17:07:38.475000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:38.455342Z","title":"Qwen1.5-moe-a2.7b,","venue":null,"work_id":"8b8c97d6-3d0b-4d5a-ad6a-8efb84e16fa9","year":2024},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-19T11:12:00.406566Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.944163Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:fdc8b55288208432fcdf6676d753c14621439f41ec51b87b975ad970e1c564bd","observation_id":"edce804e-4cf3-45d1-93c0-13f3a8e855f0","resolution":{"observed_at":"2026-08-10T17:07:38.460323Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:38.438153Z","title":"Sglang: Efficient execution of structured language model programs,","venue":null,"work_id":"e96cf8b8-82a7-475d-9cb4-d7f232abb78b","year":2024},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-19T11:12:00.406566Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.948535Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:c9be480a492350bd9889b5dc026f5514cbe0e0cd1c8f12778a1eb6805d60a654","observation_id":"96078f9c-7b54-41d4-b7ab-f80ab14f83f5","resolution":{"observed_at":"2026-08-10T17:07:38.443975Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:38.421571Z","title":"Introducing the next generation of claude","venue":null,"work_id":"10b309e2-463a-4b03-9c55-384482d5d730","year":2024},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-19T11:12:00.406566Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.953117Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:761309e232b96e5fcc11f20f6749ca1abc19f5cb747d70405d2e698d1bd30fac","observation_id":"910f8908-83a9-411e-8b17-1125c43caea1","resolution":{"observed_at":"2026-08-10T17:07:38.426565Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:38.405911Z","title":"Upmem software development kit (sdk),","venue":null,"work_id":"3324c3ea-cc24-495d-af64-8d522eac85a2","year":2025},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-19T11:12:00.406566Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.957755Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:1ec5a7ae30a466e9a0972c6e0ff07fc50118d627799d8e59a4d76dba79a6fef1","observation_id":"5a9f9032-2d6b-4cd1-a3fd-95e6b61f826e","resolution":{"observed_at":"2026-08-10T17:07:38.410712Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.05100","last_updated":"2023-06-27T09:57:58Z","snapshot_observed_at":"2026-08-04T18:56:03.233715Z","submitted_at":"2022-11-09T18:48:09Z","title":"BLOOM: A 176B-Parameter Open-Access Multilingual Language Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.05100","snapshot_observed_at":"2026-08-10T17:07:37.962298Z","title":"Bloom: A 176b-parameter open-access multilingual language model,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-19T11:12:00.406566Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.962298Z"},"links":{"cited_paper":"/paper/2211.05100","citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:b9c8fc9350cd0b52db60910bb4ed34737f8f86555763d21175754f6ecbb3583b","observation_id":"ac10e1cc-307d-4650-b64f-292aa15c45a8","resolution":{"observed_at":"2026-08-10T17:07:37.962298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:38.390161Z","title":"Pim gpt a hybrid process in memory accelerator for autoregressive transformers,","venue":null,"work_id":"663d51bb-cdb9-4774-a0b5-505b3032fc63","year":2024},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-19T11:12:00.406566Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.967462Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:32fcec03a330c8db4700c78044d86510e219be008142b550fb3db00fe570f6ca","observation_id":"16927598-8583-4e6b-9871-b9556d42bcbb","resolution":{"observed_at":"2026-08-10T17:07:38.395249Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:38.374918Z","title":"Waitgpt: Monitoring and steering conversational llm agent in data analysis with on-the-fly code visualization,","venue":null,"work_id":"8f4f1b4e-1b6e-4b18-b187-802a94824676","year":2024},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-19T11:12:00.406566Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.972628Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:6d787f20e03966e2e6eb53c1a99dc154e0d06685f70f8d61fd16211f1d80f9a9","observation_id":"bb2bf72f-8ddb-4c6a-8ea8-7a31bf9af2e5","resolution":{"observed_at":"2026-08-10T17:07:38.379994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.05497","last_updated":"2026-05-12T10:04:18Z","snapshot_observed_at":"2026-08-16T21:35:51.823223Z","submitted_at":"2025-10-07T01:31:39Z","title":"Patterns behind Chaos: Forecasting Data Movement for Efficient Large-Scale MoE LLM Inference","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.05497","snapshot_observed_at":"2026-08-10T17:07:37.977874Z","title":"Orders in chaos: Enhancing large-scale moe llm serving with data movement forecasting,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-19T11:12:00.406566Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.977874Z"},"links":{"cited_paper":"/paper/2510.05497","citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:24f034673d95d48022e8d85dbf394209bc5618c79642402e8180a64bb05bbf81","observation_id":"99b76cda-51fc-4b0d-99ae-85fb04ce4241","resolution":{"observed_at":"2026-08-10T17:07:37.977874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:38.359613Z","title":"Duplex: A device for large language models with mixture of experts, grouped query attention, and continuous batching,","venue":null,"work_id":"07724d05-c85f-42c7-ad05-1f8f978410a0","year":2024},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-19T11:12:00.406566Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.982655Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:179d409ef4d89198d8ed43b419cfdccaadb86d6cde14dc489c3f26a359fcdbe3","observation_id":"5f496768-78ad-464e-b06d-01e9d5510997","resolution":{"observed_at":"2026-08-10T17:07:38.364518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:37.987438Z","title":"Llmcompass: Enabling efficient hardware design for large language model inference,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-19T11:12:00.406566Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.987438Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:cc799bedaacb3abd1e332dc0a4defa9a1d4c260f1c996f67f54a4443f25e7bf2","observation_id":"1a943f7c-7f6a-461c-a0d9-e69183ee3b60","resolution":{"observed_at":"2026-08-10T17:07:37.987438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:38.334805Z","title":"Um-pim: Dram-based pim with uniform & shared memory space,","venue":null,"work_id":"4317cd13-2445-476d-9525-c6704e343ee3","year":2024},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-19T11:12:00.406566Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.992508Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:74bc7a5d4b522c939b32795ca8affbc6282303c358c0c649051b4715a5157d3a","observation_id":"561cccd9-80e0-41b3-b6fd-2de7b77a3ceb","resolution":{"observed_at":"2026-08-10T17:07:38.339889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:38.317345Z","title":"Lmsys-chat-1m: A large-scale real-world llm conversation dataset,","venue":null,"work_id":"fe4902b1-0b06-4bbd-8038-95ae66ef47ff","year":2023},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-19T11:12:00.406566Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.997008Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:7ef2376d4241d75b55fc5618016855b6357e80ba658291b5d87cca81dcb07e85","observation_id":"89f41714-2435-494d-a2d4-fbf1fe817cec","resolution":{"observed_at":"2026-08-10T17:07:38.324063Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05897","last_updated":"2025-04-08T10:47:37Z","snapshot_observed_at":"2026-08-16T12:43:03.903686Z","submitted_at":"2025-04-08T10:47:37Z","title":"HybriMoE: Hybrid CPU-GPU Scheduling and Cache Management for Efficient MoE Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05897","snapshot_observed_at":"2026-08-10T17:07:38.001641Z","title":"Hybrimoe: Hybrid cpu-gpu scheduling and cache management for efficient moe inference,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-19T11:12:00.406566Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:38.001641Z"},"links":{"cited_paper":"/paper/2504.05897","citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:83b70cd539b244794ff529f5bc0283c00165d1c94516ba4855988fec3fcde2c4","observation_id":"71c53d55-488d-4640-9f8b-b233e79affa2","resolution":{"observed_at":"2026-08-10T17:07:38.001641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:38.006403Z","title":"{DistServe}: Disaggregating prefill and decoding for goodput-optimized large language model serving,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-19T11:12:00.406566Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:38.006403Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:66ead60f727fd26f3a47a63ae31bc3c74d5aaf593097ca3b9be783085843cfc1","observation_id":"e4237319-436f-4a50-9577-d0bae12978e3","resolution":{"observed_at":"2026-08-10T17:07:38.006403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:38.292435Z","title":"Mixture-of-experts with expert choice routing,","venue":null,"work_id":"f3482aef-0596-4f3d-afa3-27666d5875aa","year":2022},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-19T11:12:00.406566Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:38.011039Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:62d72bc1e8f233ea09e9f6a9c8e66b315404dab8c9c36a9c9bd8f72002656098","observation_id":"62ce0ff7-c17c-4158-8e2c-e5372e6186df","resolution":{"observed_at":"2026-08-10T17:07:38.297303Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:38.277023Z","title":"A comprehensive analysis of superpage management mechanisms and policies,","venue":null,"work_id":"d9294960-9801-4789-91c1-2923be07041b","year":2020},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-19T11:12:00.406566Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:38.016961Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:fece8ef712eeb76dedf68cf8a03bd020c3b1876a39917da20c69d64633ae8782","observation_id":"f3e9a925-87d8-4d46-b866-a74baf7971b1","resolution":{"observed_at":"2026-08-10T17:07:38.281956Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:38.526061Z","title":"Available: https://semiconductor.samsung.com/dram/ hbm/hbm2e-flashbolt/khaa44801b-mc16/","venue":null,"work_id":"2c8b854a-3f4c-452c-a81e-9ea29eae94b4","year":null},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-19T11:12:00.406566Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.920527Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:7b5e1f405f9cfbb724fe79c0a2820d8dbf71d895955a368ca057854ac6c7bc17","observation_id":"93da23a9-244c-4f81-b22e-cd7f9d2d58e7","resolution":{"observed_at":"2026-08-10T17:07:38.531333Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","latest_version":1,"primary_category":"cs.AR","snapshot_observed_at":"2026-08-19T11:12:00.406566Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM"},"reference_resolution":{"displayed":68,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":31,"verified_exact":2,"verified_fuzzy":35},"total_outbound_references":68},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 68 of 68 outbound references and 0 inbound Pith citation observations for arXiv:2608.06989."}