{"as_of":"2026-08-11T15:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:935468575e76a54ccde768e01bedcf98a19531f9e0756fd97319b4a3d7c5f58d","coverage":[{"denominator":84,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":84,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T12:20:33.276786Z","state":"measured"},{"denominator":84,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":84,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.05483/citation-record","integrity":"/paper/2608.05483/integrity","json":"/paper/2608.05483/citation-record.json","paper":"/paper/2608.05483"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:32.940781Z","title":"Exploiting cxl-based memory for distributed deep learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-10T17:56:54.790182Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:32.940781Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:f707eddf028a97d2a3ad5aeaf84192ed02014dad88c897aaa5979ed5b9d0df5d","observation_id":"69d5d327-1c51-43aa-b2e7-55961ee8f14b","resolution":{"observed_at":"2026-08-08T12:20:32.940781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:32.945642Z","title":"Arm neoverse and NVIDIA NVLink fusion: AMBA CHI C2C interoperability for custom silicon,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-10T17:56:54.790182Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:32.945642Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:f79641ff53f9a89259f226a9da52f80484c927c178db17903ca3bc0222d1643a","observation_id":"ec72d40d-779e-43d4-a574-f933cd47e04b","resolution":{"observed_at":"2026-08-08T12:20:32.945642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:32.949840Z","title":"Chameleon: Versatile and practical near-dram acceleration architecture for large memory systems,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-10T17:56:54.790182Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:32.949840Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:0330c0a3a53d093adea9a3f3895c17d6341a00230fe637fb482e99e465d1985d","observation_id":"91df20ec-a7c3-427b-87b3-7910274a157d","resolution":{"observed_at":"2026-08-08T12:20:32.949840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:32.954261Z","title":"Nvidia spent over $900 million on Enfabrica CEO, AI startup technology,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-10T17:56:54.790182Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:32.954261Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:2ca8867ad78e0a30afe67a01fe666837610b4a9e5ac550712bca14c133d6fd97","observation_id":"6040c853-0872-4998-b5c9-bd66b582c377","resolution":{"observed_at":"2026-08-08T12:20:32.954261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:34.590656Z","title":"Punica: Multi-tenant lora serving,","venue":null,"work_id":"8332bca0-b279-4d6d-8494-4cde084001ca","year":2024},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-10T17:56:54.790182Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:32.958486Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:cef274f900eef14f026a6960ee5f48583e2eed19dd6071deb1aa81d698d4d750","observation_id":"cf7ae5f9-aab4-4f54-87cb-64fafbf91ef2","resolution":{"observed_at":"2026-08-08T12:20:34.595686Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:34.574542Z","title":"Compute express link (CXL) 3.1 specification,","venue":null,"work_id":"6f4f5a2d-5a89-4a7c-9cbf-cba49d0c48c8","year":2024},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-10T17:56:54.790182Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:32.963089Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:832df8e3b72b0fd4bd3aa73a98df59627fe48a031d49fd4234ac310513380154","observation_id":"b6d28489-d618-45aa-a872-469d226fd187","resolution":{"observed_at":"2026-08-08T12:20:34.579622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16937","last_updated":"2024-11-18T12:36:13Z","snapshot_observed_at":"2026-07-06T18:36:16.828338Z","submitted_at":"2024-06-17T09:39:34Z","title":"A Complete Survey on LLM-based AI Chatbots","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16937","snapshot_observed_at":"2026-08-08T12:20:32.967888Z","title":"A complete survey on LLM-based AI chatbots,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-10T17:56:54.790182Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:32.967888Z"},"links":{"cited_paper":"/paper/2406.16937","citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:6c9330c4178f00d8d85417d1a2bd80503db86b41f0be78bda2fa3a4072d46cca","observation_id":"c2638423-f4ad-4744-b1d8-a09cb4b1bbe7","resolution":{"observed_at":"2026-08-08T12:20:32.967888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:32.972314Z","title":"FlashAttention-2: Faster attention with better parallelism and work partitioning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-10T17:56:54.790182Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:32.972314Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:5670540cf138ad3551a659528dc96edbea02ddedc410e4018214e7b3d99bbd29","observation_id":"be082b7b-97f9-4cf4-8b81-7d8ad4aaa47c","resolution":{"observed_at":"2026-08-08T12:20:32.972314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:34.549489Z","title":"Flashattention: Fast and memory-efficient exact attention with io-awareness,","venue":null,"work_id":"e140408f-3d94-43ce-aaa3-c602dcfa4075","year":2022},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-10T17:56:54.790182Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:32.976334Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:df8ac1a62c3faaf4285a06453c28fef211d0928babf067cc903ed48c1142ab45","observation_id":"549d4585-fc73-4410-8dab-b20d04845d6c","resolution":{"observed_at":"2026-08-08T12:20:34.554629Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:34.533780Z","title":"Qlora: Efficient finetuning of quantized llms,","venue":null,"work_id":"07b45209-e889-404f-9ece-765acdcc0764","year":2023},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-10T17:56:54.790182Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:32.980323Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:1a061818d854bc8324e965509332bb95428cbdac91a203c34fc8b7cc2ad43d5e","observation_id":"1ec7a543-b4d5-417b-81f7-bdb3f4a5ff72","resolution":{"observed_at":"2026-08-08T12:20:34.538778Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:34.517310Z","title":"The true processing in memory accelerator,","venue":null,"work_id":"dc8efe12-e373-4cc7-b122-9351b0efc4eb","year":2019},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-10T17:56:54.790182Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:32.984353Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:d5b0f587203ff713bd7616f887e934faf55f116ff78d006dfb31a330f4e952f0","observation_id":"0b17fcd5-ab90-4532-8d4c-70292885a26e","resolution":{"observed_at":"2026-08-08T12:20:34.522561Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:34.500725Z","title":"EMFASYS: Elastic memory fabric system,","venue":null,"work_id":"eab08224-ae03-4eb9-9ed3-55caab5ee926","year":2025},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-10T17:56:54.790182Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:32.988820Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:d0822d25959eebfd7db102bd793d6a583f712662786d833ae97fedb5a52076cc","observation_id":"d22943f8-9e90-455f-8ecf-2fa41249627f","resolution":{"observed_at":"2026-08-08T12:20:34.505381Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:34.486013Z","title":"NVIDIA Grace Hopper superchip architecture in-depth,","venue":null,"work_id":"9b1f9fe0-1a7c-427b-9350-78a1fe834683","year":2022},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-10T17:56:54.790182Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:32.992636Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:f539922e4542c75b9a23155e0df3f6715d4272fd2b1668ab92012960851c5847","observation_id":"a4018afc-1ed8-4e6d-a8c9-d3e82927ba00","resolution":{"observed_at":"2026-08-08T12:20:34.490851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:34.470083Z","title":"Techniques for an efficient fabric attached memory,","venue":null,"work_id":"8213a398-87d0-4be3-b122-3fdea46f83e8","year":2021},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-10T17:56:54.790182Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:32.996554Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:7f9ae39c97e243b74ff3ed189a1faa8693904a8229936f7a676b9b1e07385cf8","observation_id":"1fd79946-f20b-4e20-a11f-a7cd4a611884","resolution":{"observed_at":"2026-08-08T12:20:34.475522Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:34.454252Z","title":"Techniques for an efficient fabric attached memory,","venue":null,"work_id":"3f952f6e-0939-47c4-97d5-bfbbde4a996e","year":2023},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-10T17:56:54.790182Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.000405Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:32395f1724c13fdcb19b5cd7aa06ba3982f528bba761bdac080a5e985eca7e45","observation_id":"de7a7073-e524-4e78-8b29-dec7ab493681","resolution":{"observed_at":"2026-08-08T12:20:34.458777Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:34.439389Z","title":"Low-overhead general-purpose near- data processing in CXL memory expanders,","venue":null,"work_id":"bb0f8cb3-b56f-4458-9f31-eae052c996cb","year":2024},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-10T17:56:54.790182Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.004342Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:cf173ab0d4e31d7d87f2fcbc24d9d6ab386807f980146a82a763881781bd97c9","observation_id":"6a927501-7de5-428b-b7d4-d17a2429dc33","resolution":{"observed_at":"2026-08-08T12:20:34.443771Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:34.424328Z","title":"Newton: A dram-maker’s accelerator-in- memory (aim) architecture for machine learning,","venue":null,"work_id":"f4332a25-2c89-4210-b5b3-4e6de45ea728","year":2020},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-10T17:56:54.790182Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.008169Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:f8ac88295fc747433a29881b803714bd4c18cf70bd1480783765093b405a666a","observation_id":"eed5a743-8521-4670-a697-eaa604297c51","resolution":{"observed_at":"2026-08-08T12:20:34.428864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:34.409687Z","title":"Parameter-efficient transfer learning for nlp,","venue":null,"work_id":"201d4b8f-c713-4e55-88a6-4468e09b97cb","year":2019},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-10T17:56:54.790182Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.012017Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:6c86d8f6cb82a9c4a08b16f75fded4dd44daff530ac83cdcd1d21860236c96c5","observation_id":"09ec8895-f7cb-45e9-bd3f-f7d10760ce01","resolution":{"observed_at":"2026-08-08T12:20:34.414123Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:34.395364Z","title":"Latency and bandwidth impact on GPU-systems,","venue":null,"work_id":"9bdc57c1-ee59-4cbe-8066-c9aa55d2698c","year":2008},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-10T17:56:54.790182Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.015668Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:21b76e8d2e310d0430a49bc3f0ddf901c59f7c36536889128b2137799934ba58","observation_id":"22742911-4acb-404a-a45d-193e5d4c90b1","resolution":{"observed_at":"2026-08-08T12:20:34.400026Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:33.020108Z","title":"LoRA: Low-rank adaptation of large language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-10T17:56:54.790182Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.020108Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:988921966028c89cc7733bec8b134a7c68b7b0f4006c49d955091b3f66a7f6af","observation_id":"e85fc5f0-5092-4beb-b585-cbae7e8308e7","resolution":{"observed_at":"2026-08-08T12:20:33.020108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:34.370783Z","title":"Achieving page-mapping ftl performance at block-mapping ftl cost by hiding address translation,","venue":null,"work_id":"3e59fda8-ea02-4656-86fa-d1b1e8ebfaa9","year":2010},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-10T17:56:54.790182Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.024041Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:27bf806b15b22e6133519903cc557cbbda5961e723c7f731ee833dc3dffd4025","observation_id":"3616a006-30da-4936-92bc-56eb63ef88a1","resolution":{"observed_at":"2026-08-08T12:20:34.375521Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:34.356549Z","title":"Beacon: Scalable near-data-processing accelerators for genome analysis near memory pool with the cxl support,","venue":null,"work_id":"18c40e40-895e-4bcd-b5cf-cd4a7f494e89","year":2022},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-10T17:56:54.790182Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.027918Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:2f53518a7eafb506c61be3446c482f22fdda3c4b872ac0459a78966b885976cf","observation_id":"a42e67e0-a5dd-4d2c-bf3a-ced8775ba74a","resolution":{"observed_at":"2026-08-08T12:20:34.361324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:34.341065Z","title":"Pifs-rec: Process- in-fabric-switch for large-scale recommendation system inferences,","venue":null,"work_id":"e83f8ab7-d56c-491b-9a39-49fba3bcd0a9","year":2024},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-10T17:56:54.790182Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.031835Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:51a6050c3984b0eb26326b91dda0130e6c86f9d981c8403fa7afe15ef72b1898","observation_id":"cf8c1e56-0e05-4c18-863e-8210e8fc30a9","resolution":{"observed_at":"2026-08-08T12:20:34.346166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:34.326179Z","title":"CXL- ANNS:Software-Hardware collaborative memory disaggregation and computation for Billion-Scale approximate nearest neighbor search,","venue":null,"work_id":"7c34dbee-00d6-4920-82af-b01f7b14f3e8","year":2023},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-10T17:56:54.790182Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.035788Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:916347aaa67aac4b7c7af04dc832e2cf180bc5c0fd162851fd43b5dfa28a8291","observation_id":"603106db-8e52-428a-ae24-61bfd7d88e38","resolution":{"observed_at":"2026-08-08T12:20:34.331209Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:34.311959Z","title":"Demystifying a CXL type-2 device: A heterogeneous cooperative computing perspective,","venue":null,"work_id":"f5f4a381-5e1f-4af0-b6c5-5f584100477c","year":2024},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-10T17:56:54.790182Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.039789Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:43c7335a49e90b58f8cf43f48004caa4441c068034ef333b41326c1702c1b422","observation_id":"87c81be1-a3bc-4fd6-9f5a-b51186bcc96a","resolution":{"observed_at":"2026-08-08T12:20:34.316528Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:34.297796Z","title":"Near-memory processing in action: Accelerating personalized recommendation with AxDIMM,","venue":null,"work_id":"22751bf3-7737-4d02-9039-30df616e41a8","year":2022},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-10T17:56:54.790182Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.043876Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:970f043cb8724385f7fb519b9382e5ab876a06ec53499d30e29b8cdab92c6690","observation_id":"c4484558-365f-4596-83b0-dc321f67ef16","resolution":{"observed_at":"2026-08-08T12:20:34.301991Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:34.284242Z","title":"Efficient memory management for large language model serving with pagedattention,","venue":null,"work_id":"cb35fbdd-e9c4-4ab9-8b5e-f346616711f8","year":2023},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-10T17:56:54.790182Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.047737Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:cf377315552080dd3564e342761466ed47c924520e4af7a7e4ad3abf9cae1625","observation_id":"5c081dc6-d69a-4784-9f6e-ca29ad58f597","resolution":{"observed_at":"2026-08-08T12:20:34.288408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:34.270268Z","title":"25.4 a 20nm 6GB function-in-memory DRAM, based on HBM2 with a 1.2TFLOPS programmable computing unit using bank- level parallelism, for machine learning applications,","venue":null,"work_id":"8bd7ab61-458b-4c85-9c62-bab4a7e1aae4","year":2021},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-10T17:56:54.790182Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.051744Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:b0ef65915e4b3565264e0d2bebd9804b4f571fd4c2f13d1aca6e19b4e2467d57","observation_id":"c1265bc4-30ea-44d6-9eb3-14dd5778eb7d","resolution":{"observed_at":"2026-08-08T12:20:34.275160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:34.255902Z","title":"TensorDIMM: A practical near-memory processing architecture for embeddings and tensor operations in deep learning,","venue":null,"work_id":"6e6b5b58-595c-4530-920d-fb2b69474f96","year":2019},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-10T17:56:54.790182Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.055486Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:01cf5f857e33958da321d4a07d36c8caf9b3e80b6838223c0f8c7b5b9bf28ae8","observation_id":"00d9074d-7b48-4743-83e8-d4504db83dbd","resolution":{"observed_at":"2026-08-08T12:20:34.260353Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:34.242689Z","title":"Tensor casting: Co-designing algorithm- architecture for personalized recommendation training,","venue":null,"work_id":"19bcd537-783b-43aa-b43f-5cfa86d033eb","year":2021},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-10T17:56:54.790182Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.059021Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:43b02fdba878e260b0dcca262005b65fbbbb31d5093cf5c6ab24d5e0214a08fa","observation_id":"dbead095-a5e6-4a04-ac99-2ff2af513e90","resolution":{"observed_at":"2026-08-08T12:20:34.246975Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:34.229186Z","title":"A 1ynm 1.25v 8gb, 16gb/s/pin gddr6-based accelerator- in-memory supporting 1tflops mac operation and various activation functions for deep-learning applications,","venue":null,"work_id":"a32f9faf-021f-44bc-9074-ea71d707b597","year":2022},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-10T17:56:54.790182Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.062588Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:1ca8c2bbc2225fb348a127035ecaaef17a77cdbd025791eaa3d4a41b37d62d62","observation_id":"eca4a8b5-00f1-4406-adcb-73789c572852","resolution":{"observed_at":"2026-08-08T12:20:34.233422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:34.216486Z","title":"Hardware architecture and software stack for PIM based on commercial DRAM technology: Industrial product,","venue":null,"work_id":"a072a2dd-c88b-4d1f-99c6-ab213d759c83","year":2021},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-10T17:56:54.790182Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.066232Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:b1b50632891635eb815298760fca6b18a135f248931aca3efb4086e1dd1a7d5d","observation_id":"6545275e-dcd4-4aa5-8c09-53d6b16eff9a","resolution":{"observed_at":"2026-08-08T12:20:34.220462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:34.202794Z","title":"Evaluating modern GPU interconnect: PCIe, NVLink, NV- SLI, NVSwitch and GPUDirect,","venue":null,"work_id":"fd694f7c-9c7e-4a8d-a6e8-71c8c1cd0ff0","year":2020},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-10T17:56:54.790182Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.069807Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:e83e1da4abdceb0a6342b818a4360d4ec5b16671208ef77ed12cbf259661244a","observation_id":"e264a6ff-77c1-4c47-ab56-446455acbc6b","resolution":{"observed_at":"2026-08-08T12:20:34.207615Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:34.187928Z","title":"Pond: CXL-based memory pooling systems for cloud platforms,","venue":null,"work_id":"532debd6-4c50-4aed-ba07-4ea34a75e3e5","year":2023},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-10T17:56:54.790182Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.073545Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:a113360b8780d0bfd20382231226935a4c9fae4a9df4680551e0efb812d972ea","observation_id":"e741aee0-a685-4f02-a73b-0f206e053179","resolution":{"observed_at":"2026-08-08T12:20:34.192748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.11240","last_updated":"2024-01-20T14:37:48Z","snapshot_observed_at":"2026-07-06T17:18:16.042313Z","submitted_at":"2024-01-20T14:37:48Z","title":"CaraServe: CPU-Assisted and Rank-Aware LoRA Serving for Generative LLM Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.11240","snapshot_observed_at":"2026-08-08T12:20:33.077193Z","title":"CaraServe: CPU-assisted and rank-aware LoRA serving for generative LLM inference,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-10T17:56:54.790182Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.077193Z"},"links":{"cited_paper":"/paper/2401.11240","citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:4d3ef589874ce09b138dc136ce4a047af82ab54bb0ce5a2da50ecf999ed6e867","observation_id":"60d133cf-caeb-4cbc-9a60-cdddbcbacc21","resolution":{"observed_at":"2026-08-08T12:20:33.077193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:34.172913Z","title":"Prefix-tuning: Optimizing continuous prompts for generation,","venue":null,"work_id":"b6365c28-2e72-45ea-9e96-3656ab461a30","year":2021},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-10T17:56:54.790182Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.081343Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:c23f2dcff2f717bcc5af271d6b14b80e0766b29caa89d619d4630630cc05384c","observation_id":"8ef50a4e-316d-410a-856a-5dd7ebdebc21","resolution":{"observed_at":"2026-08-08T12:20:34.177710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:34.157562Z","title":"Disaggregated memory for expansion and sharing in blade servers,","venue":null,"work_id":"cf6e6905-1cb8-4111-b760-8c981baf9d81","year":2009},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-10T17:56:54.790182Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.084834Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:bdbfdf5fcebc3634d30f6a7514e7e2baec1da2a3443ae89777bb765984c0a349","observation_id":"d6d8838d-a5bb-424e-8d1b-fc5d791d6fa9","resolution":{"observed_at":"2026-08-08T12:20:34.163136Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:34.141474Z","title":"Enabling efficient large recommendation model training with near cxl memory processing,","venue":null,"work_id":"f72a9a00-f4b0-4475-8c30-64a1d32d8726","year":2024},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-10T17:56:54.790182Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.088629Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:07a511b503bbd3983856a4c9e2227feb450f5b6d90506e978c5102cc87d371d0","observation_id":"4ffefbb9-a924-487c-bd9a-e81df163b784","resolution":{"observed_at":"2026-08-08T12:20:34.146719Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:34.126661Z","title":"Make LLM inference affordable to everyone: Augmenting GPU memory with NDP-DIMM,","venue":null,"work_id":"fe29eb0e-957e-4acd-bdb2-dd88e014784b","year":2025},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-10T17:56:54.790182Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.092440Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:2ea43e68c3f62eeb8a0fb29a33304600720c54e4fad3a4bf0b65b979b49b9f4b","observation_id":"347e8d3c-13c8-4fe8-9a7e-61b9f87035cb","resolution":{"observed_at":"2026-08-08T12:20:34.131485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-08T12:20:33.096095Z","title":"The llama 3 herd of models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-10T17:56:54.790182Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.096095Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:8d7480903632643df86b4fd2aa238daa10e317ae82bf647b66c1196305800566","observation_id":"36dd16d6-4c5a-49ed-8a42-cb92310fcd23","resolution":{"observed_at":"2026-08-08T12:20:33.096095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:34.110167Z","title":"LLaMAX: Scaling linguistic horizons of LLM by enhancing translation capabilities beyond 100 languages,","venue":null,"work_id":"658d2f50-40d0-4090-9210-00cb511d8a05","year":2024},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-10T17:56:54.790182Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.100034Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:20782a38835a44ef8d110cdfcffd7e663260a28cbd65408135078f04ff8f8489","observation_id":"62cf7a44-592b-4eb0-b95b-2f84b28d772c","resolution":{"observed_at":"2026-08-08T12:20:34.115705Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:34.094641Z","title":"PEFT: State-of-the-art parameter-efficient fine-tuning methods,","venue":null,"work_id":"de957372-9251-4736-a9cb-0da36c43ae73","year":2022},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-10T17:56:54.790182Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.103859Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:bd009eaaa213539bb8d5a3d4a8e4f33b37fd9c19f0038c5e14b438eee98556b8","observation_id":"62eca269-efd8-45ca-a267-d14d13fef162","resolution":{"observed_at":"2026-08-08T12:20:34.099912Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:34.037396Z","title":"SiFive bakes NVIDIA’s NVLink fusion into its RISC-V CPU IP,","venue":null,"work_id":"024f5dff-3530-46e6-8e18-0424cd1c740d","year":2026},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-10T17:56:54.790182Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.107529Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:53c597da51880ab2caae4d06610c07ea5830e83bcc4ab9ce79840a5693dcf497","observation_id":"b5618d45-e855-46a2-85eb-827313a7cf5d","resolution":{"observed_at":"2026-08-08T12:20:34.065572Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:33.997701Z","title":"Tpp: Transparent page placement for cxl-enabled tiered-memory,","venue":null,"work_id":"fbfda2ed-556b-4f5d-8602-daa6e700376e","year":2023},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-10T17:56:54.790182Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.111582Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:d52154a2586aa58407a4e54e65b1b6c8962d949b16ba458d1727aae4f8692788","observation_id":"18542b4f-e8c7-4556-860c-3ea974fca217","resolution":{"observed_at":"2026-08-08T12:20:34.011878Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:33.969789Z","title":"Marvell introduces breakthrough Structera CXL product line to address server memory bandwidth and capacity challenges in cloud data centers,","venue":null,"work_id":"df0616a7-94a7-4896-b3fa-95fd2552933a","year":2024},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-10T17:56:54.790182Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.115322Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:9f530a070dc4ed2a2f7d235be9e229987b7f0a89242240adb291ec9f509634f1","observation_id":"d86235cc-866b-4886-b8b3-5a2f40470676","resolution":{"observed_at":"2026-08-08T12:20:33.979110Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:33.950920Z","title":"Specinfer: Accelerating large language model serv- ing with tree-based speculative inference and verification,","venue":null,"work_id":"22dd4737-4f83-4bed-961b-b2ecc7e134ae","year":2024},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-10T17:56:54.790182Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.119339Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:ee683bda55abeff4c4ba0eb6ab0a1ff74843264a96822593f49908e7ebe9ce9e","observation_id":"615b1e46-b7d1-4296-81e4-5101c9121aa3","resolution":{"observed_at":"2026-08-08T12:20:33.958050Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:33.936468Z","title":"Micron launches memory expansion module portfolio to accelerate CXL 2.0 adoption,","venue":null,"work_id":"67ac794c-48bb-4848-9d66-86b0445d5f77","year":2023},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-10T17:56:54.790182Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.123307Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:9d1a982b19a603eca9c589a37d07c09d71f41640a742773435635a178e56d059","observation_id":"0e5d50dd-e7e7-456a-b32a-08a12cd1e454","resolution":{"observed_at":"2026-08-08T12:20:33.941089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:33.915511Z","title":"Nvidia licenses NVLink memory ports to CPU and accelerator makers,","venue":null,"work_id":"ae7ad052-a153-42cc-adca-aeae759122a2","year":2025},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-10T17:56:54.790182Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.127195Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:1304548daede3e75da03f072219315c70e72dabb64291e98997f15aeb0840c2a","observation_id":"fee3e2c8-27f6-4956-bf35-a72e7b29a6c7","resolution":{"observed_at":"2026-08-08T12:20:33.925238Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:33.130901Z","title":"Using an llm to help with code understanding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-10T17:56:54.790182Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.130901Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:cf7866fbf2c0ad9000c51bf549977daf0b21c465f7e196ab8464c50c1f64a073","observation_id":"34036524-fbd9-43c8-8821-9108f983752e","resolution":{"observed_at":"2026-08-08T12:20:33.130901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:33.884263Z","title":"Understanding pcie performance for end host networking,","venue":null,"work_id":"8d240420-c8de-4e84-857d-72bb611219a0","year":2018},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-10T17:56:54.790182Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.135208Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:32493215040172543c0056bd97d05b6b70098ebc77928fa6e6013796a0995113","observation_id":"a18e6e79-f6ff-4149-a6c7-621212ebc081","resolution":{"observed_at":"2026-08-08T12:20:33.891676Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:33.868295Z","title":"NVIDIA A100 Tensor Core GPU Archi- tecture,","venue":null,"work_id":"eaec2988-5f94-48a8-9baf-3c6a43183b3f","year":2020},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-10T17:56:54.790182Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.139202Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:90c11bd64afc9b0a270f88d6dab88eabd166892dfa412a96e353d0e23b7f6542","observation_id":"bb34a211-d656-430f-bb51-baa45980a68a","resolution":{"observed_at":"2026-08-08T12:20:33.873169Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:33.851367Z","title":"NVIDIA H100 Tensor Core GPU Architecture,","venue":null,"work_id":"f1191fe8-7682-4947-a36a-64a131f549ac","year":2023},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-10T17:56:54.790182Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.143668Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:e172cdff9283b8a85389e0c078b2e0190b32f0931cce29e08401722f38570a83","observation_id":"023d15a2-8f36-47e2-91e6-0102727b2a7f","resolution":{"observed_at":"2026-08-08T12:20:33.856858Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:33.836860Z","title":"NVIDIA unveils NVLink fusion for industry to build semi-custom AI infrastructure with NVIDIA partner ecosystem,","venue":null,"work_id":"151c6fb2-ff91-4710-9232-6cb7b19f30f7","year":2025},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-10T17:56:54.790182Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.147807Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:51bac2a3e1158c05a430761e7b3c55e9586d0cbd79c409826d868bc382c6e858","observation_id":"65df5acb-b8f0-4302-8de1-f240d2fc1488","resolution":{"observed_at":"2026-08-08T12:20:33.841798Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:33.822188Z","title":"Extended GPU memory,","venue":null,"work_id":"66ade677-4d20-4ea0-a90f-674039ced2d1","year":2026},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-10T17:56:54.790182Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.152193Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:5b5ffad5425b54f62f0eef0e869e13ab9ab2204dcbd375246e42b7f09385dce2","observation_id":"f7b87e51-933d-474a-bbba-9fab2e07bccb","resolution":{"observed_at":"2026-08-08T12:20:33.827502Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:33.808159Z","title":"NVLink-C2C: Chip interconnect technology,","venue":null,"work_id":"f1dcfcba-5497-40a9-af50-97cab53f230e","year":2026},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-10T17:56:54.790182Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.156541Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:4279d614753a4c7678bdaabfe6e1f48bc55a61a76b4f821bb4f2772a923a11b6","observation_id":"93ac9855-2b9e-4d34-ab4f-f830ec7374ad","resolution":{"observed_at":"2026-08-08T12:20:33.812443Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:33.793726Z","title":"NVLink: The scale-up network for AI factories,","venue":null,"work_id":"0ee07d10-70c4-4763-b3b2-a3110c4cdcf0","year":2026},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-10T17:56:54.790182Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.160514Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:8a71f00692d2634ac4e814cc673ceb43341f34a9f85fb4d0e4bcfc74ae6b19d4","observation_id":"ea828bc0-abbb-44b4-9b5c-7ce9a90578fa","resolution":{"observed_at":"2026-08-08T12:20:33.798540Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-08T12:20:33.164550Z","title":"GPT-4 technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-10T17:56:54.790182Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.164550Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:7f669fc6c38f037882032c0a0ce6bc6f567430029b3e17350d0ea34c0b48f8c2","observation_id":"37772516-2d86-4f4a-be92-45fe20ade695","resolution":{"observed_at":"2026-08-08T12:20:33.164550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:33.778794Z","title":"Attacc! unleashing the power of pim for batched transformer- based generative model inference,","venue":null,"work_id":"41ebda7a-5c64-4d94-85f7-d8e4c2ac5212","year":2024},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-10T17:56:54.790182Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.168658Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:e37dbdba0352af590e364737e1a58087b7832970e39e9f5c9c57d26e5a911fab","observation_id":"89914902-774f-440e-ba6a-81f29c951446","resolution":{"observed_at":"2026-08-08T12:20:33.783222Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:33.763903Z","title":"Trim: Enhancing processor-memory interfaces with scalable tensor reduction in memory,","venue":null,"work_id":"f51d5a5e-6b7f-43ee-aea3-257f3b08b098","year":2021},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-10T17:56:54.790182Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.172635Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:76a681bd3cf68b01b2ccadc7d6c726e31af0f91b3f18068212ce05077b70de5f","observation_id":"16ead26d-fcc7-4674-b0aa-c35531f3fcb3","resolution":{"observed_at":"2026-08-08T12:20:33.768997Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:33.749105Z","title":"An LPDDR-based CXL-PNM platform for TCO-efficient inference of transformer-based large language models,","venue":null,"work_id":"bd7f3505-9528-4cd3-ae2f-0d8bb1de89b0","year":2024},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-10T17:56:54.790182Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.177062Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:0abc3e5e8635e397e1cbe6d772f5b0ebf7e4abc68015b09a1768de8d0f65826b","observation_id":"421507d8-8832-4f9f-b084-7326cc4b1248","resolution":{"observed_at":"2026-08-08T12:20:33.754061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:33.734407Z","title":"System optimization of data analytics platforms using compute express link (CXL) memory,","venue":null,"work_id":"bdf8c9aa-b59e-47ba-a7bf-00208367e5ac","year":2023},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-10T17:56:54.790182Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.181093Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:9a0af437a829c0d2a25ed94311dc37276bc3ecae255544f671019f4c138fea67","observation_id":"7b524d22-1bff-4130-a21e-a660c63023db","resolution":{"observed_at":"2026-08-08T12:20:33.738800Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:33.710823Z","title":"Samsung CXL solutions: CMM-H (CXL memory module – hybrid),","venue":null,"work_id":"7e86bc5a-b76e-4603-ab2d-a8effc66ebb3","year":null},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-10T17:56:54.790182Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.185053Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:cf0adc4af39f3ebab0499c22cf1093e215b25d51da97cf899aff6fe7600e4298","observation_id":"714db274-4749-48b0-926c-472b1b40c875","resolution":{"observed_at":"2026-08-08T12:20:33.724966Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:33.662033Z","title":"Flashattention-3: Fast and accurate attention with asynchrony and low- precision,","venue":null,"work_id":"ff2e885e-a80e-4bdd-b087-ef38b3f3b680","year":2024},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-10T17:56:54.790182Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.193724Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:2881727c18f4b90063f5152aa0e54f576e20a9e74654a7537601a8750ea0ca1c","observation_id":"7f7d6d72-7bf6-4290-9b39-d252786c12ac","resolution":{"observed_at":"2026-08-08T12:20:33.669240Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:33.643083Z","title":"Pci express® 6.0 specification at 64.0 gt/s with pam- 4 signaling: a low latency, high bandwidth, high reliability and cost- effective interconnect,","venue":null,"work_id":"0613da63-410d-4971-abca-c676793196a1","year":2020},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-10T17:56:54.790182Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.197983Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:a22bedc21120d54bd6387c7bc8dca0399138efaa18b27f6da86ca335c0b223b4","observation_id":"26fd3423-b93e-4e2c-8902-2e5e32978542","resolution":{"observed_at":"2026-08-08T12:20:33.649764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:33.626544Z","title":"S-LoRA: Serving thousands of concurrent LoRA adapters,","venue":null,"work_id":"9d03d436-72f4-4cb8-bc1c-77ee2a4b707d","year":2024},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-10T17:56:54.790182Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.201907Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:52f29915e15c77991132277b25a193e9265db38ab6ca7bff1dfdd272bc2687e8","observation_id":"6f287182-2079-498a-a837-c5cfdaa79027","resolution":{"observed_at":"2026-08-08T12:20:33.631792Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:33.610975Z","title":"Flexgen: High-throughput generative inference of large language models with a single gpu,","venue":null,"work_id":"9b9039a5-3a99-476c-abb6-665f1a8ea3b0","year":2023},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-10T17:56:54.790182Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.205753Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:51e66110995df7da14c9ea6be0e28002026cb13111193fd398dabde31b96b881","observation_id":"c2db919a-02dd-485c-bd2c-4c5b9a6963b8","resolution":{"observed_at":"2026-08-08T12:20:33.615867Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:33.595425Z","title":"NVIDIA announces NVLink fusion: Bringing NVLink to third-party CPUs and accelerators,","venue":null,"work_id":"728d2ed9-45c7-4d32-8315-665694899c15","year":2025},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-10T17:56:54.790182Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.209938Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:f9283e91f59259482e12c37ba329c849841095b72b641d8a05989a587107caad","observation_id":"e962fbe3-bb83-4e95-821d-d784465916ce","resolution":{"observed_at":"2026-08-08T12:20:33.600341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:33.580975Z","title":"Demysti- fying CXL memory with genuine CXL-ready systems and devices,","venue":null,"work_id":"e1b0ff04-4daf-4375-91ad-ce028ca6ded2","year":2023},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-10T17:56:54.790182Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.214124Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:902d7d38c46b2b0565ceafc30cd4aec6f9ba53dc601266496801daf833c9c53a","observation_id":"06ac0306-38c1-4bac-9d86-33e22411884e","resolution":{"observed_at":"2026-08-08T12:20:33.585491Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:33.566450Z","title":"NVIDIA’s NVLink fusion stays proprietary, third parties can only work around it,","venue":null,"work_id":"71de2898-3438-42c7-a3ee-c304826c2e06","year":2025},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-10T17:56:54.790182Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.218273Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:ca84e823780fd902bdc5c0fe4bfbb0dd8862b96aa0b87624c30ca6237ba998ea","observation_id":"be69a7b1-3993-4468-8b85-b2dfe10148ae","resolution":{"observed_at":"2026-08-08T12:20:33.571469Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-08T12:20:33.222028Z","title":"Llama 2: Open foundation and fine-tuned chat models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-10T17:56:54.790182Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.222028Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:8965e79effcc9d648036fdf33229cd96811bdfc78c4f46ae5925af31c6b9b98d","observation_id":"bba8b162-dc34-4b8a-863a-daefb14c5461","resolution":{"observed_at":"2026-08-08T12:20:33.222028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:33.550714Z","title":"Introducing UALink 200g 1.0 specification,","venue":null,"work_id":"9568b44b-c4c4-49be-8788-63d1f68fcf33","year":2025},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-10T17:56:54.790182Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.226083Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:49b5e49c9827279503a6599ca57088dbf9031268702c43d88dec4399463d67ce","observation_id":"de0703f1-8098-405e-87f4-b4059b6dbeac","resolution":{"observed_at":"2026-08-08T12:20:33.555910Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:33.536348Z","title":"RAG-based LLM chatbot using Llama-2,","venue":null,"work_id":"438296b9-91b0-49c6-a39f-6495d42ab2ad","year":2024},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-10T17:56:54.790182Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.229877Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:24ca834eac53eeaa797554f37db0b1bb9f05fce30924d0cceeb6be74b787d85f","observation_id":"77e29f3c-d11b-40bd-b72d-bcd1d63c4241","resolution":{"observed_at":"2026-08-08T12:20:33.540781Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:33.233661Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-10T17:56:54.790182Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.233661Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:46833d80c8f417d462276dcaffd6e60b516ac791790eb6f2cb7668d128bf3736","observation_id":"575ba757-7920-4f94-a221-c16d6aadc94d","resolution":{"observed_at":"2026-08-08T12:20:33.233661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:33.509742Z","title":"CodeT5: Identifier-aware unified pre-trained encoder-decoder models for code understanding and generation,","venue":null,"work_id":"75496e9b-8e3d-4cfc-a60e-11cf6410da05","year":2021},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-10T17:56:54.790182Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.237540Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:c10cee49267339d0619de0828b36c9e01c9fbf390fc6bb6acd0551cce99c9371","observation_id":"23d86cb9-f84e-41ac-bba5-004e4e5e0757","resolution":{"observed_at":"2026-08-08T12:20:33.514676Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:33.494414Z","title":"Towards memory disaggregation via NVLink C2C: Benchmarking CPU-requested GPU memory access,","venue":null,"work_id":"440ddfb4-cdcd-499d-acf7-3ef2e0d64af4","year":2025},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-10T17:56:54.790182Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.241635Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:157b5740204f1bacef112d56049fd951e39eb6b8bafd95fd16a69abdf85629cc","observation_id":"3ba0a593-5564-47de-b4e4-7e5ccfd899c7","resolution":{"observed_at":"2026-08-08T12:20:33.499655Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:33.479763Z","title":"dLoRA: Dynami- cally orchestrating requests and adapters for LoRALLM serving,","venue":null,"work_id":"8ff3ff20-3c87-475c-a730-55c666bd771b","year":2024},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-10T17:56:54.790182Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.245554Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:15b9007339344e2f4024dba4bf5f8dc06d169ecc6c8240722c6bd54c2cf7c9db","observation_id":"1546ed30-3624-4b56-89b0-ee37b2cf26a3","resolution":{"observed_at":"2026-08-08T12:20:33.484647Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:33.465709Z","title":"Overcoming the memory wall with CXL- EnabledSSDs,","venue":null,"work_id":"102c557e-8352-4f2d-81e5-345009c4d516","year":2023},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-10T17:56:54.790182Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.249303Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:14f798d61f332a5c3e57d84dab87b332febe777ba8c1fc38eea006148036065e","observation_id":"3a8b3a48-e8bc-44d1-becf-abaf1122fe09","resolution":{"observed_at":"2026-08-08T12:20:33.470176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:33.450959Z","title":"Orca: A distributed serving system for Transformer-Based generative models,","venue":null,"work_id":"33c2628c-bc46-47d1-9ba6-41977a302de6","year":2022},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-10T17:56:54.790182Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.253214Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:d5ed14169e57a826261206c8ce6133c6be378806c48e24768fa83e7bd613a7e7","observation_id":"960e80d9-f6f7-4127-a171-cea507e390c1","resolution":{"observed_at":"2026-08-08T12:20:33.455342Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:33.265097Z","title":"SGLang: Efficient execution of structured language model programs,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-10T17:56:54.790182Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.265097Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:3ef21b9bd7c6b3058ccac9f96a8a91169751dc877ab11a179a2ff2b98dd92c6a","observation_id":"8093c004-5ed9-452e-95d6-a765fd4b8ccd","resolution":{"observed_at":"2026-08-08T12:20:33.265097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:33.428368Z","title":"DistServe: Disaggregating prefill and decoding for goodput- optimized large language model serving,","venue":null,"work_id":"9cec0990-e04f-496e-a587-af11aadb1cd1","year":2024},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-10T17:56:54.790182Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.269028Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:ad049c4aaaffea618dbbdd97d6edfae4fe45cb91f408eeb4ea73068397fad934","observation_id":"cdd4b648-11f9-4093-a2db-1c85884fbc89","resolution":{"observed_at":"2026-08-08T12:20:33.432764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:33.414374Z","title":"Remap-SSD: Safely and efficiently exploiting SSD address remapping to eliminate duplicate writes,","venue":null,"work_id":"4763b6fb-ca5e-4baf-adbb-c5cfb072bd0b","year":2021},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-10T17:56:54.790182Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.272989Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:9d396183ce8b7137c06ee618163adc208637e26c3ff592a46f420a6b4fb0f01b","observation_id":"1d2fd4d4-375a-4ec2-ab5a-989143d79c13","resolution":{"observed_at":"2026-08-08T12:20:33.418903Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:33.397273Z","title":"NeoMem: Hardware/software co- design for CXL-native memory tiering,","venue":null,"work_id":"d1dc771e-7ac1-4cf4-b777-2778bf96e7f7","year":2024},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-10T17:56:54.790182Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.276786Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:455924d91309a0ef1e2adb76e75644a4ccd002ba3ae984a28702cf073caafe73","observation_id":"1859044a-ba1b-4bd1-b1f5-24b53dd0e992","resolution":{"observed_at":"2026-08-08T12:20:33.403267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:33.682963Z","title":"Available: https://semiconductor.samsung.com/news- events/tech-blog/samsung-cxl-solutions-cmm-h/","venue":null,"work_id":"89555c88-360a-4d36-a002-fc70d90f7547","year":null},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-10T17:56:54.790182Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.189443Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:ff66f22af2ff2ba4bf487eb2af6220998421e2fedd4a05cdb971425318c2cd60","observation_id":"75041bd3-741f-4775-9240-522b8c324162","resolution":{"observed_at":"2026-08-08T12:20:33.694035Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.22017","last_updated":"2025-03-27T22:16:57Z","snapshot_observed_at":"2026-08-10T17:56:24.280140Z","submitted_at":"2025-03-27T22:16:57Z","title":"Performance Characterizations and Usage Guidelines of Samsung CXL Memory Module Hybrid Prototype","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.22017","snapshot_observed_at":"2026-08-08T12:20:33.261299Z","title":"Available: https://arxiv.org/abs/2503.22017","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-10T17:56:54.790182Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.261299Z"},"links":{"cited_paper":"/paper/2503.22017","citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:3a68473839f73daddeab21668a597c9714b32961ca6737e6134e7f9c35284113","observation_id":"456926f1-a6f7-4ff2-a75d-4ae099b1492b","resolution":{"observed_at":"2026-08-08T12:20:33.261299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","latest_version":1,"primary_category":"cs.AR","snapshot_observed_at":"2026-08-10T17:56:54.790182Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving"},"reference_resolution":{"displayed":84,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":15,"verified_exact":0,"verified_fuzzy":69},"total_outbound_references":84},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 84 of 84 outbound references and 0 inbound Pith citation observations for arXiv:2608.05483."}