{"as_of":"2026-08-10T00:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:275a6164818f93be6a495ec5124c74ad9ef864bee5097baea6f01303e13daff5","coverage":[{"denominator":47,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":47,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:58:07.427165Z","state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T13:52:43.151100Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.23072","last_updated":"2025-05-29T04:24:56Z","snapshot_observed_at":"2026-08-09T20:15:37.848968Z","submitted_at":"2025-05-29T04:24:56Z","title":"Speeding up Model Loading with fastsafetensors","version":1},"cited_work":{"arxiv_id":"2505.23072","doi":"10.48550/arxiv.2505.23072","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23072","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2025 , eprint =","venue":"ArXiv.org","work_id":"727627f2-2663-46ce-897e-67bfd30b6a96","year":2025},"citing_paper":{"arxiv_id":"2605.29639","last_updated":"2026-05-28T09:07:06Z","snapshot_observed_at":"2026-08-09T19:32:18.545752Z","submitted_at":"2026-05-28T09:07:06Z","title":"RTP-LLM: High-Performance Alibaba LLM Inference Engine","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-06-28T23:52:40.763228Z"},"links":{"cited_paper":"/paper/2505.23072","citing_paper":"/paper/2605.29639"},"observation_digest":"sha256:3f62fbe3dd171458ece6334d319f3a4182287534707394995d47018fb4efbfe9","observation_id":"42ecb65a-73c0-4442-bca7-7388a2662378","resolution":{"observed_at":"2026-06-28T23:52:49.146323Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23072","last_updated":"2025-05-29T04:24:56Z","snapshot_observed_at":"2026-08-09T20:15:37.848968Z","submitted_at":"2025-05-29T04:24:56Z","title":"Speeding up Model Loading with fastsafetensors","version":1},"cited_work":{"arxiv_id":"2505.23072","doi":"10.48550/arxiv.2505.23072","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23072","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2025 , eprint =","venue":"ArXiv.org","work_id":"727627f2-2663-46ce-897e-67bfd30b6a96","year":2025},"citing_paper":{"arxiv_id":"2606.23969","last_updated":"2026-07-09T21:35:14Z","snapshot_observed_at":"2026-08-08T06:46:09.840905Z","submitted_at":"2026-06-22T21:48:53Z","title":"The Serialized Bridge: Understanding and Recovering LLM Serving Performance under Blackwell GPU Confidential Computing","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-06-26T06:39:04.161585Z"},"links":{"cited_paper":"/paper/2505.23072","citing_paper":"/paper/2606.23969"},"observation_digest":"sha256:751dd5312195b239c035933142a36aa9c6fb24995cf0c85b59b713a9f1d10641","observation_id":"7d5d1c20-ccf9-4905-a4bf-701289fb01aa","resolution":{"observed_at":"2026-06-26T22:10:09.429560Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23072","last_updated":"2025-05-29T04:24:56Z","snapshot_observed_at":"2026-08-09T20:15:37.848968Z","submitted_at":"2025-05-29T04:24:56Z","title":"Speeding up Model Loading with fastsafetensors","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23072","snapshot_observed_at":"2026-07-13T07:20:36.786149Z","title":"Jianwei Zhu, Hang Yin, Peng Deng, Aline Almeida, and Shunfan Zhou","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.23969","last_updated":"2026-07-09T21:35:14Z","snapshot_observed_at":"2026-08-08T06:46:09.840905Z","submitted_at":"2026-06-22T21:48:53Z","title":"The Serialized Bridge: Understanding and Recovering LLM Serving Performance under Blackwell GPU Confidential Computing","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-13T07:20:36.786149Z"},"links":{"cited_paper":"/paper/2505.23072","citing_paper":"/paper/2606.23969"},"observation_digest":"sha256:d442d690c8cf13c97638bdababdc918db6226f21872b75ef270e9f7e1a51b8c7","observation_id":"c7989ea8-90ee-4b21-9d22-1c174033d54c","resolution":{"observed_at":"2026-07-13T07:20:36.786149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23072","last_updated":"2025-05-29T04:24:56Z","snapshot_observed_at":"2026-08-09T20:15:37.848968Z","submitted_at":"2025-05-29T04:24:56Z","title":"Speeding up Model Loading with fastsafetensors","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23072","snapshot_observed_at":"2026-08-01T13:52:43.151100Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18957","last_updated":"2026-07-21T10:49:12Z","snapshot_observed_at":"2026-08-09T07:33:02.026939Z","submitted_at":"2026-07-21T10:49:12Z","title":"InstantInfer: Enabling Fast LLM Cold Start with Communicating Finite Automata","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-01T13:52:43.151100Z"},"links":{"cited_paper":"/paper/2505.23072","citing_paper":"/paper/2607.18957"},"observation_digest":"sha256:b84d084422519c292f4e9b99bce552ff41336e2823ad7c36d052646bbf41e254","observation_id":"28bcb40f-0c63-43a1-96ad-41b4b97a7e89","resolution":{"observed_at":"2026-08-01T13:52:43.151100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.23072/citation-record","integrity":"/paper/2505.23072/integrity","json":"/paper/2505.23072/citation-record.json","paper":"/paper/2505.23072"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:12.580330Z","title":"Introducing ChatGPT,","venue":null,"work_id":"976ff8b7-0ed0-4938-94a8-7a304407a374","year":2022},"citing_paper":{"arxiv_id":"2505.23072","last_updated":"2025-05-29T04:24:56Z","snapshot_observed_at":"2026-08-09T20:15:37.848968Z","submitted_at":"2025-05-29T04:24:56Z","title":"Speeding up Model Loading with fastsafetensors","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:03.832875Z"},"links":{"citing_paper":"/paper/2505.23072"},"observation_digest":"sha256:1c441425225a27bef799a8bfdb0ab75656386122dc2c0c713db5373c6007d9ab","observation_id":"1eb807ef-31d1-4c1d-9bdf-4ecf60c58ed7","resolution":{"observed_at":"2026-08-07T12:58:12.656524Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:12.445696Z","title":"Introducing Gemini: our largest and most capable AI model,","venue":null,"work_id":"b4f4c401-0101-4a0b-8998-ea730707e47d","year":2023},"citing_paper":{"arxiv_id":"2505.23072","last_updated":"2025-05-29T04:24:56Z","snapshot_observed_at":"2026-08-09T20:15:37.848968Z","submitted_at":"2025-05-29T04:24:56Z","title":"Speeding up Model Loading with fastsafetensors","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:03.902873Z"},"links":{"citing_paper":"/paper/2505.23072"},"observation_digest":"sha256:b44018db2b302647e69a6f031e7b40bfdcecd4fd4d841907b0eb691385c19d31","observation_id":"f5b86204-bff4-4e3f-ac2b-9f89a0b3f10e","resolution":{"observed_at":"2026-08-07T12:58:12.492922Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:12.291649Z","title":"Granite Code Models: A Family of Open Foundation Models for Code Intelligence,","venue":null,"work_id":"e32d11b2-73e0-48ff-81d1-44dd78bedbe0","year":null},"citing_paper":{"arxiv_id":"2505.23072","last_updated":"2025-05-29T04:24:56Z","snapshot_observed_at":"2026-08-09T20:15:37.848968Z","submitted_at":"2025-05-29T04:24:56Z","title":"Speeding up Model Loading with fastsafetensors","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:03.973943Z"},"links":{"citing_paper":"/paper/2505.23072"},"observation_digest":"sha256:ebfefc8471123adf225da92ac42e6f2f9cfe0d0e9429a8b663d8fb34c90d7a20","observation_id":"9a68980f-964e-44a0-9507-846aeffe203f","resolution":{"observed_at":"2026-08-07T12:58:12.366624Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:12.133669Z","title":"The Shift from Models to Compound AI Systems,","venue":null,"work_id":"03954e49-4cfd-435c-a06b-060d7be1e7fd","year":2024},"citing_paper":{"arxiv_id":"2505.23072","last_updated":"2025-05-29T04:24:56Z","snapshot_observed_at":"2026-08-09T20:15:37.848968Z","submitted_at":"2025-05-29T04:24:56Z","title":"Speeding up Model Loading with fastsafetensors","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:04.077312Z"},"links":{"citing_paper":"/paper/2505.23072"},"observation_digest":"sha256:365c8742f51c22acfb18a5508e36744c22a48ff0d38234b827108ff6597a20d7","observation_id":"25defce5-5c40-4fd9-a40e-73806d7154ac","resolution":{"observed_at":"2026-08-07T12:58:12.176639Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:11.949048Z","title":"FlashAttention: Fast and memory-efficient exact attention with IO-awareness,","venue":null,"work_id":"b7551d52-6299-4c91-a02f-f3eb5ba76617","year":2022},"citing_paper":{"arxiv_id":"2505.23072","last_updated":"2025-05-29T04:24:56Z","snapshot_observed_at":"2026-08-09T20:15:37.848968Z","submitted_at":"2025-05-29T04:24:56Z","title":"Speeding up Model Loading with fastsafetensors","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:04.145099Z"},"links":{"citing_paper":"/paper/2505.23072"},"observation_digest":"sha256:65952aa85d6d83dcb88e49f28eff0d7ea586c3ae6914d5730e59aa44db105a46","observation_id":"87dc08d5-980d-4bd8-b7d9-83a130d7e7d3","resolution":{"observed_at":"2026-08-07T12:58:12.059280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:11.821852Z","title":"FlashAttention-2: Faster attention with better parallelism and work partitioning,","venue":null,"work_id":"00d56ddf-a0d0-40e3-a24b-a8633cba1ba9","year":2024},"citing_paper":{"arxiv_id":"2505.23072","last_updated":"2025-05-29T04:24:56Z","snapshot_observed_at":"2026-08-09T20:15:37.848968Z","submitted_at":"2025-05-29T04:24:56Z","title":"Speeding up Model Loading with fastsafetensors","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:04.214691Z"},"links":{"citing_paper":"/paper/2505.23072"},"observation_digest":"sha256:e92d85578993cd0b219b941704048e5d31f891652341893ec7521e7a7ed3702f","observation_id":"fd73d497-5dc8-42c4-9eb6-1b2a8d87bdc7","resolution":{"observed_at":"2026-08-07T12:58:11.895787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:11.720802Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention,","venue":null,"work_id":"e482cd0f-2755-4abb-b4ee-dbd2b2593259","year":2023},"citing_paper":{"arxiv_id":"2505.23072","last_updated":"2025-05-29T04:24:56Z","snapshot_observed_at":"2026-08-09T20:15:37.848968Z","submitted_at":"2025-05-29T04:24:56Z","title":"Speeding up Model Loading with fastsafetensors","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:04.304079Z"},"links":{"citing_paper":"/paper/2505.23072"},"observation_digest":"sha256:a2c9b6d0b39f73e63b42d85dc4aded818cd03cb2091481e1465f5ce985be3474","observation_id":"12cc850f-9c15-4005-87b1-9ae7c7d25ae2","resolution":{"observed_at":"2026-08-07T12:58:11.758834Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:11.536060Z","title":"Orca: A Distributed Serving System for Transformer-Based Generative Models,","venue":null,"work_id":"449c1a70-9a50-4a92-a77f-c35ce0fede12","year":2022},"citing_paper":{"arxiv_id":"2505.23072","last_updated":"2025-05-29T04:24:56Z","snapshot_observed_at":"2026-08-09T20:15:37.848968Z","submitted_at":"2025-05-29T04:24:56Z","title":"Speeding up Model Loading with fastsafetensors","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:04.350083Z"},"links":{"citing_paper":"/paper/2505.23072"},"observation_digest":"sha256:69fd726d34afdc24ed5c198dd6d2648f211228be7dbff881db47afe302cf218e","observation_id":"ae9808a8-4a8a-421d-9b8b-1cd773232cd5","resolution":{"observed_at":"2026-08-07T12:58:11.611414Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.19124","last_updated":"2024-06-06T18:38:34Z","snapshot_observed_at":"2026-07-06T18:07:23.217029Z","submitted_at":"2024-04-29T21:59:07Z","title":"Accelerating Production LLMs with Combined Token/Embedding Speculators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.19124","snapshot_observed_at":"2026-08-07T12:58:04.425862Z","title":"Accelerating Production LLMs with Combined Token/Embedding Speculators,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23072","last_updated":"2025-05-29T04:24:56Z","snapshot_observed_at":"2026-08-09T20:15:37.848968Z","submitted_at":"2025-05-29T04:24:56Z","title":"Speeding up Model Loading with fastsafetensors","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:04.425862Z"},"links":{"cited_paper":"/paper/2404.19124","citing_paper":"/paper/2505.23072"},"observation_digest":"sha256:a10a2d936585985de1284c4c1a5d35634e5482e320f8a3f8dd584154a2332f9e","observation_id":"e30d29f1-ab5e-4cdb-9cc2-d96cb0e427d8","resolution":{"observed_at":"2026-08-07T12:58:04.425862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09670","last_updated":"2024-06-06T15:50:51Z","snapshot_observed_at":"2026-08-05T00:28:57.370523Z","submitted_at":"2024-01-18T01:03:38Z","title":"DistServe: Disaggregating Prefill and Decoding for Goodput-optimized Large Language Model Serving","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.09670","snapshot_observed_at":"2026-08-07T12:58:04.496281Z","title":"DistServe: Disaggregating Prefill and Decoding for Goodput-optimized Large Language Model Serving,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23072","last_updated":"2025-05-29T04:24:56Z","snapshot_observed_at":"2026-08-09T20:15:37.848968Z","submitted_at":"2025-05-29T04:24:56Z","title":"Speeding up Model Loading with fastsafetensors","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:04.496281Z"},"links":{"cited_paper":"/paper/2401.09670","citing_paper":"/paper/2505.23072"},"observation_digest":"sha256:ecf4f890af36ee20524db0e9ed85bf67d25baadfe34a1622d4b295cb60cf902a","observation_id":"e64cecdc-7e37-422b-9e32-862ec995d3f4","resolution":{"observed_at":"2026-08-07T12:58:04.496281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:11.383480Z","title":"Taming throughput-latency tradeoff in llm inference with sarathi-serve,","venue":null,"work_id":"a7033e91-447b-4b82-a15e-bdf7349365a8","year":2024},"citing_paper":{"arxiv_id":"2505.23072","last_updated":"2025-05-29T04:24:56Z","snapshot_observed_at":"2026-08-09T20:15:37.848968Z","submitted_at":"2025-05-29T04:24:56Z","title":"Speeding up Model Loading with fastsafetensors","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:04.561087Z"},"links":{"citing_paper":"/paper/2505.23072"},"observation_digest":"sha256:ccd771cb3313eb659e7623cf93368400176097c9886284865f2694cca6aa8d9a","observation_id":"c2718510-a082-46bb-aa53-00fac5a49f0d","resolution":{"observed_at":"2026-08-07T12:58:11.472887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:11.237124Z","title":"Decrease PyTorch Model Load Times with CoreWeave’s Tensorizer,","venue":null,"work_id":"e9fd326a-47a4-42e8-aea5-b3352a472860","year":2024},"citing_paper":{"arxiv_id":"2505.23072","last_updated":"2025-05-29T04:24:56Z","snapshot_observed_at":"2026-08-09T20:15:37.848968Z","submitted_at":"2025-05-29T04:24:56Z","title":"Speeding up Model Loading with fastsafetensors","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:04.639769Z"},"links":{"citing_paper":"/paper/2505.23072"},"observation_digest":"sha256:ede6db5e116404d3c926e4b0e84a22cb3544acaaaa76870683353e68e03e4e2d","observation_id":"910f4ac6-e5ae-4023-9856-08bdf6a695fc","resolution":{"observed_at":"2026-08-07T12:58:11.309831Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14351","last_updated":"2024-07-25T08:08:11Z","snapshot_observed_at":"2026-08-05T17:30:19.943478Z","submitted_at":"2024-01-25T17:55:07Z","title":"ServerlessLLM: Low-Latency Serverless Inference for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14351","snapshot_observed_at":"2026-08-07T12:58:04.729125Z","title":"ServerlessLLM: Locality-Enhanced Serverless Inference for Large Language Models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23072","last_updated":"2025-05-29T04:24:56Z","snapshot_observed_at":"2026-08-09T20:15:37.848968Z","submitted_at":"2025-05-29T04:24:56Z","title":"Speeding up Model Loading with fastsafetensors","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:04.729125Z"},"links":{"cited_paper":"/paper/2401.14351","citing_paper":"/paper/2505.23072"},"observation_digest":"sha256:db46cff364bf0c8a7fd5921db32fa130a3c74b6674a229fb14dfda246b2b3607","observation_id":"cda45ea4-2e7e-4ab7-952f-e4009f79e25f","resolution":{"observed_at":"2026-08-07T12:58:04.729125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.04473","last_updated":"2021-08-23T19:41:13Z","snapshot_observed_at":"2026-08-08T01:15:17.906950Z","submitted_at":"2021-04-09T16:43:11Z","title":"Efficient Large-Scale Language Model Training on GPU Clusters Using Megatron-LM","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.04473","snapshot_observed_at":"2026-08-07T12:58:04.791744Z","title":"Efficient Large-Scale Language Model Training on GPU Clusters Using Megatron-LM,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23072","last_updated":"2025-05-29T04:24:56Z","snapshot_observed_at":"2026-08-09T20:15:37.848968Z","submitted_at":"2025-05-29T04:24:56Z","title":"Speeding up Model Loading with fastsafetensors","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:04.791744Z"},"links":{"cited_paper":"/paper/2104.04473","citing_paper":"/paper/2505.23072"},"observation_digest":"sha256:36e916fd58248960893028c561b3f301912694463e4a3347f2e30a6315586b08","observation_id":"2b1adefe-1e6a-4e8c-8fe1-fb2f309c00e3","resolution":{"observed_at":"2026-08-07T12:58:04.791744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:11.018428Z","title":"Safetensors,","venue":null,"work_id":"1b7fd1a4-9aad-4354-9011-26140382af5c","year":2024},"citing_paper":{"arxiv_id":"2505.23072","last_updated":"2025-05-29T04:24:56Z","snapshot_observed_at":"2026-08-09T20:15:37.848968Z","submitted_at":"2025-05-29T04:24:56Z","title":"Speeding up Model Loading with fastsafetensors","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:04.876060Z"},"links":{"citing_paper":"/paper/2505.23072"},"observation_digest":"sha256:989768efff191cd4505f9a93aef75096d26bd845696cc12f79c2b338054b816e","observation_id":"89ee66e9-bbba-4b12-ab18-81eab9f57679","resolution":{"observed_at":"2026-08-07T12:58:11.115727Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:10.819379Z","title":"Models – Hugging Face,","venue":null,"work_id":"a44a7044-2d26-4681-9125-7e0b64815b39","year":2025},"citing_paper":{"arxiv_id":"2505.23072","last_updated":"2025-05-29T04:24:56Z","snapshot_observed_at":"2026-08-09T20:15:37.848968Z","submitted_at":"2025-05-29T04:24:56Z","title":"Speeding up Model Loading with fastsafetensors","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:04.943400Z"},"links":{"citing_paper":"/paper/2505.23072"},"observation_digest":"sha256:54d4effe6b260961c71c9a8c0d5fd28c01c9a7a2a91ed18755feec88e56946ec","observation_id":"bc3dc6c4-e620-4184-8408-f68174e86e7b","resolution":{"observed_at":"2026-08-07T12:58:10.934865Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:10.603583Z","title":"pickle — Python object Serialization,","venue":null,"work_id":"e2cc6277-2fc2-4894-81f8-8031dff02752","year":null},"citing_paper":{"arxiv_id":"2505.23072","last_updated":"2025-05-29T04:24:56Z","snapshot_observed_at":"2026-08-09T20:15:37.848968Z","submitted_at":"2025-05-29T04:24:56Z","title":"Speeding up Model Loading with fastsafetensors","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:05.012673Z"},"links":{"citing_paper":"/paper/2505.23072"},"observation_digest":"sha256:eb353a1420924dac16eec932b1589a8f29b6afbfe7d311c3f023657c621e7949","observation_id":"8718fe95-bf6e-4e3d-8bfd-c7ac573d3059","resolution":{"observed_at":"2026-08-07T12:58:10.697345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:10.217384Z","title":"Pytorch,","venue":null,"work_id":"2ff4dbf0-040b-4cfb-bfc5-717f1a7c9c2b","year":2024},"citing_paper":{"arxiv_id":"2505.23072","last_updated":"2025-05-29T04:24:56Z","snapshot_observed_at":"2026-08-09T20:15:37.848968Z","submitted_at":"2025-05-29T04:24:56Z","title":"Speeding up Model Loading with fastsafetensors","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:05.160118Z"},"links":{"citing_paper":"/paper/2505.23072"},"observation_digest":"sha256:f956fba97219fe36d0fcf62580b579f620ad54c89c3ef11e431450cd68063529","observation_id":"a4160a11-7b76-4e06-ac30-f8ef8dab91ce","resolution":{"observed_at":"2026-08-07T12:58:10.287909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:10.363472Z","title":"Available: https://docs .python.org/3/library/pickle.html","venue":null,"work_id":"ecd2ef17-e684-425e-9a01-819b6604b23b","year":null},"citing_paper":{"arxiv_id":"2505.23072","last_updated":"2025-05-29T04:24:56Z","snapshot_observed_at":"2026-08-09T20:15:37.848968Z","submitted_at":"2025-05-29T04:24:56Z","title":"Speeding up Model Loading with fastsafetensors","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:05.086172Z"},"links":{"citing_paper":"/paper/2505.23072"},"observation_digest":"sha256:b181985747ce4eee31c41588712e61f00eda5da12aff602568fe6bbf74db9eaa","observation_id":"d5df08d8-f0c5-4082-a97e-39e272121d0e","resolution":{"observed_at":"2026-08-07T12:58:10.472708Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.07857","last_updated":"2021-04-16T02:22:12Z","snapshot_observed_at":"2026-08-08T13:19:57.834040Z","submitted_at":"2021-04-16T02:22:12Z","title":"ZeRO-Infinity: Breaking the GPU Memory Wall for Extreme Scale Deep Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.07857","snapshot_observed_at":"2026-08-07T12:58:05.322950Z","title":"ZeRO- Infinity: Breaking the GPU Memory Wall for Extreme Scale Deep Learning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23072","last_updated":"2025-05-29T04:24:56Z","snapshot_observed_at":"2026-08-09T20:15:37.848968Z","submitted_at":"2025-05-29T04:24:56Z","title":"Speeding up Model Loading with fastsafetensors","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:05.322950Z"},"links":{"cited_paper":"/paper/2104.07857","citing_paper":"/paper/2505.23072"},"observation_digest":"sha256:3a5373ab8fddf5c56dfe6f0100e798e082585b82abfcc8f1c2a7c22cc903180f","observation_id":"eac066d1-55ad-4914-9134-18f059fbd4c8","resolution":{"observed_at":"2026-08-07T12:58:05.322950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:10.066791Z","title":"TensorFlow: A System for Large-Scale Machine Learning,","venue":null,"work_id":"6a43a9f5-f698-4341-b114-5fda732d9817","year":2016},"citing_paper":{"arxiv_id":"2505.23072","last_updated":"2025-05-29T04:24:56Z","snapshot_observed_at":"2026-08-09T20:15:37.848968Z","submitted_at":"2025-05-29T04:24:56Z","title":"Speeding up Model Loading with fastsafetensors","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:05.256431Z"},"links":{"citing_paper":"/paper/2505.23072"},"observation_digest":"sha256:f7bb16e3ae9e338696563fae18246812c44b2ed45d6156b81a28e319d67d2274","observation_id":"1c0e8d69-88b5-4a1d-9c5e-c55ee495787a","resolution":{"observed_at":"2026-08-07T12:58:10.162396Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:09.881028Z","title":"ByteCheckpoint: A Unified Checkpointing System for Large Foundation Model Development,","venue":null,"work_id":"63e994f3-b1a7-4d6f-8f3e-8a57c033616f","year":null},"citing_paper":{"arxiv_id":"2505.23072","last_updated":"2025-05-29T04:24:56Z","snapshot_observed_at":"2026-08-09T20:15:37.848968Z","submitted_at":"2025-05-29T04:24:56Z","title":"Speeding up Model Loading with fastsafetensors","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:05.583944Z"},"links":{"citing_paper":"/paper/2505.23072"},"observation_digest":"sha256:2ae7a03b69213f1c00af500a06c90f9f27f279e3ad24a44b97ed38701f6652ae","observation_id":"f87c9321-eb6f-4360-a83c-21e94e87b89e","resolution":{"observed_at":"2026-08-07T12:58:09.974543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:05.415353Z","title":"PyTorch FSDP: Experiences on Scaling Fully Sharded Data Parallel,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23072","last_updated":"2025-05-29T04:24:56Z","snapshot_observed_at":"2026-08-09T20:15:37.848968Z","submitted_at":"2025-05-29T04:24:56Z","title":"Speeding up Model Loading with fastsafetensors","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:05.415353Z"},"links":{"citing_paper":"/paper/2505.23072"},"observation_digest":"sha256:8b31154f605d48736a8a904d81726ce79d60528be7c8c041ae88372307acbcd6","observation_id":"da9d9610-51ee-4e8f-8d8d-fd5c57aa3058","resolution":{"observed_at":"2026-08-07T12:58:05.415353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:09.472229Z","title":"NVIDIA Magnum IO GPUDirect Storage Design Guide,","venue":null,"work_id":"b6eb0fb1-aed3-4b72-9800-deec39b5ce09","year":null},"citing_paper":{"arxiv_id":"2505.23072","last_updated":"2025-05-29T04:24:56Z","snapshot_observed_at":"2026-08-09T20:15:37.848968Z","submitted_at":"2025-05-29T04:24:56Z","title":"Speeding up Model Loading with fastsafetensors","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:05.795124Z"},"links":{"citing_paper":"/paper/2505.23072"},"observation_digest":"sha256:6949a0aec6a2373cb8fad3cf14f7723e3a07ba1d5b2644c77b47da11d922a416","observation_id":"f5fdf0db-d9a9-45f0-a3a6-9d4f12f43a1b","resolution":{"observed_at":"2026-08-07T12:58:09.563051Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T12:58:05.994728Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23072","last_updated":"2025-05-29T04:24:56Z","snapshot_observed_at":"2026-08-09T20:15:37.848968Z","submitted_at":"2025-05-29T04:24:56Z","title":"Speeding up Model Loading with fastsafetensors","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:05.994728Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2505.23072"},"observation_digest":"sha256:279899dd43611a8ae9bce8b048245113e3ce99599b0d2e76e0f6368ce7fd1ef2","observation_id":"ea280cc0-7b24-4930-8870-e6faefdd52ae","resolution":{"observed_at":"2026-08-07T12:58:05.994728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.20143","last_updated":"2025-04-02T06:05:23Z","snapshot_observed_at":"2026-08-09T09:33:52.347339Z","submitted_at":"2024-07-29T16:18:20Z","title":"ByteCheckpoint: A Unified Checkpointing System for Large Foundation Model Development","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.20143","snapshot_observed_at":"2026-08-07T12:58:05.667602Z","title":"Available: https://arxiv .org/abs/2407.20143","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23072","last_updated":"2025-05-29T04:24:56Z","snapshot_observed_at":"2026-08-09T20:15:37.848968Z","submitted_at":"2025-05-29T04:24:56Z","title":"Speeding up Model Loading with fastsafetensors","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:05.667602Z"},"links":{"cited_paper":"/paper/2407.20143","citing_paper":"/paper/2505.23072"},"observation_digest":"sha256:6a3e2074a005adcdb36eacbf091bb6ec539f8680bdb4560f47c89de80ef1732b","observation_id":"17d7f8ea-1c41-42aa-b6e3-5e2dfc00f514","resolution":{"observed_at":"2026-08-07T12:58:05.667602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:09.685827Z","title":"Welcome to DLPack’s documentation! — DLPack 0.6.0 documentation,","venue":null,"work_id":"8dd3ac18-a702-43d8-9ce0-baed880fb69b","year":2022},"citing_paper":{"arxiv_id":"2505.23072","last_updated":"2025-05-29T04:24:56Z","snapshot_observed_at":"2026-08-09T20:15:37.848968Z","submitted_at":"2025-05-29T04:24:56Z","title":"Speeding up Model Loading with fastsafetensors","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:05.733164Z"},"links":{"citing_paper":"/paper/2505.23072"},"observation_digest":"sha256:a6909f3a4657ba9bd00436ac5cab193bdaa1d4fa3bf4334f879f8533991de91f","observation_id":"bcd5b2ae-657d-4b94-bf1a-6bd50878fd60","resolution":{"observed_at":"2026-08-07T12:58:09.782963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:09.084962Z","title":"huggingface/text-generation-inference: Large Language Model Text Generation Inference,","venue":null,"work_id":"22054f7f-726d-47e6-ade6-0aac13562704","year":2024},"citing_paper":{"arxiv_id":"2505.23072","last_updated":"2025-05-29T04:24:56Z","snapshot_observed_at":"2026-08-09T20:15:37.848968Z","submitted_at":"2025-05-29T04:24:56Z","title":"Speeding up Model Loading with fastsafetensors","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:06.274780Z"},"links":{"citing_paper":"/paper/2505.23072"},"observation_digest":"sha256:e24554e616742fbbd2fb12028f1e6502b113c0c41768c28a4f3b49ae2d9a4fd1","observation_id":"44d43244-a860-49cb-a83a-d032e69233e5","resolution":{"observed_at":"2026-08-07T12:58:09.177797Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:08.887405Z","title":"vllm-project/vllm: A high-throughput and memory-efficient inference and serving engine for LLMs,","venue":null,"work_id":"47283607-b2d3-4e58-833f-8462b2e720ac","year":2024},"citing_paper":{"arxiv_id":"2505.23072","last_updated":"2025-05-29T04:24:56Z","snapshot_observed_at":"2026-08-09T20:15:37.848968Z","submitted_at":"2025-05-29T04:24:56Z","title":"Speeding up Model Loading with fastsafetensors","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:06.378960Z"},"links":{"citing_paper":"/paper/2505.23072"},"observation_digest":"sha256:b44f696ab6147a664677a096d3dd9604d0d1ce79227060f2005300352e2e74ea","observation_id":"6356c0c6-767c-49d9-842a-31481fc4d10e","resolution":{"observed_at":"2026-08-07T12:58:08.966023Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:06.449698Z","title":"SGLang: Efficient Execution of Structured Language Model Programs,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23072","last_updated":"2025-05-29T04:24:56Z","snapshot_observed_at":"2026-08-09T20:15:37.848968Z","submitted_at":"2025-05-29T04:24:56Z","title":"Speeding up Model Loading with fastsafetensors","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:06.449698Z"},"links":{"citing_paper":"/paper/2505.23072"},"observation_digest":"sha256:c3d32b3c349343a8174aeefe6734c4f18acc7e93bb0f4a6a6527c899c6191696","observation_id":"1145e70a-359e-48e6-99fa-8aa855cee725","resolution":{"observed_at":"2026-08-07T12:58:06.449698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16867","last_updated":"2023-11-29T19:45:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-28T15:12:47Z","title":"The Falcon Series of Open Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16867","snapshot_observed_at":"2026-08-07T12:58:06.100629Z","title":"The Falcon Series of Open Language Models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23072","last_updated":"2025-05-29T04:24:56Z","snapshot_observed_at":"2026-08-09T20:15:37.848968Z","submitted_at":"2025-05-29T04:24:56Z","title":"Speeding up Model Loading with fastsafetensors","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:06.100629Z"},"links":{"cited_paper":"/paper/2311.16867","citing_paper":"/paper/2505.23072"},"observation_digest":"sha256:9135d764e31a475cc317c07d25204ae6e104f72d9e64d221265beaba2874b336","observation_id":"11caba6e-a8c6-410f-a6e8-0f52e01635ec","resolution":{"observed_at":"2026-08-07T12:58:06.100629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.05100","last_updated":"2023-06-27T09:57:58Z","snapshot_observed_at":"2026-08-04T18:56:03.233715Z","submitted_at":"2022-11-09T18:48:09Z","title":"BLOOM: A 176B-Parameter Open-Access Multilingual Language Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.05100","snapshot_observed_at":"2026-08-07T12:58:06.183400Z","title":"BLOOM: A 176B-Parameter Open-Access Multilingual Language Model,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23072","last_updated":"2025-05-29T04:24:56Z","snapshot_observed_at":"2026-08-09T20:15:37.848968Z","submitted_at":"2025-05-29T04:24:56Z","title":"Speeding up Model Loading with fastsafetensors","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:06.183400Z"},"links":{"cited_paper":"/paper/2211.05100","citing_paper":"/paper/2505.23072"},"observation_digest":"sha256:b618428705381765139921baa978496cc071d4d123d818e2836b8b9756d763f1","observation_id":"911f8b35-c10d-40d5-bf03-ef139478ad66","resolution":{"observed_at":"2026-08-07T12:58:06.183400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:08.421283Z","title":"PEP 703 — Making the Global Interpreter Lock Optional in CPython,","venue":null,"work_id":"84810c3c-0817-40d0-9ad8-6701d79283c3","year":2023},"citing_paper":{"arxiv_id":"2505.23072","last_updated":"2025-05-29T04:24:56Z","snapshot_observed_at":"2026-08-09T20:15:37.848968Z","submitted_at":"2025-05-29T04:24:56Z","title":"Speeding up Model Loading with fastsafetensors","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:06.692824Z"},"links":{"citing_paper":"/paper/2505.23072"},"observation_digest":"sha256:0362543d7993f0f21e91611ad24c404ae1d8f0d1524c201e6b258a8bbcd43cb0","observation_id":"0471cae3-d345-484f-a461-0339ac493343","resolution":{"observed_at":"2026-08-07T12:58:08.485679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:08.229369Z","title":"SPIN: Seam- less Operating System Integration of Peer-to-Peer DMA Between SSDs and GPUs,","venue":null,"work_id":"e362b628-6dda-4971-91d3-3aa434f7712b","year":2017},"citing_paper":{"arxiv_id":"2505.23072","last_updated":"2025-05-29T04:24:56Z","snapshot_observed_at":"2026-08-09T20:15:37.848968Z","submitted_at":"2025-05-29T04:24:56Z","title":"Speeding up Model Loading with fastsafetensors","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:06.791585Z"},"links":{"citing_paper":"/paper/2505.23072"},"observation_digest":"sha256:1d2afd0bc489e3ebbdd7a28f3f222350505d4e92188a0f023969e12a9e039ceb","observation_id":"beddeef5-3e13-41b1-9354-49ff7190c4d2","resolution":{"observed_at":"2026-08-07T12:58:08.306983Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:08.093231Z","title":"How beneficial is peer-to-peer DMA?","venue":null,"work_id":"816199c5-ab75-4923-a7d7-0cf425844597","year":2020},"citing_paper":{"arxiv_id":"2505.23072","last_updated":"2025-05-29T04:24:56Z","snapshot_observed_at":"2026-08-09T20:15:37.848968Z","submitted_at":"2025-05-29T04:24:56Z","title":"Speeding up Model Loading with fastsafetensors","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:06.863437Z"},"links":{"citing_paper":"/paper/2505.23072"},"observation_digest":"sha256:9e8145991aa91d17b32c81d7253abcd9e0cd9368f5f483330bb22da64975a976","observation_id":"55590a15-344c-4e65-857b-a27540e8f8c1","resolution":{"observed_at":"2026-08-07T12:58:08.178224Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-07T12:58:06.513769Z","title":"Available: https://arxiv .org/abs/2312.07104","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23072","last_updated":"2025-05-29T04:24:56Z","snapshot_observed_at":"2026-08-09T20:15:37.848968Z","submitted_at":"2025-05-29T04:24:56Z","title":"Speeding up Model Loading with fastsafetensors","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:06.513769Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2505.23072"},"observation_digest":"sha256:a99692d93aeea363a72fecf8c060059a5b580d6f8ac2937b4b7066ae50a3cdfc","observation_id":"3ee878dd-2212-47c6-ba76-acdff335049c","resolution":{"observed_at":"2026-08-07T12:58:06.513769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:08.722043Z","title":"Rapid Data Pre- Processing with NVIDIA DALI,","venue":null,"work_id":"35b73cee-08fe-4107-b748-e9c6273ab331","year":2021},"citing_paper":{"arxiv_id":"2505.23072","last_updated":"2025-05-29T04:24:56Z","snapshot_observed_at":"2026-08-09T20:15:37.848968Z","submitted_at":"2025-05-29T04:24:56Z","title":"Speeding up Model Loading with fastsafetensors","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:06.584427Z"},"links":{"citing_paper":"/paper/2505.23072"},"observation_digest":"sha256:29e892e49ea4016057db8ad2d9bc497e2b2de27bbcc0ee9ccf5052d8d60b7827","observation_id":"bee2d220-7aeb-4748-819b-4dc82321b264","resolution":{"observed_at":"2026-08-07T12:58:08.800106Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:08.567007Z","title":"Accelerate AI and ML workloads with OCI, NVIDIA Magnum IO GPUDirect Storage, and IBM Storage Scale,","venue":null,"work_id":"c25338e8-6eb5-4694-84f0-12ea324cec95","year":2023},"citing_paper":{"arxiv_id":"2505.23072","last_updated":"2025-05-29T04:24:56Z","snapshot_observed_at":"2026-08-09T20:15:37.848968Z","submitted_at":"2025-05-29T04:24:56Z","title":"Speeding up Model Loading with fastsafetensors","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:06.654325Z"},"links":{"citing_paper":"/paper/2505.23072"},"observation_digest":"sha256:20f48dc30478bed35deb082c7e5122f4a2efa51556058df08b3443974cdc18b6","observation_id":"b828a218-c17b-406d-b38d-c4422a76126c","resolution":{"observed_at":"2026-08-07T12:58:08.649672Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.05433","last_updated":"2022-09-29T20:47:07Z","snapshot_observed_at":"2026-07-06T13:51:20.183063Z","submitted_at":"2022-09-12T17:39:55Z","title":"FP8 Formats for Deep Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.05433","snapshot_observed_at":"2026-08-07T12:58:07.253100Z","title":"FP8 Formats for Deep Learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23072","last_updated":"2025-05-29T04:24:56Z","snapshot_observed_at":"2026-08-09T20:15:37.848968Z","submitted_at":"2025-05-29T04:24:56Z","title":"Speeding up Model Loading with fastsafetensors","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:07.253100Z"},"links":{"cited_paper":"/paper/2209.05433","citing_paper":"/paper/2505.23072"},"observation_digest":"sha256:4f8f534dc54e78f91aa7ce28890d041201f0b4ae1cc096d20a5812a272fb3111","observation_id":"84dd1e58-3951-47ed-a478-0fe6cd855632","resolution":{"observed_at":"2026-08-07T12:58:07.253100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14592","last_updated":"2024-03-31T23:05:53Z","snapshot_observed_at":"2026-07-06T16:23:38.359686Z","submitted_at":"2023-09-26T00:58:36Z","title":"Efficient Post-training Quantization with FP8 Formats","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14592","snapshot_observed_at":"2026-08-07T12:58:07.344437Z","title":"Efficient post-training quantization with fp8 formats,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23072","last_updated":"2025-05-29T04:24:56Z","snapshot_observed_at":"2026-08-09T20:15:37.848968Z","submitted_at":"2025-05-29T04:24:56Z","title":"Speeding up Model Loading with fastsafetensors","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:07.344437Z"},"links":{"cited_paper":"/paper/2309.14592","citing_paper":"/paper/2505.23072"},"observation_digest":"sha256:27092a42e23e00f52641ff4fc1e3c74a2f19d051f7381932c21d327ac4d79e23","observation_id":"151eca64-8839-4a13-bc73-a709b13deba7","resolution":{"observed_at":"2026-08-07T12:58:07.344437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.09225","last_updated":"2024-02-23T13:49:45Z","snapshot_observed_at":"2026-08-01T08:03:58.744148Z","submitted_at":"2022-08-19T09:03:00Z","title":"FP8 Quantization: The Power of the Exponent","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.09225","snapshot_observed_at":"2026-08-07T12:58:07.427165Z","title":"FP8 Quantization: The Power of the Exponent,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23072","last_updated":"2025-05-29T04:24:56Z","snapshot_observed_at":"2026-08-09T20:15:37.848968Z","submitted_at":"2025-05-29T04:24:56Z","title":"Speeding up Model Loading with fastsafetensors","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:07.427165Z"},"links":{"cited_paper":"/paper/2208.09225","citing_paper":"/paper/2505.23072"},"observation_digest":"sha256:7013d78be71ff98ebb46a953beacd6d56f8632ffcbdd3176c68522e619ad8362","observation_id":"8514445a-46b1-414c-9313-606aeec79f5a","resolution":{"observed_at":"2026-08-07T12:58:07.427165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:07.936284Z","title":"Column Cache: Buffer Cache for Columnar Storage on HDFS,","venue":null,"work_id":"6a530c28-373f-46c5-86c0-9c0ad5f81c06","year":2018},"citing_paper":{"arxiv_id":"2505.23072","last_updated":"2025-05-29T04:24:56Z","snapshot_observed_at":"2026-08-09T20:15:37.848968Z","submitted_at":"2025-05-29T04:24:56Z","title":"Speeding up Model Loading with fastsafetensors","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:06.941011Z"},"links":{"citing_paper":"/paper/2505.23072"},"observation_digest":"sha256:45acffb2306b15672e855c409c5ada017219167d44ade4829c206a352b70cf2f","observation_id":"0ce17f57-773f-4db8-a49a-e450f646dbc0","resolution":{"observed_at":"2026-08-07T12:58:08.008794Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:07.813617Z","title":"Teraheap: Reducing memory pressure in managed big data frameworks,","venue":null,"work_id":"9998bfa2-b248-4b12-b570-0439b4a17dbe","year":2023},"citing_paper":{"arxiv_id":"2505.23072","last_updated":"2025-05-29T04:24:56Z","snapshot_observed_at":"2026-08-09T20:15:37.848968Z","submitted_at":"2025-05-29T04:24:56Z","title":"Speeding up Model Loading with fastsafetensors","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:07.049645Z"},"links":{"citing_paper":"/paper/2505.23072"},"observation_digest":"sha256:be8765afa0190a715784003cd516bc3fdf72aa5436b5871c09b1a6d4a303adec","observation_id":"4525d906-06ac-473e-a464-382a9ac9027a","resolution":{"observed_at":"2026-08-07T12:58:07.862265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:07.662253Z","title":"Accelerating multilingual applications with in-memory array sharing,","venue":null,"work_id":"9426f990-405d-45ac-a2b1-3d0eaefad074","year":2023},"citing_paper":{"arxiv_id":"2505.23072","last_updated":"2025-05-29T04:24:56Z","snapshot_observed_at":"2026-08-09T20:15:37.848968Z","submitted_at":"2025-05-29T04:24:56Z","title":"Speeding up Model Loading with fastsafetensors","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:07.153431Z"},"links":{"citing_paper":"/paper/2505.23072"},"observation_digest":"sha256:8291597f4c48b2a62893a2ef8ad3a00a82033d508d912964cff75f3bbd2980c2","observation_id":"fc358a47-a979-4eb3-9fd4-c52b5fc52e0b","resolution":{"observed_at":"2026-08-07T12:58:07.752961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.11277","last_updated":"2023-09-12T16:28:00Z","snapshot_observed_at":"2026-08-01T19:01:47.393546Z","submitted_at":"2023-04-21T23:52:27Z","title":"PyTorch FSDP: Experiences on Scaling Fully Sharded Data Parallel","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.11277","snapshot_observed_at":"2026-08-07T12:58:05.511142Z","title":"Available: https://arxiv .org/abs/2304.11277","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23072","last_updated":"2025-05-29T04:24:56Z","snapshot_observed_at":"2026-08-09T20:15:37.848968Z","submitted_at":"2025-05-29T04:24:56Z","title":"Speeding up Model Loading with fastsafetensors","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:05.511142Z"},"links":{"cited_paper":"/paper/2304.11277","citing_paper":"/paper/2505.23072"},"observation_digest":"sha256:dd9bc4efa3ce3ca7cfdd07030f625124886209f33befa1364454f16a8d26762c","observation_id":"5d4bbd67-4c41-4ccf-be99-f739761dd62b","resolution":{"observed_at":"2026-08-07T12:58:05.511142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04324","last_updated":"2024-05-07T13:50:40Z","snapshot_observed_at":"2026-08-09T20:15:03.728117Z","submitted_at":"2024-05-07T13:50:40Z","title":"Granite Code Models: A Family of Open Foundation Models for Code Intelligence","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04324","snapshot_observed_at":"2026-08-07T12:58:04.032742Z","title":"Available: https://arxiv .org/abs/2405.04324","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23072","last_updated":"2025-05-29T04:24:56Z","snapshot_observed_at":"2026-08-09T20:15:37.848968Z","submitted_at":"2025-05-29T04:24:56Z","title":"Speeding up Model Loading with fastsafetensors","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:04.032742Z"},"links":{"cited_paper":"/paper/2405.04324","citing_paper":"/paper/2505.23072"},"observation_digest":"sha256:89e7c18b6110bf2fb00825d6db9b49527f2af43981d2481334222303ad98f3f0","observation_id":"465ebe04-efce-4d36-a082-c9493210a02f","resolution":{"observed_at":"2026-08-07T12:58:04.032742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:09.273649Z","title":"Available: https://docs .nvidia.com/gpudirect-storage/ design-guide/index.html","venue":null,"work_id":"ad9ae3cc-a895-4e70-9445-c86486e2f778","year":null},"citing_paper":{"arxiv_id":"2505.23072","last_updated":"2025-05-29T04:24:56Z","snapshot_observed_at":"2026-08-09T20:15:37.848968Z","submitted_at":"2025-05-29T04:24:56Z","title":"Speeding up Model Loading with fastsafetensors","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:05.911032Z"},"links":{"citing_paper":"/paper/2505.23072"},"observation_digest":"sha256:afd5775d6e865a6c3b818cab766f565f484466c8ed4746b4109bd85116ef143c","observation_id":"842d19cb-7c3f-4cbd-a9ff-095b167ac77c","resolution":{"observed_at":"2026-08-07T12:58:09.368234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.23072","last_updated":"2025-05-29T04:24:56Z","latest_version":1,"primary_category":"cs.DC","snapshot_observed_at":"2026-08-09T20:15:37.848968Z","submitted_at":"2025-05-29T04:24:56Z","title":"Speeding up Model Loading with fastsafetensors"},"reference_resolution":{"displayed":47,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":17,"verified_exact":0,"verified_fuzzy":30},"total_outbound_references":47},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 47 of 47 outbound references and 4 inbound Pith citation observations for arXiv:2505.23072."}