{"as_of":"2026-08-10T12:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:04e3b4335ee975cd4eea82889e8076978ea62d14af8f8e3a6b4190c4f0715e5d","coverage":[{"denominator":52,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":52,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T22:21:08.635007Z","state":"measured"},{"denominator":52,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":52,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.22033/citation-record","integrity":"/paper/2506.22033/integrity","json":"/paper/2506.22033/citation-record.json","paper":"/paper/2506.22033"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:21:12.810543Z","title":null,"venue":null,"work_id":"1b2d715b-f6d8-49b7-b2cb-15fcabcc7355","year":null},"citing_paper":{"arxiv_id":"2506.22033","last_updated":"2025-06-27T09:27:04Z","snapshot_observed_at":"2026-08-10T04:37:46.503725Z","submitted_at":"2025-06-27T09:27:04Z","title":"SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T22:20:14.448663Z"},"links":{"citing_paper":"/paper/2506.22033"},"observation_digest":"sha256:788d06da26d7d73d57d9ad6babdd13eabf2d5a455b81dd79ca2b2ae38fb6c575","observation_id":"eda8f667-6c97-40e1-8709-c7640524db87","resolution":{"observed_at":"2026-08-06T22:21:12.863562Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:21:12.647560Z","title":"Llama 2 follow-up: too much RLHF, GPU sizing, technical details","venue":null,"work_id":"843fc084-c8d7-4058-b971-3bd80ca72b85","year":2024},"citing_paper":{"arxiv_id":"2506.22033","last_updated":"2025-06-27T09:27:04Z","snapshot_observed_at":"2026-08-10T04:37:46.503725Z","submitted_at":"2025-06-27T09:27:04Z","title":"SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T22:20:14.523091Z"},"links":{"citing_paper":"/paper/2506.22033"},"observation_digest":"sha256:549a1fbd8aaf7a5bbe21f935059f2f3edff9273c2600844a6f51244cf3718b20","observation_id":"a7e2ca0d-ed95-45fc-abf6-f24ce6039877","resolution":{"observed_at":"2026-08-06T22:21:12.743116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:21:12.440459Z","title":"AI Inference Market Size, Share and Trends Report","venue":null,"work_id":"b0d59853-cf07-4134-a47c-140fe4958dca","year":2025},"citing_paper":{"arxiv_id":"2506.22033","last_updated":"2025-06-27T09:27:04Z","snapshot_observed_at":"2026-08-10T04:37:46.503725Z","submitted_at":"2025-06-27T09:27:04Z","title":"SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T22:20:14.589199Z"},"links":{"citing_paper":"/paper/2506.22033"},"observation_digest":"sha256:20b1fa516dda90ae0f661d050f6560b0ada9287db25170fd1257d912164439ee","observation_id":"27287006-71ea-4b4f-aee3-782b6863c827","resolution":{"observed_at":"2026-08-06T22:21:12.550883Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:21:12.204872Z","title":"OpenAI API Documentation","venue":null,"work_id":"faaecf9a-55d8-4fbd-991f-4ab14a7b8713","year":2025},"citing_paper":{"arxiv_id":"2506.22033","last_updated":"2025-06-27T09:27:04Z","snapshot_observed_at":"2026-08-10T04:37:46.503725Z","submitted_at":"2025-06-27T09:27:04Z","title":"SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T22:20:14.662099Z"},"links":{"citing_paper":"/paper/2506.22033"},"observation_digest":"sha256:5f013392456b815c5577b10b4a1193258afb0d5a480bc882926e9ebd0c1705fb","observation_id":"68c9c1f6-c288-418c-85e0-dbd25802cb0b","resolution":{"observed_at":"2026-08-06T22:21:12.301445Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:21:12.007352Z","title":"ShareGPT Datasets","venue":null,"work_id":"f01b33d5-321c-4be4-8116-8a4896f5e598","year":2025},"citing_paper":{"arxiv_id":"2506.22033","last_updated":"2025-06-27T09:27:04Z","snapshot_observed_at":"2026-08-10T04:37:46.503725Z","submitted_at":"2025-06-27T09:27:04Z","title":"SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T22:20:14.755064Z"},"links":{"citing_paper":"/paper/2506.22033"},"observation_digest":"sha256:0793e858bb0784c6e5853c4f56d7ac5e6acc1e747369b0079756a0676e07efde","observation_id":"668572f2-9761-4394-81f0-0ed57fa41f2e","resolution":{"observed_at":"2026-08-06T22:21:12.099360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:21:11.753949Z","title":"vLLM–Optimization and Tuning","venue":null,"work_id":"0232e3e7-5b17-4766-9f7c-5d8e73826a3a","year":2025},"citing_paper":{"arxiv_id":"2506.22033","last_updated":"2025-06-27T09:27:04Z","snapshot_observed_at":"2026-08-10T04:37:46.503725Z","submitted_at":"2025-06-27T09:27:04Z","title":"SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T22:20:14.834539Z"},"links":{"citing_paper":"/paper/2506.22033"},"observation_digest":"sha256:dba79ab571da1d7342f9e65f3f9ddfb00ab7fd249d80c59431be725bdaee9a74","observation_id":"8fe31ad3-be65-41c5-9159-e878d7be02f9","resolution":{"observed_at":"2026-08-06T22:21:11.863187Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:21:11.655507Z","title":null,"venue":null,"work_id":"88566e21-0ca6-45eb-81cf-873e224737ec","year":1985},"citing_paper":{"arxiv_id":"2506.22033","last_updated":"2025-06-27T09:27:04Z","snapshot_observed_at":"2026-08-10T04:37:46.503725Z","submitted_at":"2025-06-27T09:27:04Z","title":"SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T22:20:14.945681Z"},"links":{"citing_paper":"/paper/2506.22033"},"observation_digest":"sha256:4dca037d678d60e635606f965a9bb00c77d159fca2351f829a8bee932bb4b86e","observation_id":"4deeb3c9-ff8b-430a-8f4c-eb8486bcac22","resolution":{"observed_at":"2026-08-06T22:21:11.726600Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:21:11.522814Z","title":null,"venue":null,"work_id":"7105b1e8-34b9-4378-8c41-27fa9b1b523d","year":2024},"citing_paper":{"arxiv_id":"2506.22033","last_updated":"2025-06-27T09:27:04Z","snapshot_observed_at":"2026-08-10T04:37:46.503725Z","submitted_at":"2025-06-27T09:27:04Z","title":"SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T22:20:15.016310Z"},"links":{"citing_paper":"/paper/2506.22033"},"observation_digest":"sha256:1be3e2e7358bf1193688fa8647fb065674bff43e5d096aff94ce7e648b7d5c6e","observation_id":"483eb470-30d0-4c87-96da-62ab4b519120","resolution":{"observed_at":"2026-08-06T22:21:11.584750Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:21:11.390743Z","title":null,"venue":null,"work_id":"5cc18738-e3eb-480a-bc57-d66b85f98cce","year":2024},"citing_paper":{"arxiv_id":"2506.22033","last_updated":"2025-06-27T09:27:04Z","snapshot_observed_at":"2026-08-10T04:37:46.503725Z","submitted_at":"2025-06-27T09:27:04Z","title":"SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T22:20:15.106452Z"},"links":{"citing_paper":"/paper/2506.22033"},"observation_digest":"sha256:7f8cbd9a22d5c24c2e7cb35483697a93c4c5158558e6efd8e26b963f73872cc2","observation_id":"e3094ddb-046f-4c7f-ad34-77e5c2a2f2e9","resolution":{"observed_at":"2026-08-06T22:21:11.432438Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.14255","last_updated":"2022-07-28T17:40:47Z","snapshot_observed_at":"2026-08-07T11:38:07.397956Z","submitted_at":"2022-07-28T17:40:47Z","title":"Efficient Training of Language Models to Fill in the Middle","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.14255","snapshot_observed_at":"2026-08-06T22:20:15.212688Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.22033","last_updated":"2025-06-27T09:27:04Z","snapshot_observed_at":"2026-08-10T04:37:46.503725Z","submitted_at":"2025-06-27T09:27:04Z","title":"SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T22:20:15.212688Z"},"links":{"cited_paper":"/paper/2207.14255","citing_paper":"/paper/2506.22033"},"observation_digest":"sha256:45f2da7afd61875f3f576798844fce1f1a09cd356019a126541f2da40e8ed67e","observation_id":"8640ffa2-d7a3-4b79-abce-c8e5e86284ec","resolution":{"observed_at":"2026-08-06T22:20:15.212688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:21:11.294276Z","title":null,"venue":null,"work_id":"7b285db4-85b8-4c93-9d8e-e5f8db02e4a9","year":2020},"citing_paper":{"arxiv_id":"2506.22033","last_updated":"2025-06-27T09:27:04Z","snapshot_observed_at":"2026-08-10T04:37:46.503725Z","submitted_at":"2025-06-27T09:27:04Z","title":"SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T22:20:15.362759Z"},"links":{"citing_paper":"/paper/2506.22033"},"observation_digest":"sha256:ebb096778692a6613955fa691f961f8d44968528f793718f886353bda2b3c0e8","observation_id":"28b0a20a-608e-4a84-b9cd-64802d1e956d","resolution":{"observed_at":"2026-08-06T22:21:11.349478Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1406.2024","last_updated":"2014-06-08T20:52:15Z","snapshot_observed_at":"2026-08-10T09:51:19.534548Z","submitted_at":"2014-06-08T20:52:15Z","title":"Hilfer fractional advection-diffusion equations with power-law initial condition; a Numerical study using variational iteration method","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1406.2024","snapshot_observed_at":"2026-08-06T22:20:15.500147Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22033","last_updated":"2025-06-27T09:27:04Z","snapshot_observed_at":"2026-08-10T04:37:46.503725Z","submitted_at":"2025-06-27T09:27:04Z","title":"SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T22:20:15.500147Z"},"links":{"cited_paper":"/paper/1406.2024","citing_paper":"/paper/2506.22033"},"observation_digest":"sha256:7a751b6ac6bae6924f2f37fac4398617c526d32e0bef080f56d3b5d098331b25","observation_id":"4c9d6a34-cb93-46be-b390-3dbaeabb0195","resolution":{"observed_at":"2026-08-06T22:20:15.500147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.11414","last_updated":"2023-04-22T14:09:14Z","snapshot_observed_at":"2026-07-06T15:18:45.940190Z","submitted_at":"2023-04-22T14:09:14Z","title":"Pipeline MoE: A Flexible MoE Implementation with Pipeline Parallelism","version":1},"cited_work":{"arxiv_id":"2304.11414","doi":null,"metadata_source":"pith","pith_arxiv_id":"2304.11414","snapshot_observed_at":"2026-08-06T22:21:09.413492Z","title":"Pipeline MoE: A Flexible MoE Implementation with Pipeline Parallelism","venue":"cs.DC","work_id":"25815a7f-34a3-4bca-bbce-e0e83a5de293","year":2023},"citing_paper":{"arxiv_id":"2506.22033","last_updated":"2025-06-27T09:27:04Z","snapshot_observed_at":"2026-08-10T04:37:46.503725Z","submitted_at":"2025-06-27T09:27:04Z","title":"SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T22:20:15.603651Z"},"links":{"cited_paper":"/paper/2304.11414","citing_paper":"/paper/2506.22033"},"observation_digest":"sha256:17bb1494570e796b89a655194b2328ed34c8a9def53363815727cf7cdb24780c","observation_id":"350d479b-3d67-42c8-930c-01e10176205f","resolution":{"observed_at":"2026-08-06T22:21:09.451557Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T22:20:15.704474Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22033","last_updated":"2025-06-27T09:27:04Z","snapshot_observed_at":"2026-08-10T04:37:46.503725Z","submitted_at":"2025-06-27T09:27:04Z","title":"SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T22:20:15.704474Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.22033"},"observation_digest":"sha256:1ba5b5090c1ec7a25cea599299671c1c35286735c617532ad14f0efc731b8ecc","observation_id":"cf1e1b8c-182c-4363-b042-b7af0fc35e48","resolution":{"observed_at":"2026-08-06T22:20:15.704474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1805.04833","last_updated":"2018-05-13T07:07:08Z","snapshot_observed_at":"2026-07-06T06:38:48.758485Z","submitted_at":"2018-05-13T07:07:08Z","title":"Hierarchical Neural Story Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1805.04833","snapshot_observed_at":"2026-08-06T22:20:15.795643Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.22033","last_updated":"2025-06-27T09:27:04Z","snapshot_observed_at":"2026-08-10T04:37:46.503725Z","submitted_at":"2025-06-27T09:27:04Z","title":"SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T22:20:15.795643Z"},"links":{"cited_paper":"/paper/1805.04833","citing_paper":"/paper/2506.22033"},"observation_digest":"sha256:7a88d96c935fd3fd99c1c1868114b83b6c69489ff4f657aa87549d4f81c7ec54","observation_id":"69d42e74-a598-4bce-8b85-3f8147ce0421","resolution":{"observed_at":"2026-08-06T22:20:15.795643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:21:11.213175Z","title":null,"venue":null,"work_id":"194491ed-78ab-470c-a848-8805d11ef3e2","year":2024},"citing_paper":{"arxiv_id":"2506.22033","last_updated":"2025-06-27T09:27:04Z","snapshot_observed_at":"2026-08-10T04:37:46.503725Z","submitted_at":"2025-06-27T09:27:04Z","title":"SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T22:20:15.876134Z"},"links":{"citing_paper":"/paper/2506.22033"},"observation_digest":"sha256:18dcd9e23552b6b47acccfbcde2550062f456e301d48c9c3d199dc9b00c601ee","observation_id":"d82b7fb0-3dec-4317-b55d-62d7d524cea7","resolution":{"observed_at":"2026-08-06T22:21:11.240085Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:20:15.954063Z","title":null,"venue":null,"work_id":null,"year":1994},"citing_paper":{"arxiv_id":"2506.22033","last_updated":"2025-06-27T09:27:04Z","snapshot_observed_at":"2026-08-10T04:37:46.503725Z","submitted_at":"2025-06-27T09:27:04Z","title":"SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T22:20:15.954063Z"},"links":{"citing_paper":"/paper/2506.22033"},"observation_digest":"sha256:31edfaa0d80007bb3a94cc26723931a1d0dadc12769d9e399980a9854b20ab48","observation_id":"67316e09-607d-48a7-82e8-eaf985ffa864","resolution":{"observed_at":"2026-08-06T22:20:15.954063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:21:11.106100Z","title":null,"venue":null,"work_id":"02345678-ca9f-4c76-bf0a-226e265b775e","year":2020},"citing_paper":{"arxiv_id":"2506.22033","last_updated":"2025-06-27T09:27:04Z","snapshot_observed_at":"2026-08-10T04:37:46.503725Z","submitted_at":"2025-06-27T09:27:04Z","title":"SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T22:20:15.998595Z"},"links":{"citing_paper":"/paper/2506.22033"},"observation_digest":"sha256:841f0d894897f0d6cc52762e31547b38cf665e53646ddc7fccbc8ac4bb0c38f3","observation_id":"f4f58a12-cd6b-4257-af48-4a0438e3610e","resolution":{"observed_at":"2026-08-06T22:21:11.143841Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T22:20:16.049548Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.22033","last_updated":"2025-06-27T09:27:04Z","snapshot_observed_at":"2026-08-10T04:37:46.503725Z","submitted_at":"2025-06-27T09:27:04Z","title":"SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T22:20:16.049548Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.22033"},"observation_digest":"sha256:7e419c75db7774aee5463643487dbfc90c6785f9c0d6b4004d8446a465918a0f","observation_id":"afe2f31d-fd0a-4e3f-a1af-958f0bfb29db","resolution":{"observed_at":"2026-08-06T22:20:16.049548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14775","last_updated":"2025-05-28T01:38:07Z","snapshot_observed_at":"2026-08-07T16:00:42.914926Z","submitted_at":"2025-04-21T00:07:49Z","title":"gLLM: Global Balanced Pipeline Parallelism System for Distributed LLM Serving with Token Throttling","version":2},"cited_work":{"arxiv_id":"2504.14775","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.14775","snapshot_observed_at":"2026-08-06T22:21:09.224994Z","title":"gLLM: Global Balanced Pipeline Parallelism System for Distributed LLM Serving with Token Throttling","venue":"cs.DC","work_id":"d963d47e-bfd0-4bc6-8a56-7b8c6c35a9a3","year":2025},"citing_paper":{"arxiv_id":"2506.22033","last_updated":"2025-06-27T09:27:04Z","snapshot_observed_at":"2026-08-10T04:37:46.503725Z","submitted_at":"2025-06-27T09:27:04Z","title":"SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T22:20:16.114739Z"},"links":{"cited_paper":"/paper/2504.14775","citing_paper":"/paper/2506.22033"},"observation_digest":"sha256:e4e3436dd5dd1a95e44353d9c2b554b53703659f9889bb2324aa1a1c70a2b9b2","observation_id":"7bbfbc50-d118-4b34-af80-607e28c5d775","resolution":{"observed_at":"2026-08-06T22:21:09.287877Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:20:16.190154Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.22033","last_updated":"2025-06-27T09:27:04Z","snapshot_observed_at":"2026-08-10T04:37:46.503725Z","submitted_at":"2025-06-27T09:27:04Z","title":"SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T22:20:16.190154Z"},"links":{"citing_paper":"/paper/2506.22033"},"observation_digest":"sha256:957fbfb5ffcb5d0e0998de6b35904ab48f66c121ca3a43ab6123f7b89f5a4d14","observation_id":"89a8467e-b453-40b8-8e93-3be55432743c","resolution":{"observed_at":"2026-08-06T22:20:16.190154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:21:10.992828Z","title":null,"venue":null,"work_id":"48b409d1-ea8a-4fc8-9fa5-6ab949dc952c","year":2023},"citing_paper":{"arxiv_id":"2506.22033","last_updated":"2025-06-27T09:27:04Z","snapshot_observed_at":"2026-08-10T04:37:46.503725Z","submitted_at":"2025-06-27T09:27:04Z","title":"SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T22:20:16.258548Z"},"links":{"citing_paper":"/paper/2506.22033"},"observation_digest":"sha256:f55799a4f23c296d05bd425adf9e729aaf8e81d88e82b1e543176fa2ce85ceb6","observation_id":"63992c81-8c65-4d35-a313-9d211d0648ff","resolution":{"observed_at":"2026-08-06T22:21:11.024519Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:20:16.342358Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.22033","last_updated":"2025-06-27T09:27:04Z","snapshot_observed_at":"2026-08-10T04:37:46.503725Z","submitted_at":"2025-06-27T09:27:04Z","title":"SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T22:20:16.342358Z"},"links":{"citing_paper":"/paper/2506.22033"},"observation_digest":"sha256:a68361d634f8750eaa290310def968666fab4c9f67d5bd8ece8ce6b0dffbf199","observation_id":"629b038b-6b07-410a-a29f-4922ae16be94","resolution":{"observed_at":"2026-08-06T22:20:16.342358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-08T06:16:25.839566Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-06T22:20:16.520554Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22033","last_updated":"2025-06-27T09:27:04Z","snapshot_observed_at":"2026-08-10T04:37:46.503725Z","submitted_at":"2025-06-27T09:27:04Z","title":"SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T22:20:16.520554Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2506.22033"},"observation_digest":"sha256:23fd1255468a37bf33ab039c8e74f361b224abeb48ec376e37a53cb19a398c90","observation_id":"d12dede5-368d-42b3-85a1-9949a2573ab1","resolution":{"observed_at":"2026-08-06T22:20:16.520554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:20:16.614495Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.22033","last_updated":"2025-06-27T09:27:04Z","snapshot_observed_at":"2026-08-10T04:37:46.503725Z","submitted_at":"2025-06-27T09:27:04Z","title":"SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T22:20:16.614495Z"},"links":{"citing_paper":"/paper/2506.22033"},"observation_digest":"sha256:ff9aa8776bf657b4f92eaea7b896363682015f44b984cabdea79196c365c42e3","observation_id":"16e3a6c2-f9b7-4c5e-94b9-2c95b6aa4ea8","resolution":{"observed_at":"2026-08-06T22:20:16.614495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:21:10.871757Z","title":null,"venue":null,"work_id":"306df026-0338-422f-9324-d65ab8b2d928","year":null},"citing_paper":{"arxiv_id":"2506.22033","last_updated":"2025-06-27T09:27:04Z","snapshot_observed_at":"2026-08-10T04:37:46.503725Z","submitted_at":"2025-06-27T09:27:04Z","title":"SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T22:20:16.667095Z"},"links":{"citing_paper":"/paper/2506.22033"},"observation_digest":"sha256:fbe590d361b0755b13fc5efbaa97c5186d6701159457586abbbeb8d71da5aa84","observation_id":"5d084f37-96ae-4aa0-be5d-434df4b4cf17","resolution":{"observed_at":"2026-08-06T22:21:10.930151Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:20:16.881512Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.22033","last_updated":"2025-06-27T09:27:04Z","snapshot_observed_at":"2026-08-10T04:37:46.503725Z","submitted_at":"2025-06-27T09:27:04Z","title":"SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T22:20:16.881512Z"},"links":{"citing_paper":"/paper/2506.22033"},"observation_digest":"sha256:f5ca4f9395f8e0f2e45a86b8697fa4c7a4923ded88c6a20f1d075e88b51ecd97","observation_id":"0c7059ae-fd6d-4c0f-b1ea-c9eb65dbaa9b","resolution":{"observed_at":"2026-08-06T22:20:16.881512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2024.00010","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:21:09.050697Z","title":null,"venue":null,"work_id":"6253f443-89cc-4be3-a58b-7baad0a56619","year":2024},"citing_paper":{"arxiv_id":"2506.22033","last_updated":"2025-06-27T09:27:04Z","snapshot_observed_at":"2026-08-10T04:37:46.503725Z","submitted_at":"2025-06-27T09:27:04Z","title":"SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T22:21:07.644237Z"},"links":{"citing_paper":"/paper/2506.22033"},"observation_digest":"sha256:9f1e0520b7c86e8e577952afe5b4b6c1db09f691eb2827ed76770c6f74bda4a1","observation_id":"b96b25f9-5721-49c1-8109-4d4a7e9ff94a","resolution":{"observed_at":"2026-08-06T22:21:09.118369Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:21:10.759368Z","title":null,"venue":null,"work_id":"7ffb1610-7827-4c87-b642-cf99d245506d","year":2024},"citing_paper":{"arxiv_id":"2506.22033","last_updated":"2025-06-27T09:27:04Z","snapshot_observed_at":"2026-08-10T04:37:46.503725Z","submitted_at":"2025-06-27T09:27:04Z","title":"SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T22:21:07.727480Z"},"links":{"citing_paper":"/paper/2506.22033"},"observation_digest":"sha256:40c6841124eca40ac511fd4227e7d08495a04b3c14a3755462f3e5e0847d117d","observation_id":"7bc78cbf-e16f-4e8b-af8b-44bacdcbc419","resolution":{"observed_at":"2026-08-06T22:21:10.784355Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-06T22:21:07.812287Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22033","last_updated":"2025-06-27T09:27:04Z","snapshot_observed_at":"2026-08-10T04:37:46.503725Z","submitted_at":"2025-06-27T09:27:04Z","title":"SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T22:21:07.812287Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2506.22033"},"observation_digest":"sha256:343833923dfad1d0aa34ffed58671477b77ac943b9b43b7e4aa55c3e962f1b70","observation_id":"5508d0a2-44cb-4a0c-8501-fa58a3e1ab7e","resolution":{"observed_at":"2026-08-06T22:21:07.812287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-06T22:21:07.904773Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22033","last_updated":"2025-06-27T09:27:04Z","snapshot_observed_at":"2026-08-10T04:37:46.503725Z","submitted_at":"2025-06-27T09:27:04Z","title":"SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T22:21:07.904773Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2506.22033"},"observation_digest":"sha256:4e3d380d4eb4ae307e430b733f2a3729480be91353596251af9702127f863172","observation_id":"ae5d44d4-a143-4a01-a804-ee47ff718c66","resolution":{"observed_at":"2026-08-06T22:21:07.904773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:21:07.961712Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22033","last_updated":"2025-06-27T09:27:04Z","snapshot_observed_at":"2026-08-10T04:37:46.503725Z","submitted_at":"2025-06-27T09:27:04Z","title":"SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T22:21:07.961712Z"},"links":{"citing_paper":"/paper/2506.22033"},"observation_digest":"sha256:d256c8a1b22589a73391af6cc2c80e4425d2f432c6238fe6a47ca23ecc677e89","observation_id":"cefce2a6-b69d-41e6-8783-336b31613bd1","resolution":{"observed_at":"2026-08-06T22:21:07.961712Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:21:10.637372Z","title":null,"venue":null,"work_id":"3715f0e7-09dc-42a5-a0d2-72e559753830","year":2024},"citing_paper":{"arxiv_id":"2506.22033","last_updated":"2025-06-27T09:27:04Z","snapshot_observed_at":"2026-08-10T04:37:46.503725Z","submitted_at":"2025-06-27T09:27:04Z","title":"SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T22:21:07.985649Z"},"links":{"citing_paper":"/paper/2506.22033"},"observation_digest":"sha256:e4afcaffa7926c13c67e219c7cbe1d19339e4bbe48fc90cc03753ae94f05b7ae","observation_id":"4310d535-db69-4f10-a7f5-da9604b867fb","resolution":{"observed_at":"2026-08-06T22:21:10.709481Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:21:10.542215Z","title":null,"venue":null,"work_id":"9bcfcdba-77ca-4d5b-add0-29420c63a375","year":2023},"citing_paper":{"arxiv_id":"2506.22033","last_updated":"2025-06-27T09:27:04Z","snapshot_observed_at":"2026-08-10T04:37:46.503725Z","submitted_at":"2025-06-27T09:27:04Z","title":"SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T22:21:08.079266Z"},"links":{"citing_paper":"/paper/2506.22033"},"observation_digest":"sha256:a3d92c7e278cebb85e70c8d682173a29134ad73ee12e8db87367cbd8f2087b56","observation_id":"0950a895-2307-4290-a159-804a45563232","resolution":{"observed_at":"2026-08-06T22:21:10.588607Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:21:10.398514Z","title":null,"venue":null,"work_id":"07db7992-e2ec-4616-a18b-ed52417a20e4","year":2022},"citing_paper":{"arxiv_id":"2506.22033","last_updated":"2025-06-27T09:27:04Z","snapshot_observed_at":"2026-08-10T04:37:46.503725Z","submitted_at":"2025-06-27T09:27:04Z","title":"SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T22:21:08.146466Z"},"links":{"citing_paper":"/paper/2506.22033"},"observation_digest":"sha256:38d5b8f427a714321a89a163f664c9d29af8c372f4b509ecf55851c12ac2aee5","observation_id":"098aa4c5-edf9-4cd1-8311-560e59a21832","resolution":{"observed_at":"2026-08-06T22:21:10.481868Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:21:10.276918Z","title":null,"venue":null,"work_id":"f78e4498-7153-487d-9a05-44c2b8f0b085","year":2009},"citing_paper":{"arxiv_id":"2506.22033","last_updated":"2025-06-27T09:27:04Z","snapshot_observed_at":"2026-08-10T04:37:46.503725Z","submitted_at":"2025-06-27T09:27:04Z","title":"SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T22:21:08.224850Z"},"links":{"citing_paper":"/paper/2506.22033"},"observation_digest":"sha256:35aa3fe0795ed2a46279285dab97eb8d1ec222581f7b536dcbcce13ad1975fee","observation_id":"23c3e4f1-55b1-48d2-b753-caa8000d3519","resolution":{"observed_at":"2026-08-06T22:21:10.323146Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05149","last_updated":"2022-04-11T14:30:27Z","snapshot_observed_at":"2026-08-09T18:42:48.591269Z","submitted_at":"2022-04-11T14:30:27Z","title":"The Carbon Footprint of Machine Learning Training Will Plateau, Then Shrink","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05149","snapshot_observed_at":"2026-08-06T22:21:08.252474Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.22033","last_updated":"2025-06-27T09:27:04Z","snapshot_observed_at":"2026-08-10T04:37:46.503725Z","submitted_at":"2025-06-27T09:27:04Z","title":"SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T22:21:08.252474Z"},"links":{"cited_paper":"/paper/2204.05149","citing_paper":"/paper/2506.22033"},"observation_digest":"sha256:c779d189478d44267e58a182b75f5ea0fb3495825fe1e9201b89a2f3e7a693a6","observation_id":"24a13c47-9d69-4473-9ce4-e6d805307483","resolution":{"observed_at":"2026-08-06T22:21:08.252474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:21:10.192749Z","title":null,"venue":null,"work_id":"081b7dbc-96d2-4184-9531-f066bb18b162","year":2025},"citing_paper":{"arxiv_id":"2506.22033","last_updated":"2025-06-27T09:27:04Z","snapshot_observed_at":"2026-08-10T04:37:46.503725Z","submitted_at":"2025-06-27T09:27:04Z","title":"SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T22:21:08.291122Z"},"links":{"citing_paper":"/paper/2506.22033"},"observation_digest":"sha256:98d08b3d76d2415c35313335c9c18d247df831157a1f50fdcc67b75b7de06651","observation_id":"19a82f40-f7bf-463a-890a-6dfa5ac806b5","resolution":{"observed_at":"2026-08-06T22:21:10.232576Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:21:10.075038Z","title":null,"venue":null,"work_id":"38647eec-4858-4819-92f5-a88f9a1fce8e","year":2024},"citing_paper":{"arxiv_id":"2506.22033","last_updated":"2025-06-27T09:27:04Z","snapshot_observed_at":"2026-08-10T04:37:46.503725Z","submitted_at":"2025-06-27T09:27:04Z","title":"SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T22:21:08.316471Z"},"links":{"citing_paper":"/paper/2506.22033"},"observation_digest":"sha256:a64340de66f33fe084a3621f775d7c570b80ca2c235961f6e91a8821a85bc2bb","observation_id":"c531d65f-241c-49a2-b291-30be26f522f0","resolution":{"observed_at":"2026-08-06T22:21:10.134845Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:21:08.334204Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.22033","last_updated":"2025-06-27T09:27:04Z","snapshot_observed_at":"2026-08-10T04:37:46.503725Z","submitted_at":"2025-06-27T09:27:04Z","title":"SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T22:21:08.334204Z"},"links":{"citing_paper":"/paper/2506.22033"},"observation_digest":"sha256:49845607b20d159e39df5e274653622ab744960d7c9dc17bdf883d880a8d8f6b","observation_id":"1356f8a4-9c85-464a-9ac5-39522fae388a","resolution":{"observed_at":"2026-08-06T22:21:08.334204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-06T22:21:08.365349Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.22033","last_updated":"2025-06-27T09:27:04Z","snapshot_observed_at":"2026-08-10T04:37:46.503725Z","submitted_at":"2025-06-27T09:27:04Z","title":"SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T22:21:08.365349Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2506.22033"},"observation_digest":"sha256:ff87fd429d37c3a5171cb01050ea1d2ed0944dfa036a0a89bf733f5320f87aaf","observation_id":"214c4e61-2956-459c-9afe-5f4bb09df192","resolution":{"observed_at":"2026-08-06T22:21:08.365349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:21:09.912462Z","title":null,"venue":null,"work_id":"8e041d54-b844-4817-9e5e-c2f2bc1f5fb3","year":2025},"citing_paper":{"arxiv_id":"2506.22033","last_updated":"2025-06-27T09:27:04Z","snapshot_observed_at":"2026-08-10T04:37:46.503725Z","submitted_at":"2025-06-27T09:27:04Z","title":"SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T22:21:08.404913Z"},"links":{"citing_paper":"/paper/2506.22033"},"observation_digest":"sha256:d7b15bc78257e3c49d66b70bcd06f2b0afa0738e75dd28a98227417078f5ae1d","observation_id":"5c9a273f-9b2b-41e0-b87c-de85b7be8551","resolution":{"observed_at":"2026-08-06T22:21:10.025414Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:21:09.775957Z","title":null,"venue":null,"work_id":"3ca090d2-0894-4f03-9975-d345f2f98d2e","year":2024},"citing_paper":{"arxiv_id":"2506.22033","last_updated":"2025-06-27T09:27:04Z","snapshot_observed_at":"2026-08-10T04:37:46.503725Z","submitted_at":"2025-06-27T09:27:04Z","title":"SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T22:21:08.433933Z"},"links":{"citing_paper":"/paper/2506.22033"},"observation_digest":"sha256:dc1e7915732af7fd3d050bcc488a74fe3699b58239475f3edee0fc3c553a6edc","observation_id":"d9ca8580-08af-4309-a510-6bc2fdc74e20","resolution":{"observed_at":"2026-08-06T22:21:09.862571Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:21:08.482407Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.22033","last_updated":"2025-06-27T09:27:04Z","snapshot_observed_at":"2026-08-10T04:37:46.503725Z","submitted_at":"2025-06-27T09:27:04Z","title":"SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T22:21:08.482407Z"},"links":{"citing_paper":"/paper/2506.22033"},"observation_digest":"sha256:7db76da2516483798529a5cc902b89c23c796c27dc95c5382f77409570bc2d11","observation_id":"40d011e9-9cfc-47ad-a30a-8069b912bb21","resolution":{"observed_at":"2026-08-06T22:21:08.482407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14430","last_updated":"2025-12-03T10:59:23Z","snapshot_observed_at":"2026-08-08T21:50:02.096694Z","submitted_at":"2024-05-23T11:00:07Z","title":"PipeFusion: Patch-level Pipeline Parallelism for Diffusion Transformers Inference","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14430","snapshot_observed_at":"2026-08-06T22:21:08.502337Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22033","last_updated":"2025-06-27T09:27:04Z","snapshot_observed_at":"2026-08-10T04:37:46.503725Z","submitted_at":"2025-06-27T09:27:04Z","title":"SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T22:21:08.502337Z"},"links":{"cited_paper":"/paper/2405.14430","citing_paper":"/paper/2506.22033"},"observation_digest":"sha256:1e23f1bc1d913ab1aebcce2a04a4ba58824bbb8434a5a0ff2268f8e046a1f9ea","observation_id":"a0796d54-cf61-41e1-aefe-f2c49c2629a8","resolution":{"observed_at":"2026-08-06T22:21:08.502337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:21:09.665660Z","title":null,"venue":null,"work_id":"9eb104c7-099f-4089-bfd3-52750469e500","year":2022},"citing_paper":{"arxiv_id":"2506.22033","last_updated":"2025-06-27T09:27:04Z","snapshot_observed_at":"2026-08-10T04:37:46.503725Z","submitted_at":"2025-06-27T09:27:04Z","title":"SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T22:21:08.511891Z"},"links":{"citing_paper":"/paper/2506.22033"},"observation_digest":"sha256:2a86fab1911b6428e31aec88823add3590a0c822e75159610c728c28fa90789a","observation_id":"0f81eb64-e1e7-4ed4-a5e1-54e3f4ad135b","resolution":{"observed_at":"2026-08-06T22:21:09.707779Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-06T22:21:08.549867Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22033","last_updated":"2025-06-27T09:27:04Z","snapshot_observed_at":"2026-08-10T04:37:46.503725Z","submitted_at":"2025-06-27T09:27:04Z","title":"SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T22:21:08.549867Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2506.22033"},"observation_digest":"sha256:838e0891a04ef1faa84026ba4edb4d392e79cf7361a5a76098279dba07dd418c","observation_id":"51b7d836-3419-4b09-8350-ea0d214bd869","resolution":{"observed_at":"2026-08-06T22:21:08.549867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:21:09.538121Z","title":null,"venue":null,"work_id":"0be6ebce-6fa8-45f3-8153-2fee2737f79b","year":2024},"citing_paper":{"arxiv_id":"2506.22033","last_updated":"2025-06-27T09:27:04Z","snapshot_observed_at":"2026-08-10T04:37:46.503725Z","submitted_at":"2025-06-27T09:27:04Z","title":"SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T22:21:08.587759Z"},"links":{"citing_paper":"/paper/2506.22033"},"observation_digest":"sha256:82e2cef7c30660114c67ef145d3c8e5d14539e068a75dc922b6b81f5b34b90b9","observation_id":"557c3af2-268f-4f09-8fc4-5c2d1f9749ec","resolution":{"observed_at":"2026-08-06T22:21:09.605042Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02263","last_updated":"2025-07-26T15:29:10Z","snapshot_observed_at":"2026-08-08T01:33:26.740871Z","submitted_at":"2025-04-03T04:20:44Z","title":"MegaScale-Infer: Serving Mixture-of-Experts at Scale with Disaggregated Expert Parallelism","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.02263","snapshot_observed_at":"2026-08-06T22:21:08.635007Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.22033","last_updated":"2025-06-27T09:27:04Z","snapshot_observed_at":"2026-08-10T04:37:46.503725Z","submitted_at":"2025-06-27T09:27:04Z","title":"SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T22:21:08.635007Z"},"links":{"cited_paper":"/paper/2504.02263","citing_paper":"/paper/2506.22033"},"observation_digest":"sha256:afd2553e48a9f4f5fc288270a7dd2ea233a418dafdde822a0e38fa34d112f1a2","observation_id":"9b514c71-d402-45ab-9f31-d839c8a7030d","resolution":{"observed_at":"2026-08-06T22:21:08.635007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.00907","last_updated":"2019-11-03T11:21:56Z","snapshot_observed_at":"2026-07-06T07:12:15.425343Z","submitted_at":"2018-11-02T14:54:50Z","title":"Importance of Search and Evaluation Strategies in Neural Dialogue Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.00907","snapshot_observed_at":"2026-08-06T22:20:16.776351Z","title":"arXiv preprint arXiv:1811.00907 2 (2018)","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.22033","last_updated":"2025-06-27T09:27:04Z","snapshot_observed_at":"2026-08-10T04:37:46.503725Z","submitted_at":"2025-06-27T09:27:04Z","title":"SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-06T22:20:16.776351Z"},"links":{"cited_paper":"/paper/1811.00907","citing_paper":"/paper/2506.22033"},"observation_digest":"sha256:87f2b79a3f31b9f2f63ef0b5b47253b0b0068aa22f6089006a6bdafed4a0c713","observation_id":"89d81ba5-9760-4bd5-ab5c-1ec0d6815487","resolution":{"observed_at":"2026-08-06T22:20:16.776351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09751","last_updated":"2020-02-14T21:56:30Z","snapshot_observed_at":"2026-07-06T07:47:32.745963Z","submitted_at":"2019-04-22T07:17:18Z","title":"The Curious Case of Neural Text Degeneration","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.09751","snapshot_observed_at":"2026-08-06T22:20:16.448376Z","title":"arXiv preprint arXiv:1904.09751 (2019)","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.22033","last_updated":"2025-06-27T09:27:04Z","snapshot_observed_at":"2026-08-10T04:37:46.503725Z","submitted_at":"2025-06-27T09:27:04Z","title":"SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-06T22:20:16.448376Z"},"links":{"cited_paper":"/paper/1904.09751","citing_paper":"/paper/2506.22033"},"observation_digest":"sha256:8950ec1a631ae5de451873c3130e10b8e15840e4a59cc793d8e8acd85ab317b7","observation_id":"d990ec36-4a83-46ce-8f78-4998e8148b68","resolution":{"observed_at":"2026-08-06T22:20:16.448376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:20:16.951598Z","title":"In Proceedings of the 29th Symposium on Operating Systems Principles","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.22033","last_updated":"2025-06-27T09:27:04Z","snapshot_observed_at":"2026-08-10T04:37:46.503725Z","submitted_at":"2025-06-27T09:27:04Z","title":"SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T22:20:16.951598Z"},"links":{"citing_paper":"/paper/2506.22033"},"observation_digest":"sha256:a06fc9206a3f2a110db1a3c66676d8f48b5443b68fca83b46185e6b5a4323d7b","observation_id":"49db65b0-7641-43df-b475-86403e866d8c","resolution":{"observed_at":"2026-08-06T22:20:16.951598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.22033","last_updated":"2025-06-27T09:27:04Z","latest_version":1,"primary_category":"cs.DC","snapshot_observed_at":"2026-08-10T04:37:46.503725Z","submitted_at":"2025-06-27T09:27:04Z","title":"SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference"},"reference_resolution":{"displayed":52,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":43,"verified_exact":3,"verified_fuzzy":5},"total_outbound_references":52},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 52 of 52 outbound references and 0 inbound Pith citation observations for arXiv:2506.22033."}