{"as_of":"2026-08-10T08:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4a9eb3d9a4e6fe68b2662b953598fc5d844e200c9f0866aa0236ee787c631fc5","coverage":[{"denominator":88,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":88,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T18:23:08.569863Z","state":"measured"},{"denominator":88,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":88,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.06007/citation-record","integrity":"/paper/2608.06007/integrity","json":"/paper/2608.06007/citation-record.json","paper":"/paper/2608.06007"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:08.210099Z","title":"https://www.kimi.com/blog/kimi- k3","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.210099Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:61d4d3ded574984a5f7dfccd09d71ac984f215ba49807a6afe44a535ee73b585","observation_id":"7266694b-2167-460e-a9a2-c6a1461ddcae","resolution":{"observed_at":"2026-08-07T18:23:08.210099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:08.215746Z","title":"ServerlessLLM: Low-Latency serverless inference for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.215746Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:7b43313c14dce3197f07c7e16acae8fcf7dec85fb0f74310e91cf7d97ddeaa48","observation_id":"c5640c60-ddb8-46c0-820b-289b6a800bd5","resolution":{"observed_at":"2026-08-07T18:23:08.215746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:08.220987Z","title":"Deep- flow: Serverless large language model serving at scale.arXiv e-prints, pages arXiv–2501, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.220987Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:c9fb64fb9e26ee6c79e046735ff308b35338c9d4f32a4da02dc009478db8c6c7","observation_id":"d373c80b-505e-4110-9072-7ef34e468468","resolution":{"observed_at":"2026-08-07T18:23:08.220987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03622","last_updated":"2025-07-08T02:15:07Z","snapshot_observed_at":"2026-07-06T15:39:10.697564Z","submitted_at":"2023-06-06T12:19:05Z","title":"Torpor: GPU-Enabled Serverless Computing for Low-Latency, Resource-Efficient Inference","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.03622","snapshot_observed_at":"2026-08-07T18:23:08.225722Z","title":"Faaswap: Slo-aware, gpu-efficient serverless inference via model swap- ping.arXiv preprint arXiv:2306.03622, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.225722Z"},"links":{"cited_paper":"/paper/2306.03622","citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:fa943dcdcfe09722863a49f5aa625779d5ad69b3451a133a84196218f8b25557","observation_id":"059a9267-99f7-4671-b484-7768bf48ee96","resolution":{"observed_at":"2026-08-07T18:23:08.225722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:08.230680Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.230680Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:cda7fb58592b9cb478925b322c649c0d6ca07fd939d4461bbdca635050d8de43","observation_id":"7bb633c6-8d07-43e5-a398-f51152382d11","resolution":{"observed_at":"2026-08-07T18:23:08.230680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:08.234958Z","title":"BlitzScale: Fast and Live Large Model Autoscaling with O (1) Host Caching","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.234958Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:d8c95aac4de041276c6cd5110e39f1b3eb15bb34f61e458afe1ae22761dc6794","observation_id":"e4436a8a-eac5-4d58-a312-6f25afa6d915","resolution":{"observed_at":"2026-08-07T18:23:08.234958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:08.239382Z","title":"Hydraserve: Minimizing cold start latency for serverless llm serving in public clouds.arXiv preprint arXiv:2502.15524, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.239382Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:05ce9a577dc755a5e26b992549c0c6e1eafe304e1923faae0ebe3a777e489ae9","observation_id":"4c447d41-9049-42d6-a526-314478418a4a","resolution":{"observed_at":"2026-08-07T18:23:08.239382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:08.243347Z","title":"https://lmsys.org/blog/2025-12-10-rfork/","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.243347Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:acb3bda915b851e48ce09d5eddade003f621b4f7798e11b57106217071594ffd","observation_id":"cff16d1b-78d6-4d53-afdf-1a465b2f75e0","resolution":{"observed_at":"2026-08-07T18:23:08.243347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:08.247723Z","title":"Mooncake: Trad- ing more storage for less computation—a KVCache-centric architecture for serving LLM chatbot","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.247723Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:3b17cbdeca55c0f670204c2d57cb3e6365bf39062e7426896ffc0c4400967f90","observation_id":"9012b892-fc8d-46fe-9e9a-83c5ef0d592a","resolution":{"observed_at":"2026-08-07T18:23:08.247723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:08.252135Z","title":"Dualmap: Enabling both cache affinity and load bal- ancing for distributed LLM serving","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.252135Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:6925ac275773d6076a3a34ba0f6da0af67ecd59d93e3ad4ceacd7190561c33e6","observation_id":"214672d2-ef54-4bbc-9f95-a8ecd3432886","resolution":{"observed_at":"2026-08-07T18:23:08.252135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:08.256927Z","title":"Lmcache: An efficient kv cache layer for enterprise-scale llm inference","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.256927Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:0e7df6161913733b9178808a2fc0dbebf4542d4368e14ebba392bbf10937ae70","observation_id":"530077e3-3828-4a3b-8d88-67308194f45b","resolution":{"observed_at":"2026-08-07T18:23:08.256927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:08.261289Z","title":"https://lmsys.org/blog/2025-09-10-sglang-hicache/","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.261289Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:c48121f64e069f542c55932153f464b4878ffa71b563985e131435e1a7b6fd9a","observation_id":"1bab6d33-92c7-4dee-8e00-57df7e7504a8","resolution":{"observed_at":"2026-08-07T18:23:08.261289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:10.643159Z","title":"Stateful large language model serving with pensieve","venue":null,"work_id":"693b1091-7e39-4fa6-9f4b-00e628f88235","year":2025},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.265567Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:577ca166b8d2a0795dd642c4a39359aadc53a5dae21e2c649724ad046506ea22","observation_id":"42f290ec-4062-48e3-bfca-971efb32b231","resolution":{"observed_at":"2026-08-07T18:23:10.647674Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:10.631960Z","title":"Cacheblend: Fast large language model serving for rag with cached knowledge fusion","venue":null,"work_id":"1aa3cc90-5684-4e0a-98a3-6123c9829b15","year":2025},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.270101Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:88f00958d2853b00debd0ae6d32aeed17d3920fbbbb156ec76ce6ceb6782d29f","observation_id":"9194a7a9-2f73-4e9c-b28f-1f56071a2766","resolution":{"observed_at":"2026-08-07T18:23:10.635789Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:10.620584Z","title":"Cost-Efficient large language model serving for multi-turn conversations with Cache- dAttention","venue":null,"work_id":"7dfd4f60-16c4-4ac3-ac97-b2a278b83b8f","year":2024},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.274263Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:10b3b3bc0ee21ef1c6e410d8c0dea32dec23ffc2a8f06a56d022cf8d4851b4bc","observation_id":"da5d784e-d1e4-4906-82b2-e611454f3ffb","resolution":{"observed_at":"2026-08-07T18:23:10.624659Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:10.609354Z","title":"{ByteCheckpoint}: A unified checkpointing system for large foundation model development","venue":null,"work_id":"6d93d69d-25b7-4d69-8e3a-887dfc26cd59","year":2025},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.278745Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:281bc05c11efc542f83c1eb43d1b1f025f6c505c41806ada7bcebc49b26b9153","observation_id":"7b20c028-7b9f-4073-9b77-231851ecc7da","resolution":{"observed_at":"2026-08-07T18:23:10.613146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:10.597311Z","title":"https://github.com/MoonshotAI/chec kpoint-engine","venue":null,"work_id":"f5da0a2d-6959-4516-a86e-c86f90369cc3","year":2026},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.282891Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:db99cac92c68d147af154e3de9cbdace522b7f5f5dfc7137fbc64681408e09fd","observation_id":"4662b785-a21c-4aa6-a755-bec13fc799eb","resolution":{"observed_at":"2026-08-07T18:23:10.601572Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:10.585375Z","title":"https://vllm.ai/","venue":null,"work_id":"9f2240a2-effa-4076-9db7-8a8987ce8e4a","year":2026},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.286808Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:ed8c6cdb1e6d978219afa01a903e5bc5d763f05cae13156163d381916adcbdb9","observation_id":"31c3bf0a-5caf-4897-8dfd-3bc84f726e13","resolution":{"observed_at":"2026-08-07T18:23:10.589655Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:08.292156Z","title":"Sglang: Efficient execution of structured language model programs.Advances in neural information processing systems, 37:62557–62583, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.292156Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:b2c7d6256f713c13dd1b4ea066ec3f118e2656a4000c44519343c4bfe8d67083","observation_id":"4559eff5-182a-4fde-b2db-6844d6b4eef1","resolution":{"observed_at":"2026-08-07T18:23:08.292156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:10.567163Z","title":"https://nvidia.github.io/TensorRT-LLM/","venue":null,"work_id":"677276d8-c74b-4ee6-bfe2-fae5ac135982","year":2026},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.296384Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:ba3c685bd81cca63ceb12359e5a8dfdf027b5b092ca2f76b0bda649a292b4cca","observation_id":"f1a612b6-281d-44a8-966a-de5cd8b8260d","resolution":{"observed_at":"2026-08-07T18:23:10.571245Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:10.554961Z","title":null,"venue":null,"work_id":"40401d33-c8da-4c11-aaa9-08ca16cdf9ac","year":null},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.300372Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:067ded218f674282988fcc5334aee719ab410753532d82e13e6897c9393f0f3f","observation_id":"88da8772-4852-4076-aeed-3d06e9d38c5c","resolution":{"observed_at":"2026-08-07T18:23:10.559915Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:10.542322Z","title":"https://redis.io/","venue":null,"work_id":"b6e7b4f0-59c0-48b0-9a76-dcb7828e78f7","year":2026},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.304346Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:ab0b5054d04ce5dd6b99a520e886b7cbcd73934ccece672362c12ea1dfe905ca","observation_id":"db842daf-c122-4ea2-933e-7cb220a4e955","resolution":{"observed_at":"2026-08-07T18:23:10.546071Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:10.530444Z","title":"Vineyard: Optimizing data sharing in data- intensive analytics.Proc","venue":null,"work_id":"ac64380a-29e7-45f1-bb01-d28c925620fe","year":2023},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.308377Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:895b03ff8c1ea354a8ee95ce3d3b26926b2692881a8f03da7df9c9be124400da","observation_id":"e67a7a63-1040-4cf5-a8c1-e12cedf1315d","resolution":{"observed_at":"2026-08-07T18:23:10.534517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:10.517081Z","title":"https://github.com/ray-project/plasma","venue":null,"work_id":"2548e854-8f26-42d5-a095-b1438cbe4986","year":2026},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.312295Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:e23913fbed6fffd66671726e9c8cdcc0c873e96661e75b24e9a2e1375757106c","observation_id":"45e262c5-30d2-4c6f-be79-3d1fc74ab155","resolution":{"observed_at":"2026-08-07T18:23:10.522032Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:10.505709Z","title":"Ray: A distributed framework for emerging ai applications","venue":null,"work_id":"d0fb6272-a6ab-408f-9212-ce5796f250a2","year":2018},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.315974Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:2999b6bc86d562c3d2e668a68826c9028184f9a7f2c15050cba4e9d174a22dbe","observation_id":"8436dcad-3029-4bdf-bb28-e3e864b50b22","resolution":{"observed_at":"2026-08-07T18:23:10.509673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:10.493268Z","title":"Resilient distributed datasets: A Fault-Tolerant abstraction for In-Memory cluster computing","venue":null,"work_id":"38a0e9a3-d83c-4556-9ea6-969c16cf2165","year":2012},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.320121Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:6cd0a3f9050500008467e4e85bcb5f6f2607853fc2f29398adb4dc37f61ad279","observation_id":"76dc0904-c3ee-4e49-a3cb-3e5b4a919e09","resolution":{"observed_at":"2026-08-07T18:23:10.497933Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:08.324667Z","title":"Serverless computing: Design, implementation, and performance","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.324667Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:3b3aff7231383519e1a25094c12c54e5b0e8e77fcd188ffb70931b50bd65c6d5","observation_id":"0d236e8d-f09c-4621-b24c-a6a9d6cc73ed","resolution":{"observed_at":"2026-08-07T18:23:08.324667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:10.473954Z","title":"Infless: a native serverless system for low-latency, high-throughput inference","venue":null,"work_id":"77b3b745-8a0b-4b7d-9cbf-df5c044d567c","year":2022},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.328764Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:71f7f68fe420139f0aa600254d54132f446a54a9b6e01b8aa9f0215b09084e94","observation_id":"b4725148-3cf4-48f3-bcf2-2e285e89f710","resolution":{"observed_at":"2026-08-07T18:23:10.478626Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:08.332432Z","title":"Attention is all you need.Advances in neural information processing systems, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.332432Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:71eae65c47b3355c355756be66a6d3e04e071c9389a8ade933c35a323159154d","observation_id":"61af6026-a968-4494-9880-29304696fc9d","resolution":{"observed_at":"2026-08-07T18:23:08.332432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:08.336296Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.336296Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:583e8a78a37d78426078df7eefd97d5fbe40353746850b2ce205d72c0cffa9bf","observation_id":"d04194b5-e4b6-438e-8cae-de4d804b89f0","resolution":{"observed_at":"2026-08-07T18:23:08.336296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.16148","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:09.333855Z","title":"Flexkv: Flexible index offloading for memory-disaggregated key-value store.arXiv preprint arXiv:2512.16148, 2025","venue":null,"work_id":"ef7adfc7-0ed9-4824-acf5-de8fcc85cd41","year":2025},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.339917Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:98a8041b107e22606b14c403b565b2fbfba41e6b5fbac8d193ebac655532579c","observation_id":"8c2c0de8-44a0-435c-8316-63e889a005a8","resolution":{"observed_at":"2026-08-07T18:23:09.340739Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:10.446333Z","title":"In USENIX OSDI, 2024","venue":null,"work_id":"8d62ce17-6876-4198-813b-c9637f3bfd6d","year":2024},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.344903Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:4a2918b88c9fc908ec7a931d463b3ba4987b57b97a08fa5fcef00d75e8cf7756","observation_id":"770044c6-56af-42e6-a0b9-808c69d64444","resolution":{"observed_at":"2026-08-07T18:23:10.450965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:10.433562Z","title":"Splitwise: Efficient genera- tive llm inference using phase splitting","venue":null,"work_id":"7ff8fb8c-9652-47f6-8ab1-d7a916b5e462","year":null},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.348995Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:1f25e213cf75530b946fd858f53d38ac0eba1d3ad3a9ab834ccd40d74caf2e6a","observation_id":"c0f22ded-c796-44de-a7ef-351c921e3fd7","resolution":{"observed_at":"2026-08-07T18:23:10.438704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.11181","last_updated":"2024-01-20T09:43:36Z","snapshot_observed_at":"2026-08-05T23:35:16.350557Z","submitted_at":"2024-01-20T09:43:36Z","title":"Inference without Interference: Disaggregate LLM Inference for Mixed Downstream Workloads","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.11181","snapshot_observed_at":"2026-08-07T18:23:08.353271Z","title":"Inference without interference: Disaggregate llm inference for mixed downstream workloads.arXiv preprint arXiv:2401.11181, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.353271Z"},"links":{"cited_paper":"/paper/2401.11181","citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:3849753606447abc9b9f67cc7ab93bbc5fcbe6b3f9ff4043e8849288b5fb9e19","observation_id":"ea77d351-5772-4605-b59d-d2342eac07e3","resolution":{"observed_at":"2026-08-07T18:23:08.353271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.01876","last_updated":"2024-03-04T09:32:05Z","snapshot_observed_at":"2026-08-09T23:49:32.413832Z","submitted_at":"2024-03-04T09:32:05Z","title":"D\\'ej\\`aVu: KV-cache Streaming for Fast, Fault-tolerant Generative LLM Serving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.01876","snapshot_observed_at":"2026-08-07T18:23:08.357426Z","title":"D \\’ej\\avu: Kv-cache streaming for fast, fault- tolerant generative llm serving.arXiv preprint arXiv:2403.01876, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.357426Z"},"links":{"cited_paper":"/paper/2403.01876","citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:fe179b3805769a9eb1cd1964415a74b4a5fc1cc6b3c1edd8c1d1bddfce8e756d","observation_id":"60fe65b5-c7d9-437f-aa3f-c6cb4b316c79","resolution":{"observed_at":"2026-08-07T18:23:08.357426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:10.421639Z","title":"Prompt cache: Modular attention reuse for low-latency inference.Proceedings of Machine Learning and Systems, 6:325–338, 2024","venue":null,"work_id":"43425072-7c87-46a1-a14d-62b013573a6a","year":2024},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.361591Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:ef459ccb18ac78610577e1e5db5b2ced31ece3d987c8e8084cd77ddb1cc6edaf","observation_id":"e3d048ff-38d0-4f2e-9257-ef5544fc095f","resolution":{"observed_at":"2026-08-07T18:23:10.425673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:10.409795Z","title":"Cachegen: Kv cache compression and streaming for fast large language model serving","venue":null,"work_id":"971c2c7a-fcf0-4f00-81ce-7a3c5ed3ed7c","year":2024},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.365396Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:8a8a8f79c53cc678b9bd2fe290af76dddc53ac555cb5e2ca2c837c9ee921d606","observation_id":"bcc27414-be25-4ed7-90ec-d706b5fad965","resolution":{"observed_at":"2026-08-07T18:23:10.414206Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:10.396553Z","title":"Ragcache: Efficient knowledge caching for retrieval-augmented generation.ACM Transactions on Computer Sys- tems, 44(1):1–27, 2025","venue":null,"work_id":"11689a65-a727-4ca0-86d0-55f855ba87ea","year":2025},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.369036Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:701e20c94f5a04d8ffc46ede5e88f81aa0f059789d3c30e3e31714f5b0488cef","observation_id":"1a8aac5a-b716-4e1a-b453-3e151a60595c","resolution":{"observed_at":"2026-08-07T18:23:10.401403Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19708","last_updated":"2024-06-30T23:50:38Z","snapshot_observed_at":"2026-08-03T11:15:07.121206Z","submitted_at":"2024-03-23T10:42:49Z","title":"Cost-Efficient Large Language Model Serving for Multi-turn Conversations with CachedAttention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.19708","snapshot_observed_at":"2026-08-07T18:23:08.373466Z","title":"Attentionstore: Cost-effective attention reuse across multi-turn conversations in large language model serving.arXiv preprint arXiv:2403.19708, 52:20–38, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.373466Z"},"links":{"cited_paper":"/paper/2403.19708","citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:f4c20239c885ecb6318185ee34e37e605d406593a576dc0cc1805216641e59d1","observation_id":"573cad29-4ab0-4ad7-ae10-34ce8d5c21d4","resolution":{"observed_at":"2026-08-07T18:23:08.373466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:10.382237Z","title":"Dist checkpointing package","venue":null,"work_id":"3b19c140-284d-4699-907e-03cd3ffd3498","year":2026},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.378063Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:2a3afb747ff910a0033c374763d141b507ffa54a40546ada7328cd85cf794e88","observation_id":"254654b9-7c4a-46cd-95fe-2db36adfceca","resolution":{"observed_at":"2026-08-07T18:23:10.386334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:10.368426Z","title":"Getting started with Distributed Check- point (DCP)","venue":null,"work_id":"264c14a0-6c8f-4ba8-9117-eae917da892e","year":2026},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.382598Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:232c18d8183c913074e96fff100389c774bcab963a59cafb2f179d26e704943a","observation_id":"69313a8f-f463-45a8-ac16-3a10cb5bdf78","resolution":{"observed_at":"2026-08-07T18:23:10.373829Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18820","last_updated":"2025-07-04T06:16:30Z","snapshot_observed_at":"2026-08-05T10:35:46.891754Z","submitted_at":"2024-06-27T01:28:30Z","title":"Universal Checkpointing: A Flexible and Efficient Distributed Checkpointing System for Large-Scale DNN Training with Reconfigurable Parallelis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18820","snapshot_observed_at":"2026-08-07T18:23:08.386378Z","title":"Universal checkpointing: Efficient and flexible checkpointing for large scale distributed training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.386378Z"},"links":{"cited_paper":"/paper/2406.18820","citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:55cc1318f3cec55166e4ba6bd523ee411f077341b229999b6a86627b80f3309d","observation_id":"5f164233-bc05-4186-942a-ec60c49025d7","resolution":{"observed_at":"2026-08-07T18:23:08.386378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:10.355439Z","title":"Simple is better: Multiplication may be all you need for llm request scheduling","venue":null,"work_id":"ae254e82-9108-4542-a77d-5ec2918e0f70","year":2026},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.390858Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:e752bd448fd7fb15b33e41b21d78cf02ff007cd9f0148fc55baa94a2d72e28a2","observation_id":"9cfffabc-cb58-4e9a-b75f-bc7b8d852320","resolution":{"observed_at":"2026-08-07T18:23:10.359485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:10.343205Z","title":"Efficient memory management for large language model serving with pagedattention","venue":null,"work_id":"0717b09d-d989-4d01-a4e9-403b2bfd2b82","year":2023},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.394615Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:eee4d7be3d11f66c79559d5ab3a997f696861fbf891934eef4fb3f97eaa746ee","observation_id":"8a62c2a8-f310-4c44-aae6-6933689baeb9","resolution":{"observed_at":"2026-08-07T18:23:10.347609Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:10.330642Z","title":"https://docs.vllm.ai/en/stable/desig n/prefix_caching/","venue":null,"work_id":"92f017e5-75b7-4950-b921-66b562fc72fa","year":2026},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.398238Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:3a8917fcf6ff2445e17ee7451cacdf720fd3192f94db24d7ea35aaceec5a7f07","observation_id":"48fdc530-c428-411c-87e2-112cddc9bfd4","resolution":{"observed_at":"2026-08-07T18:23:10.334793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:10.318828Z","title":"https://lmsys.org/blog/2024-01-17-sglang/","venue":null,"work_id":"08378bce-eaf0-41b0-a21c-ba251fe630b4","year":2024},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.401764Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:817d29cd1bd99212fed7d0e6c75151fdbd270ed3b9df565695b55d63045e848b","observation_id":"2ec7bafd-e84c-4950-a29a-579d9f6908fa","resolution":{"observed_at":"2026-08-07T18:23:10.322790Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:10.306493Z","title":"Pie: A pro- grammable serving system for emerging llm applications","venue":null,"work_id":"1c6e4904-9ae2-4752-bb18-2225bbe0cc80","year":2025},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.405393Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:76cd0426dce576b7e54e9ebf71a5cdb84144ffc02767bee43c69e83be74b971d","observation_id":"aed7ed80-0a54-4021-9bad-50150fca6b34","resolution":{"observed_at":"2026-08-07T18:23:10.310698Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:08.409426Z","title":"Chain-of-thought prompt- ing elicits reasoning in large language models.Advances in neural information processing systems, 35:24824–24837, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.409426Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:8e5917323c15760cfba39d3946db1502a9a9e04d99dd99c8094426d6e1cb2f15","observation_id":"2d7fe69a-4765-4fa5-a54c-4bd2caefbe3d","resolution":{"observed_at":"2026-08-07T18:23:08.409426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:08.412959Z","title":"Tree of thoughts: Deliberate problem solving with large language models.Advances in neural information processing systems, 36:11809–11822, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.412959Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:ab8fdf6efe7e983be3c096a28d7a4c7bd5df911c55154bee6296c3983d668d03","observation_id":"4c63f9c8-ebc7-45d6-aa2d-1fb0fd3500ba","resolution":{"observed_at":"2026-08-07T18:23:08.412959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:10.277504Z","title":"Training language models to follow instruc- tions with human feedback.Advances in neural information processing systems, 35:27730–27744, 2022","venue":null,"work_id":"642f9486-27b2-4d60-84ba-f46981d849bf","year":2022},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.416940Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:487301f1823b8679098ddbe8d7bb761d22dc8426fa90b04df5a89913a7064ac6","observation_id":"60382737-0556-4911-ab3d-b66a51c7f2ec","resolution":{"observed_at":"2026-08-07T18:23:10.282711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.14617","last_updated":"2026-04-03T12:47:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-18T16:12:21Z","title":"Seer: Online Context Learning for Fast Synchronous LLM Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.14617","snapshot_observed_at":"2026-08-07T18:23:08.421353Z","title":"Seer: Online context learning for fast synchronous llm reinforcement learning.arXiv preprint arXiv:2511.14617, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.421353Z"},"links":{"cited_paper":"/paper/2511.14617","citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:57496d41a19dc81ee72d9e2e22fdb2709ec1a48a17c97bf51fa0b8d337a548db","observation_id":"4c583cb5-6425-44b7-82ee-ab34222e266e","resolution":{"observed_at":"2026-08-07T18:23:08.421353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-07T18:23:08.425755Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.425755Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:4b5a08af323ae3c3eee555c302b122ce54e8d91279520e76ac4bccdda171628d","observation_id":"f8c235cd-4da4-4fe4-88dc-0cf04bcc8159","resolution":{"observed_at":"2026-08-07T18:23:08.425755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:08.430349Z","title":"Totrl: Unlock llm tree-of-thoughts reasoning potential through puzzles solving.arXiv preprint arXiv:2505.12717, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.430349Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:70c094a410d3f4169929cddbc619488890780c23e2e3b7d2e660b03dc6482d1b","observation_id":"2847fa79-e643-40e6-a65c-fb56839f6f7e","resolution":{"observed_at":"2026-08-07T18:23:08.430349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:10.264845Z","title":"Using name-based map- pings to increase hit rates.IEEE/ACM Transactions on networking, 6(1):1–14, 2002","venue":null,"work_id":"0d607f03-e09b-4d39-9777-b4d248afa5fd","year":2002},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.434044Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:d570b72a5552bfc8932142efa9d83da4198f799220026d0b1fe3922d7f468ad9","observation_id":"50a88b26-30cb-4888-a5af-cec5627c30a6","resolution":{"observed_at":"2026-08-07T18:23:10.269755Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:08.438822Z","title":"Paxos made simple.ACM SIGACT News (Distributed Computing Column) 32, 4 (Whole Number 121, December 2001), pages 51–58, 2001","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.438822Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:691fca910d4f993546c30607d49ff06f2c3a997405531e85b4eb47c5822b3b44","observation_id":"006bb2b3-6cfd-4972-844b-26a05685227f","resolution":{"observed_at":"2026-08-07T18:23:08.438822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:10.245499Z","title":"In search of an understandable consensus algorithm","venue":null,"work_id":"27b222e9-915a-435b-b743-83e8e50545bb","year":2014},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.442644Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:0b02a8fbef13864583266cdc310aa5f9ad5d1d84d5e9fac1b1bc3022bb277a03","observation_id":"32b178f7-8443-4441-b96b-3e37cc30c25a","resolution":{"observed_at":"2026-08-07T18:23:10.249413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:10.233203Z","title":"Chain replication for sup- porting high throughput and availability","venue":null,"work_id":"e938b9d5-a693-4607-a93d-4d5c840e27b9","year":2004},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.446537Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:4aa289f3299477b3e91080cb5e6a3bdcacf04e4bdfcc92aefd3fe981ffaac469","observation_id":"bbf2b854-54d3-4aaa-bb1d-fe5f9036b578","resolution":{"observed_at":"2026-08-07T18:23:10.238009Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:10.220873Z","title":"Object storage on craq: High- throughput chain replication for read-mostly workloads","venue":null,"work_id":"ca03792b-72c9-484f-a5ea-d636df49f469","year":2009},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.450954Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:5e6467fe11b57c43c92edb4137472d8007e4248c0c93c1de70c4d959a65b0550","observation_id":"ff7f2fae-e973-42ba-8053-ca9eff8b8ff9","resolution":{"observed_at":"2026-08-07T18:23:10.224973Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:10.206898Z","title":"https://duckdb.org/","venue":null,"work_id":"7bd40e1b-5001-474a-8b89-ef712769617e","year":2026},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.454631Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:52f93122041766db8584ef9da75ac5fd21416ddc77ced6a01b13993ecc51e0f0","observation_id":"9168acd8-ed5d-4b95-8f5f-2019e44874c8","resolution":{"observed_at":"2026-08-07T18:23:10.211272Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:10.194084Z","title":"mtcp: a highly scalable user-level tcp stack for multicore systems","venue":null,"work_id":"16165aaf-e388-41f9-8521-faee65a1b35a","year":2014},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.459162Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:d431abfa40f4cfc80e93cabfeb15c54a5b4e172f70bd0b87b7ac82758f07fb49","observation_id":"53bf552d-21dd-4d45-a1ec-41026a92b6c8","resolution":{"observed_at":"2026-08-07T18:23:10.198701Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:10.181418Z","title":"https://github.com/juicedata/juicefs","venue":null,"work_id":"fdc40910-54b6-4a06-b37f-c69ceb8fa36f","year":2026},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.462909Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:3e4889a46eeee7807f3bc942b76dc2a82d77cc98b449bf213261bf93d49257c0","observation_id":"6a330889-e78c-40b5-9722-42ead742e5d1","resolution":{"observed_at":"2026-08-07T18:23:10.186247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:10.168775Z","title":"https://github.com/scitix/InstantTensor","venue":null,"work_id":"b28974d4-1806-4a47-a09a-d0e073432466","year":2026},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.466659Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:2be552d03387ebda745652441d299b83ab7be4ac7b5acfe769da0671557a4e02","observation_id":"e5e4bb20-5e0d-4601-ba22-8341ef673049","resolution":{"observed_at":"2026-08-07T18:23:10.172944Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:10.156517Z","title":"Long- bench: A bilingual, multitask benchmark for long context understand- ing","venue":null,"work_id":"08a113cc-0d28-4c4a-af97-df7d48d19d34","year":2024},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.470342Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:d543676ccdafb9c0634618ade1cfc8e321cee3bbff358f9fe014c7429857348c","observation_id":"3e039b24-fd2d-4026-b25b-8d5d812f2fed","resolution":{"observed_at":"2026-08-07T18:23:10.160803Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.15039","last_updated":"2026-04-22T03:05:12Z","snapshot_observed_at":"2026-07-06T23:02:40.364114Z","submitted_at":"2026-04-16T14:07:41Z","title":"Prefill-as-a-Service: KVCache of Next-Generation Models Could Go Cross-Datacenter","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.15039","snapshot_observed_at":"2026-08-07T18:23:08.474373Z","title":"Prefill-as-a-service: Kvcache of next-generation models could go cross-datacenter.arXiv preprint arXiv:2604.15039, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.474373Z"},"links":{"cited_paper":"/paper/2604.15039","citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:d01e69fc41688d4fa06fc94867a336cabf812a7e3b3aea01f760af46afa88796","observation_id":"39ad49e7-c9ab-40df-ac0f-262f08e9d101","resolution":{"observed_at":"2026-08-07T18:23:08.474373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:10.143489Z","title":"https://docs.sglang.io/docs/advanced_feature s/sgl_model_gateway","venue":null,"work_id":"26b0f945-6c18-421d-93cf-a7a3f2d2ace8","year":2026},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.478209Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:e436e38bf19587dcc7790accb1b727b88d21d51fba597b37eb05581c55867924","observation_id":"22a3cb25-dbb3-44a9-83a9-ba3209d9e25d","resolution":{"observed_at":"2026-08-07T18:23:10.147703Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:10.131392Z","title":"The power of two choices in randomized load balancing.IEEE transactions on parallel and distributed systems, 12(10):1094–1104, 2002","venue":null,"work_id":"5d0bc1b6-de8a-4797-a9bd-ea4a244f92d0","year":2002},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.481823Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:7c76b3ba2766a6709abd03b547aac6be2665feaa4dce8f41955844c96dbe05f3","observation_id":"f82df5cf-a17a-497c-a3eb-179e3270f03c","resolution":{"observed_at":"2026-08-07T18:23:10.135851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:10.118849Z","title":"https://huggingf ace.co/datasets/SWE-Gym/OpenHands-Sampled-Trajectories","venue":null,"work_id":"099e7909-8860-459b-b4b6-6fc7cf25f0dc","year":2026},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.486166Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:fa6c949655d2e3869f58dd9e4c17e919eb11888166cd04cdadf7e039ca274c43","observation_id":"916f0139-d982-41e4-9dda-0c918187b03b","resolution":{"observed_at":"2026-08-07T18:23:10.123576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:10.105156Z","title":"Statistical analysis of a telephone call center: A queueing-science perspective.Journal of the American statistical association, 100(469):36–50, 2005","venue":null,"work_id":"9c448de3-4043-4e2a-87b3-0c4ddb82fb7c","year":2005},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.489786Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:0383373d32d16fc10d2c665d3eb12bb0240602fbb626d24ec018e5b288814c2a","observation_id":"ad3735ae-f21e-46a5-9c1d-c929ea663c71","resolution":{"observed_at":"2026-08-07T18:23:10.109945Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:10.087444Z","title":"A poissonian explanation for heavy tails in e-mail communi- cation.Proceedings of the National Academy of Sciences, 105(47):18153– 18158, 2008","venue":null,"work_id":"2e101f8d-2ad7-4387-bb44-cd1e54275f93","year":2008},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.493268Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:9e1754a5fc2379071f39232e6a2f64c558d61799a280479eaf6bbc074ef42636","observation_id":"50970dc1-da77-4f6d-87a2-d011f79d8682","resolution":{"observed_at":"2026-08-07T18:23:10.092229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-07T18:23:08.497271Z","title":"Megatron-lm: Training multi- billion parameter language models using model parallelism.arXiv preprint arXiv:1909.08053, 2019","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.497271Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:747a38353f6d1fd4fc22429056472b7722373f4263a412f8c16e1a4628456b44","observation_id":"9da05baf-c805-45e5-b197-927e82cb80a7","resolution":{"observed_at":"2026-08-07T18:23:08.497271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:08.501915Z","title":"Deepspeed: System optimizations enable training deep learning models with over 100 billion parameters","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.501915Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:24f9f9a2b088fea20931ff37cedd73904aab4151ac77f5e6200ea2e16ee4f68d","observation_id":"7c371ba0-aef4-4f2f-9ba9-cc684d7c79ce","resolution":{"observed_at":"2026-08-07T18:23:08.501915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:10.065917Z","title":"Alpa: Automating inter-and{Intra-Operator} par- allelism for distributed deep learning","venue":null,"work_id":"c471a51c-ec14-4ec4-a249-e4ce68e71f2e","year":2022},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.506285Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:4d8903244deb08f1785e875a20a9522a06dc1a70bb899b1470bdfcefc5d12598","observation_id":"3f1f042e-f93e-4b13-97de-451d75f5d386","resolution":{"observed_at":"2026-08-07T18:23:10.070297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:10.050867Z","title":"Deepspeed-inference: enabling efficient inference of transformer models at unprecedented scale","venue":null,"work_id":"4c61c30f-b510-4fbd-88b5-c8db58adad89","year":2022},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.510490Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:9de54fcb930a1c17a836dcf4bddce1cd17fc1c1a569f11a37c1f93ba7a9ea2f5","observation_id":"ec3db6c5-8618-41dd-a0e0-fc2975811352","resolution":{"observed_at":"2026-08-07T18:23:10.056029Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:10.037051Z","title":"Loongserve: Efficiently serving long-context large lan- guage models with elastic sequence parallelism","venue":null,"work_id":"7215be30-fd00-43d7-8218-d64eb9f05a4d","year":2024},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.514615Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:07b6eb1b35deede3db35b6a39a4ecb9baa5e518dc82014c779bc2ee7ca7f84ea","observation_id":"ce5ad13f-c44f-4996-b5d5-3d1c1068e11c","resolution":{"observed_at":"2026-08-07T18:23:10.041553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.05920","last_updated":"2024-09-25T05:57:51Z","snapshot_observed_at":"2026-08-09T14:08:47.340904Z","submitted_at":"2023-05-10T06:17:50Z","title":"Fast Distributed Inference Serving for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.05920","snapshot_observed_at":"2026-08-07T18:23:08.520249Z","title":"Fast dis- tributed inference serving for large language models.arXiv preprint arXiv:2305.05920, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.520249Z"},"links":{"cited_paper":"/paper/2305.05920","citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:b91097a34f12c539df00cc813936b391f0a3676e5805b44081913b4312da3f51","observation_id":"321a3a82-8a7f-431a-b288-9d475621f8dd","resolution":{"observed_at":"2026-08-07T18:23:08.520249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:10.024111Z","title":"Orca: A distributed serving system for {Transformer-Based}generative models","venue":null,"work_id":"b82eec44-59c9-4125-9fbc-ca1ea7dc2fb9","year":2022},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.524500Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:fcd82a77ef260baf4b9fb533d86ead7b00d8911aac2783a387a7df971bf6558a","observation_id":"d44d2940-594a-4da8-9e92-b240f4b8893d","resolution":{"observed_at":"2026-08-07T18:23:10.028543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:10.011122Z","title":"Taming{Throughput-Latency} tradeoff in{LLM} inference with {Sarathi-Serve}","venue":null,"work_id":"1a09d5b8-a456-43b3-a32c-e8bfb28cd394","year":2024},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.528420Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:47f672f8935fcc407dabbdd5309c2383a59b3e0891d274680325051aab154968","observation_id":"e5b698e6-323f-4355-87d5-cc3ac62d84e0","resolution":{"observed_at":"2026-08-07T18:23:10.016099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:09.995004Z","title":"{InfiniGen}: Efficient generative inference of large language mod- els with dynamic{KV}cache management","venue":null,"work_id":"3a779fa4-96f8-4d04-bb3e-d92cbd83f5ae","year":2024},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.532162Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:7cb9317ac25a650eef33098ae6766459576640573d4afefdc0d4ef1f7a444aae","observation_id":"a47f28ee-3dff-4fe0-b73d-64c8f230a1b1","resolution":{"observed_at":"2026-08-07T18:23:09.999320Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:09.981002Z","title":"Jenga: Effective memory management for serving llm with heterogeneity","venue":null,"work_id":"fca32d01-1263-4096-badf-61a2c4a515f4","year":2025},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.535995Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:f532329c2b84611eda182a89324be44fa8b887f5d40a4be4b68e5968459815e2","observation_id":"d7f6d99a-bfde-4c43-b0d1-93c0571d3a74","resolution":{"observed_at":"2026-08-07T18:23:09.985186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11453","last_updated":"2023-10-17T17:59:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-17T17:59:15Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11453","snapshot_observed_at":"2026-08-07T18:23:08.539810Z","title":"Bitnet: Scaling 1-bit transformers for large language models.arXiv preprint arXiv:2310.11453, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.539810Z"},"links":{"cited_paper":"/paper/2310.11453","citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:f6502bc775ef6a11e84d37ed2a4993db5100a02ea608ce6ea5da2c83a03a4f95","observation_id":"47d81dd6-1a6f-458a-91d8-0c0eb459dba6","resolution":{"observed_at":"2026-08-07T18:23:08.539810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:08.544105Z","title":"Awq: Activation-aware weight quantization for on-device llm compression and acceleration.Proceedings of machine learning and systems, 6:87–100, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.544105Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:acbf6c3495d7de7645a0d90e21586505fddfb7351815d45508ce35af8b094444","observation_id":"1ec8b77c-2dc6-4430-a65d-ae0ace596689","resolution":{"observed_at":"2026-08-07T18:23:08.544105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:09.961007Z","title":"Flashattention: Fast and memory-efficient exact attention with io- awareness.Advances in neural information processing systems, 35:16344–16359, 2022","venue":null,"work_id":"1a3ebf89-9e6d-4dad-a0c3-dcd78e57c1a3","year":2022},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.547722Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:ade89ca7f92ba80fe3884b7c8c01e18128d5f1ac045aed1f6554fa2cc6eeaeb9","observation_id":"e727258c-6057-4d0d-b6fc-f4007d5afa6c","resolution":{"observed_at":"2026-08-07T18:23:09.965148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01005","last_updated":"2025-04-21T20:10:11Z","snapshot_observed_at":"2026-07-06T20:15:36.280948Z","submitted_at":"2025-01-02T02:02:20Z","title":"FlashInfer: Efficient and Customizable Attention Engine for LLM Inference Serving","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01005","snapshot_observed_at":"2026-08-07T18:23:08.551553Z","title":"Flashinfer: Efficient and customizable attention engine for llm inference serving.arXiv preprint arXiv:2501.01005, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.551553Z"},"links":{"cited_paper":"/paper/2501.01005","citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:2df112478fabc98ee4a4e1ad4e17b904996e0ef219e8566e935c9856ca291580","observation_id":"84c4db5f-97ed-4335-a15a-5f09fc966fd5","resolution":{"observed_at":"2026-08-07T18:23:08.551553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:09.948339Z","title":"https://gith ub.com/langchain-ai/langchain","venue":null,"work_id":"075c13cc-de6b-49e2-911d-cf7a6b20c97a","year":2026},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.555354Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:43ed6b99911fe28c5a4f471ccdaffc07380b61cc8030fbdb9015a213e68f1c6c","observation_id":"097379e1-7500-43d0-8074-29ede2225e43","resolution":{"observed_at":"2026-08-07T18:23:09.953397Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:09.936219Z","title":"https://www.langflow.org/","venue":null,"work_id":"4fc65de1-0445-4d2e-b292-4a9e6cba6589","year":2026},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.558727Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:7b032d1ab056825d42e2c9fdae22905ed91c6239b8acd971193a815e7e38bf4d","observation_id":"da08e753-aeb8-4041-b346-72bca9005c74","resolution":{"observed_at":"2026-08-07T18:23:09.940054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.08155","last_updated":"2023-10-03T20:47:10Z","snapshot_observed_at":"2026-08-08T22:28:26.004138Z","submitted_at":"2023-08-16T05:57:52Z","title":"AutoGen: Enabling Next-Gen LLM Applications via Multi-Agent Conversation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.08155","snapshot_observed_at":"2026-08-07T18:23:08.562330Z","title":"Auto- gen: Enabling next-gen llm applications via multi-agent conversation framework.arXiv preprint arXiv:2308.08155, 3(4), 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.562330Z"},"links":{"cited_paper":"/paper/2308.08155","citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:68dbe3653ecba9a93395b59826e1e6278d978d147ce8ccc1d5f1de386fb3d39a","observation_id":"829b080f-c9c2-465c-af2a-a92e10744480","resolution":{"observed_at":"2026-08-07T18:23:08.562330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:09.924232Z","title":"Dspy: Compiling declarative 17 language model calls into state-of-the-art pipelines","venue":null,"work_id":"1823220b-a3ba-45e6-a33b-0af4732ee1ae","year":2024},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.566354Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:c80090e0e794d67a097e238a078e7851a7cf26714a564d6e02bd2007f89a9035","observation_id":"a982b658-0abc-40b2-bc57-01279d88e8c3","resolution":{"observed_at":"2026-08-07T18:23:09.928405Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.12488","last_updated":"2024-12-17T02:44:43Z","snapshot_observed_at":"2026-07-06T20:08:16.471575Z","submitted_at":"2024-12-17T02:44:43Z","title":"A System for Microserving of LLMs","version":1},"cited_work":{"arxiv_id":"2412.12488","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.12488","snapshot_observed_at":"2026-08-07T18:23:08.603497Z","title":"A System for Microserving of LLMs","venue":"cs.DC","work_id":"38fb0145-240f-4042-a9ef-97a1366f6f16","year":2024},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.569863Z"},"links":{"cited_paper":"/paper/2412.12488","citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:36c183a276d3e1f21e429de5e3b54896836d47b5c4e7f6331faf6a7dc7b547ad","observation_id":"d6368581-12ab-416e-8120-5c3d69cb5437","resolution":{"observed_at":"2026-08-07T18:23:08.608861Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","latest_version":1,"primary_category":"cs.DC","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure"},"reference_resolution":{"displayed":88,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":35,"verified_exact":2,"verified_fuzzy":51},"total_outbound_references":88},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 88 of 88 outbound references and 0 inbound Pith citation observations for arXiv:2608.06007."}