{"as_of":"2026-08-10T13:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:59ffb4fe5a6adaf7e498272f4bf7ede089d1eaadc7a185744148e4a02a4d9fb1","coverage":[{"denominator":86,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":86,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T03:40:12.723229Z","state":"measured"},{"denominator":86,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":86,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.23115/citation-record","integrity":"/paper/2607.23115/integrity","json":"/paper/2607.23115/citation-record.json","paper":"/paper/2607.23115"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:10.999156Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-09T14:13:38.129942Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:10.999156Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:d6dce7c08075ee502a387be13c1623ef7b4a4c92c5d30647f73919e9cbbec677","observation_id":"e81fbd40-63ff-4fc2-bd55-05114131724b","resolution":{"observed_at":"2026-08-01T03:40:10.999156Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.005260Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-09T14:13:38.129942Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.005260Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:394a14e94dc25ee988edcbc0d8d077a1cdffeab68c3f9a7b5f2c9cbcf36759df","observation_id":"4da32b21-7b4a-4b7e-b44f-f20dc4ec28b5","resolution":{"observed_at":"2026-08-01T03:40:11.005260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.010282Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-09T14:13:38.129942Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.010282Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:f08afb5c6f5e3e4a685423b9f4fcc54e787359fb9fc2a6ea427de4a8d548768a","observation_id":"a5039eec-7bfa-4d8e-85b5-96275f47ad23","resolution":{"observed_at":"2026-08-01T03:40:11.010282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.016717Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-09T14:13:38.129942Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.016717Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:388366ed6e2f4eea5a97347047a821c8556365078bd348ca122f38f6cadc3015","observation_id":"ee08d559-9968-4f12-9b7c-842efcc8f3e2","resolution":{"observed_at":"2026-08-01T03:40:11.016717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.021558Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-09T14:13:38.129942Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.021558Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:6c4a0be5453b19679f1a7b4c0bb6d63c5f34428cf9704b6bf738e5d59358e099","observation_id":"75dcedb9-39d9-49cb-8803-3983dd7e0a82","resolution":{"observed_at":"2026-08-01T03:40:11.021558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.026430Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-09T14:13:38.129942Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.026430Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:6de59a1fd2351f93e5b3efd4bb58c5f6e4bd86dfb142d13fd1aab830a0cf5853","observation_id":"acf32578-7480-4dd9-8ee9-a728a93cabdc","resolution":{"observed_at":"2026-08-01T03:40:11.026430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.031727Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-09T14:13:38.129942Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.031727Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:f62074ef5af92685a369aa1a5f1e783a524938400bcf636218825626357920d6","observation_id":"398ec4d2-4f66-46a8-8a2b-aebc9527be8d","resolution":{"observed_at":"2026-08-01T03:40:11.031727Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.035939Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-09T14:13:38.129942Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.035939Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:5e8646a11c16311eb550e04cc7da3bfd81ef3dbc355a8cf1572f34d8a00c6cfd","observation_id":"d6d493f9-cf75-428d-9f6b-79d4780f6d6c","resolution":{"observed_at":"2026-08-01T03:40:11.035939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.040074Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-09T14:13:38.129942Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.040074Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:36412f9e719ec03bdc177564bca6fdf2e9ee3c33ead429d64af3fbf58fc12176","observation_id":"f91212a2-8ee2-4d32-b5d3-de5ef048aaf6","resolution":{"observed_at":"2026-08-01T03:40:11.040074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.044193Z","title":"Scissionlite: Accelerating distributed deep learning with lightweight data compression for iiot.IEEE Transac- tions on Industrial Informatics, 20(10):11950–11960, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-09T14:13:38.129942Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.044193Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:55abf059964ab8d27ae4ad0122149ef5fcc8e9d28ed6fc59b95f4743a3d817c8","observation_id":"faf139c7-f5ae-4003-a1d8-05b1a98d601e","resolution":{"observed_at":"2026-08-01T03:40:11.044193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.048531Z","title":"Tooth: Toward optimal balance of video {QoE} and redundancy cost by {Fine- Grained}{FEC} in cloud gaming streaming","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-09T14:13:38.129942Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.048531Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:e0a7301315ed781bf0dc4d624c5a6bf433f85df4dd8f38c3256c9adfe772bcf8","observation_id":"cfd4fa3d-553e-4145-a395-0831c5726fd3","resolution":{"observed_at":"2026-08-01T03:40:11.048531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.053431Z","title":"Crux: Gpu-efficient communication scheduling for deep learning training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-09T14:13:38.129942Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.053431Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:ed24513b5c892f509389c20bea90582d4d8174b39cc3703b6a7ca11c8590a1ea","observation_id":"a98f0dba-9b93-43cf-930d-3a588ffe6c00","resolution":{"observed_at":"2026-08-01T03:40:11.053431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.057720Z","title":"Eva: Cost- efficient cloud-based cluster scheduling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-09T14:13:38.129942Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.057720Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:4b1160c841173ce75e7420f6f355ef43c75906853427fb44b3c3f5ccd44405cc","observation_id":"7aba9b77-b011-46a8-995d-5a2d2eb23de6","resolution":{"observed_at":"2026-08-01T03:40:11.057720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.061940Z","title":"Kernel oper- ations on the gpu, with autodiff, without memory over- flows.Journal of Machine Learning Research, 22(74):1– 6, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-09T14:13:38.129942Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.061940Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:00d529dd5eb3c2d6bad9dffd79b6d768095477c9e79b2e9baa2e571a4ac72467","observation_id":"5af2baa5-b736-4b88-9b16-8515905d1d06","resolution":{"observed_at":"2026-08-01T03:40:11.061940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.066423Z","title":"Remote procedure call as a managed system service","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-09T14:13:38.129942Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.066423Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:03107063d0dee54b18ef64b2dc9a708b6fec9b0ba99eb68733290e5752fccdd7","observation_id":"7bbd9110-e6f2-46af-85ee-526807ff3686","resolution":{"observed_at":"2026-08-01T03:40:11.066423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.070517Z","title":"Multiplexing dynamic deep learn- ing workloads with slo-awareness in gpu clusters","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-09T14:13:38.129942Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.070517Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:fc3b3bbf65e95e0c4061149a5ae6157a99424682aa29da595574c6e42dee6044","observation_id":"591726b1-51c1-47dc-b966-fdb425e9b7e1","resolution":{"observed_at":"2026-08-01T03:40:11.070517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.074609Z","title":"{GRACE}:{Loss- Resilient}{Real-Time} video through neural codecs","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-09T14:13:38.129942Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.074609Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:8e7c3caff72bbe1b86807d330a61b3589cb3d1b82b900ca7a15ce3a41047009b","observation_id":"45221d94-c5ea-4cb3-a447-c93037871049","resolution":{"observed_at":"2026-08-01T03:40:11.074609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.078564Z","title":"Flashattention: Fast and memory- efficient exact attention with io-awareness.Advances in neural information processing systems, 35:16344– 16359, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-09T14:13:38.129942Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.078564Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:b52356ad524b0d72cbc906faef74495da78b1126b057955b050576afffc8cb66","observation_id":"7379fdeb-82e1-4252-8bb5-d5414e62298a","resolution":{"observed_at":"2026-08-01T03:40:11.078564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.083135Z","title":"Oneadapt: Fast adapta- tion for deep learning applications via backpropagation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-09T14:13:38.129942Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.083135Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:80d9df10dc837457c8e86dfaeaab08be3207ad5ab9e675e852ff9ca18d4c2475","observation_id":"e4812f51-687c-4fc5-a585-03122aa6c47f","resolution":{"observed_at":"2026-08-01T03:40:11.083135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.087432Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-09T14:13:38.129942Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.087432Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:772aff593cd9a95498b42a31e7821088e10852b5ece4468fa3313415d701e039","observation_id":"85a1258d-f65f-47ea-86ae-05737e63e0c4","resolution":{"observed_at":"2026-08-01T03:40:11.087432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.091621Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-09T14:13:38.129942Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.091621Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:07dffdd7ae78b912afa24e3f5724f7379b5e66d69dc882d14dd7babb4720fcb7","observation_id":"6b7fc549-6faf-42cb-82e9-bc59ca50a6b4","resolution":{"observed_at":"2026-08-01T03:40:11.091621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.095749Z","title":"Dgsf: Disaggregated gpus for serverless functions","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-09T14:13:38.129942Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.095749Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:9d03b3cf9798ffc06115a5853f1c4047eaf99b976a6deb95cd3fcce1adef8de1","observation_id":"379c6fbb-fec8-47e1-9d20-3021728b2615","resolution":{"observed_at":"2026-08-01T03:40:11.095749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.099856Z","title":"Rdma over ethernet for distributed training at meta scale","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-09T14:13:38.129942Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.099856Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:a48bc67433dd41b3f85f486f7d0869a9c2506fdac0151fe9cf68a97e45e15e97","observation_id":"818656c9-a51e-4238-b955-4067ca201da4","resolution":{"observed_at":"2026-08-01T03:40:11.099856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.104095Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-09T14:13:38.129942Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.104095Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:8f9887308f79e259a9291dfe864da207080ae48662eec11e04e50ef8cfbdb822","observation_id":"d63b93d0-c65c-4979-947e-2eec9e855e89","resolution":{"observed_at":"2026-08-01T03:40:11.104095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.108698Z","title":"A gpgpu transparent virtualization component for high performance computing clouds","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-09T14:13:38.129942Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.108698Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:43386764d9745f5010650ca74b80e58330271e06774369d089070fb8e0182697","observation_id":"ee927be3-9751-4415-8937-0d7a837b8199","resolution":{"observed_at":"2026-08-01T03:40:11.108698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.113329Z","title":"Shin, Yibo Zhu, Myeongjae Jeon, Junjie Qian, Hongqiang Liu, and Chuanxiong Guo","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-09T14:13:38.129942Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.113329Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:963ed220969b0dfa97b268e3da8ed34d4ea240e14c6da83aa9a0a77f670ebea8","observation_id":"ab9ae254-bd5c-408d-9972-c3ec21c2066f","resolution":{"observed_at":"2026-08-01T03:40:11.113329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.120130Z","title":"Kace: Kernel-aware colocation for effi- cient gpu spatial sharing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-09T14:13:38.129942Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.120130Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:f5ee3d2eb868315c5104b07ccee2a2931e2c07c87b27427cd51d61d9c9af7176","observation_id":"9e82ee4d-322c-478b-b98b-eddd16370dcd","resolution":{"observed_at":"2026-08-01T03:40:11.120130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.125670Z","title":"Microsecond-scale preemption for concurrent GPU-accelerated DNN inferences","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-09T14:13:38.129942Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.125670Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:4a2d857fb063ab1900bb8b5d613637bd1676584cd9007f97e4f7b5f03c004f1a","observation_id":"b4ca0d1e-f0ff-4e5f-a691-c506cc9959ad","resolution":{"observed_at":"2026-08-01T03:40:11.125670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.130167Z","title":"Multi-agent collaborative infer- ence via dnn decoupling: Intermediate feature compres- sion and edge learning.IEEE Transactions on Mobile Computing, 22(10):6041–6055, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-09T14:13:38.129942Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.130167Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:99f74a978a8bc84cf9cbfbe773a7b75f0593cdb26a1c2c11e323ee52f7fc6e51","observation_id":"834d32cb-73f6-4e79-96b7-042367f4f229","resolution":{"observed_at":"2026-08-01T03:40:11.130167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.134612Z","title":"Lora: Low-rank adaptation of large language models.ICLR, 1(2):3, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-09T14:13:38.129942Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.134612Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:ddf3a37fcd844f843daa24484ca6cd030d1f6d273c578e865106fed170dc57d5","observation_id":"6a4fff8d-2f02-44bf-a2e0-5806d25bd8c6","resolution":{"observed_at":"2026-08-01T03:40:11.134612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.138890Z","title":"In 20th USENIX Symposium on Networked Systems Design and Implementation (NSDI 23), pages 87–101, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-09T14:13:38.129942Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.138890Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:e82d6ce260256ef4cfb6fff07ff8426e0ed2870d3181d0c2fabb49d20696b1a4","observation_id":"6af4123f-65db-4204-9fe1-e3ee783c1dfa","resolution":{"observed_at":"2026-08-01T03:40:11.138890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.143422Z","title":"Charlie Hu, Xiaojun Lin, and Nan Deng","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-09T14:13:38.129942Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.143422Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:7cba61524d5397deaa013b413e42569cc8cb4b61cce0070c46b54626ea8ac69d","observation_id":"895f8f53-7860-40f3-8e5f-32e8a2ff6f53","resolution":{"observed_at":"2026-08-01T03:40:11.143422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.147743Z","title":"A house united within itself: Slo-awareness for on-premises containerized ml inference clusters via faro","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-09T14:13:38.129942Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.147743Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:ac114193721bcddcea815c25a8a8f26a9598f90e5dc263ebfd39d4ba8e35da10","observation_id":"a12eb9f5-097c-4c74-ade9-57c9a012db8c","resolution":{"observed_at":"2026-08-01T03:40:11.147743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.152064Z","title":"Mor- ley Mao","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-09T14:13:38.129942Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.152064Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:97793497c0ceae3c2d21281bde4c0dadf0e36d75ecac4938be431dde168b3b69","observation_id":"817605af-c388-4aec-bca1-2b9a568f9d27","resolution":{"observed_at":"2026-08-01T03:40:11.152064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.156399Z","title":"Deepum: Tensor migration and prefetching in unified memory","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-09T14:13:38.129942Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.156399Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:42be4542541adf4f5579ede68a4f51ffba6f9ee22e7f112fc5b3440cb15f03fb","observation_id":"6d512668-de1e-402f-84e4-697d9c7ef85a","resolution":{"observed_at":"2026-08-01T03:40:11.156399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.161088Z","title":"A neural-network- based realization of in-network computation for the in- ternet of things","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-09T14:13:38.129942Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.161088Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:5f174f88e90d330265d5c56a6036221cc17eaa771d95909dd120ae841e1518eb","observation_id":"b6ab778c-3b3f-4b23-b486-80fd42e4dd23","resolution":{"observed_at":"2026-08-01T03:40:11.161088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.165512Z","title":"{SuperServe}:{Fine-Grained} inference serving for unpredictable workloads","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-09T14:13:38.129942Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.165512Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:ca558f74b73321422e7bfeccc23819c0ea620fac0556896ddf3fbc2f08f4fc06","observation_id":"5ee45b07-34d1-42ca-b61d-e5cee2fea889","resolution":{"observed_at":"2026-08-01T03:40:11.165512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.169742Z","title":"A survey on in-network computing: Programmable data plane and technology specific applications.IEEE Communications Surveys & Tutorials, 25(1):701–761, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-09T14:13:38.129942Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.169742Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:4b276ecfd6f3c5895e5b30757495e51498ee4036fb968e3f3e43679bac1c5b94","observation_id":"54e34d1c-f630-4ea1-b661-51f6b00f7317","resolution":{"observed_at":"2026-08-01T03:40:11.169742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.173949Z","title":"Navigator: Dynamic multi-kernel scheduling to improve gpu per- formance","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-09T14:13:38.129942Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.173949Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:6f2a0c6c01a7ff844e028d1e45de59fdc8bc3b231a2ea64b96eef52b60c492a8","observation_id":"d438c829-33e9-49ed-9b5d-8fc735a80211","resolution":{"observed_at":"2026-08-01T03:40:11.173949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.178278Z","title":"Efficient memory manage- ment for large language model serving with pagedatten- tion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-09T14:13:38.129942Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.178278Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:a0a1b912383418267093d77734e19feb7f340a28632258cdc00137663562e89c","observation_id":"57aef14b-de47-4fa5-a3d9-552485dd5783","resolution":{"observed_at":"2026-08-01T03:40:11.178278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.182444Z","title":"Forecasting gpu performance for deep learning train- ing and inference","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-09T14:13:38.129942Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.182444Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:4abed5260214950397e2e9d8d4452f1cadda31a2c421e1a98af196fd1e36f48f","observation_id":"2784287b-4418-4329-bb95-87bea9ede7f6","resolution":{"observed_at":"2026-08-01T03:40:11.182444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.186651Z","title":"A survey on large language model acceleration based on kv cache management, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-09T14:13:38.129942Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.186651Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:9f3ae3db0382fe8ee7d7c3717e4d0ff9688a2d41234e2957a1c16a6e410477ef","observation_id":"93854fcd-8bc9-495f-8ba3-0e35228838d0","resolution":{"observed_at":"2026-08-01T03:40:11.186651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.190669Z","title":"THC: Accelerating distributed deep learning using ten- sor homomorphic compression","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-09T14:13:38.129942Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.190669Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:fffebfaca3edf1bc250ced91a06ca1d8c9cf12b36f638c7cb9f69652ea87b76b","observation_id":"59f34cb6-8c73-46c1-bac8-e7ddd46290ff","resolution":{"observed_at":"2026-08-01T03:40:11.190669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.05459","last_updated":"2024-05-08T06:16:23Z","snapshot_observed_at":"2026-08-02T13:57:57.119489Z","submitted_at":"2024-01-10T09:25:45Z","title":"Personal LLM Agents: Insights and Survey about the Capability, Efficiency and Security","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.05459","snapshot_observed_at":"2026-08-01T03:40:11.195265Z","title":"Personal llm agents: Insights and survey about the capability, efficiency and security","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-09T14:13:38.129942Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.195265Z"},"links":{"cited_paper":"/paper/2401.05459","citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:332f9f5f2b8bc12407cb6b50750df554b82035572e31966f1be63efe5993f1d4","observation_id":"8832f8da-a903-4fa7-a36e-7e876239de19","resolution":{"observed_at":"2026-08-01T03:40:11.195265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.199805Z","title":"Incbricks: To- ward in-network computation with an in-network cache","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-09T14:13:38.129942Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.199805Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:8bc0c3f4934a856265a0226e28ff3c85c92ff77133c2587baf1e036b61f5c217","observation_id":"4f757e3e-db2e-4b27-86fc-7c7bf30891d0","resolution":{"observed_at":"2026-08-01T03:40:11.199805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.204037Z","title":"Cachegen: Kv cache compression and streaming for fast large lan- guage model serving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-09T14:13:38.129942Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.204037Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:07e813bbb7387363fb332bcb51a17f00ee8ac9a4133d27b56e3d7f3f517d1aa7","observation_id":"9cc3512f-8635-4f4a-a61d-ab588b7d3118","resolution":{"observed_at":"2026-08-01T03:40:11.204037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.209596Z","title":"A convnet for the 2020s","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-09T14:13:38.129942Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.209596Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:107b4d003dfa4c788f2206cd7de720bd80e9a323747d49e4b3ad67c440dcb0d4","observation_id":"74a2a691-484f-422e-ad78-ae137fa5c5cf","resolution":{"observed_at":"2026-08-01T03:40:11.209596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02170","last_updated":"2024-11-15T04:30:04Z","snapshot_observed_at":"2026-08-07T04:49:42.215176Z","submitted_at":"2023-10-03T16:05:48Z","title":"A Dynamic LLM-Powered Agent Network for Task-Oriented Agent Collaboration","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02170","snapshot_observed_at":"2026-08-01T03:40:11.216782Z","title":"Dynamic llm-agent network: An llm-agent collab- oration framework with agent team optimization.arXiv preprint arXiv:2310.02170, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-09T14:13:38.129942Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.216782Z"},"links":{"cited_paper":"/paper/2310.02170","citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:147e17902b0713c5e08613d244082ca587ce1091605774717ebf5af5fc1bdbd6","observation_id":"d225d4c4-314e-4207-a6cf-e764f6337ada","resolution":{"observed_at":"2026-08-01T03:40:11.216782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.228099Z","title":"A survey of storage systems in the rdma era.IEEE Transac- tions on Parallel and Distributed Systems, 33(12):4395– 4409, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-09T14:13:38.129942Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.228099Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:f0ac4bc1ce1cb6ba00e612f473ed932c070cc9a1d43833a8f47336969cd741e8","observation_id":"5147f1f6-46fc-4e50-8ab4-02134dfaec9b","resolution":{"observed_at":"2026-08-01T03:40:11.228099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.240104Z","title":"Skyserve: Serving ai mod- els across regions and clouds with spot instances","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-09T14:13:38.129942Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.240104Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:db62d28043505a9a99ab34e4b382c419a71185baba8f7bc3db9fbd4469465189","observation_id":"803fc393-b9d1-4a27-9bda-af2fae79b699","resolution":{"observed_at":"2026-08-01T03:40:11.240104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.252541Z","title":"Efficient scheduling policies for Microsecond-Scale tasks","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-09T14:13:38.129942Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.252541Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:575f7d37ffe494c3bc7fe3f15f13c5d727938102c08ca50507e9233808bcb6fe","observation_id":"3f7e2269-9f65-4a92-9f83-c07e307cbf42","resolution":{"observed_at":"2026-08-01T03:40:11.252541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.266736Z","title":"To- ward performance-portable petsc for gpu-based exascale systems.Parallel Computing, 108:102831, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-09T14:13:38.129942Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.266736Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:d178a3efc61a700787f6fd1d9217cd691ff2a69554c77c2b887f4aa2d15e3560","observation_id":"5bf9d1f6-3277-4920-99de-e1685840341c","resolution":{"observed_at":"2026-08-01T03:40:11.266736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.285770Z","title":"Porting warpx to gpu- accelerated platforms.Parallel Computing, 108:102833, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-09T14:13:38.129942Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.285770Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:aaaf2b080cf02448e3c4e221eee0573a0d55d92caf07090bba745b615686b2c9","observation_id":"5220bb3a-f75b-48e1-ad6c-dcef1b447bc0","resolution":{"observed_at":"2026-08-01T03:40:11.285770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.314644Z","title":"Jellyfish: Timely inference serving for dynamic edge networks","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-09T14:13:38.129942Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.314644Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:aaf10d5677e1e4cfbff046cfb0be51c6c7731e89b779ee38a89ebbcd60b505f3","observation_id":"ba9cc23b-1df0-4c96-a5f0-166389d8f973","resolution":{"observed_at":"2026-08-01T03:40:11.314644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.330029Z","title":"Bringing umap closer to the speed of light with gpu acceleration","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-09T14:13:38.129942Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.330029Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:8d01af8ef54c6c59381177522f1f8a83c0bff28f8c91bff5efffea52f11ad848","observation_id":"0bf2f227-ab26-4dc9-9b0a-8a3d888cce04","resolution":{"observed_at":"2026-08-01T03:40:11.330029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.337088Z","title":"Nvidia nvswitch: The world’s highest- bandwidth on-node switch","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-09T14:13:38.129942Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.337088Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:c5dfb79d2c8b6cad44e6926095b575012b8dafbf8bf0f3021410bafde8cc6a44","observation_id":"e333a6ea-f011-4074-9c60-244140e14361","resolution":{"observed_at":"2026-08-01T03:40:11.337088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.344509Z","title":"Gemel: Model merging for memory-efficient,real-time video analytics at the edge","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-09T14:13:38.129942Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.344509Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:e0324d1febf82bad63cf4876c86909a52b18e81c7e7614918a7e6c78fc434757","observation_id":"e97e016e-0e66-4ac1-a005-0ec3c96f368a","resolution":{"observed_at":"2026-08-01T03:40:11.344509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-01T03:40:11.352874Z","title":"Sdxl: Improving latent diffusion mod- els for high-resolution image synthesis.arXiv preprint arXiv:2307.01952, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-09T14:13:38.129942Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.352874Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:b6fce356c9404f828e65f96c61329a5c487fd7cafd24b785c179ebaafa85f7ea","observation_id":"ba9ad0f5-3866-4e5e-8ef5-184567811aed","resolution":{"observed_at":"2026-08-01T03:40:11.352874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.364647Z","title":"{CASSINI}:{Network-Aware} job scheduling in machine learning clusters","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-09T14:13:38.129942Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.364647Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:ee5610dc6808334f2c95644c9ea70299e6694f5aa79a67cba54cc5d9f041844c","observation_id":"5e56c7da-083f-4b4d-9639-22c3682c3071","resolution":{"observed_at":"2026-08-01T03:40:11.364647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.372960Z","title":"Sentinel: Efficient tensor migration and allocation on heterogeneous memory systems for deep learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-09T14:13:38.129942Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.372960Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:a92079fe6065e9d895e68044f8469e51716ab67f1ceb5e778a78f88cc4172e41","observation_id":"b84179bc-e235-4d4c-ba79-78842ad7de83","resolution":{"observed_at":"2026-08-01T03:40:11.372960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.379969Z","title":"Enabling large dynamic neural net- work training with learning-based memory manage- ment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-09T14:13:38.129942Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.379969Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:893f3f7e680aae2967f5af3ef3d1864502576c7c2df8d862441ad898407d7d66","observation_id":"2900bced-7c98-4149-8e37-75d00f579e1d","resolution":{"observed_at":"2026-08-01T03:40:11.379969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.387513Z","title":"{Cloud-LoRa}: Enabling cloud radio access {LoRa} networks using reinforce- ment learning based {Bandwidth-Adaptive} compres- sion","venue":null,"work_id":null,"year":1959},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-09T14:13:38.129942Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.387513Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:f44ebb05d469f0f067d662f1c88d21f575869e811050a0a6ba35867be3eb37cd","observation_id":"748e008d-6c97-475a-b8f2-1ed5e89acc24","resolution":{"observed_at":"2026-08-01T03:40:11.387513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.394196Z","title":"Exploiting simultaneous communications to accelerate data parallel distributed deep learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-09T14:13:38.129942Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.394196Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:83a7b00df52dcb751adb6fd071231df5a7acc294f2f9ef5ab4973d2c090e8f9c","observation_id":"b275ef95-bf4f-448f-9b27-da8cd39c9bc1","resolution":{"observed_at":"2026-08-01T03:40:11.394196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.400877Z","title":"Orion: Interference-aware, fine-grained gpu sharing for ml ap- plications","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-09T14:13:38.129942Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.400877Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:f638aeb9b256829cf6cb307dc7f036707a04edecea48bc3aff6f59e8f9ceaedb","observation_id":"693cf1f8-96ac-43b0-b349-607ef9f9dd10","resolution":{"observed_at":"2026-08-01T03:40:11.400877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.416566Z","title":"gremote: Cloud ren- dering on gpu resource pool based on api-forwarding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-09T14:13:38.129942Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.416566Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:60d7640f53a6be88867f5819a6aaf0b2606a45c080322e3a49a1563f184a8b4b","observation_id":"1e32dc8d-be47-41bc-89af-2f2e08ef8975","resolution":{"observed_at":"2026-08-01T03:40:11.416566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.440322Z","title":"Lammps-a flexible simu- lation tool for particle-based materials modeling at the atomic, meso, and continuum scales.Computer physics communications, 271:108171, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-09T14:13:38.129942Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.440322Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:64479c9e261dbd783542b3ca6f5a00aa287df759c2844d0e2709f9601b46bd05","observation_id":"188d3cf4-d525-4a75-9005-8c8caff3d0ab","resolution":{"observed_at":"2026-08-01T03:40:11.440322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.468036Z","title":"Plssvm—parallel least squares support vector machine","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-09T14:13:38.129942Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.468036Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:b954c0e361b2823b849549d272b02067cb734ba9b2cba4d722030ef92290274d","observation_id":"d9075125-c546-4c9d-8edd-367ac0d72b9c","resolution":{"observed_at":"2026-08-01T03:40:11.468036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.522658Z","title":"Aqua: Network-accelerated memory offloading for llms in scale-up gpu domains","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-09T14:13:38.129942Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.522658Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:413a923a67478f6bbd326281d4ecfe5f76b7d179908bb795046b1c661ee7c17f","observation_id":"5771c190-475e-4cae-95be-a852315c3cea","resolution":{"observed_at":"2026-08-01T03:40:11.522658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.576555Z","title":"Coflow scheduling for llm training","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-09T14:13:38.129942Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.576555Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:2d640c405064031a8b3d63a46b26e4ecfbbdb8908f65ce8af9bb29169d43bd60","observation_id":"9ecc8377-7758-414f-9506-64ac79e2ed9a","resolution":{"observed_at":"2026-08-01T03:40:11.576555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.13354","last_updated":"2024-01-24T10:30:39Z","snapshot_observed_at":"2026-08-08T17:44:21.476630Z","submitted_at":"2024-01-24T10:30:39Z","title":"Characterizing Network Requirements for GPU API Remoting in AI Applications","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.13354","snapshot_observed_at":"2026-08-01T03:40:11.630913Z","title":"Character- izing network requirements for gpu api remoting in ai applications.arXiv preprint arXiv:2401.13354, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-09T14:13:38.129942Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.630913Z"},"links":{"cited_paper":"/paper/2401.13354","citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:cc3492e25638d88283d4b18ac7e4ad53382bb9c92536f83f4794001aca733885","observation_id":"158cf9d6-e008-4c7c-a59e-73473353b2b2","resolution":{"observed_at":"2026-08-01T03:40:11.630913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.675274Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-09T14:13:38.129942Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.675274Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:aef2a9985d9807aaeb1c2bc8ea19d13c035504c7a966d6ebddfb55093ce28803","observation_id":"b7884337-5363-4d05-b8a1-1ae263e751ab","resolution":{"observed_at":"2026-08-01T03:40:11.675274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.755151Z","title":"Beware of fragmentation: Scheduling {GPU-Sharing} workloads with fragmentation gradient descent","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-09T14:13:38.129942Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.755151Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:f1ed21c2f8cd773cbdd2c9d172b17ad54e56cf70d4e738267ed9896d776d439b","observation_id":"b25a7077-5fa2-4b4e-b832-c3e0c4d9b323","resolution":{"observed_at":"2026-08-01T03:40:11.755151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.798443Z","title":"Transparent {GPU} sharing in container clouds for deep learning workloads","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-09T14:13:38.129942Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.798443Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:dba673433ca99fc5f01f9d0c7bc8f53935a7fb9aab2622a27f34f22ab4c4b672","observation_id":"ea9fd065-ddb7-48c9-a4c8-7b2ef3390bcb","resolution":{"observed_at":"2026-08-01T03:40:11.798443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.872455Z","title":"Yan, and Junchen Jiang","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-09T14:13:38.129942Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.872455Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:b87beb91e752bdfa9cd745958e0759b7a2dbc7e80516718143d0076ec17f792d","observation_id":"e46584d6-1c14-4058-bc99-72391d454c51","resolution":{"observed_at":"2026-08-01T03:40:11.872455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.914851Z","title":"Efficient tensor offloading for large deep-learning model training based on compute express link","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-09T14:13:38.129942Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.914851Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:a4349a830a4ded24f534944b7c981641ea1a479f47fdeffa3725e0a610cda115","observation_id":"04c59993-3ce9-4598-a883-0405c0d8b2a1","resolution":{"observed_at":"2026-08-01T03:40:11.914851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:12.019245Z","title":"Infless: a native serverless system for low-latency, high- throughput inference","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-09T14:13:38.129942Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:12.019245Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:38cf206395fd8f4b0298b846ab71678671695f1792f3a047e5ae68bf3d3044f6","observation_id":"f0699efe-20a1-4124-a9e0-7c8f547898d5","resolution":{"observed_at":"2026-08-01T03:40:12.019245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:12.078779Z","title":"Deep compressive offloading: Speeding up neural net- work inference by trading edge computation for network latency","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-09T14:13:38.129942Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:12.078779Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:ef0488b70a2fa8a9194f1a8a503e402bd8a3b9d3737506917b72938127446d07","observation_id":"e87e1bfe-f4ef-4c12-85e7-b6ea4ff2bef8","resolution":{"observed_at":"2026-08-01T03:40:12.078779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:12.186797Z","title":"Horus: granular in-network task sched- uler for cloud datacenters","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-09T14:13:38.129942Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:12.186797Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:a83dbac6128bb2d65468b4a0104e0c01301470105899182822911e19d160f881","observation_id":"d9dce3a7-97b3-4d3a-8f78-165427374f2d","resolution":{"observed_at":"2026-08-01T03:40:12.186797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03622","last_updated":"2025-07-08T02:15:07Z","snapshot_observed_at":"2026-07-06T15:39:10.697564Z","submitted_at":"2023-06-06T12:19:05Z","title":"Torpor: GPU-Enabled Serverless Computing for Low-Latency, Resource-Efficient Inference","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.03622","snapshot_observed_at":"2026-08-01T03:40:12.308277Z","title":"Faaswap: Slo-aware, gpu-efficient serverless inference via model swapping","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-09T14:13:38.129942Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:12.308277Z"},"links":{"cited_paper":"/paper/2306.03622","citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:7da1b843fe88d84f85acf68805596cf8887d5b3f443cd02af021d1ff798af1c8","observation_id":"0525d198-f573-46b9-bfc1-ec895eb25d05","resolution":{"observed_at":"2026-08-01T03:40:12.308277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:12.369125Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-09T14:13:38.129942Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:12.369125Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:a141e4a9662dc24e1dae42224efc76cfe1d582e0deeb062dbc6651cb8c379062","observation_id":"32543cfe-c61d-4c10-80df-6a54ead58c8c","resolution":{"observed_at":"2026-08-01T03:40:12.369125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:12.439101Z","title":"Expel: Llm agents are ex- periential learners","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-09T14:13:38.129942Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:12.439101Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:6b46d2d3995d616e62a150a4c2831052c68b3110c9b10ccc728c996d82631753","observation_id":"435783a6-c85b-4a06-95aa-502e3d4c7815","resolution":{"observed_at":"2026-08-01T03:40:12.439101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:12.509184Z","title":"Efficient {Direct-Connect} topologies for collective communications","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-09T14:13:38.129942Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:12.509184Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:01f640d615cee1c93c8db4478ae22a746207c6f070b6d25a6781141fde9a727a","observation_id":"9ba649ac-fb75-41ad-98e5-0ec9e7e9ca01","resolution":{"observed_at":"2026-08-01T03:40:12.509184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:12.594996Z","title":"Tally: Non-intrusive performance isolation for concur- rent deep learning workloads","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-09T14:13:38.129942Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:12.594996Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:896856851d40ba6dfd6ca4ffb47db9dc371295a61908dd33adec34e1bba7a526","observation_id":"da20ac6b-e61e-4283-b465-2ecc048e4ac1","resolution":{"observed_at":"2026-08-01T03:40:12.594996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:12.665111Z","title":"Sglang: Efficient execution of structured language model pro- grams.Advances in neural information processing sys- tems, 37:62557–62583, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-09T14:13:38.129942Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:12.665111Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:56f94ea4ce6ea58cf385fd0084698d27f09829758d0a9b8198611c54864c955c","observation_id":"49ea237c-f11d-4484-a700-a0a96ebfd31c","resolution":{"observed_at":"2026-08-01T03:40:12.665111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:12.683698Z","title":"Kernelet: High- throughput gpu kernel executions with dynamic slicing and scheduling.IEEE Transactions on Parallel and Distributed Systems, 25(6):1522–1532, 2014","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-09T14:13:38.129942Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:12.683698Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:83734b1674f4f9b374833f284d5f00a61d2a73732ed1e4fb4e26f16d6dd3b3ae","observation_id":"ab65e9fa-816f-4f3a-afe8-2b559f56f520","resolution":{"observed_at":"2026-08-01T03:40:12.683698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:12.723229Z","title":"Megascale-infer: Efficient mixture-of-experts model serving with disag- gregated expert parallelism","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-09T14:13:38.129942Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:12.723229Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:7065da8b1ffc50f104a6fee0b030f65ce8859e0ad57e008c472660d9433daa29","observation_id":"dbee7ac1-5724-4102-8cf5-d0e06cce693b","resolution":{"observed_at":"2026-08-01T03:40:12.723229Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","latest_version":1,"primary_category":"cs.DC","snapshot_observed_at":"2026-08-09T14:13:38.129942Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs"},"reference_resolution":{"displayed":86,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":2,"unresolved":83,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":86},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 86 of 86 outbound references and 0 inbound Pith citation observations for arXiv:2607.23115."}