{"as_of":"2026-08-09T16:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5c7dd1ab1a3a6349673982c1e83d22761f57726add87f248b2265653e135c5b3","coverage":[{"denominator":42,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":42,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T21:08:29.373276Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.05926/citation-record","integrity":"/paper/2608.05926/integrity","json":"/paper/2608.05926/citation-record.json","paper":"/paper/2608.05926"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:08:31.754892Z","title":"Network edge inference for large language models: Principles, tech- niques, and opportunities,","venue":null,"work_id":"743e466d-cb8e-4f7e-8028-2deb930f8bbb","year":2026},"citing_paper":{"arxiv_id":"2608.05926","last_updated":"2026-08-06T11:57:36Z","snapshot_observed_at":"2026-08-09T16:12:12.593656Z","submitted_at":"2026-08-06T11:57:36Z","title":"BALANCE: Hybrid Autoregressive-Speculative LLM Inference in Wireless Edge Networks","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T21:08:28.744841Z"},"links":{"citing_paper":"/paper/2608.05926"},"observation_digest":"sha256:6c1b1df9a534831df92f4c8a161582cba6bb3eb75e553922c50af67cb2bf4e57","observation_id":"c202ef84-78f1-4943-a2e3-11d1a0c9782e","resolution":{"observed_at":"2026-08-07T21:08:31.758685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:08:28.795653Z","title":"Mobile edge intelligence for large language models: A contemporary survey,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05926","last_updated":"2026-08-06T11:57:36Z","snapshot_observed_at":"2026-08-09T16:12:12.593656Z","submitted_at":"2026-08-06T11:57:36Z","title":"BALANCE: Hybrid Autoregressive-Speculative LLM Inference in Wireless Edge Networks","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T21:08:28.795653Z"},"links":{"citing_paper":"/paper/2608.05926"},"observation_digest":"sha256:48b34ff77e25531cdb4787b3cfc107ca97fa7db31a3f35cd31a4725090e0ef5b","observation_id":"d6c3391c-1730-4aa5-908c-a240e1b120bd","resolution":{"observed_at":"2026-08-07T21:08:28.795653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:08:31.732709Z","title":"QLLMS: Quantization-adaptive LLM scheduling for partially informed edge serving systems,","venue":null,"work_id":"c4077a40-e745-477e-94a1-9197cf7649f2","year":2025},"citing_paper":{"arxiv_id":"2608.05926","last_updated":"2026-08-06T11:57:36Z","snapshot_observed_at":"2026-08-09T16:12:12.593656Z","submitted_at":"2026-08-06T11:57:36Z","title":"BALANCE: Hybrid Autoregressive-Speculative LLM Inference in Wireless Edge Networks","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T21:08:28.885981Z"},"links":{"citing_paper":"/paper/2608.05926"},"observation_digest":"sha256:eb5833ef3e9bfab42802164925a1ee9efc0f0f9c6032ab58bff847ede09f38a4","observation_id":"13a10b5d-40b2-47ef-90fe-de6d2a5250d7","resolution":{"observed_at":"2026-08-07T21:08:31.738892Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:08:31.721012Z","title":"Edge-first language model inference: Models, metrics, and tradeoffs,","venue":null,"work_id":"3118d4ac-07c5-4ee5-8650-3abfb37d02fb","year":2025},"citing_paper":{"arxiv_id":"2608.05926","last_updated":"2026-08-06T11:57:36Z","snapshot_observed_at":"2026-08-09T16:12:12.593656Z","submitted_at":"2026-08-06T11:57:36Z","title":"BALANCE: Hybrid Autoregressive-Speculative LLM Inference in Wireless Edge Networks","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T21:08:28.949004Z"},"links":{"citing_paper":"/paper/2608.05926"},"observation_digest":"sha256:f2eb6a217f9099eaa1e0330c565887e6c30fa60de26baaa97455f4e4df30d5d9","observation_id":"5a8c2aa9-c611-4ebf-a8d1-998cbf64e85f","resolution":{"observed_at":"2026-08-07T21:08:31.725473Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:08:31.709212Z","title":"Large language model partitioning for low-latency inference at the edge,","venue":null,"work_id":"c17d25af-84cf-48a6-b7d3-46628a2b53d5","year":2025},"citing_paper":{"arxiv_id":"2608.05926","last_updated":"2026-08-06T11:57:36Z","snapshot_observed_at":"2026-08-09T16:12:12.593656Z","submitted_at":"2026-08-06T11:57:36Z","title":"BALANCE: Hybrid Autoregressive-Speculative LLM Inference in Wireless Edge Networks","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T21:08:29.007436Z"},"links":{"citing_paper":"/paper/2608.05926"},"observation_digest":"sha256:a66a04e85aafee8e4cc0fa38b5472eea4c2104f3f317866d484fd883be974fc1","observation_id":"cd1f003d-cd3c-44cf-8a2e-affafaac8752","resolution":{"observed_at":"2026-08-07T21:08:31.713787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:08:31.698738Z","title":"Taming throughput-latency tradeoff in LLM inference with sarathi-serve,","venue":null,"work_id":"c8505656-1189-4bb8-a863-869e2da8a6c6","year":2024},"citing_paper":{"arxiv_id":"2608.05926","last_updated":"2026-08-06T11:57:36Z","snapshot_observed_at":"2026-08-09T16:12:12.593656Z","submitted_at":"2026-08-06T11:57:36Z","title":"BALANCE: Hybrid Autoregressive-Speculative LLM Inference in Wireless Edge Networks","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T21:08:29.063572Z"},"links":{"citing_paper":"/paper/2608.05926"},"observation_digest":"sha256:b7b3c2589acf176b7047ab18590dcc3839125bcb0033e67fe0813add9510de8b","observation_id":"4999c787-a28b-4856-8ecc-af4023438ea7","resolution":{"observed_at":"2026-08-07T21:08:31.702428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:08:31.688388Z","title":"Attention is all you need,","venue":null,"work_id":"6a994fa3-d350-4723-ade1-c87a7da8445a","year":2017},"citing_paper":{"arxiv_id":"2608.05926","last_updated":"2026-08-06T11:57:36Z","snapshot_observed_at":"2026-08-09T16:12:12.593656Z","submitted_at":"2026-08-06T11:57:36Z","title":"BALANCE: Hybrid Autoregressive-Speculative LLM Inference in Wireless Edge Networks","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T21:08:29.098892Z"},"links":{"citing_paper":"/paper/2608.05926"},"observation_digest":"sha256:69182d644e89f2a762770c9dac8a36b066344cce94dff8d5d8d1a2d14fcf7a64","observation_id":"971b823c-a4ed-4ebd-9550-78d6288f56a3","resolution":{"observed_at":"2026-08-07T21:08:31.692096Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:08:31.678414Z","title":"FFN-SkipLLM: A hidden gem for autoregressive decoding with adap- tive feed forward skipping,","venue":null,"work_id":"39ac1982-a7b5-43fe-ac1c-b227d13d2071","year":2024},"citing_paper":{"arxiv_id":"2608.05926","last_updated":"2026-08-06T11:57:36Z","snapshot_observed_at":"2026-08-09T16:12:12.593656Z","submitted_at":"2026-08-06T11:57:36Z","title":"BALANCE: Hybrid Autoregressive-Speculative LLM Inference in Wireless Edge Networks","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T21:08:29.104186Z"},"links":{"citing_paper":"/paper/2608.05926"},"observation_digest":"sha256:c164012802a59062e089e1a0e85ea355899c180ea19213bfadcd363894c12047","observation_id":"ad6a93fb-e0fc-479f-b5d2-4756cc183b94","resolution":{"observed_at":"2026-08-07T21:08:31.681807Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:08:31.534974Z","title":"Unlocking efficiency in large language model inference: A comprehensive survey of speculative decoding,","venue":null,"work_id":"8b2eae4c-ae46-486c-ae56-0711bdbbc795","year":2024},"citing_paper":{"arxiv_id":"2608.05926","last_updated":"2026-08-06T11:57:36Z","snapshot_observed_at":"2026-08-09T16:12:12.593656Z","submitted_at":"2026-08-06T11:57:36Z","title":"BALANCE: Hybrid Autoregressive-Speculative LLM Inference in Wireless Edge Networks","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T21:08:29.108485Z"},"links":{"citing_paper":"/paper/2608.05926"},"observation_digest":"sha256:5c94241fd80f82c27195d7f991c9a1f5c57345eb84d158f981355905072511e1","observation_id":"8d1d594a-a920-4824-8d9d-10610310cbf4","resolution":{"observed_at":"2026-08-07T21:08:31.605619Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:08:31.376996Z","title":"A theoretical perspective for speculative decoding algorithm,","venue":null,"work_id":"f1c7bf97-4906-4421-a94b-f99cf8795ea3","year":2024},"citing_paper":{"arxiv_id":"2608.05926","last_updated":"2026-08-06T11:57:36Z","snapshot_observed_at":"2026-08-09T16:12:12.593656Z","submitted_at":"2026-08-06T11:57:36Z","title":"BALANCE: Hybrid Autoregressive-Speculative LLM Inference in Wireless Edge Networks","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T21:08:29.112636Z"},"links":{"citing_paper":"/paper/2608.05926"},"observation_digest":"sha256:05c22da02d1f0ac4ca3adc585ba2493e82afe9fb25e94fcfc523a01b69d2c1f3","observation_id":"ecf288db-331f-471f-b50d-a58bd58f8eb1","resolution":{"observed_at":"2026-08-07T21:08:31.426342Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:08:31.171375Z","title":"Decoding speculative decoding,","venue":null,"work_id":"18cbef4a-c4f0-45d4-9f27-b30e115866b0","year":2025},"citing_paper":{"arxiv_id":"2608.05926","last_updated":"2026-08-06T11:57:36Z","snapshot_observed_at":"2026-08-09T16:12:12.593656Z","submitted_at":"2026-08-06T11:57:36Z","title":"BALANCE: Hybrid Autoregressive-Speculative LLM Inference in Wireless Edge Networks","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T21:08:29.116225Z"},"links":{"citing_paper":"/paper/2608.05926"},"observation_digest":"sha256:518f1e17739572b80dc79f1149eea3720449b121eec24ea9b159750c3e49dc6c","observation_id":"1d86221b-1984-44a9-a752-9fe10e00eda3","resolution":{"observed_at":"2026-08-07T21:08:31.254424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:08:31.083832Z","title":"SpecExec: Massively parallel speculative decoding for interactive LLM inference on consumer devices,","venue":null,"work_id":"3a18793f-c7fc-4087-a5a9-fcf71b1535f8","year":2024},"citing_paper":{"arxiv_id":"2608.05926","last_updated":"2026-08-06T11:57:36Z","snapshot_observed_at":"2026-08-09T16:12:12.593656Z","submitted_at":"2026-08-06T11:57:36Z","title":"BALANCE: Hybrid Autoregressive-Speculative LLM Inference in Wireless Edge Networks","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T21:08:29.120207Z"},"links":{"citing_paper":"/paper/2608.05926"},"observation_digest":"sha256:0108cd1a755ab339c0c7e7ea530c29369d936ce1e79de5150cebda047bbe90f0","observation_id":"0a891704-32d6-41f2-be5c-f64955cfa642","resolution":{"observed_at":"2026-08-07T21:08:31.088489Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:08:31.072752Z","title":"QuantSpec: Self-speculative decoding with hierarchical quantized KV cache,","venue":null,"work_id":"641d1536-9daa-49c5-a49d-4a8988329b0d","year":2025},"citing_paper":{"arxiv_id":"2608.05926","last_updated":"2026-08-06T11:57:36Z","snapshot_observed_at":"2026-08-09T16:12:12.593656Z","submitted_at":"2026-08-06T11:57:36Z","title":"BALANCE: Hybrid Autoregressive-Speculative LLM Inference in Wireless Edge Networks","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T21:08:29.124398Z"},"links":{"citing_paper":"/paper/2608.05926"},"observation_digest":"sha256:c533eb5408f3b0c6a16d8c2229bb334d1558ff5f7eea766096c45a4209d946a2","observation_id":"2f22cde4-9768-4b03-bbce-2dfe8496cde1","resolution":{"observed_at":"2026-08-07T21:08:31.076711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:08:31.061134Z","title":"Draft & verify: Lossless large language model acceleration via self- speculative decoding,","venue":null,"work_id":"16c5d88d-7100-4a7d-b664-37c21889740d","year":2024},"citing_paper":{"arxiv_id":"2608.05926","last_updated":"2026-08-06T11:57:36Z","snapshot_observed_at":"2026-08-09T16:12:12.593656Z","submitted_at":"2026-08-06T11:57:36Z","title":"BALANCE: Hybrid Autoregressive-Speculative LLM Inference in Wireless Edge Networks","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T21:08:29.128476Z"},"links":{"citing_paper":"/paper/2608.05926"},"observation_digest":"sha256:13728af451563ff9ed1ae1a2e54b54a84c5894be3f7153147119e0225fa57fde","observation_id":"2f627ff2-c25d-4bf5-9c61-f84244227c57","resolution":{"observed_at":"2026-08-07T21:08:31.065507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:08:31.049391Z","title":"SWIFT: On-the-fly self- speculative decoding for LLM inference acceleration,","venue":null,"work_id":"d00c1c91-f03b-4c12-94b0-928429f1982e","year":2025},"citing_paper":{"arxiv_id":"2608.05926","last_updated":"2026-08-06T11:57:36Z","snapshot_observed_at":"2026-08-09T16:12:12.593656Z","submitted_at":"2026-08-06T11:57:36Z","title":"BALANCE: Hybrid Autoregressive-Speculative LLM Inference in Wireless Edge Networks","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T21:08:29.131973Z"},"links":{"citing_paper":"/paper/2608.05926"},"observation_digest":"sha256:15de0adb788dd715a453594a4a8fa2220683d397da7f43b66dbc6da07b797330","observation_id":"b0a088f0-c9ba-4b7e-9bd8-d0908ef97809","resolution":{"observed_at":"2026-08-07T21:08:31.052967Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:08:31.038457Z","title":"Edge inference for large language models with pipeline parallelism and batching,","venue":null,"work_id":"cf3058f0-8728-4ed4-9176-1b9c2cc96701","year":2026},"citing_paper":{"arxiv_id":"2608.05926","last_updated":"2026-08-06T11:57:36Z","snapshot_observed_at":"2026-08-09T16:12:12.593656Z","submitted_at":"2026-08-06T11:57:36Z","title":"BALANCE: Hybrid Autoregressive-Speculative LLM Inference in Wireless Edge Networks","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T21:08:29.135978Z"},"links":{"citing_paper":"/paper/2608.05926"},"observation_digest":"sha256:67dc93b5b823291228d5cf81c7ab78c4ea6e3db19a1a14ef03335f616df70925","observation_id":"fef51e62-a032-4e9e-ba78-f8b0fd24be31","resolution":{"observed_at":"2026-08-07T21:08:31.042137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:08:31.026560Z","title":"Beyond the cloud: Edge inference for generative large language models in wireless networks,","venue":null,"work_id":"22c555eb-d19a-4bcc-a7f0-f8a238c3778e","year":2025},"citing_paper":{"arxiv_id":"2608.05926","last_updated":"2026-08-06T11:57:36Z","snapshot_observed_at":"2026-08-09T16:12:12.593656Z","submitted_at":"2026-08-06T11:57:36Z","title":"BALANCE: Hybrid Autoregressive-Speculative LLM Inference in Wireless Edge Networks","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T21:08:29.141637Z"},"links":{"citing_paper":"/paper/2608.05926"},"observation_digest":"sha256:ae8d755b1f73faf18a74149010e40d1bb7e02e5834e698192f9f9f82a1a4da44","observation_id":"c0f52df3-d546-4693-b3f5-a4abe2801dbd","resolution":{"observed_at":"2026-08-07T21:08:31.030415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:08:31.013357Z","title":"Resource allocation in large language model integrated 6G vehicular networks,","venue":null,"work_id":"d8197d24-a296-42b1-b2ef-b69ede7d62a5","year":2024},"citing_paper":{"arxiv_id":"2608.05926","last_updated":"2026-08-06T11:57:36Z","snapshot_observed_at":"2026-08-09T16:12:12.593656Z","submitted_at":"2026-08-06T11:57:36Z","title":"BALANCE: Hybrid Autoregressive-Speculative LLM Inference in Wireless Edge Networks","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T21:08:29.149099Z"},"links":{"citing_paper":"/paper/2608.05926"},"observation_digest":"sha256:dd34d6a06353df150fbf7928b8a4034a3b5693ca51d7e70ea6fdc276413520bc","observation_id":"a776d1f0-696e-46b3-b67d-02d3cd7f8e6d","resolution":{"observed_at":"2026-08-07T21:08:31.017703Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:08:30.973895Z","title":"Communication- efficient distributed on-device LLM inference over wireless networks,","venue":null,"work_id":"c4714d26-5723-4007-af9a-8a656cf582aa","year":2025},"citing_paper":{"arxiv_id":"2608.05926","last_updated":"2026-08-06T11:57:36Z","snapshot_observed_at":"2026-08-09T16:12:12.593656Z","submitted_at":"2026-08-06T11:57:36Z","title":"BALANCE: Hybrid Autoregressive-Speculative LLM Inference in Wireless Edge Networks","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T21:08:29.153372Z"},"links":{"citing_paper":"/paper/2608.05926"},"observation_digest":"sha256:6ebdfb10dd665521a4be799b5d9c90295fc90aeee5fa8025889e59c21d5528b9","observation_id":"bfaf85cd-bd5a-4d07-9531-9cba43f57d18","resolution":{"observed_at":"2026-08-07T21:08:31.002970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:08:29.157535Z","title":"Efficient LLM inference over heterogeneous edge networks with speculative decoding,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05926","last_updated":"2026-08-06T11:57:36Z","snapshot_observed_at":"2026-08-09T16:12:12.593656Z","submitted_at":"2026-08-06T11:57:36Z","title":"BALANCE: Hybrid Autoregressive-Speculative LLM Inference in Wireless Edge Networks","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T21:08:29.157535Z"},"links":{"citing_paper":"/paper/2608.05926"},"observation_digest":"sha256:5c30f8669d99b0d0e47b33154916cb05448ebb10e8c6b40b99dbef0ce898d907","observation_id":"fdb8c11f-99d6-4ed6-a2c1-61e9763ded5f","resolution":{"observed_at":"2026-08-07T21:08:29.157535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.20919","last_updated":"2026-04-22T04:02:13Z","snapshot_observed_at":"2026-08-02T05:44:41.311612Z","submitted_at":"2026-04-22T04:02:13Z","title":"DiP-SD: Distributed Pipelined Speculative Decoding for Efficient LLM Inference at the Edge","version":1},"cited_work":{"arxiv_id":"2604.20919","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.20919","snapshot_observed_at":"2026-08-07T21:08:29.552605Z","title":"DiP-SD: Distributed Pipelined Speculative Decoding for Efficient LLM Inference at the Edge","venue":"cs.IT","work_id":"cf8c1048-77a4-4797-96ce-a49cac3825b5","year":2026},"citing_paper":{"arxiv_id":"2608.05926","last_updated":"2026-08-06T11:57:36Z","snapshot_observed_at":"2026-08-09T16:12:12.593656Z","submitted_at":"2026-08-06T11:57:36Z","title":"BALANCE: Hybrid Autoregressive-Speculative LLM Inference in Wireless Edge Networks","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T21:08:29.166612Z"},"links":{"cited_paper":"/paper/2604.20919","citing_paper":"/paper/2608.05926"},"observation_digest":"sha256:5f7a1eb465b71670cf0d079331ab4634a065307d1c85dbe6b7b76151aef87beb","observation_id":"5e869023-8674-42ad-82c1-70f9401efec0","resolution":{"observed_at":"2026-08-07T21:08:29.622307Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:08:30.455278Z","title":"SLED: A speculative LLM decoding framework for efficient edge serving,","venue":null,"work_id":"9e45a451-840c-42fe-a19e-2fe09878272b","year":2025},"citing_paper":{"arxiv_id":"2608.05926","last_updated":"2026-08-06T11:57:36Z","snapshot_observed_at":"2026-08-09T16:12:12.593656Z","submitted_at":"2026-08-06T11:57:36Z","title":"BALANCE: Hybrid Autoregressive-Speculative LLM Inference in Wireless Edge Networks","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T21:08:29.210427Z"},"links":{"citing_paper":"/paper/2608.05926"},"observation_digest":"sha256:1c32985f62c4fe966737c866ddd32b4feb18cbbe6239d619af4d65a4a90816b7","observation_id":"29a1d9fe-8c02-4aad-b515-66088ad6d2b3","resolution":{"observed_at":"2026-08-07T21:08:30.738637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:08:30.280730Z","title":"OPT-tree: Speculative decoding with adaptive draft tree structure,","venue":null,"work_id":"8c8a5d60-08e8-4d9f-8b3e-6c9a14a6ae9f","year":2025},"citing_paper":{"arxiv_id":"2608.05926","last_updated":"2026-08-06T11:57:36Z","snapshot_observed_at":"2026-08-09T16:12:12.593656Z","submitted_at":"2026-08-06T11:57:36Z","title":"BALANCE: Hybrid Autoregressive-Speculative LLM Inference in Wireless Edge Networks","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T21:08:29.214342Z"},"links":{"citing_paper":"/paper/2608.05926"},"observation_digest":"sha256:3a91741b2213f50abdc53a20cb3186056c98beb5d98bc7cb952f352a2187a647","observation_id":"23faed8f-64be-4649-8f59-613d9a2cba5e","resolution":{"observed_at":"2026-08-07T21:08:30.362101Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:08:30.269194Z","title":"PEARL: Parallel speculative decoding with adaptive draft length,","venue":null,"work_id":"c4e6da2c-8733-42e5-835e-be4553bdb55d","year":2025},"citing_paper":{"arxiv_id":"2608.05926","last_updated":"2026-08-06T11:57:36Z","snapshot_observed_at":"2026-08-09T16:12:12.593656Z","submitted_at":"2026-08-06T11:57:36Z","title":"BALANCE: Hybrid Autoregressive-Speculative LLM Inference in Wireless Edge Networks","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T21:08:29.218303Z"},"links":{"citing_paper":"/paper/2608.05926"},"observation_digest":"sha256:5c27eb237c7f2ad6ede6a69161aa0a40a99025a023643dafefe2162096922bd0","observation_id":"f309469c-702e-46f2-b5ba-071f3bc3ce91","resolution":{"observed_at":"2026-08-07T21:08:30.273514Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:08:30.255616Z","title":"Think fast, infer smart: A hybrid distributed LLMs inference at the wireless edge,","venue":null,"work_id":"b1fc98fc-3383-4bd0-ab29-920739f5f16b","year":2025},"citing_paper":{"arxiv_id":"2608.05926","last_updated":"2026-08-06T11:57:36Z","snapshot_observed_at":"2026-08-09T16:12:12.593656Z","submitted_at":"2026-08-06T11:57:36Z","title":"BALANCE: Hybrid Autoregressive-Speculative LLM Inference in Wireless Edge Networks","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T21:08:29.221924Z"},"links":{"citing_paper":"/paper/2608.05926"},"observation_digest":"sha256:4ae9302ee6298d29a10772ed6d5a1d47c9b426ea37fd3849789f7b4d0c6176ca","observation_id":"ad212f60-cfbb-42e4-acc2-f4e81e6c680d","resolution":{"observed_at":"2026-08-07T21:08:30.259737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:08:30.243704Z","title":"Hybrid LLM: Cost-efficient and quality-aware query routing,","venue":null,"work_id":"a8c021e0-2bad-4b5c-8372-4fd5b0cdcaa8","year":2024},"citing_paper":{"arxiv_id":"2608.05926","last_updated":"2026-08-06T11:57:36Z","snapshot_observed_at":"2026-08-09T16:12:12.593656Z","submitted_at":"2026-08-06T11:57:36Z","title":"BALANCE: Hybrid Autoregressive-Speculative LLM Inference in Wireless Edge Networks","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T21:08:29.225068Z"},"links":{"citing_paper":"/paper/2608.05926"},"observation_digest":"sha256:472c89f627010bc18cd1484aedae2f94324b1a61858fb4c7dcc841e3eef231f6","observation_id":"a38dc186-7ffc-4731-8ec5-923370845313","resolution":{"observed_at":"2026-08-07T21:08:30.248779Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:08:30.229742Z","title":"Communication-efficient hybrid language model via uncertainty-aware opportunistic and compressed transmission,","venue":null,"work_id":"3559eb8e-ce84-48a4-828a-6c2c5928b5fe","year":2026},"citing_paper":{"arxiv_id":"2608.05926","last_updated":"2026-08-06T11:57:36Z","snapshot_observed_at":"2026-08-09T16:12:12.593656Z","submitted_at":"2026-08-06T11:57:36Z","title":"BALANCE: Hybrid Autoregressive-Speculative LLM Inference in Wireless Edge Networks","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T21:08:29.229836Z"},"links":{"citing_paper":"/paper/2608.05926"},"observation_digest":"sha256:d66e8c3000587a9a01778427ba869bfb760d6628f4cfb3270c230b98da474a30","observation_id":"b5efa405-d9ae-48bf-8553-39b6d315ee1c","resolution":{"observed_at":"2026-08-07T21:08:30.235018Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06282","last_updated":"2025-02-10T09:24:06Z","snapshot_observed_at":"2026-08-08T15:54:54.027148Z","submitted_at":"2025-02-10T09:24:06Z","title":"Jakiro: Boosting Speculative Decoding with Decoupled Multi-Head via MoE","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06282","snapshot_observed_at":"2026-08-07T21:08:29.233848Z","title":"Jakiro: Boosting speculative decoding with decoupled multi-head via MoE,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05926","last_updated":"2026-08-06T11:57:36Z","snapshot_observed_at":"2026-08-09T16:12:12.593656Z","submitted_at":"2026-08-06T11:57:36Z","title":"BALANCE: Hybrid Autoregressive-Speculative LLM Inference in Wireless Edge Networks","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T21:08:29.233848Z"},"links":{"cited_paper":"/paper/2502.06282","citing_paper":"/paper/2608.05926"},"observation_digest":"sha256:eec3fa1ae5fd74c0ce9954a40e98fc00cae45dfda9e798d94116d98a98054674","observation_id":"65d5aa5c-6c44-4655-8b74-163e69737c36","resolution":{"observed_at":"2026-08-07T21:08:29.233848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:08:29.289489Z","title":"When, what, and how: Rethinking retrieval-enhanced speculative decoding,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05926","last_updated":"2026-08-06T11:57:36Z","snapshot_observed_at":"2026-08-09T16:12:12.593656Z","submitted_at":"2026-08-06T11:57:36Z","title":"BALANCE: Hybrid Autoregressive-Speculative LLM Inference in Wireless Edge Networks","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T21:08:29.289489Z"},"links":{"citing_paper":"/paper/2608.05926"},"observation_digest":"sha256:7d5a44b1be741a3a1a36a2e7fdd495707cf21728a82647426d244209e2f4bb9f","observation_id":"7e9d7529-2100-453c-add3-687ddc8c4b5d","resolution":{"observed_at":"2026-08-07T21:08:29.289489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:08:30.210339Z","title":"ExeGPT: Constraint-aware resource scheduling for LLM inference,","venue":null,"work_id":"79d3ba9d-2547-473c-94ae-8a2a8f47f083","year":2024},"citing_paper":{"arxiv_id":"2608.05926","last_updated":"2026-08-06T11:57:36Z","snapshot_observed_at":"2026-08-09T16:12:12.593656Z","submitted_at":"2026-08-06T11:57:36Z","title":"BALANCE: Hybrid Autoregressive-Speculative LLM Inference in Wireless Edge Networks","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T21:08:29.314663Z"},"links":{"citing_paper":"/paper/2608.05926"},"observation_digest":"sha256:77f94d011548c96e07ed70e883c17689e49976c6f6cfc696887722bd74e74650","observation_id":"d0efae99-d930-4d07-88cd-c817724b4999","resolution":{"observed_at":"2026-08-07T21:08:30.215195Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:08:30.190493Z","title":"Efficient interactive LLM serving with proxy model-based sequence length prediction,","venue":null,"work_id":"32d0a28f-9923-45b6-9b90-a07dc1d0f351","year":2024},"citing_paper":{"arxiv_id":"2608.05926","last_updated":"2026-08-06T11:57:36Z","snapshot_observed_at":"2026-08-09T16:12:12.593656Z","submitted_at":"2026-08-06T11:57:36Z","title":"BALANCE: Hybrid Autoregressive-Speculative LLM Inference in Wireless Edge Networks","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T21:08:29.318182Z"},"links":{"citing_paper":"/paper/2608.05926"},"observation_digest":"sha256:d3deddbd5d1cc4bcba357aac90663355b9bf5b787c54cb1f8b5889e0e606f70e","observation_id":"83ab9c14-685b-4568-89ef-0129fb92b1a9","resolution":{"observed_at":"2026-08-07T21:08:30.196856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:08:30.178169Z","title":"Past-future scheduler for LLM serving under SLA guarantees,","venue":null,"work_id":"38a49a6c-5901-4217-b9f2-ba10accc9f2d","year":2025},"citing_paper":{"arxiv_id":"2608.05926","last_updated":"2026-08-06T11:57:36Z","snapshot_observed_at":"2026-08-09T16:12:12.593656Z","submitted_at":"2026-08-06T11:57:36Z","title":"BALANCE: Hybrid Autoregressive-Speculative LLM Inference in Wireless Edge Networks","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T21:08:29.321631Z"},"links":{"citing_paper":"/paper/2608.05926"},"observation_digest":"sha256:b13fd4a9db8f2af36623136a5723ec4ff0597ba82f4f4961077038b5fff7ba89","observation_id":"cafb86ba-eae3-47cb-b39a-031d5d340bbe","resolution":{"observed_at":"2026-08-07T21:08:30.182107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:08:30.165373Z","title":"Orca: A distributed serving system for{Transformer-Based}generative models,","venue":null,"work_id":"66dbfa00-bc63-4d6a-bbaa-57e333cf9875","year":2022},"citing_paper":{"arxiv_id":"2608.05926","last_updated":"2026-08-06T11:57:36Z","snapshot_observed_at":"2026-08-09T16:12:12.593656Z","submitted_at":"2026-08-06T11:57:36Z","title":"BALANCE: Hybrid Autoregressive-Speculative LLM Inference in Wireless Edge Networks","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T21:08:29.325121Z"},"links":{"citing_paper":"/paper/2608.05926"},"observation_digest":"sha256:7cb6f5d0997ae8dd3a95d345852a35ff8ad6e151517fc5fdeac8309a1677317c","observation_id":"b7dfc47a-5365-4998-b3a3-df0d4c33f36f","resolution":{"observed_at":"2026-08-07T21:08:30.169739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:08:30.106974Z","title":"ColBERT: Efficient and effective passage search via contextualized late interaction over BERT,","venue":null,"work_id":"d8c1ff10-f538-45b8-aa3a-daca4ae6a9a3","year":2020},"citing_paper":{"arxiv_id":"2608.05926","last_updated":"2026-08-06T11:57:36Z","snapshot_observed_at":"2026-08-09T16:12:12.593656Z","submitted_at":"2026-08-06T11:57:36Z","title":"BALANCE: Hybrid Autoregressive-Speculative LLM Inference in Wireless Edge Networks","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T21:08:29.328584Z"},"links":{"citing_paper":"/paper/2608.05926"},"observation_digest":"sha256:5c329dc4240096cce292807df59deb170baa5b580db90a3ecce5337df378afc7","observation_id":"4a4aa75f-4553-4e0e-9315-0d1f0d0db32d","resolution":{"observed_at":"2026-08-07T21:08:30.157573Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:08:29.915130Z","title":"Reference API","venue":null,"work_id":"bde6a770-e4f2-4e47-ba59-4cda0343c0a9","year":null},"citing_paper":{"arxiv_id":"2608.05926","last_updated":"2026-08-06T11:57:36Z","snapshot_observed_at":"2026-08-09T16:12:12.593656Z","submitted_at":"2026-08-06T11:57:36Z","title":"BALANCE: Hybrid Autoregressive-Speculative LLM Inference in Wireless Edge Networks","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T21:08:29.332049Z"},"links":{"citing_paper":"/paper/2608.05926"},"observation_digest":"sha256:51af1a53026f6fcc43425de755e1f23969c730291c38565039c39058c3a9e300","observation_id":"762ff0ba-3ecb-4071-a3ec-1fa10c38d1f1","resolution":{"observed_at":"2026-08-07T21:08:30.015890Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:08:29.840097Z","title":"FlexGen: High-throughput generative inference of large language models with a single GPU,","venue":null,"work_id":"ccd669cc-f5ae-47ba-a2ff-ce4f79bbf520","year":2023},"citing_paper":{"arxiv_id":"2608.05926","last_updated":"2026-08-06T11:57:36Z","snapshot_observed_at":"2026-08-09T16:12:12.593656Z","submitted_at":"2026-08-06T11:57:36Z","title":"BALANCE: Hybrid Autoregressive-Speculative LLM Inference in Wireless Edge Networks","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T21:08:29.338097Z"},"links":{"citing_paper":"/paper/2608.05926"},"observation_digest":"sha256:6b7a2412115da507d9cfd0ab41c748101468697b65f229ac79634521ec37f0da","observation_id":"7f6b3f8f-684b-4884-b6c3-9697451d062d","resolution":{"observed_at":"2026-08-07T21:08:29.844275Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:08:29.827986Z","title":"NVIDIA multi-instance GPU user guide release r580,","venue":null,"work_id":"9a2981d6-b9a3-40c7-86f8-5bd1d6d2e165","year":null},"citing_paper":{"arxiv_id":"2608.05926","last_updated":"2026-08-06T11:57:36Z","snapshot_observed_at":"2026-08-09T16:12:12.593656Z","submitted_at":"2026-08-06T11:57:36Z","title":"BALANCE: Hybrid Autoregressive-Speculative LLM Inference in Wireless Edge Networks","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T21:08:29.341739Z"},"links":{"citing_paper":"/paper/2608.05926"},"observation_digest":"sha256:8cb403a9e0b9161bdbdca7e583001309dc1caaca35c3f3fd821c1142f2a3a287","observation_id":"e42b014f-0455-4f9f-9b86-c226b759e749","resolution":{"observed_at":"2026-08-07T21:08:29.832168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:08:29.349710Z","title":"iGniter: Interference-aware GPU resource provisioning for predictable DNN inference in the cloud,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05926","last_updated":"2026-08-06T11:57:36Z","snapshot_observed_at":"2026-08-09T16:12:12.593656Z","submitted_at":"2026-08-06T11:57:36Z","title":"BALANCE: Hybrid Autoregressive-Speculative LLM Inference in Wireless Edge Networks","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T21:08:29.349710Z"},"links":{"citing_paper":"/paper/2608.05926"},"observation_digest":"sha256:aa1770ed775b21ca673b42928ed6dcb59b58d1928822c0a8d7727dcaac890165","observation_id":"05887f2f-7741-45dc-a7ca-2b527abea792","resolution":{"observed_at":"2026-08-07T21:08:29.349710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:08:29.353171Z","title":"Multiuser co- inference with batch processing capable edge server,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05926","last_updated":"2026-08-06T11:57:36Z","snapshot_observed_at":"2026-08-09T16:12:12.593656Z","submitted_at":"2026-08-06T11:57:36Z","title":"BALANCE: Hybrid Autoregressive-Speculative LLM Inference in Wireless Edge Networks","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T21:08:29.353171Z"},"links":{"citing_paper":"/paper/2608.05926"},"observation_digest":"sha256:a7fb98558879f3e7964fefb04ff17759be8adf93d49ffcb450bcda30ed03f207","observation_id":"0d8f6ebe-c30e-4524-93a8-11c4046618ea","resolution":{"observed_at":"2026-08-07T21:08:29.353171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:08:29.788950Z","title":"A fast and scal- able multidimensional multiple-choice knapsack heuristic,","venue":null,"work_id":"6924b760-8aa2-4660-a55c-7bb1c1af8c55","year":2013},"citing_paper":{"arxiv_id":"2608.05926","last_updated":"2026-08-06T11:57:36Z","snapshot_observed_at":"2026-08-09T16:12:12.593656Z","submitted_at":"2026-08-06T11:57:36Z","title":"BALANCE: Hybrid Autoregressive-Speculative LLM Inference in Wireless Edge Networks","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T21:08:29.356251Z"},"links":{"citing_paper":"/paper/2608.05926"},"observation_digest":"sha256:f8ba5eac0a0a6ca903bcafc9698de97f15e0432ce770df287d4759e361ab3298","observation_id":"e248ce9e-28ff-4585-8a40-67381b635403","resolution":{"observed_at":"2026-08-07T21:08:29.793311Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:08:29.776978Z","title":"Heuristic algorithms for the multiple-choice multidimensional knapsack problem,","venue":null,"work_id":"5d46fa3b-5019-45b8-bb49-74376e8f7644","year":2004},"citing_paper":{"arxiv_id":"2608.05926","last_updated":"2026-08-06T11:57:36Z","snapshot_observed_at":"2026-08-09T16:12:12.593656Z","submitted_at":"2026-08-06T11:57:36Z","title":"BALANCE: Hybrid Autoregressive-Speculative LLM Inference in Wireless Edge Networks","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T21:08:29.373276Z"},"links":{"citing_paper":"/paper/2608.05926"},"observation_digest":"sha256:5a3a2ef8954cc89f9ed5055c8604df4c53504a5709832820aaa09c04f7eb58f5","observation_id":"a201f439-1ead-4958-9d96-5ad738dc8e6d","resolution":{"observed_at":"2026-08-07T21:08:29.781164Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:08:29.814940Z","title":"Available: https://docs.nvidia.com/datacenter/tesla/pdf/ MIG User Guide.pdf","venue":null,"work_id":"0e43a3b0-88b1-4a33-9abb-c1759638c1ca","year":null},"citing_paper":{"arxiv_id":"2608.05926","last_updated":"2026-08-06T11:57:36Z","snapshot_observed_at":"2026-08-09T16:12:12.593656Z","submitted_at":"2026-08-06T11:57:36Z","title":"BALANCE: Hybrid Autoregressive-Speculative LLM Inference in Wireless Edge Networks","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T21:08:29.345773Z"},"links":{"citing_paper":"/paper/2608.05926"},"observation_digest":"sha256:eb22f9a57c57ea8a9ebfea0a01244b5ffacf907a35d2859f372797b4601e8514","observation_id":"ab4d71cd-9c34-466c-9a0f-11d0f1c4aced","resolution":{"observed_at":"2026-08-07T21:08:29.819444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.05926","last_updated":"2026-08-06T11:57:36Z","latest_version":1,"primary_category":"cs.NI","snapshot_observed_at":"2026-08-09T16:12:12.593656Z","submitted_at":"2026-08-06T11:57:36Z","title":"BALANCE: Hybrid Autoregressive-Speculative LLM Inference in Wireless Edge Networks"},"reference_resolution":{"displayed":42,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":6,"verified_exact":1,"verified_fuzzy":35},"total_outbound_references":42},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 42 of 42 outbound references and 0 inbound Pith citation observations for arXiv:2608.05926."}