{"as_of":"2026-08-11T20:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:de69b3988bd8871968020ebb67b7dde08ba69e22e4ffcfd83e8668604b38b84a","coverage":[{"denominator":65,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":65,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T18:01:46.443737Z","state":"measured"},{"denominator":66,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":66,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-29T10:07:06.141581Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-29T10:13:17.805330Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-11T09:05:01.680844Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"cited_work":{"arxiv_id":"2501.11779","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.11779","snapshot_observed_at":"2026-06-29T10:13:17.805330Z","title":"Glinthawk: A two-tiered architecture for offline llm inference.arXiv preprint arXiv:2501.11779, 2025","venue":null,"work_id":"50d23eef-2c6c-47b9-a9c1-9beeae27b26c","year":2025},"citing_paper":{"arxiv_id":"2605.28095","last_updated":"2026-05-27T07:52:03Z","snapshot_observed_at":"2026-08-11T13:03:39.028604Z","submitted_at":"2026-05-27T07:52:03Z","title":"SiDP: Memory-Efficient Data Parallelism for Offline LLM Inference","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-29T10:07:06.141581Z"},"links":{"cited_paper":"/paper/2501.11779","citing_paper":"/paper/2605.28095"},"observation_digest":"sha256:030b958e4ba37740383e12757a4f16d6cb208cf426217e3b3924b09ca6f7faf7","observation_id":"92ab72be-fe40-44fe-beda-082c7f07b3c8","resolution":{"observed_at":"2026-06-29T10:13:17.806801Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.11779/citation-record","integrity":"/paper/2501.11779/integrity","json":"/paper/2501.11779/citation-record.json","paper":"/paper/2501.11779"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:01:47.808048Z","title":null,"venue":null,"work_id":"83e58abb-7413-4385-a0f4-1627a3a28059","year":2024},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-11T09:05:01.680844Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.140974Z"},"links":{"citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:ff18430a6f4ba4b8ed87ef51b4cb3b7e37d2218b91bab71fd627acd8a2546e52","observation_id":"cd8de5fb-360c-4b60-9eb0-a7750f47ec22","resolution":{"observed_at":"2026-08-10T18:01:47.812432Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:01:47.792898Z","title":null,"venue":null,"work_id":"a2f9fa11-536a-4a3b-8dfa-621dd9c3a71f","year":2024},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-11T09:05:01.680844Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.146738Z"},"links":{"citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:1093fc6b47a77396bc16f27289b4e50856900b33b2daf69d9aa8bd2c2da74db6","observation_id":"9afcc265-6c9e-493f-b264-bc249066982e","resolution":{"observed_at":"2026-08-10T18:01:47.797233Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:01:47.777739Z","title":null,"venue":null,"work_id":"d971601e-2268-4433-ad08-f7da7f42f1b7","year":2024},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-11T09:05:01.680844Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.152117Z"},"links":{"citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:8e158fd2251345782ecf949d54f66001808b30a825793601b7bd8747b95020a9","observation_id":"b17145cb-ea74-4204-b576-b5c5fa1b91f1","resolution":{"observed_at":"2026-08-10T18:01:47.782633Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:01:47.760264Z","title":null,"venue":null,"work_id":"eb8d2fc7-e29e-4a7c-85f7-bfe276cc60e3","year":2024},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-11T09:05:01.680844Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.156915Z"},"links":{"citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:4576c76a693bc589adaeda25b7c5ead6ce513581451e02d93a00efd5d5a32045","observation_id":"40834a54-9776-447b-9d81-0578cc68fa6c","resolution":{"observed_at":"2026-08-10T18:01:47.764911Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:01:47.744541Z","title":null,"venue":null,"work_id":"652cc4da-c156-4a5a-aca4-06500b087bb4","year":2024},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-11T09:05:01.680844Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.161851Z"},"links":{"citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:86a088b7168a15adcae3f6e72bdb04110c1e58ac3e9f005ff6c44c800cacc0d8","observation_id":"5476b1d9-7ca1-40a4-a9fc-ce9d313715b6","resolution":{"observed_at":"2026-08-10T18:01:47.749908Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:01:47.727379Z","title":null,"venue":null,"work_id":"51916b23-b4b3-4250-a5bf-098d9ab2782f","year":2024},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-11T09:05:01.680844Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.166848Z"},"links":{"citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:5c7546891b376eaff01eb1daa0225e5de34e54273dc6262be009543d3ae46a7f","observation_id":"32ae0556-c6f6-4648-9fc9-bef2c07adc3f","resolution":{"observed_at":"2026-08-10T18:01:47.732416Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:01:47.710396Z","title":null,"venue":null,"work_id":"c1fca359-12a3-4c2b-a5d3-8e347cc69ac9","year":2024},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-11T09:05:01.680844Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.172598Z"},"links":{"citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:3c0af652be9f2df8a4ea7cd1b8ba62790abab86a924e9e8353661bdbddeca342","observation_id":"185deb44-aa19-4381-b0c9-6c2c9ad6812b","resolution":{"observed_at":"2026-08-10T18:01:47.715213Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:01:47.693350Z","title":null,"venue":null,"work_id":"1b7dd9c7-2df8-4693-b7b4-dda05b552f36","year":2024},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-11T09:05:01.680844Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.177212Z"},"links":{"citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:1b541de84026b22b6f463c3a778eb3371a94e3421fc0dd5452fed10fb716352c","observation_id":"d6f5c94e-829c-40e4-b784-ebd37a967a15","resolution":{"observed_at":"2026-08-10T18:01:47.698905Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:01:47.675742Z","title":null,"venue":null,"work_id":"a32b9382-37a8-462d-86b3-dfcedc0a6e4d","year":2024},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-11T09:05:01.680844Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.181969Z"},"links":{"citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:9b3c31a532863105284650fa0ce29f6b3a173c1b357ffc34cbf3a7474db8d789","observation_id":"5a96ce76-ce01-404f-91b7-de152b17b688","resolution":{"observed_at":"2026-08-10T18:01:47.680983Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:01:46.186890Z","title":"IEEE Standard for Floating-Point Arithmetic","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-11T09:05:01.680844Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.186890Z"},"links":{"citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:4a44d2d7d32493210ba94077087bce1f03f5d77cbe026526a06a3c2f7cc516f8","observation_id":"49fd9485-fe74-4915-ab5c-509fc4535d98","resolution":{"observed_at":"2026-08-10T18:01:46.186890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16369","last_updated":"2023-08-31T00:03:02Z","snapshot_observed_at":"2026-08-06T15:43:00.292272Z","submitted_at":"2023-08-31T00:03:02Z","title":"SARATHI: Efficient LLM Inference by Piggybacking Decodes with Chunked Prefills","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16369","snapshot_observed_at":"2026-08-10T18:01:46.191693Z","title":"Gulavani, and Ramachandran Ramjee","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-11T09:05:01.680844Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.191693Z"},"links":{"cited_paper":"/paper/2308.16369","citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:db6b50432b8ff271ca9dbb94d5a36190f5f0e77d9e18828b06a019f46ef2b0db","observation_id":"30508ef3-964c-4a89-b862-55a835c64b15","resolution":{"observed_at":"2026-08-10T18:01:46.191693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13245","last_updated":"2023-12-23T17:55:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-22T17:16:38Z","title":"GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13245","snapshot_observed_at":"2026-08-10T18:01:46.196980Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-11T09:05:01.680844Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.196980Z"},"links":{"cited_paper":"/paper/2305.13245","citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:5259583a9a226504724c7814a698220f64222bd0728b07a9ee43c85b953144b2","observation_id":"0b852a1a-d85d-48e5-ac61-781431ef0e37","resolution":{"observed_at":"2026-08-10T18:01:46.196980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.00032","last_updated":"2022-06-30T18:01:08Z","snapshot_observed_at":"2026-08-07T13:09:22.711587Z","submitted_at":"2022-06-30T18:01:08Z","title":"DeepSpeed Inference: Enabling Efficient Inference of Transformer Models at Unprecedented Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.00032","snapshot_observed_at":"2026-08-10T18:01:46.202032Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-11T09:05:01.680844Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.202032Z"},"links":{"cited_paper":"/paper/2207.00032","citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:0fe50e036cadd9ce9606b0e74ad948fc0f79b305cbfc90f1a832f40ebd71c8d9","observation_id":"d873e317-48e0-4e95-9548-57e999c07e5a","resolution":{"observed_at":"2026-08-10T18:01:46.202032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:01:47.659002Z","title":null,"venue":null,"work_id":"44a1f953-48c6-41a6-b4a7-c2819a17ac0a","year":null},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-11T09:05:01.680844Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.206986Z"},"links":{"citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:a58a928971dae0ae6fd3d9c06544ff4bb314c72cca82bf0a17644aebdd7bec5e","observation_id":"4b10e56c-ab3a-48e8-8081-68882a03d8eb","resolution":{"observed_at":"2026-08-10T18:01:47.664194Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-10T18:01:46.216356Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-11T09:05:01.680844Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.216356Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:2e231af177a57b58522a80c09f6dbf72aa405dcd865731f2cbb6034adc0a12de","observation_id":"821c8ffe-0d58-480e-ad1a-3e3f0e051c72","resolution":{"observed_at":"2026-08-10T18:01:46.216356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:01:46.221091Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-11T09:05:01.680844Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.221091Z"},"links":{"citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:13e58263f2fa913de4e4fdb6705c15208225e4420ab3adb7ca7767e105ff578a","observation_id":"6b0f0fc0-f990-4b19-974a-1ff4ed8a7f96","resolution":{"observed_at":"2026-08-10T18:01:46.221091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01814","last_updated":"2025-04-10T14:56:01Z","snapshot_observed_at":"2026-07-06T18:09:08.963593Z","submitted_at":"2024-05-03T02:15:15Z","title":"Efficient Heterogeneous Large Language Model Decoding with Model-Attention Disaggregation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.01814","snapshot_observed_at":"2026-08-10T18:01:46.225490Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-11T09:05:01.680844Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.225490Z"},"links":{"cited_paper":"/paper/2405.01814","citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:4735da9c3ed87648ee4ae07937e9238f819225486c80f40d33d9e97117ffcbff","observation_id":"dfc4d592-14b0-4872-b016-572b6b7205cb","resolution":{"observed_at":"2026-08-10T18:01:46.225490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:01:47.642463Z","title":"Gonzalez, Ion Stoica, and Eric P","venue":null,"work_id":"ec133071-1fa5-498a-899f-1068448ccc76","year":2023},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-11T09:05:01.680844Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.230083Z"},"links":{"citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:dcae8023a885f16e8d9270c6fe80ef890e041553c68b6975f49ab861d5c83dba","observation_id":"98e3309a-8922-4408-8530-5963028a63ff","resolution":{"observed_at":"2026-08-10T18:01:47.647618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08691","last_updated":"2023-07-17T17:50:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-17T17:50:36Z","title":"FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08691","snapshot_observed_at":"2026-08-10T18:01:46.234652Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-11T09:05:01.680844Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.234652Z"},"links":{"cited_paper":"/paper/2307.08691","citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:a72bf649066bf10d443412e09acae2d6d4808393e1c91c2781acceceec0cc073","observation_id":"f7acc176-41e2-4c67-900c-1bfb10329ef2","resolution":{"observed_at":"2026-08-10T18:01:46.234652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:01:46.239316Z","title":"Fu, Stefano Ermon, Atri Rudra, and Christopher Ré","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-11T09:05:01.680844Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.239316Z"},"links":{"citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:c47d9c6de10d994066d1de4d96a7271c3cc0daa2fed1f3b0d1bd27192014ccd2","observation_id":"a0020f9a-f8d6-4595-8b60-7ddc5010b49c","resolution":{"observed_at":"2026-08-10T18:01:46.239316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-10T18:01:46.247690Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-11T09:05:01.680844Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.247690Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:35bc7572338f74733eed328bb6eef6d8c28c38b2183b2278fafd7ded71362d21","observation_id":"fa93b2c9-582e-40a1-a862-d63a7b72ce3c","resolution":{"observed_at":"2026-08-10T18:01:46.247690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.14135","last_updated":"2022-06-23T17:53:32Z","snapshot_observed_at":"2026-07-06T13:14:48.753329Z","submitted_at":"2022-05-27T17:53:09Z","title":"FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.14135","snapshot_observed_at":"2026-08-10T18:01:46.243579Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-11T09:05:01.680844Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.243579Z"},"links":{"cited_paper":"/paper/2205.14135","citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:c05087173df4e3d9c14b0bfd822cc77b26806b377029fa5bd8c04f5081847a8e","observation_id":"6de14574-7611-41a9-bc56-159929147cf3","resolution":{"observed_at":"2026-08-10T18:01:46.243579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:01:47.617173Z","title":null,"venue":null,"work_id":"61fd58c3-7406-4672-8a01-5a7b7af96500","year":2023},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-11T09:05:01.680844Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.256388Z"},"links":{"citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:94649afdbd4a332115d3c68a447041917302b90a49b56cce99aa7ed533722d08","observation_id":"df405801-7510-4393-ba9d-c170c58d0343","resolution":{"observed_at":"2026-08-10T18:01:47.621766Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.01667","last_updated":"2022-09-04T18:00:29Z","snapshot_observed_at":"2026-08-10T21:30:58.269678Z","submitted_at":"2022-09-04T18:00:29Z","title":"A Review of Sparse Expert Models in Deep Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.01667","snapshot_observed_at":"2026-08-10T18:01:46.251978Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-11T09:05:01.680844Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.251978Z"},"links":{"cited_paper":"/paper/2209.01667","citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:465d7284f846374da43d853a60976029f37829c988a361445d0f1f41c18029fa","observation_id":"230a61d0-3247-457e-8bf9-041081624c0e","resolution":{"observed_at":"2026-08-10T18:01:46.251978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:01:47.602286Z","title":null,"venue":null,"work_id":"c22c2089-dff2-49a9-bfb0-4d921462d075","year":2022},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-11T09:05:01.680844Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.264975Z"},"links":{"citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:dc72163a535a5660b6366b15952c3dfadf67e4bf7f217c252b417a9f068494af","observation_id":"e5db946e-4b6a-4c3e-a57b-2ba309b685e3","resolution":{"observed_at":"2026-08-10T18:01:47.606695Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:01:46.260751Z","title":null,"venue":null,"work_id":null,"year":1994},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-11T09:05:01.680844Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.260751Z"},"links":{"citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:38fede9883605ef2b866f9782d4a77e7c8f1fbb87b26037fccbf467d2ef0788c","observation_id":"b71d3ac2-652b-4b38-bf8e-b82d796d912d","resolution":{"observed_at":"2026-08-10T18:01:46.260751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05099","last_updated":"2024-05-13T08:49:44Z","snapshot_observed_at":"2026-08-09T16:33:20.413953Z","submitted_at":"2024-02-07T18:53:01Z","title":"Hydragen: High-Throughput LLM Inference with Shared Prefixes","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05099","snapshot_observed_at":"2026-08-10T18:01:46.274340Z","title":"Fu, Christo- pher Ré, and Azalia Mirhoseini","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-11T09:05:01.680844Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.274340Z"},"links":{"cited_paper":"/paper/2402.05099","citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:9cd3b4d333fd91b1d9f2fc8f804446a3cbd3563f2dae351bedcbd080b48bb9dc","observation_id":"7be11884-41b4-47eb-aaa8-98915c69c71e","resolution":{"observed_at":"2026-08-10T18:01:46.274340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-08T06:16:25.839566Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-10T18:01:46.269431Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-11T09:05:01.680844Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.269431Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:4b40b8d8112623ceaf180fa34f5370e882e73860603f8af529ea5e6d64f12e35","observation_id":"d4b7bc4e-ddf8-4658-af62-ab28c98b8f48","resolution":{"observed_at":"2026-08-10T18:01:46.269431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.11665","last_updated":"2023-07-19T04:03:11Z","snapshot_observed_at":"2026-08-05T15:40:10.466298Z","submitted_at":"2023-02-22T21:41:34Z","title":"AlpaServe: Statistical Multiplexing with Model Parallelism for Deep Learning Serving","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.11665","snapshot_observed_at":"2026-08-10T18:01:46.288769Z","title":"Gonzalez, and Ion Stoica","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-11T09:05:01.680844Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.288769Z"},"links":{"cited_paper":"/paper/2302.11665","citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:d980b7dd696e4114298edf5fcc70440635f0f8b1e3b3cac87d298b6215a0ca9c","observation_id":"f8976462-c76a-4b5f-abbb-98e1e5806d2d","resolution":{"observed_at":"2026-08-10T18:01:46.288769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:01:46.279142Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-11T09:05:01.680844Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.279142Z"},"links":{"citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:e7be9b794e9d369e4037f5c2b7657fb9dc154a778cbbfbc730d9350da00497a2","observation_id":"bd323758-0973-4522-b625-69ca3526214e","resolution":{"observed_at":"2026-08-10T18:01:46.279142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00978","last_updated":"2026-04-25T06:58:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-01T17:59:10Z","title":"AWQ: Activation-aware Weight Quantization for LLM Compression and Acceleration","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.00978","snapshot_observed_at":"2026-08-10T18:01:46.298972Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-11T09:05:01.680844Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.298972Z"},"links":{"cited_paper":"/paper/2306.00978","citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:0a46904f48feafe87d5cacf5adf75df03172bb0e22e16097b7f2ded2ab6d3583","observation_id":"0114ff0f-e917-4c51-826f-57473f90e5c3","resolution":{"observed_at":"2026-08-10T18:01:46.298972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01889","last_updated":"2023-11-27T06:38:47Z","snapshot_observed_at":"2026-08-07T09:22:20.831075Z","submitted_at":"2023-10-03T08:44:50Z","title":"Ring Attention with Blockwise Transformers for Near-Infinite Context","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01889","snapshot_observed_at":"2026-08-10T18:01:46.304481Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-11T09:05:01.680844Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.304481Z"},"links":{"cited_paper":"/paper/2310.01889","citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:c2e31e4d7b4439bae261525babea9493bd3094a784d85b96769dace5bfdb526d","observation_id":"8e6f5535-8ba1-432d-8af5-80c971140973","resolution":{"observed_at":"2026-08-10T18:01:46.304481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02669","last_updated":"2024-07-04T15:12:54Z","snapshot_observed_at":"2026-08-11T00:55:35.992515Z","submitted_at":"2024-01-05T06:53:00Z","title":"Infinite-LLM: Efficient LLM Service for Long Context with DistAttention and Distributed KVCache","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02669","snapshot_observed_at":"2026-08-10T18:01:46.293818Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-11T09:05:01.680844Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.293818Z"},"links":{"cited_paper":"/paper/2401.02669","citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:7d76f41a7a1c2840ee9ee1bc4a4aca82b600dbd8e5c360c5cef7bf462d1fee18","observation_id":"fa98683e-5b9a-43f0-a904-6183b0d6c34c","resolution":{"observed_at":"2026-08-10T18:01:46.293818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:01:46.313249Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-11T09:05:01.680844Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.313249Z"},"links":{"citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:3e827f90bb5f2e6ba8964b8d3112f7e0c24b5c244f6a2168a4df05b3601505a0","observation_id":"ee5166c2-c1a0-4b1c-adc1-74aa3e589515","resolution":{"observed_at":"2026-08-10T18:01:46.313249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.09911","last_updated":"2022-12-24T10:12:53Z","snapshot_observed_at":"2026-08-10T20:46:48.127668Z","submitted_at":"2022-05-20T00:53:43Z","title":"Can Foundation Models Wrangle Your Data?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.09911","snapshot_observed_at":"2026-08-10T18:01:46.317445Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-11T09:05:01.680844Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.317445Z"},"links":{"cited_paper":"/paper/2205.09911","citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:d7ec61435e804a1bc1a50331b22c574ce11d21de7ac226e50a0a560e32bb213b","observation_id":"9b20b16e-4b1b-4b6b-84d2-eeba8a108ed3","resolution":{"observed_at":"2026-08-10T18:01:46.317445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2008.07772","last_updated":"2020-10-14T22:56:32Z","snapshot_observed_at":"2026-08-06T01:07:00.222113Z","submitted_at":"2020-08-18T07:14:54Z","title":"Very Deep Transformers for Neural Machine Translation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2008.07772","snapshot_observed_at":"2026-08-10T18:01:46.309018Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-11T09:05:01.680844Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.309018Z"},"links":{"cited_paper":"/paper/2008.07772","citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:ba7c26871b2d9fee799e7ee8b8c69c175a34c1e1b897c7b1a7b305b9953f6228","observation_id":"6328fcdd-c8a6-4999-ae95-e56846b34da7","resolution":{"observed_at":"2026-08-10T18:01:46.309018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:01:46.325426Z","title":null,"venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-11T09:05:01.680844Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.325426Z"},"links":{"citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:67281541d32e255c794c97f75c51596d47d0cfade62229c838c9a6e4ee86715b","observation_id":"6fe44fe3-76cd-49eb-aa0b-1d355d017a14","resolution":{"observed_at":"2026-08-10T18:01:46.325426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:01:47.562173Z","title":null,"venue":null,"work_id":"b8c47d7a-7d15-4721-9d21-8d2da735af64","year":2024},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-11T09:05:01.680844Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.329244Z"},"links":{"citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:6d2f12cfdfce97d39c8171d88996588c24a86c59f57df6c1c0716fb615bdd867","observation_id":"c77e6827-4ea1-4d3f-a9bc-6b04e3dcacaf","resolution":{"observed_at":"2026-08-10T18:01:47.566549Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:01:47.576546Z","title":null,"venue":null,"work_id":"9e21bb51-dbbc-409f-bf1f-7c5e378597d3","year":2024},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-11T09:05:01.680844Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.321446Z"},"links":{"citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:f199c798456ae00a1403f5b6bf860bfcf4b864cd70bf565cad393652aa9774af","observation_id":"a12cfd8b-e8f4-4433-b6db-008b8cc6c386","resolution":{"observed_at":"2026-08-10T18:01:47.581844Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:01:47.546331Z","title":null,"venue":null,"work_id":"e1201fd0-9936-4cb5-8012-123017161947","year":2023},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-11T09:05:01.680844Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.338347Z"},"links":{"citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:7275d8a62a0caed07ce0dbfceaf028722a7e6ec8374c25656b7f59d032dd8543","observation_id":"d608c8dd-c737-4c05-acef-536a9115555d","resolution":{"observed_at":"2026-08-10T18:01:47.551053Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:01:46.342837Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-11T09:05:01.680844Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.342837Z"},"links":{"citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:03f6518b738f4026ec44938a10d105db4102a6beb691d66e1b114076634b7e50","observation_id":"ed95a91c-db04-4f62-89b6-c23584fb5e00","resolution":{"observed_at":"2026-08-10T18:01:46.342837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18677","last_updated":"2024-05-20T15:37:36Z","snapshot_observed_at":"2026-08-10T21:29:53.476151Z","submitted_at":"2023-11-30T16:24:42Z","title":"Splitwise: Efficient generative LLM inference using phase splitting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.18677","snapshot_observed_at":"2026-08-10T18:01:46.333688Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-11T09:05:01.680844Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.333688Z"},"links":{"cited_paper":"/paper/2311.18677","citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:c38797411df764269cebcc4fca1cb233c26a646e6db3efb0a696a5604ddf04ef","observation_id":"008b4344-7dd3-45f0-807d-d483848decd0","resolution":{"observed_at":"2026-08-10T18:01:46.333688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:01:46.352066Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-11T09:05:01.680844Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.352066Z"},"links":{"citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:121470964bd7d35dce46baf14c1b0b0e750f5da28e34cc785001359bd9c3d6d7","observation_id":"09dea148-68ba-4b46-ab31-f4962826ad67","resolution":{"observed_at":"2026-08-10T18:01:46.352066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:01:47.506864Z","title":null,"venue":null,"work_id":"5473582a-0251-430e-9f82-7bf9410e10d8","year":2023},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-11T09:05:01.680844Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.362128Z"},"links":{"citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:f3ce642acd10d4f63dcd99bead486dfcf45e764327e93e299467bd450f41bd7f","observation_id":"4a4d17f1-51ec-4698-af02-cf6ce691bef2","resolution":{"observed_at":"2026-08-10T18:01:47.511723Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.02054","last_updated":"2020-05-13T06:45:15Z","snapshot_observed_at":"2026-07-06T08:27:00.558613Z","submitted_at":"2019-10-04T17:29:39Z","title":"ZeRO: Memory Optimizations Toward Training Trillion Parameter Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.02054","snapshot_observed_at":"2026-08-10T18:01:46.347288Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-11T09:05:01.680844Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.347288Z"},"links":{"cited_paper":"/paper/1910.02054","citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:dee8b636a0df4466a4ff515c871cc055c351593b5204acdbdebe8059360d7438","observation_id":"8a63bae5-8be2-49fb-8f40-8dc294552bbb","resolution":{"observed_at":"2026-08-10T18:01:46.347288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1701.06538","last_updated":"2017-01-23T18:10:00Z","snapshot_observed_at":"2026-08-11T16:18:55.320420Z","submitted_at":"2017-01-23T18:10:00Z","title":"Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1701.06538","snapshot_observed_at":"2026-08-10T18:01:46.371711Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-11T09:05:01.680844Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.371711Z"},"links":{"cited_paper":"/paper/1701.06538","citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:d93a3f61c2f357dcbe8c59e67163ffbcd04cdbc316afde8b0dc53be06cb9583b","observation_id":"e3109990-33ca-4a29-8056-87fc6b526f6d","resolution":{"observed_at":"2026-08-10T18:01:46.371711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.06865","last_updated":"2023-06-12T07:48:53Z","snapshot_observed_at":"2026-08-06T08:43:40.051791Z","submitted_at":"2023-03-13T05:19:28Z","title":"FlexGen: High-Throughput Generative Inference of Large Language Models with a Single GPU","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.06865","snapshot_observed_at":"2026-08-10T18:01:46.376642Z","title":"Fu, Zhiqiang Xie, Beidi Chen, Clark Barrett, Joseph E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-11T09:05:01.680844Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.376642Z"},"links":{"cited_paper":"/paper/2303.06865","citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:7c7c1d35669f38cf600bb3ccb64562f14053bc088b74e94400281bad7c82da95","observation_id":"538f9376-388b-4a88-bd12-368ad2660701","resolution":{"observed_at":"2026-08-10T18:01:46.376642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-10T18:01:46.381691Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-11T09:05:01.680844Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.381691Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:9ed4fe0fc11555b4b7c1c474da0248b27eb7d6df6f883f137099449d5f0f8d2e","observation_id":"ddef0a13-13fc-4950-85de-3fddc4607b09","resolution":{"observed_at":"2026-08-10T18:01:46.381691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.02150","last_updated":"2019-11-06T00:19:05Z","snapshot_observed_at":"2026-07-06T08:35:01.386074Z","submitted_at":"2019-11-06T00:19:05Z","title":"Fast Transformer Decoding: One Write-Head is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.02150","snapshot_observed_at":"2026-08-10T18:01:46.366806Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-11T09:05:01.680844Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.366806Z"},"links":{"cited_paper":"/paper/1911.02150","citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:1a5d30f911d6ae6897c692bb85c85ca9a1b218a7dc08180250e3659424cdf81d","observation_id":"afc9cdde-5e85-4042-8003-9455e23d8fd1","resolution":{"observed_at":"2026-08-10T18:01:46.366806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08295","last_updated":"2024-04-16T12:52:47Z","snapshot_observed_at":"2026-08-03T03:29:01.959523Z","submitted_at":"2024-03-13T06:59:16Z","title":"Gemma: Open Models Based on Gemini Research and Technology","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08295","snapshot_observed_at":"2026-08-10T18:01:46.395770Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-11T09:05:01.680844Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.395770Z"},"links":{"cited_paper":"/paper/2403.08295","citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:ab889d2108d8497eb3fd49b0f5ccda9dbbba962956b542bd4ac781f59cc06d30","observation_id":"1388f066-5ab7-4032-800b-0946cd7feb8e","resolution":{"observed_at":"2026-08-10T18:01:46.395770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-10T18:01:46.400525Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-11T09:05:01.680844Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.400525Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:0714bb3df49a370d9f70ae81580c860d173e89422a8d7d78ffc5824a75561c3b","observation_id":"e6e96f27-0529-4ed8-9291-2434bfab177a","resolution":{"observed_at":"2026-08-10T18:01:46.400525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-10T18:01:46.405679Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-11T09:05:01.680844Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.405679Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:970ddffd1fe7c75f489e96ea1337b14d6791f3cf88c01e4637dba64cdd6a5102","observation_id":"c8075934-419a-4ff1-824a-69fc162d6966","resolution":{"observed_at":"2026-08-10T18:01:46.405679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:01:47.491107Z","title":"Hashimoto","venue":null,"work_id":"be2bc9a6-0322-415c-b10f-8ecb08e51896","year":null},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-11T09:05:01.680844Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.386417Z"},"links":{"citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:cfd476eea1d4a5f7815ba23ef6e887fe24555b0967713aba4443004e46a2d440","observation_id":"7b1b74c8-5585-4af5-9e9d-9f80e3477958","resolution":{"observed_at":"2026-08-10T18:01:47.495870Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:01:47.474071Z","title":"https://github.com/tatsu-lab/stanford_alpaca","venue":null,"work_id":"381bdb6f-5415-4c99-bd5f-9e36f9f2bd16","year":2023},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-11T09:05:01.680844Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.391253Z"},"links":{"citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:351f66389178627a316ec8ad1853dc4dd85ceef7bd9da5ad3cc5800871c0faf3","observation_id":"aa9fc5da-241b-48a4-a391-f12f25d25746","resolution":{"observed_at":"2026-08-10T18:01:47.480502Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17453","last_updated":"2024-04-07T00:56:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-29T17:59:56Z","title":"Efficient Streaming Language Models with Attention Sinks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17453","snapshot_observed_at":"2026-08-10T18:01:46.419673Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-11T09:05:01.680844Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.419673Z"},"links":{"cited_paper":"/paper/2309.17453","citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:98ed0721d41d0973a521594b97a72fd49c4d83cf0d74ef8e4c4823c8dcbc97b6","observation_id":"6638c6f8-f207-4fbc-9d19-e9a5194ea8a8","resolution":{"observed_at":"2026-08-10T18:01:46.419673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:01:47.440007Z","title":null,"venue":null,"work_id":"5677f0ba-287e-4819-b57a-b522b2e07eeb","year":2022},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-11T09:05:01.680844Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.424728Z"},"links":{"citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:a671d27cfcefa78d4f23df71844a9700fe68c0af4ea98c5f46cabf27adbb7dba","observation_id":"1a341c62-7758-4ef6-9b7b-f3a906243954","resolution":{"observed_at":"2026-08-10T18:01:47.446422Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.11277","last_updated":"2023-09-12T16:28:00Z","snapshot_observed_at":"2026-08-01T19:01:47.393546Z","submitted_at":"2023-04-21T23:52:27Z","title":"PyTorch FSDP: Experiences on Scaling Fully Sharded Data Parallel","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.11277","snapshot_observed_at":"2026-08-10T18:01:46.429279Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-11T09:05:01.680844Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.429279Z"},"links":{"cited_paper":"/paper/2304.11277","citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:a3294ff74afabfa3fde91dfcaccaff1d811cb962b87af5397f3e87ac25132357","observation_id":"ead83c85-b29d-4a54-8b74-e380f9d34488","resolution":{"observed_at":"2026-08-10T18:01:46.429279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.03762","last_updated":"2023-08-02T00:41:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-06-12T17:57:34Z","title":"Attention Is All You Need","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.03762","snapshot_observed_at":"2026-08-10T18:01:46.410490Z","title":"Gomez, Lukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-11T09:05:01.680844Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.410490Z"},"links":{"cited_paper":"/paper/1706.03762","citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:9c7222c2146c3709ceb6b69092dae0e2032504bd777e7798595290d43f839962","observation_id":"94e4e9b8-bffb-405d-a62d-5efe4dd4944f","resolution":{"observed_at":"2026-08-10T18:01:46.410490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:01:47.457980Z","title":null,"venue":null,"work_id":"5c02bffb-fe62-4370-b1dd-0bf1eaae5d45","year":2023},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-11T09:05:01.680844Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.414954Z"},"links":{"citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:2294bdd50aa368c071aa9ffd7b3eec0d2b1c2507423042d4c135a8016dad3ee8","observation_id":"6aac2e18-c272-4954-a29b-1199c8c3ddca","resolution":{"observed_at":"2026-08-10T18:01:47.463238Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-08-11T10:42:54.633244Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-10T18:01:46.443737Z","title":"Gonzalez, Clark Barrett, and Ying Sheng","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-11T09:05:01.680844Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.443737Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:581b0db446068ac03ad08c4e7ec3f1b44dd8a53f25082fdd9c0c9f626d14cf68","observation_id":"e6ae9f20-fcf8-4cfd-9b14-1d03b3498b32","resolution":{"observed_at":"2026-08-10T18:01:46.443737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05685","last_updated":"2023-12-24T02:01:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-09T05:55:52Z","title":"Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05685","snapshot_observed_at":"2026-08-10T18:01:46.434131Z","title":"Xing, Hao Zhang, Joseph E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-11T09:05:01.680844Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.434131Z"},"links":{"cited_paper":"/paper/2306.05685","citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:3aa2a66580ddea27c7c3dbaa59b4651ec2a918a06a299bcd3574baf523000d8f","observation_id":"78efc752-fb3c-448b-8aa0-b3c6f03409f4","resolution":{"observed_at":"2026-08-10T18:01:46.434131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12023","last_updated":"2022-06-28T19:36:44Z","snapshot_observed_at":"2026-08-07T05:15:09.810779Z","submitted_at":"2022-01-28T10:13:35Z","title":"Alpa: Automating Inter- and Intra-Operator Parallelism for Distributed Deep Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.12023","snapshot_observed_at":"2026-08-10T18:01:46.438859Z","title":"Xing, Joseph E","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-11T09:05:01.680844Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.438859Z"},"links":{"cited_paper":"/paper/2201.12023","citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:f6e9af70c821308dceb43a41f5a2b60990cf315306087326b15f03b076732c93","observation_id":"246c3827-a89b-4aa2-9451-d0bfe498b018","resolution":{"observed_at":"2026-08-10T18:01:46.438859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.06840","last_updated":"2021-01-18T02:11:25Z","snapshot_observed_at":"2026-07-06T10:33:17.427927Z","submitted_at":"2021-01-18T02:11:25Z","title":"ZeRO-Offload: Democratizing Billion-Scale Model Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.06840","snapshot_observed_at":"2026-08-10T18:01:46.357295Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-11T09:05:01.680844Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.357295Z"},"links":{"cited_paper":"/paper/2101.06840","citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:c0f9733a3aed0d7f1aacbd6a1930bd4027c883ba087597cd7fe482268d0bd7d5","observation_id":"f8781437-3a20-4210-8d3c-598c1a342079","resolution":{"observed_at":"2026-08-10T18:01:46.357295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.01188","last_updated":"2023-03-02T19:33:31Z","snapshot_observed_at":"2026-08-09T03:33:05.296150Z","submitted_at":"2022-09-02T17:38:03Z","title":"Petals: Collaborative Inference and Fine-tuning of Large Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.01188","snapshot_observed_at":"2026-08-10T18:01:46.211564Z","title":"arXiv preprint arXiv:2209.01188 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-11T09:05:01.680844Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.211564Z"},"links":{"cited_paper":"/paper/2209.01188","citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:06d0526ad02a38fe80aa0df31cb56f1c936c9c8d75a1854bde8f6637b7d95881","observation_id":"641f29ab-e41c-47fd-9499-c9961485dcc7","resolution":{"observed_at":"2026-08-10T18:01:46.211564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-10T18:01:46.284071Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-11T09:05:01.680844Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.284071Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:920f313b186db3199e3727d9bf8802dcd66c6471bb7d45a59ac6a698e9b1f699","observation_id":"a5ea8d80-6826-4545-b75a-8d3a2f494986","resolution":{"observed_at":"2026-08-10T18:01:46.284071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-11T09:05:01.680844Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference"},"reference_resolution":{"displayed":65,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":62,"verified_exact":0,"verified_fuzzy":3},"total_outbound_references":65},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 65 of 65 outbound references and 1 inbound Pith citation observation for arXiv:2501.11779."}