{"as_of":"2026-08-11T14:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a56176dafb0c6c92152ba62830a2ee30e2180d5d9a3143b14015ed4eba776d1f","coverage":[{"denominator":92,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":92,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T16:59:01.487312Z","state":"measured"},{"denominator":93,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":93,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T14:42:35.999530Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.12689","last_updated":"2025-09-04T06:20:55Z","snapshot_observed_at":"2026-08-10T16:51:34.188333Z","submitted_at":"2025-01-22T07:52:38Z","title":"IC-Cache: Efficient Large Language Model Serving via In-context Caching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12689","snapshot_observed_at":"2026-08-04T14:42:35.999530Z","title":"Echolm: Accelerating llm serving with real-time knowledge distillation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.24088","last_updated":"2026-06-08T21:46:49Z","snapshot_observed_at":"2026-08-09T08:48:04.144510Z","submitted_at":"2025-09-28T21:47:20Z","title":"CORRECT: COndensed eRror RECognition via knowledge Transfer in multi-agent systems","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-04T14:42:35.999530Z"},"links":{"cited_paper":"/paper/2501.12689","citing_paper":"/paper/2509.24088"},"observation_digest":"sha256:507e4a257e0ff9f0a35fde1036ba91d5c2394869feb4ad62387ea5cb465f79d2","observation_id":"b0f988cc-6209-4367-8174-1ca3a132931f","resolution":{"observed_at":"2026-08-04T14:42:35.999530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2501.12689/citation-record","integrity":"/paper/2501.12689/integrity","json":"/paper/2501.12689/citation-record.json","paper":"/paper/2501.12689"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:59:01.196339Z","title":"https://developers.google.com/ search/docs/appearance/ai-overviews","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.12689","last_updated":"2025-09-04T06:20:55Z","snapshot_observed_at":"2026-08-10T16:51:34.188333Z","submitted_at":"2025-01-22T07:52:38Z","title":"IC-Cache: Efficient Large Language Model Serving via In-context Caching","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T16:59:01.196339Z"},"links":{"citing_paper":"/paper/2501.12689"},"observation_digest":"sha256:e8c024b8648abb77d4cf404c1f8f15adef845a71e35f475803e16eb2ee98f642","observation_id":"cd32cb47-cc50-4020-86d5-2130697c6f13","resolution":{"observed_at":"2026-08-10T16:59:01.196339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:59:01.200708Z","title":"https://aws.amazon.com/codewhisperer/","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.12689","last_updated":"2025-09-04T06:20:55Z","snapshot_observed_at":"2026-08-10T16:51:34.188333Z","submitted_at":"2025-01-22T07:52:38Z","title":"IC-Cache: Efficient Large Language Model Serving via In-context Caching","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T16:59:01.200708Z"},"links":{"citing_paper":"/paper/2501.12689"},"observation_digest":"sha256:79c49e7f16b8eda5cf1a9d0426c236ad2c76d4ac0e4a3668fddd4e124b02bdcb","observation_id":"e500c042-14d4-4c90-8ab8-36aa279a2743","resolution":{"observed_at":"2026-08-10T16:59:01.200708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:59:01.204302Z","title":"https://claude.ai/","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.12689","last_updated":"2025-09-04T06:20:55Z","snapshot_observed_at":"2026-08-10T16:51:34.188333Z","submitted_at":"2025-01-22T07:52:38Z","title":"IC-Cache: Efficient Large Language Model Serving via In-context Caching","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T16:59:01.204302Z"},"links":{"citing_paper":"/paper/2501.12689"},"observation_digest":"sha256:22fcfb133247b993f89050ef3cd08692a3ce5b40a3be1d982cf172a8b045a493","observation_id":"380085fe-9edc-4b6a-ad44-5a23f39d0a4c","resolution":{"observed_at":"2026-08-10T16:59:01.204302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:59:01.209020Z","title":"https://character.ai/","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.12689","last_updated":"2025-09-04T06:20:55Z","snapshot_observed_at":"2026-08-10T16:51:34.188333Z","submitted_at":"2025-01-22T07:52:38Z","title":"IC-Cache: Efficient Large Language Model Serving via In-context Caching","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T16:59:01.209020Z"},"links":{"citing_paper":"/paper/2501.12689"},"observation_digest":"sha256:5b9440c66e07425c309a29d8b3d924fd80db03c88ae4b01053631828b4cd711f","observation_id":"44786cd6-a2bf-470c-a50d-a425c26c6d57","resolution":{"observed_at":"2026-08-10T16:59:01.209020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:59:01.212859Z","title":"https://openai.com/index/ introducing-deep-research/","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.12689","last_updated":"2025-09-04T06:20:55Z","snapshot_observed_at":"2026-08-10T16:51:34.188333Z","submitted_at":"2025-01-22T07:52:38Z","title":"IC-Cache: Efficient Large Language Model Serving via In-context Caching","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T16:59:01.212859Z"},"links":{"citing_paper":"/paper/2501.12689"},"observation_digest":"sha256:cb3e6f112676fdbf215f9a9a15c487354e02cedbdbadaf52ffc1a31bb903165e","observation_id":"f88c1446-2145-4f77-94db-aa0af443544b","resolution":{"observed_at":"2026-08-10T16:59:01.212859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:59:01.216531Z","title":"https://api-docs.deepseek.com/guides/ kv_cache","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.12689","last_updated":"2025-09-04T06:20:55Z","snapshot_observed_at":"2026-08-10T16:51:34.188333Z","submitted_at":"2025-01-22T07:52:38Z","title":"IC-Cache: Efficient Large Language Model Serving via In-context Caching","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T16:59:01.216531Z"},"links":{"citing_paper":"/paper/2501.12689"},"observation_digest":"sha256:24bb5d660b32be974832e2e6e500def284f6bd1fcb9b82e7a9b8fcb8b4c05dc3","observation_id":"096681f9-7a28-426c-a187-75d8f547d723","resolution":{"observed_at":"2026-08-10T16:59:01.216531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:59:01.219494Z","title":"https: //github.com/deepseek-ai/open-infra-index/blob/main/ 202502OpenSourceWeek/day_6_one_more_thing_ deepseekV3R1_inference_system_overview.md","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.12689","last_updated":"2025-09-04T06:20:55Z","snapshot_observed_at":"2026-08-10T16:51:34.188333Z","submitted_at":"2025-01-22T07:52:38Z","title":"IC-Cache: Efficient Large Language Model Serving via In-context Caching","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T16:59:01.219494Z"},"links":{"citing_paper":"/paper/2501.12689"},"observation_digest":"sha256:e63f95f5105bea8869e537b1bfe510a60b73ca94663966663ddc4966cfc4bf4d","observation_id":"3a6f70cf-8326-48c0-8a96-4e6c24dec579","resolution":{"observed_at":"2026-08-10T16:59:01.219494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:59:01.222104Z","title":"https: //developers.googleblog.com/en/gemini-15-flash-8b-is-now- generally-\\available-for-use/","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.12689","last_updated":"2025-09-04T06:20:55Z","snapshot_observed_at":"2026-08-10T16:51:34.188333Z","submitted_at":"2025-01-22T07:52:38Z","title":"IC-Cache: Efficient Large Language Model Serving via In-context Caching","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T16:59:01.222104Z"},"links":{"citing_paper":"/paper/2501.12689"},"observation_digest":"sha256:e588425afc06a6fb68f8069021145f3ec8e3fcfecd5ef92b760d10897a3b1f1a","observation_id":"2cf6f2cc-1fcb-4feb-9706-572214791dd1","resolution":{"observed_at":"2026-08-10T16:59:01.222104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:59:01.224912Z","title":"https://ai.google.dev/gemini-api/docs/ caching?lang=python","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.12689","last_updated":"2025-09-04T06:20:55Z","snapshot_observed_at":"2026-08-10T16:51:34.188333Z","submitted_at":"2025-01-22T07:52:38Z","title":"IC-Cache: Efficient Large Language Model Serving via In-context Caching","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T16:59:01.224912Z"},"links":{"citing_paper":"/paper/2501.12689"},"observation_digest":"sha256:691363ac0e991c8bb877eca41243887e45ea75eaa7f678bef65ef6fd42403c42","observation_id":"3b45434b-deb8-4bd2-8354-411b2d10f417","resolution":{"observed_at":"2026-08-10T16:59:01.224912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:59:01.227790Z","title":"https://github.com/features/copilot/","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.12689","last_updated":"2025-09-04T06:20:55Z","snapshot_observed_at":"2026-08-10T16:51:34.188333Z","submitted_at":"2025-01-22T07:52:38Z","title":"IC-Cache: Efficient Large Language Model Serving via In-context Caching","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T16:59:01.227790Z"},"links":{"citing_paper":"/paper/2501.12689"},"observation_digest":"sha256:f3bebd2676e877fd74ffd6f2d2fc8e82561fbd16610ed5fcf0725efddbaf4dae","observation_id":"a97d271e-8ce3-4965-9ec3-9fc697263bcf","resolution":{"observed_at":"2026-08-10T16:59:01.227790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:59:01.230372Z","title":"https://www","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.12689","last_updated":"2025-09-04T06:20:55Z","snapshot_observed_at":"2026-08-10T16:51:34.188333Z","submitted_at":"2025-01-22T07:52:38Z","title":"IC-Cache: Efficient Large Language Model Serving via In-context Caching","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T16:59:01.230372Z"},"links":{"citing_paper":"/paper/2501.12689"},"observation_digest":"sha256:343fce351601377fc4e10682ee4df2a67e26d74fae43d65248888695cecf6196","observation_id":"b0b110c8-ed32-401e-bfef-cb6af0771a32","resolution":{"observed_at":"2026-08-10T16:59:01.230372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:59:01.233061Z","title":"https://huggingface.co/spaces/lmarena-ai/chatbot-arena- leaderboard","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.12689","last_updated":"2025-09-04T06:20:55Z","snapshot_observed_at":"2026-08-10T16:51:34.188333Z","submitted_at":"2025-01-22T07:52:38Z","title":"IC-Cache: Efficient Large Language Model Serving via In-context Caching","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T16:59:01.233061Z"},"links":{"citing_paper":"/paper/2501.12689"},"observation_digest":"sha256:8f14874f3f94833c149a6e30162b6449b77bc0d9ee1d5a6b063cc58144ee7e5e","observation_id":"a1ccee4c-a3ce-4e1a-b78f-9966255d546c","resolution":{"observed_at":"2026-08-10T16:59:01.233061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:59:02.418819Z","title":"https://huggingface.co/docs/ api-inference/index","venue":null,"work_id":"3bdc7a57-95a6-4234-8e9f-4cd7fe8b9f22","year":null},"citing_paper":{"arxiv_id":"2501.12689","last_updated":"2025-09-04T06:20:55Z","snapshot_observed_at":"2026-08-10T16:51:34.188333Z","submitted_at":"2025-01-22T07:52:38Z","title":"IC-Cache: Efficient Large Language Model Serving via In-context Caching","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T16:59:01.235646Z"},"links":{"citing_paper":"/paper/2501.12689"},"observation_digest":"sha256:d3ead013abeed3ab236841435595cf93afac67cd4617e159ed583839509d4a99","observation_id":"d2d29a30-d0b2-4492-aed9-dff524a20be2","resolution":{"observed_at":"2026-08-10T16:59:02.422543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:59:02.410316Z","title":"https://github","venue":null,"work_id":"a1acacfa-0c4d-4c19-9ac4-adee0a09f091","year":null},"citing_paper":{"arxiv_id":"2501.12689","last_updated":"2025-09-04T06:20:55Z","snapshot_observed_at":"2026-08-10T16:51:34.188333Z","submitted_at":"2025-01-22T07:52:38Z","title":"IC-Cache: Efficient Large Language Model Serving via In-context Caching","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T16:59:01.238251Z"},"links":{"citing_paper":"/paper/2501.12689"},"observation_digest":"sha256:18bc2d3997fcafed7ea68304b5131faec4ca07b3129f4af19fad3243eccdc713","observation_id":"992e6427-342e-4c0b-8bc3-c95b28dd62ad","resolution":{"observed_at":"2026-08-10T16:59:02.413250Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:59:02.401738Z","title":"https://microsoft.github.io/msmarco/","venue":null,"work_id":"0d5946b9-7e2f-429e-91a5-56f55c1975d7","year":null},"citing_paper":{"arxiv_id":"2501.12689","last_updated":"2025-09-04T06:20:55Z","snapshot_observed_at":"2026-08-10T16:51:34.188333Z","submitted_at":"2025-01-22T07:52:38Z","title":"IC-Cache: Efficient Large Language Model Serving via In-context Caching","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T16:59:01.241257Z"},"links":{"citing_paper":"/paper/2501.12689"},"observation_digest":"sha256:84ffda2bf99d25b2288e804e6b34a171acb6d0e0563ff0eac5353065b4f7c8e0","observation_id":"b9ecb950-bb36-4c65-8103-eda5c8aa0075","resolution":{"observed_at":"2026-08-10T16:59:02.404981Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:59:02.393070Z","title":"https: //github.com/explosion/spaCy","venue":null,"work_id":"4d309a0f-222f-4841-b715-df26d215996b","year":null},"citing_paper":{"arxiv_id":"2501.12689","last_updated":"2025-09-04T06:20:55Z","snapshot_observed_at":"2026-08-10T16:51:34.188333Z","submitted_at":"2025-01-22T07:52:38Z","title":"IC-Cache: Efficient Large Language Model Serving via In-context Caching","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T16:59:01.243979Z"},"links":{"citing_paper":"/paper/2501.12689"},"observation_digest":"sha256:de9d9d1b3c6b711ff58ae98ca63838f64edb8ede4391e6ec97fa39e0ad40a9d5","observation_id":"c5bbda78-31ab-4abf-9cdf-c7cbfdd066bc","resolution":{"observed_at":"2026-08-10T16:59:02.396331Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:59:02.384682Z","title":"https://www.databricks.com/blog/building-cost-optimized- chatbot-semantic-caching, 2024","venue":null,"work_id":"5f891789-be8e-461f-a434-bb7cc7437bdb","year":2024},"citing_paper":{"arxiv_id":"2501.12689","last_updated":"2025-09-04T06:20:55Z","snapshot_observed_at":"2026-08-10T16:51:34.188333Z","submitted_at":"2025-01-22T07:52:38Z","title":"IC-Cache: Efficient Large Language Model Serving via In-context Caching","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T16:59:01.246580Z"},"links":{"citing_paper":"/paper/2501.12689"},"observation_digest":"sha256:1578ab5276dcea1cf5adf0ff414ca74931fa56e02385ee8f3bd18339abfd4ed7","observation_id":"e38a789c-d390-4ee9-9638-9b4f0356c303","resolution":{"observed_at":"2026-08-10T16:59:02.387503Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16369","last_updated":"2023-08-31T00:03:02Z","snapshot_observed_at":"2026-08-06T15:43:00.292272Z","submitted_at":"2023-08-31T00:03:02Z","title":"SARATHI: Efficient LLM Inference by Piggybacking Decodes with Chunked Prefills","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16369","snapshot_observed_at":"2026-08-10T16:59:01.249697Z","title":"Sarathi: Efficient llm in- ference by piggybacking decodes with chunked prefills","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12689","last_updated":"2025-09-04T06:20:55Z","snapshot_observed_at":"2026-08-10T16:51:34.188333Z","submitted_at":"2025-01-22T07:52:38Z","title":"IC-Cache: Efficient Large Language Model Serving via In-context Caching","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T16:59:01.249697Z"},"links":{"cited_paper":"/paper/2308.16369","citing_paper":"/paper/2501.12689"},"observation_digest":"sha256:deb0d82f0234a4a32b315550bf71e40a127d67cca1a842c544270f307f44f0f9","observation_id":"69b137e8-c30b-4caa-a7d5-36e0f26602a0","resolution":{"observed_at":"2026-08-10T16:59:01.249697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:59:02.376239Z","title":"Analysis of thompson sampling for the multi-armed bandit problem","venue":null,"work_id":"57cc78b4-a240-4a2c-9d59-efb5068d10d8","year":null},"citing_paper":{"arxiv_id":"2501.12689","last_updated":"2025-09-04T06:20:55Z","snapshot_observed_at":"2026-08-10T16:51:34.188333Z","submitted_at":"2025-01-22T07:52:38Z","title":"IC-Cache: Efficient Large Language Model Serving via In-context Caching","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T16:59:01.252860Z"},"links":{"citing_paper":"/paper/2501.12689"},"observation_digest":"sha256:2deea656f6a4baa4e296c4211522020dac5f3f96c495c8187447daeeb8218ca6","observation_id":"b0fe5ba3-8f17-44ec-8617-f9f70b688597","resolution":{"observed_at":"2026-08-10T16:59:02.379244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11511","last_updated":"2023-10-17T18:18:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-17T18:18:32Z","title":"Self-RAG: Learning to Retrieve, Generate, and Critique through Self-Reflection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11511","snapshot_observed_at":"2026-08-10T16:59:01.255587Z","title":"Self-rag: Learning to retrieve, generate, and critique through self-reflection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12689","last_updated":"2025-09-04T06:20:55Z","snapshot_observed_at":"2026-08-10T16:51:34.188333Z","submitted_at":"2025-01-22T07:52:38Z","title":"IC-Cache: Efficient Large Language Model Serving via In-context Caching","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T16:59:01.255587Z"},"links":{"cited_paper":"/paper/2310.11511","citing_paper":"/paper/2501.12689"},"observation_digest":"sha256:060a35d971164d27197c1477cce7c925be6c3b093bbef2d423e0a4145669103c","observation_id":"92175fbd-bfe9-4eb6-a4ad-da7e1613a51a","resolution":{"observed_at":"2026-08-10T16:59:01.255587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:59:02.367545Z","title":"Gptcache: An open-source semantic cache for llm applica- tions enabling faster answers and cost savings","venue":null,"work_id":"6c9706e1-ef4b-429e-b321-47c350125dfe","year":2023},"citing_paper":{"arxiv_id":"2501.12689","last_updated":"2025-09-04T06:20:55Z","snapshot_observed_at":"2026-08-10T16:51:34.188333Z","submitted_at":"2025-01-22T07:52:38Z","title":"IC-Cache: Efficient Large Language Model Serving via In-context Caching","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T16:59:01.259377Z"},"links":{"citing_paper":"/paper/2501.12689"},"observation_digest":"sha256:4327489ac8f3e7487d633d27654c25b047616070645b2effeab9bade87fdfe49","observation_id":"c7123322-f633-448a-a5f5-657ab115c5da","resolution":{"observed_at":"2026-08-10T16:59:02.370400Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:59:02.358061Z","title":"Findings of the 2016 conference on machine translation","venue":null,"work_id":"ede4c8e6-498c-4650-8739-77cb9a0065e4","year":2025},"citing_paper":{"arxiv_id":"2501.12689","last_updated":"2025-09-04T06:20:55Z","snapshot_observed_at":"2026-08-10T16:51:34.188333Z","submitted_at":"2025-01-22T07:52:38Z","title":"IC-Cache: Efficient Large Language Model Serving via In-context Caching","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T16:59:01.262365Z"},"links":{"citing_paper":"/paper/2501.12689"},"observation_digest":"sha256:a8f2b7e215f0b03c5f4e9c38194b7391702ece7a856989898c1677a8c49047b7","observation_id":"074cb387-ae3a-4d81-bb27-b477f80bad82","resolution":{"observed_at":"2026-08-10T16:59:02.361569Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:59:02.348076Z","title":"JAX: compos- able transformations of Python+NumPy programs, 2018","venue":null,"work_id":"b975293b-607b-4616-8b7c-ff98198a87a2","year":2018},"citing_paper":{"arxiv_id":"2501.12689","last_updated":"2025-09-04T06:20:55Z","snapshot_observed_at":"2026-08-10T16:51:34.188333Z","submitted_at":"2025-01-22T07:52:38Z","title":"IC-Cache: Efficient Large Language Model Serving via In-context Caching","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T16:59:01.265474Z"},"links":{"citing_paper":"/paper/2501.12689"},"observation_digest":"sha256:b6052a1d17066456c5ee3867d8085dde1fe5a75a161f1cd00676070a5c2f555e","observation_id":"f90915e7-10a2-444b-8b22-0d8c5fff2872","resolution":{"observed_at":"2026-08-10T16:59:02.351675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-10T16:59:01.269384Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2501.12689","last_updated":"2025-09-04T06:20:55Z","snapshot_observed_at":"2026-08-10T16:51:34.188333Z","submitted_at":"2025-01-22T07:52:38Z","title":"IC-Cache: Efficient Large Language Model Serving via In-context Caching","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T16:59:01.269384Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2501.12689"},"observation_digest":"sha256:0e4bd795ab5c758a1ebbc7a27f6c71b532614fee41be5f31eb64be2e4008bec9","observation_id":"e71ff12a-149e-4d43-a45e-c90fbf043580","resolution":{"observed_at":"2026-08-10T16:59:01.269384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:59:02.337606Z","title":"Are more llm calls all you need? towards scaling laws of compound inference systems","venue":null,"work_id":"b9f4c534-3ac8-40ac-8bc2-faa0440d3878","year":2024},"citing_paper":{"arxiv_id":"2501.12689","last_updated":"2025-09-04T06:20:55Z","snapshot_observed_at":"2026-08-10T16:51:34.188333Z","submitted_at":"2025-01-22T07:52:38Z","title":"IC-Cache: Efficient Large Language Model Serving via In-context Caching","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T16:59:01.273733Z"},"links":{"citing_paper":"/paper/2501.12689"},"observation_digest":"sha256:a960ca2bfba7e595e1e7476da0061d424f67ddbf516daf14c88615b9bda64585","observation_id":"1044e1e8-587f-484f-8592-841ad40b297d","resolution":{"observed_at":"2026-08-10T16:59:02.341134Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12773","last_updated":"2023-10-19T14:22:03Z","snapshot_observed_at":"2026-08-02T16:56:38.535065Z","submitted_at":"2023-10-19T14:22:03Z","title":"Safe RLHF: Safe Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12773","snapshot_observed_at":"2026-08-10T16:59:01.277250Z","title":"Safe rlhf: Safe reinforcement learning from human feedback","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12689","last_updated":"2025-09-04T06:20:55Z","snapshot_observed_at":"2026-08-10T16:51:34.188333Z","submitted_at":"2025-01-22T07:52:38Z","title":"IC-Cache: Efficient Large Language Model Serving via In-context Caching","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T16:59:01.277250Z"},"links":{"cited_paper":"/paper/2310.12773","citing_paper":"/paper/2501.12689"},"observation_digest":"sha256:1dadfedcb217560228d01651c5de45547b70286bd5a94a499704d40b3aa241c0","observation_id":"a194a693-786f-4437-9fad-67e3d8be7938","resolution":{"observed_at":"2026-08-10T16:59:01.277250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:59:02.327519Z","title":"Learning semantic similarity in a continuous space","venue":null,"work_id":"b3b016c9-c188-441d-91dc-80263f588dd1","year":2018},"citing_paper":{"arxiv_id":"2501.12689","last_updated":"2025-09-04T06:20:55Z","snapshot_observed_at":"2026-08-10T16:51:34.188333Z","submitted_at":"2025-01-22T07:52:38Z","title":"IC-Cache: Efficient Large Language Model Serving via In-context Caching","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T16:59:01.280850Z"},"links":{"citing_paper":"/paper/2501.12689"},"observation_digest":"sha256:0e37badebf66a9624e7e4bb075512d2594b5d0678c012573361c51d03a6e65c1","observation_id":"75dec9d3-3c05-46d1-8630-51089c5c7376","resolution":{"observed_at":"2026-08-10T16:59:02.331126Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00234","last_updated":"2024-10-05T11:47:02Z","snapshot_observed_at":"2026-07-06T14:36:25.690733Z","submitted_at":"2022-12-31T15:57:09Z","title":"A Survey on In-context Learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00234","snapshot_observed_at":"2026-08-10T16:59:01.284457Z","title":"A survey on in-context learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12689","last_updated":"2025-09-04T06:20:55Z","snapshot_observed_at":"2026-08-10T16:51:34.188333Z","submitted_at":"2025-01-22T07:52:38Z","title":"IC-Cache: Efficient Large Language Model Serving via In-context Caching","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T16:59:01.284457Z"},"links":{"cited_paper":"/paper/2301.00234","citing_paper":"/paper/2501.12689"},"observation_digest":"sha256:4b7619b998d139fd1d0d95946e39e4bdb1c24a6052a822ac613906d8322352b0","observation_id":"1546857c-aac3-4d70-b3a7-7cc1bead340b","resolution":{"observed_at":"2026-08-10T16:59:01.284457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-10T16:59:01.288550Z","title":"Gemini: A family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12689","last_updated":"2025-09-04T06:20:55Z","snapshot_observed_at":"2026-08-10T16:51:34.188333Z","submitted_at":"2025-01-22T07:52:38Z","title":"IC-Cache: Efficient Large Language Model Serving via In-context Caching","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T16:59:01.288550Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2501.12689"},"observation_digest":"sha256:537ee2b68ecbc3e91b78076e367fb6b37dfa3315715786e6ddafee07a1b9ac72","observation_id":"1a51bbd8-2ba0-4fe2-82bf-c7da66dfb1dc","resolution":{"observed_at":"2026-08-10T16:59:01.288550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-10T16:59:01.291516Z","title":"Reso, Maxim Groshev, Maxim Naumov, Maya Lathi, Meghan Ke- neally, Miao Liu, Michael L","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2501.12689","last_updated":"2025-09-04T06:20:55Z","snapshot_observed_at":"2026-08-10T16:51:34.188333Z","submitted_at":"2025-01-22T07:52:38Z","title":"IC-Cache: Efficient Large Language Model Serving via In-context Caching","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T16:59:01.291516Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2501.12689"},"observation_digest":"sha256:6a1ee12b6deae568fc67033fbcbbc4a23e629bd5836806c13715406000dfeb1c","observation_id":"480858d0-a692-4121-bd7c-9e26947eb758","resolution":{"observed_at":"2026-08-10T16:59:01.291516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:59:01.294266Z","title":"Apple intelligence foundation lan- guage models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12689","last_updated":"2025-09-04T06:20:55Z","snapshot_observed_at":"2026-08-10T16:51:34.188333Z","submitted_at":"2025-01-22T07:52:38Z","title":"IC-Cache: Efficient Large Language Model Serving via In-context Caching","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T16:59:01.294266Z"},"links":{"citing_paper":"/paper/2501.12689"},"observation_digest":"sha256:bccaf1d5cde967ad0f44b5bbf5079d9e27b4a5fd9b3697bc13d8607e6ce63a87","observation_id":"9ba9fc8b-ef05-4783-add3-b425f3128708","resolution":{"observed_at":"2026-08-10T16:59:01.294266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.07971","last_updated":"2023-03-14T15:24:05Z","snapshot_observed_at":"2026-08-06T13:04:22.551600Z","submitted_at":"2023-03-14T15:24:05Z","title":"A Theory of Emergent In-Context Learning as Implicit Structure Induction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.07971","snapshot_observed_at":"2026-08-10T16:59:01.296886Z","title":"A theory of emergent in-context learning as implicit structure induction","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12689","last_updated":"2025-09-04T06:20:55Z","snapshot_observed_at":"2026-08-10T16:51:34.188333Z","submitted_at":"2025-01-22T07:52:38Z","title":"IC-Cache: Efficient Large Language Model Serving via In-context Caching","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T16:59:01.296886Z"},"links":{"cited_paper":"/paper/2303.07971","citing_paper":"/paper/2501.12689"},"observation_digest":"sha256:5b4ad31f4c0881eeb0234d716253b9e66ac14311c9448f039e592346857eb619","observation_id":"d44d57c7-7753-48a5-b1a1-6f5e882e17dc","resolution":{"observed_at":"2026-08-10T16:59:01.296886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.11181","last_updated":"2024-01-20T09:43:36Z","snapshot_observed_at":"2026-08-05T23:35:16.350557Z","submitted_at":"2024-01-20T09:43:36Z","title":"Inference without Interference: Disaggregate LLM Inference for Mixed Downstream Workloads","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.11181","snapshot_observed_at":"2026-08-10T16:59:01.299994Z","title":"Inference without interference: Disaggregate llm inference for mixed downstream workloads","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12689","last_updated":"2025-09-04T06:20:55Z","snapshot_observed_at":"2026-08-10T16:51:34.188333Z","submitted_at":"2025-01-22T07:52:38Z","title":"IC-Cache: Efficient Large Language Model Serving via In-context Caching","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T16:59:01.299994Z"},"links":{"cited_paper":"/paper/2401.11181","citing_paper":"/paper/2501.12689"},"observation_digest":"sha256:4e0faf2d92bf91a741c6b67af5ca0652656a83ceca1417799397802b00595492","observation_id":"b6b05c68-830a-4601-8a77-16dc123ccd23","resolution":{"observed_at":"2026-08-10T16:59:01.299994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.02839","last_updated":"2025-05-30T12:01:03Z","snapshot_observed_at":"2026-07-06T17:39:45.571775Z","submitted_at":"2024-03-05T10:20:52Z","title":"An Empirical Study of LLM-as-a-Judge for LLM Evaluation: Fine-tuned Judge Model is not a General Substitute for GPT-4","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.02839","snapshot_observed_at":"2026-08-10T16:59:01.302934Z","title":"An empirical study of llm-as-a-judge for llm evaluation: Fine-tuned judge models are task-specific classifiers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12689","last_updated":"2025-09-04T06:20:55Z","snapshot_observed_at":"2026-08-10T16:51:34.188333Z","submitted_at":"2025-01-22T07:52:38Z","title":"IC-Cache: Efficient Large Language Model Serving via In-context Caching","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T16:59:01.302934Z"},"links":{"cited_paper":"/paper/2403.02839","citing_paper":"/paper/2501.12689"},"observation_digest":"sha256:91f5c256ec1c90656054945a6f35385bff0d05df374d481da1305320a4e4e0b9","observation_id":"eb5f9fb0-9d97-4ce2-98f3-c9f04f6c252e","resolution":{"observed_at":"2026-08-10T16:59:01.302934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12668","last_updated":"2025-02-18T09:18:02Z","snapshot_observed_at":"2026-08-07T18:09:46.292772Z","submitted_at":"2025-02-18T09:18:02Z","title":"Evaluation of Best-of-N Sampling Strategies for Language Model Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12668","snapshot_observed_at":"2026-08-10T16:59:01.305843Z","title":"Evaluation of best-of-n sampling strategies for language model alignment","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2501.12689","last_updated":"2025-09-04T06:20:55Z","snapshot_observed_at":"2026-08-10T16:51:34.188333Z","submitted_at":"2025-01-22T07:52:38Z","title":"IC-Cache: Efficient Large Language Model Serving via In-context Caching","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T16:59:01.305843Z"},"links":{"cited_paper":"/paper/2502.12668","citing_paper":"/paper/2501.12689"},"observation_digest":"sha256:09f0fd198a480928f4c41cd1ff456b210511bafce73c48f7e4fcdd6a1865c6d2","observation_id":"c425dc93-770c-4898-b7cc-6db9de6902b4","resolution":{"observed_at":"2026-08-10T16:59:01.305843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06983","last_updated":"2023-10-22T00:11:13Z","snapshot_observed_at":"2026-07-06T15:26:06.998516Z","submitted_at":"2023-05-11T17:13:40Z","title":"Active Retrieval Augmented Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06983","snapshot_observed_at":"2026-08-10T16:59:01.308781Z","title":"Active retrieval augmented generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12689","last_updated":"2025-09-04T06:20:55Z","snapshot_observed_at":"2026-08-10T16:51:34.188333Z","submitted_at":"2025-01-22T07:52:38Z","title":"IC-Cache: Efficient Large Language Model Serving via In-context Caching","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T16:59:01.308781Z"},"links":{"cited_paper":"/paper/2305.06983","citing_paper":"/paper/2501.12689"},"observation_digest":"sha256:cb385e1d2eea777cf38825a864940022a478f7d67e2a15b79928eb5e6508cd33","observation_id":"3c5439a9-4d0e-4605-a805-1f7377e26f93","resolution":{"observed_at":"2026-08-10T16:59:01.308781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:59:02.316761Z","title":"MegaScale: Scaling large language model training to more than 10,000 GPUs","venue":null,"work_id":"0469e5e7-1bfb-4127-80db-38bcf796e693","year":null},"citing_paper":{"arxiv_id":"2501.12689","last_updated":"2025-09-04T06:20:55Z","snapshot_observed_at":"2026-08-10T16:51:34.188333Z","submitted_at":"2025-01-22T07:52:38Z","title":"IC-Cache: Efficient Large Language Model Serving via In-context Caching","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T16:59:01.312290Z"},"links":{"citing_paper":"/paper/2501.12689"},"observation_digest":"sha256:68b4396c55c8ba4ed896e1f634abcd716a78e05f9bbf1e3915433e713f065701","observation_id":"dae16513-ac8f-466d-a8b0-8c28aaec925c","resolution":{"observed_at":"2026-08-10T16:59:02.320664Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:59:02.307017Z","title":"Billion-scale similarity search with GPUs","venue":null,"work_id":"4f9d2310-cc88-42a8-9cb0-55ac0195fed2","year":2019},"citing_paper":{"arxiv_id":"2501.12689","last_updated":"2025-09-04T06:20:55Z","snapshot_observed_at":"2026-08-10T16:51:34.188333Z","submitted_at":"2025-01-22T07:52:38Z","title":"IC-Cache: Efficient Large Language Model Serving via In-context Caching","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T16:59:01.315989Z"},"links":{"citing_paper":"/paper/2501.12689"},"observation_digest":"sha256:816cbea8ba65f181b7153586adde3810170076aab5fd8e46d64354e0bcd2ebc3","observation_id":"e7f5ad9c-8aad-4a38-ad0e-7897ee31dd45","resolution":{"observed_at":"2026-08-10T16:59:02.310486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:59:02.296929Z","title":"Tanh works better with asymmetry","venue":null,"work_id":"6786e2a3-915f-44b9-bd3c-deb5a2b66b5b","year":2023},"citing_paper":{"arxiv_id":"2501.12689","last_updated":"2025-09-04T06:20:55Z","snapshot_observed_at":"2026-08-10T16:51:34.188333Z","submitted_at":"2025-01-22T07:52:38Z","title":"IC-Cache: Efficient Large Language Model Serving via In-context Caching","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T16:59:01.319029Z"},"links":{"citing_paper":"/paper/2501.12689"},"observation_digest":"sha256:e86b48f44faf5c0f733995a1260415e3de7f9161661d8f8b15ce197ca485b74d","observation_id":"ead06160-c83b-40fe-912f-208322b47337","resolution":{"observed_at":"2026-08-10T16:59:02.300514Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.14696","last_updated":"2023-10-23T08:42:49Z","snapshot_observed_at":"2026-08-10T14:02:03.103271Z","submitted_at":"2023-10-23T08:42:49Z","title":"Tree of Clarifications: Answering Ambiguous Questions with Retrieval-Augmented Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.14696","snapshot_observed_at":"2026-08-10T16:59:01.322004Z","title":"Tree of clarifications: Answering ambiguous ques- tions with retrieval-augmented large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12689","last_updated":"2025-09-04T06:20:55Z","snapshot_observed_at":"2026-08-10T16:51:34.188333Z","submitted_at":"2025-01-22T07:52:38Z","title":"IC-Cache: Efficient Large Language Model Serving via In-context Caching","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T16:59:01.322004Z"},"links":{"cited_paper":"/paper/2310.14696","citing_paper":"/paper/2501.12689"},"observation_digest":"sha256:a68c008dd549f1c5356daa812b5d68856b46b6791038b069a0ba94dcf49f9142","observation_id":"391c229e-cd53-430d-aed8-b10dcc8d28ef","resolution":{"observed_at":"2026-08-10T16:59:01.322004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:59:01.325281Z","title":"Toutanova, Llion Jones, Ming-Wei Chang, Andrew Dai, Jakob Uszkoreit, Quoc Le, and Slav Petrov","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.12689","last_updated":"2025-09-04T06:20:55Z","snapshot_observed_at":"2026-08-10T16:51:34.188333Z","submitted_at":"2025-01-22T07:52:38Z","title":"IC-Cache: Efficient Large Language Model Serving via In-context Caching","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T16:59:01.325281Z"},"links":{"citing_paper":"/paper/2501.12689"},"observation_digest":"sha256:9e75113029e51bf931e0c624d58df9c0514afd378c233c3e0ed25c2fd0ced5d9","observation_id":"c08c3152-cb8f-4692-b3d7-6337991f75ba","resolution":{"observed_at":"2026-08-10T16:59:01.325281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:59:01.328661Z","title":"Efficient memory management for large language model serving with pagedattention","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12689","last_updated":"2025-09-04T06:20:55Z","snapshot_observed_at":"2026-08-10T16:51:34.188333Z","submitted_at":"2025-01-22T07:52:38Z","title":"IC-Cache: Efficient Large Language Model Serving via In-context Caching","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T16:59:01.328661Z"},"links":{"citing_paper":"/paper/2501.12689"},"observation_digest":"sha256:f5f976cf68552a1d6aabcf3b75069a3c878a8816b1eb4c6ff54fc447dc2f7be5","observation_id":"946dc1bd-1535-494a-ab91-c7ea8e33cf37","resolution":{"observed_at":"2026-08-10T16:59:01.328661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03461","last_updated":"2025-03-14T17:27:00Z","snapshot_observed_at":"2026-07-06T19:27:42.862745Z","submitted_at":"2024-10-04T14:21:27Z","title":"Auto-GDA: Automatic Domain Adaptation for Efficient Grounding Verification in Retrieval-Augmented Generation","version":2},"cited_work":{"arxiv_id":"2410.03461","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.03461","snapshot_observed_at":"2026-08-10T16:59:01.793483Z","title":"Auto-GDA: Automatic Domain Adaptation for Efficient Grounding Verification in Retrieval-Augmented Generation","venue":"cs.CL","work_id":"4b38b4b6-eec5-4d7e-946b-196ef9a6e420","year":2024},"citing_paper":{"arxiv_id":"2501.12689","last_updated":"2025-09-04T06:20:55Z","snapshot_observed_at":"2026-08-10T16:51:34.188333Z","submitted_at":"2025-01-22T07:52:38Z","title":"IC-Cache: Efficient Large Language Model Serving via In-context Caching","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T16:59:01.332595Z"},"links":{"cited_paper":"/paper/2410.03461","citing_paper":"/paper/2501.12689"},"observation_digest":"sha256:1a11e8b16d346bc21f8c62c79f0fd897201331e39c038a8634229054020e699a","observation_id":"6b3e0f31-9917-4819-9713-88ad72c33937","resolution":{"observed_at":"2026-08-10T16:59:01.797977Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:59:02.275842Z","title":"Retrieval-augmented generation for knowledge- intensive nlp tasks","venue":null,"work_id":"14c145a7-3c6f-461c-8584-c015b24874bf","year":2020},"citing_paper":{"arxiv_id":"2501.12689","last_updated":"2025-09-04T06:20:55Z","snapshot_observed_at":"2026-08-10T16:51:34.188333Z","submitted_at":"2025-01-22T07:52:38Z","title":"IC-Cache: Efficient Large Language Model Serving via In-context Caching","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T16:59:01.336033Z"},"links":{"citing_paper":"/paper/2501.12689"},"observation_digest":"sha256:dfaac16feb12295b6418e50cde759fdd247d1aa267f189e8bc4680c1e005f4ea","observation_id":"e7d1cf4a-5f0f-42f2-a50a-6e3b78c0ed52","resolution":{"observed_at":"2026-08-10T16:59:02.278868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:59:02.266475Z","title":"Dpsynthe- sizer: differentially private data synthesizer for privacy preserving data sharing","venue":null,"work_id":"b0877c2d-5f8c-40d9-ac19-88f9f805f232","year":2014},"citing_paper":{"arxiv_id":"2501.12689","last_updated":"2025-09-04T06:20:55Z","snapshot_observed_at":"2026-08-10T16:51:34.188333Z","submitted_at":"2025-01-22T07:52:38Z","title":"IC-Cache: Efficient Large Language Model Serving via In-context Caching","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T16:59:01.339123Z"},"links":{"citing_paper":"/paper/2501.12689"},"observation_digest":"sha256:9f03b664d534e35f9acc38e899518fc50e4fb85cf4b139a15694ae7802d08fb9","observation_id":"c4163a19-a8e2-496d-b1cf-f4fd42b79230","resolution":{"observed_at":"2026-08-10T16:59:02.269666Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:59:02.257624Z","title":"Schapire","venue":null,"work_id":"f00bcd93-18b1-4855-b6db-cf0275247b4a","year":2010},"citing_paper":{"arxiv_id":"2501.12689","last_updated":"2025-09-04T06:20:55Z","snapshot_observed_at":"2026-08-10T16:51:34.188333Z","submitted_at":"2025-01-22T07:52:38Z","title":"IC-Cache: Efficient Large Language Model Serving via In-context Caching","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T16:59:01.342208Z"},"links":{"citing_paper":"/paper/2501.12689"},"observation_digest":"sha256:b267e34c53e302f81db6dfc77f34ffa1098b322fbda400c02448c9f5b59323c7","observation_id":"c38910f0-5b83-440e-9b42-dd41ee577771","resolution":{"observed_at":"2026-08-10T16:59:02.260458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:59:02.248805Z","title":"Gon- zalez, and Ion Stoica","venue":null,"work_id":"d48b303f-ea47-4bc5-8a85-6907d61d1af7","year":2023},"citing_paper":{"arxiv_id":"2501.12689","last_updated":"2025-09-04T06:20:55Z","snapshot_observed_at":"2026-08-10T16:51:34.188333Z","submitted_at":"2025-01-22T07:52:38Z","title":"IC-Cache: Efficient Large Language Model Serving via In-context Caching","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T16:59:01.345353Z"},"links":{"citing_paper":"/paper/2501.12689"},"observation_digest":"sha256:d21b44e38c6731cce2dd37860dca34eb9e4654f2b62ddf94a8c3878ade77778f","observation_id":"3de0911c-4795-4685-b6fe-85e16e4bce7a","resolution":{"observed_at":"2026-08-10T16:59:02.251889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12162","last_updated":"2025-05-17T07:09:10Z","snapshot_observed_at":"2026-08-10T17:24:35.572072Z","submitted_at":"2025-01-21T14:15:01Z","title":"AdaServe: Accelerating Multi-SLO LLM Serving with SLO-Customized Speculative Decoding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12162","snapshot_observed_at":"2026-08-10T16:59:01.348128Z","title":"Adaserve: Slo- customized llm serving with fine-grained speculative decoding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2501.12689","last_updated":"2025-09-04T06:20:55Z","snapshot_observed_at":"2026-08-10T16:51:34.188333Z","submitted_at":"2025-01-22T07:52:38Z","title":"IC-Cache: Efficient Large Language Model Serving via In-context Caching","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T16:59:01.348128Z"},"links":{"cited_paper":"/paper/2501.12162","citing_paper":"/paper/2501.12689"},"observation_digest":"sha256:4f5742d70862f71bef1044252b0bef5569bf267393d39ecd4fa1ccc9975cfc81","observation_id":"6f803b86-85e5-468a-aa9f-53d9479639e6","resolution":{"observed_at":"2026-08-10T16:59:01.348128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:59:02.240413Z","title":"Openorca: An open dataset of gpt augmented flan reasoning traces","venue":null,"work_id":"067892ee-3d18-4943-8066-baba06a40cf1","year":2023},"citing_paper":{"arxiv_id":"2501.12689","last_updated":"2025-09-04T06:20:55Z","snapshot_observed_at":"2026-08-10T16:51:34.188333Z","submitted_at":"2025-01-22T07:52:38Z","title":"IC-Cache: Efficient Large Language Model Serving via In-context Caching","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T16:59:01.350881Z"},"links":{"citing_paper":"/paper/2501.12689"},"observation_digest":"sha256:d02d26df8006c2512b5928711fcb6a0b349535b37fb9da427b452892caffc547","observation_id":"3537dd21-d42d-472a-83eb-32702659733f","resolution":{"observed_at":"2026-08-10T16:59:02.243226Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:59:02.231928Z","title":"Parrot: Efficient serving of llm-based applications with semantic variable","venue":null,"work_id":"7348f251-0e81-4ea1-8249-9f6a3e2943c8","year":2024},"citing_paper":{"arxiv_id":"2501.12689","last_updated":"2025-09-04T06:20:55Z","snapshot_observed_at":"2026-08-10T16:51:34.188333Z","submitted_at":"2025-01-22T07:52:38Z","title":"IC-Cache: Efficient Large Language Model Serving via In-context Caching","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T16:59:01.353771Z"},"links":{"citing_paper":"/paper/2501.12689"},"observation_digest":"sha256:4f854c1d27b12652c390285e82dcc643db54f833749ef783cbb0a86e06bc2580","observation_id":"1ca1e0b8-f16c-4aef-a0bb-dc53bfee0978","resolution":{"observed_at":"2026-08-10T16:59:02.234904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:59:02.222137Z","title":"Andes: Defining and enhancing quality-of- experience in llm-based text streaming services","venue":null,"work_id":"c554cc9d-7445-4d12-81da-78dc6367f229","year":2024},"citing_paper":{"arxiv_id":"2501.12689","last_updated":"2025-09-04T06:20:55Z","snapshot_observed_at":"2026-08-10T16:51:34.188333Z","submitted_at":"2025-01-22T07:52:38Z","title":"IC-Cache: Efficient Large Language Model Serving via In-context Caching","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T16:59:01.356375Z"},"links":{"citing_paper":"/paper/2501.12689"},"observation_digest":"sha256:9d7f376696aa52f9e18fc274bc9f86eda2226ef0fd9bde6450b12299adcb201a","observation_id":"e2b46443-4199-4a28-b683-bdf3080bd62e","resolution":{"observed_at":"2026-08-10T16:59:02.225238Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.11624","last_updated":"2024-03-23T16:35:45Z","snapshot_observed_at":"2026-08-11T13:15:51.132159Z","submitted_at":"2024-01-21T23:34:42Z","title":"In-context Learning with Retrieved Demonstrations for Language Models: A Survey","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.11624","snapshot_observed_at":"2026-08-10T16:59:01.358903Z","title":"In-context learning with retrieved demonstrations for language models: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12689","last_updated":"2025-09-04T06:20:55Z","snapshot_observed_at":"2026-08-10T16:51:34.188333Z","submitted_at":"2025-01-22T07:52:38Z","title":"IC-Cache: Efficient Large Language Model Serving via In-context Caching","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T16:59:01.358903Z"},"links":{"cited_paper":"/paper/2401.11624","citing_paper":"/paper/2501.12689"},"observation_digest":"sha256:2100f65f86e88f8f88914ab04631233a072cca4ebf1caf4c9f2dd6e454115d4a","observation_id":"95a57241-3c22-4ef3-909f-094181b591e5","resolution":{"observed_at":"2026-08-10T16:59:01.358903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:59:01.362089Z","title":"Simpo: Simple preference optimization with a reference-free reward","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12689","last_updated":"2025-09-04T06:20:55Z","snapshot_observed_at":"2026-08-10T16:51:34.188333Z","submitted_at":"2025-01-22T07:52:38Z","title":"IC-Cache: Efficient Large Language Model Serving via In-context Caching","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T16:59:01.362089Z"},"links":{"citing_paper":"/paper/2501.12689"},"observation_digest":"sha256:c3d155877628f0bcc92e44dcfb161e7f77171d9741972157b5e21e4cb82c0d2e","observation_id":"522b6ef3-5e6b-411e-9d0f-a74d285a6b0c","resolution":{"observed_at":"2026-08-10T16:59:01.362089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1611.09268","last_updated":"2018-10-31T14:46:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-11-28T18:14:11Z","title":"MS MARCO: A Human Generated MAchine Reading COmprehension Dataset","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.09268","snapshot_observed_at":"2026-08-10T16:59:01.364722Z","title":"MS MARCO: A human generated machine reading comprehension dataset","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.12689","last_updated":"2025-09-04T06:20:55Z","snapshot_observed_at":"2026-08-10T16:51:34.188333Z","submitted_at":"2025-01-22T07:52:38Z","title":"IC-Cache: Efficient Large Language Model Serving via In-context Caching","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-10T16:59:01.364722Z"},"links":{"cited_paper":"/paper/1611.09268","citing_paper":"/paper/2501.12689"},"observation_digest":"sha256:f16ad84746207ce49416f74e815bd52857435e04481e003f8375e8a638b28398","observation_id":"33dffffc-c17f-42f0-ab03-fb5177ecbbf9","resolution":{"observed_at":"2026-08-10T16:59:01.364722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18665","last_updated":"2025-02-23T08:50:33Z","snapshot_observed_at":"2026-07-30T15:06:18.011623Z","submitted_at":"2024-06-26T18:10:22Z","title":"RouteLLM: Learning to Route LLMs with Preference Data","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18665","snapshot_observed_at":"2026-08-10T16:59:01.367502Z","title":"Gonzalez, M Waleed Kadous, and Ion Stoica","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12689","last_updated":"2025-09-04T06:20:55Z","snapshot_observed_at":"2026-08-10T16:51:34.188333Z","submitted_at":"2025-01-22T07:52:38Z","title":"IC-Cache: Efficient Large Language Model Serving via In-context Caching","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-10T16:59:01.367502Z"},"links":{"cited_paper":"/paper/2406.18665","citing_paper":"/paper/2501.12689"},"observation_digest":"sha256:264572978d630397e10145ca8144a7005c0fd5e3285f765a7f0a70b53aa7a615","observation_id":"035a3950-fb3e-470a-b310-124f02b63984","resolution":{"observed_at":"2026-08-10T16:59:01.367502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:59:02.206104Z","title":"Training language models to follow instruc- tions with human feedback","venue":null,"work_id":"699f8b12-1135-41f2-b7cf-e40911dbd618","year":2022},"citing_paper":{"arxiv_id":"2501.12689","last_updated":"2025-09-04T06:20:55Z","snapshot_observed_at":"2026-08-10T16:51:34.188333Z","submitted_at":"2025-01-22T07:52:38Z","title":"IC-Cache: Efficient Large Language Model Serving via In-context Caching","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-10T16:59:01.370325Z"},"links":{"citing_paper":"/paper/2501.12689"},"observation_digest":"sha256:8c2c914e0fd012741b49659fb4f33fe26482111009b35f9087acaa0d119a156a","observation_id":"b70c6d1a-371a-4f0d-a4bc-6fad3bf9fb16","resolution":{"observed_at":"2026-08-10T16:59:02.209813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:59:01.373036Z","title":"Splitwise: Efficient gen- erative llm inference using phase splitting","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12689","last_updated":"2025-09-04T06:20:55Z","snapshot_observed_at":"2026-08-10T16:51:34.188333Z","submitted_at":"2025-01-22T07:52:38Z","title":"IC-Cache: Efficient Large Language Model Serving via In-context Caching","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-10T16:59:01.373036Z"},"links":{"citing_paper":"/paper/2501.12689"},"observation_digest":"sha256:e937fbf2ddf0787630a3d9a185a59ce9c835d96e9525bb207e9a8fac391cac7b","observation_id":"5d3ec71e-b22e-4de4-856e-e8c4bfd0f1ba","resolution":{"observed_at":"2026-08-10T16:59:01.373036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01228","last_updated":"2025-09-03T20:54:57Z","snapshot_observed_at":"2026-08-09T03:41:25.206013Z","submitted_at":"2024-10-02T04:12:13Z","title":"ConServe: Fine-Grained GPU Harvesting for LLM Online and Offline Co-Serving","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01228","snapshot_observed_at":"2026-08-10T16:59:01.376047Z","title":"Conserve: Harvesting gpus for low-latency and high-throughput large language model serving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12689","last_updated":"2025-09-04T06:20:55Z","snapshot_observed_at":"2026-08-10T16:51:34.188333Z","submitted_at":"2025-01-22T07:52:38Z","title":"IC-Cache: Efficient Large Language Model Serving via In-context Caching","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-10T16:59:01.376047Z"},"links":{"cited_paper":"/paper/2410.01228","citing_paper":"/paper/2501.12689"},"observation_digest":"sha256:7356fda87c80034b529dcb940fc3a3b4e480c7714e558524cf0176fc3a53c436","observation_id":"605cb783-6603-4532-b2bd-4b797d720249","resolution":{"observed_at":"2026-08-10T16:59:01.376047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:59:01.379428Z","title":"Modserve: Scal- able and resource-efficient large multimodal model serving","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2501.12689","last_updated":"2025-09-04T06:20:55Z","snapshot_observed_at":"2026-08-10T16:51:34.188333Z","submitted_at":"2025-01-22T07:52:38Z","title":"IC-Cache: Efficient Large Language Model Serving via In-context Caching","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-10T16:59:01.379428Z"},"links":{"citing_paper":"/paper/2501.12689"},"observation_digest":"sha256:1615997892ce5e9e0a2035d74ed90c35629cbb7cdbab939936259a684c848227","observation_id":"d477c421-d779-42f1-919d-6a1ad668f1bb","resolution":{"observed_at":"2026-08-10T16:59:01.379428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:59:02.190421Z","title":null,"venue":null,"work_id":"cb245359-904a-475a-8d56-0bd0ec71cb42","year":2020},"citing_paper":{"arxiv_id":"2501.12689","last_updated":"2025-09-04T06:20:55Z","snapshot_observed_at":"2026-08-10T16:51:34.188333Z","submitted_at":"2025-01-22T07:52:38Z","title":"IC-Cache: Efficient Large Language Model Serving via In-context Caching","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-10T16:59:01.382463Z"},"links":{"citing_paper":"/paper/2501.12689"},"observation_digest":"sha256:88e143de72ac1166aefd5fdcd7693236eb2b87a9db5be37b64e818f979a84ad2","observation_id":"d1204164-7432-4757-a02d-d0e905e17bc4","resolution":{"observed_at":"2026-08-10T16:59:02.193782Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:59:02.180492Z","title":"The probabilistic relevance framework: Bm25 and beyond","venue":null,"work_id":"2ddb7952-21d7-466e-b49a-556567bd508e","year":2009},"citing_paper":{"arxiv_id":"2501.12689","last_updated":"2025-09-04T06:20:55Z","snapshot_observed_at":"2026-08-10T16:51:34.188333Z","submitted_at":"2025-01-22T07:52:38Z","title":"IC-Cache: Efficient Large Language Model Serving via In-context Caching","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-10T16:59:01.385557Z"},"links":{"citing_paper":"/paper/2501.12689"},"observation_digest":"sha256:61bfbde224d68d771497d1813efc073a8efc6ce9ddfe8b5535542ddf830aa2ed","observation_id":"2a15ae50-03c3-4a63-8cee-834b174626cb","resolution":{"observed_at":"2026-08-10T16:59:02.184115Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15294","last_updated":"2023-10-23T09:58:13Z","snapshot_observed_at":"2026-08-03T16:18:57.922065Z","submitted_at":"2023-05-24T16:17:36Z","title":"Enhancing Retrieval-Augmented Large Language Models with Iterative Retrieval-Generation Synergy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.15294","snapshot_observed_at":"2026-08-10T16:59:01.389424Z","title":"Enhancing retrieval-augmented large language models with iterative retrieval-generation synergy","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12689","last_updated":"2025-09-04T06:20:55Z","snapshot_observed_at":"2026-08-10T16:51:34.188333Z","submitted_at":"2025-01-22T07:52:38Z","title":"IC-Cache: Efficient Large Language Model Serving via In-context Caching","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-10T16:59:01.389424Z"},"links":{"cited_paper":"/paper/2305.15294","citing_paper":"/paper/2501.12689"},"observation_digest":"sha256:ccf68975b9275dd2b588245366cdfbf26f8b9dd6ccdc0ba799721a01c825c9f3","observation_id":"6b26c39d-d4b9-496e-a29f-ca20b9578756","resolution":{"observed_at":"2026-08-10T16:59:01.389424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:59:01.392854Z","title":"Gonzalez, and Ion Stoica","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12689","last_updated":"2025-09-04T06:20:55Z","snapshot_observed_at":"2026-08-10T16:51:34.188333Z","submitted_at":"2025-01-22T07:52:38Z","title":"IC-Cache: Efficient Large Language Model Serving via In-context Caching","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-10T16:59:01.392854Z"},"links":{"citing_paper":"/paper/2501.12689"},"observation_digest":"sha256:ad61aa5da6c37853175996530f5a2d8d633a1bc28c08ce3d8e61b71b8066d6ef","observation_id":"540059ff-f982-4dc7-b9d3-a703af6d1982","resolution":{"observed_at":"2026-08-10T16:59:01.392854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:59:02.164942Z","title":"A statistical interpretation of term specificity and its application in retrieval","venue":null,"work_id":"6609f2c7-69eb-423d-b3f0-e0b8608adc5a","year":1972},"citing_paper":{"arxiv_id":"2501.12689","last_updated":"2025-09-04T06:20:55Z","snapshot_observed_at":"2026-08-10T16:51:34.188333Z","submitted_at":"2025-01-22T07:52:38Z","title":"IC-Cache: Efficient Large Language Model Serving via In-context Caching","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-10T16:59:01.401232Z"},"links":{"citing_paper":"/paper/2501.12689"},"observation_digest":"sha256:8bd2b4251d83b8bde55b2ae580d9a9f1f45e132e05325074e7ee8358861cc68a","observation_id":"f03d290f-c6ca-42d2-9b55-dfa4dac278ac","resolution":{"observed_at":"2026-08-10T16:59:02.168557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:59:01.404692Z","title":"Hygen: Efficient llm serving via elastic online-offline request co-location","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2501.12689","last_updated":"2025-09-04T06:20:55Z","snapshot_observed_at":"2026-08-10T16:51:34.188333Z","submitted_at":"2025-01-22T07:52:38Z","title":"IC-Cache: Efficient Large Language Model Serving via In-context Caching","version":3},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-10T16:59:01.404692Z"},"links":{"citing_paper":"/paper/2501.12689"},"observation_digest":"sha256:150a3af24bf749c07d59528e3be454d411682bac8a856dce465c3fc4ce705906","observation_id":"e4714e4c-3b96-4f0f-835b-eb5358916a14","resolution":{"observed_at":"2026-08-10T16:59:01.404692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:59:01.407925Z","title":"Hashimoto","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12689","last_updated":"2025-09-04T06:20:55Z","snapshot_observed_at":"2026-08-10T16:51:34.188333Z","submitted_at":"2025-01-22T07:52:38Z","title":"IC-Cache: Efficient Large Language Model Serving via In-context Caching","version":3},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-10T16:59:01.407925Z"},"links":{"citing_paper":"/paper/2501.12689"},"observation_digest":"sha256:73ec74f7dcc5cab9a48aecda7796d0c86f5c37a6c3584a41369bcb31c35f43d8","observation_id":"48874c01-f19b-4c00-985c-05ded19a3a08","resolution":{"observed_at":"2026-08-10T16:59:01.407925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00118","last_updated":"2024-10-02T15:22:49Z","snapshot_observed_at":"2026-08-02T16:20:09.773989Z","submitted_at":"2024-07-31T19:13:07Z","title":"Gemma 2: Improving Open Language Models at a Practical Size","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00118","snapshot_observed_at":"2026-08-10T16:59:01.411181Z","title":"Gemma 2: Im- proving open language models at a practical size","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12689","last_updated":"2025-09-04T06:20:55Z","snapshot_observed_at":"2026-08-10T16:51:34.188333Z","submitted_at":"2025-01-22T07:52:38Z","title":"IC-Cache: Efficient Large Language Model Serving via In-context Caching","version":3},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-10T16:59:01.411181Z"},"links":{"cited_paper":"/paper/2408.00118","citing_paper":"/paper/2501.12689"},"observation_digest":"sha256:f180d16ddd168cedc6dc8568623e1408553d1c1ce983290cd05adec20a492608","observation_id":"95cd782d-7f5b-481f-8aa0-a38814cc11e8","resolution":{"observed_at":"2026-08-10T16:59:01.411181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:59:02.149698Z","title":null,"venue":null,"work_id":"5fa81ff4-1f78-470b-b097-02c1108a3bd4","year":2024},"citing_paper":{"arxiv_id":"2501.12689","last_updated":"2025-09-04T06:20:55Z","snapshot_observed_at":"2026-08-10T16:51:34.188333Z","submitted_at":"2025-01-22T07:52:38Z","title":"IC-Cache: Efficient Large Language Model Serving via In-context Caching","version":3},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-10T16:59:01.414581Z"},"links":{"citing_paper":"/paper/2501.12689"},"observation_digest":"sha256:c6bb454ccd640a35b4697b2c9f87760035e24a0762a66c9124ef6bb25333a91f","observation_id":"567a4a46-69a7-4919-a334-1efc461420a6","resolution":{"observed_at":"2026-08-10T16:59:02.152835Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.07682","last_updated":"2022-10-26T05:06:24Z","snapshot_observed_at":"2026-08-02T15:56:35.249569Z","submitted_at":"2022-06-15T17:32:01Z","title":"Emergent Abilities of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.07682","snapshot_observed_at":"2026-08-10T16:59:01.417721Z","title":"Emergent abilities of large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.12689","last_updated":"2025-09-04T06:20:55Z","snapshot_observed_at":"2026-08-10T16:51:34.188333Z","submitted_at":"2025-01-22T07:52:38Z","title":"IC-Cache: Efficient Large Language Model Serving via In-context Caching","version":3},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-10T16:59:01.417721Z"},"links":{"cited_paper":"/paper/2206.07682","citing_paper":"/paper/2501.12689"},"observation_digest":"sha256:d71b8b48069236bee0c935ce80e71c3bdccf03a669ca15724feab6c008eb17ed","observation_id":"e129664e-46f7-4ad3-8439-a31b468b8046","resolution":{"observed_at":"2026-08-10T16:59:01.417721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.05920","last_updated":"2024-09-25T05:57:51Z","snapshot_observed_at":"2026-08-09T14:08:47.340904Z","submitted_at":"2023-05-10T06:17:50Z","title":"Fast Distributed Inference Serving for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.05920","snapshot_observed_at":"2026-08-10T16:59:01.420549Z","title":"Fast dis- tributed inference serving for large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12689","last_updated":"2025-09-04T06:20:55Z","snapshot_observed_at":"2026-08-10T16:51:34.188333Z","submitted_at":"2025-01-22T07:52:38Z","title":"IC-Cache: Efficient Large Language Model Serving via In-context Caching","version":3},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-10T16:59:01.420549Z"},"links":{"cited_paper":"/paper/2305.05920","citing_paper":"/paper/2501.12689"},"observation_digest":"sha256:81d2c419124251a9c532910ce73096c1ddf6dc7ec62224fed074476949978077","observation_id":"52f8979c-3250-407b-8261-f1ee720fae31","resolution":{"observed_at":"2026-08-10T16:59:01.420549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:59:02.140286Z","title":"dLoRA: Dynamically orchestrating requests and adapters for LoRA LLM serving","venue":null,"work_id":"66c95250-9d4a-439d-9bf4-466d12f78f81","year":2024},"citing_paper":{"arxiv_id":"2501.12689","last_updated":"2025-09-04T06:20:55Z","snapshot_observed_at":"2026-08-10T16:51:34.188333Z","submitted_at":"2025-01-22T07:52:38Z","title":"IC-Cache: Efficient Large Language Model Serving via In-context Caching","version":3},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-10T16:59:01.423310Z"},"links":{"citing_paper":"/paper/2501.12689"},"observation_digest":"sha256:e624382e8c7739013254f7954e757954fc042b93ff9f5a0399a30a2e647daed1","observation_id":"5ec0c356-036f-414a-9093-2aff9256d5b1","resolution":{"observed_at":"2026-08-10T16:59:02.143575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:59:02.130357Z","title":"Why in-context learning models are good few-shot learners? In ICLR, 2025","venue":null,"work_id":"35021cbe-ca87-4bc3-9914-5a88bfdc3d2c","year":2025},"citing_paper":{"arxiv_id":"2501.12689","last_updated":"2025-09-04T06:20:55Z","snapshot_observed_at":"2026-08-10T16:51:34.188333Z","submitted_at":"2025-01-22T07:52:38Z","title":"IC-Cache: Efficient Large Language Model Serving via In-context Caching","version":3},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-10T16:59:01.426023Z"},"links":{"citing_paper":"/paper/2501.12689"},"observation_digest":"sha256:8692b0fe6e4d5533ed718d5789ba85a6413ca90b49da92dd510926c7ffb21863","observation_id":"4e61e9fa-c230-405c-b437-f0c5dc32a5e8","resolution":{"observed_at":"2026-08-10T16:59:02.133859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06282","last_updated":"2024-12-12T12:24:18Z","snapshot_observed_at":"2026-08-06T16:06:48.213787Z","submitted_at":"2024-06-10T14:01:21Z","title":"PowerInfer-2: Fast Large Language Model Inference on a Smartphone","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06282","snapshot_observed_at":"2026-08-10T16:59:01.428571Z","title":"Powerinfer-2: Fast large language model inference on a smart- phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12689","last_updated":"2025-09-04T06:20:55Z","snapshot_observed_at":"2026-08-10T16:51:34.188333Z","submitted_at":"2025-01-22T07:52:38Z","title":"IC-Cache: Efficient Large Language Model Serving via In-context Caching","version":3},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-10T16:59:01.428571Z"},"links":{"cited_paper":"/paper/2406.06282","citing_paper":"/paper/2501.12689"},"observation_digest":"sha256:f7190d03adbbcb0934f2a193382a8cb3b6143019c1f84c62727020c15b7fc26d","observation_id":"7c569c36-6cf0-4a3b-8347-14970b0e2415","resolution":{"observed_at":"2026-08-10T16:59:01.428571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16444","last_updated":"2025-04-03T22:49:22Z","snapshot_observed_at":"2026-08-07T00:11:38.883613Z","submitted_at":"2024-05-26T06:00:17Z","title":"CacheBlend: Fast Large Language Model Serving for RAG with Cached Knowledge Fusion","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16444","snapshot_observed_at":"2026-08-10T16:59:01.431548Z","title":"Cacheblend: Fast large language model serving with cached knowledge fusion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12689","last_updated":"2025-09-04T06:20:55Z","snapshot_observed_at":"2026-08-10T16:51:34.188333Z","submitted_at":"2025-01-22T07:52:38Z","title":"IC-Cache: Efficient Large Language Model Serving via In-context Caching","version":3},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-10T16:59:01.431548Z"},"links":{"cited_paper":"/paper/2405.16444","citing_paper":"/paper/2501.12689"},"observation_digest":"sha256:694ad8b37336d6ec56ae578d9b1a0179dd9abc92f32301f1d8071e0f825b52d1","observation_id":"a437b52c-ed8b-4a15-8e53-6e5611e3efb2","resolution":{"observed_at":"2026-08-10T16:59:01.431548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13917","last_updated":"2023-05-23T10:44:00Z","snapshot_observed_at":"2026-07-06T15:31:18.144952Z","submitted_at":"2023-05-23T10:44:00Z","title":"Generating Data for Symbolic Language with Large Language Models","version":1},"cited_work":{"arxiv_id":"2305.13917","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.13917","snapshot_observed_at":"2026-08-10T16:59:01.533940Z","title":"Generating Data for Symbolic Language with Large Language Models","venue":"cs.CL","work_id":"e9a06eb9-da33-4a75-bc82-cba529e9a0d9","year":2023},"citing_paper":{"arxiv_id":"2501.12689","last_updated":"2025-09-04T06:20:55Z","snapshot_observed_at":"2026-08-10T16:51:34.188333Z","submitted_at":"2025-01-22T07:52:38Z","title":"IC-Cache: Efficient Large Language Model Serving via In-context Caching","version":3},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-10T16:59:01.434253Z"},"links":{"cited_paper":"/paper/2305.13917","citing_paper":"/paper/2501.12689"},"observation_digest":"sha256:90e60da798f03fdd1a222a8a12e6c74fcc52ed4b51ef416757d696e17ec9afd7","observation_id":"ac1ef0f7-dd5d-4b55-9f7f-c44df8a7be25","resolution":{"observed_at":"2026-08-10T16:59:01.539371Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:59:02.121097Z","title":"Compositional exemplars for in-context learning","venue":null,"work_id":"198a0473-79d4-4434-859a-d766d9a22f20","year":2023},"citing_paper":{"arxiv_id":"2501.12689","last_updated":"2025-09-04T06:20:55Z","snapshot_observed_at":"2026-08-10T16:51:34.188333Z","submitted_at":"2025-01-22T07:52:38Z","title":"IC-Cache: Efficient Large Language Model Serving via In-context Caching","version":3},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-10T16:59:01.437310Z"},"links":{"citing_paper":"/paper/2501.12689"},"observation_digest":"sha256:8065a9f1f9c244a8e72b1aae4421bc4dd41690fa36cbff36aae16bf3c69fb1b9","observation_id":"fd80b406-6514-4059-b32c-6213b6ee35f1","resolution":{"observed_at":"2026-08-10T16:59:02.124312Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:59:02.111721Z","title":"Orca: A distributed serving system for{Transformer- Based} generative models","venue":null,"work_id":"817375cf-c5db-464c-860c-d8ff666b1359","year":2022},"citing_paper":{"arxiv_id":"2501.12689","last_updated":"2025-09-04T06:20:55Z","snapshot_observed_at":"2026-08-10T16:51:34.188333Z","submitted_at":"2025-01-22T07:52:38Z","title":"IC-Cache: Efficient Large Language Model Serving via In-context Caching","version":3},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-10T16:59:01.440027Z"},"links":{"citing_paper":"/paper/2501.12689"},"observation_digest":"sha256:9950cda22b15484d3095a23cf00495fc95166bdda08b15a12d0ab52cc4ef3d07","observation_id":"5d0ae6f1-7cb1-472d-bc84-92625cdb4022","resolution":{"observed_at":"2026-08-10T16:59:02.115345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:59:02.102893Z","title":"Longrag: A dual-perspective retrieval- augmented generation paradigm for long-context question answering","venue":null,"work_id":"8f5801cf-8e3e-43d2-9d73-700000c0744e","year":2024},"citing_paper":{"arxiv_id":"2501.12689","last_updated":"2025-09-04T06:20:55Z","snapshot_observed_at":"2026-08-10T16:51:34.188333Z","submitted_at":"2025-01-22T07:52:38Z","title":"IC-Cache: Efficient Large Language Model Serving via In-context Caching","version":3},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-10T16:59:01.442999Z"},"links":{"citing_paper":"/paper/2501.12689"},"observation_digest":"sha256:3ceaac7367b7fe7b31a4b47d85d3b980a5ee52f1a6d0f85afa86c113b935b5bd","observation_id":"28518b5b-a337-4f2c-9f10-67ee85eb4b12","resolution":{"observed_at":"2026-08-10T16:59:02.106458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11998","last_updated":"2024-03-10T19:34:57Z","snapshot_observed_at":"2026-07-06T16:21:45.588487Z","submitted_at":"2023-09-21T12:13:55Z","title":"LMSYS-Chat-1M: A Large-Scale Real-World LLM Conversation Dataset","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11998","snapshot_observed_at":"2026-08-10T16:59:01.446099Z","title":"Xing, Joseph E","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12689","last_updated":"2025-09-04T06:20:55Z","snapshot_observed_at":"2026-08-10T16:51:34.188333Z","submitted_at":"2025-01-22T07:52:38Z","title":"IC-Cache: Efficient Large Language Model Serving via In-context Caching","version":3},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-10T16:59:01.446099Z"},"links":{"cited_paper":"/paper/2309.11998","citing_paper":"/paper/2501.12689"},"observation_digest":"sha256:e935a8b0e85760bbadd23bf4d10bbcddd5044e57405e28b2066da3df8c48e133","observation_id":"299158f3-1257-4348-870e-49c0a38a585e","resolution":{"observed_at":"2026-08-10T16:59:01.446099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:59:02.094347Z","title":"Judging llm-as-a-judge with mt-bench and chatbot arena.NeurIPS, 2023","venue":null,"work_id":"af3a18cc-0274-43a8-a4ac-09c93b5696cb","year":2023},"citing_paper":{"arxiv_id":"2501.12689","last_updated":"2025-09-04T06:20:55Z","snapshot_observed_at":"2026-08-10T16:51:34.188333Z","submitted_at":"2025-01-22T07:52:38Z","title":"IC-Cache: Efficient Large Language Model Serving via In-context Caching","version":3},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-10T16:59:01.449572Z"},"links":{"citing_paper":"/paper/2501.12689"},"observation_digest":"sha256:47747c3f014701155dbc7e568f632299453cbf14c297310d379216bd33c9db01","observation_id":"745952cf-51da-46fe-b11f-2cf26ae7ff9a","resolution":{"observed_at":"2026-08-10T16:59:02.097402Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:59:02.085866Z","title":"Gonzalez, Clark Barrett, and Ying Sheng","venue":null,"work_id":"4d97aaa8-3dc5-4f60-b4e5-c15c58a5f0fb","year":2023},"citing_paper":{"arxiv_id":"2501.12689","last_updated":"2025-09-04T06:20:55Z","snapshot_observed_at":"2026-08-10T16:51:34.188333Z","submitted_at":"2025-01-22T07:52:38Z","title":"IC-Cache: Efficient Large Language Model Serving via In-context Caching","version":3},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-10T16:59:01.452502Z"},"links":{"citing_paper":"/paper/2501.12689"},"observation_digest":"sha256:8161f4289f069d5dd69805509d017f3942db5a47dd94ceff43779b2d5008124d","observation_id":"72e24730-f6f0-4451-ac9f-bf749807b0f8","resolution":{"observed_at":"2026-08-10T16:59:02.088761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09670","last_updated":"2024-06-06T15:50:51Z","snapshot_observed_at":"2026-08-05T00:28:57.370523Z","submitted_at":"2024-01-18T01:03:38Z","title":"DistServe: Disaggregating Prefill and Decoding for Goodput-optimized Large Language Model Serving","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.09670","snapshot_observed_at":"2026-08-10T16:59:01.455880Z","title":"Distserve: Disaggregating prefill and decoding for goodput-optimized large language model serving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12689","last_updated":"2025-09-04T06:20:55Z","snapshot_observed_at":"2026-08-10T16:51:34.188333Z","submitted_at":"2025-01-22T07:52:38Z","title":"IC-Cache: Efficient Large Language Model Serving via In-context Caching","version":3},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-10T16:59:01.455880Z"},"links":{"cited_paper":"/paper/2401.09670","citing_paper":"/paper/2501.12689"},"observation_digest":"sha256:b0bda032d68f3e14cbddd5125fee6facea457a05a5cfb9c0510565777e97e095","observation_id":"52914cab-38cd-435e-ba70-e6f7090abdba","resolution":{"observed_at":"2026-08-10T16:59:01.455880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:59:02.076753Z","title":"Distillspec: Improving speculative decoding via knowledge distillation, 2024","venue":null,"work_id":"b7fb9d5b-ec04-4d0b-9862-7390cfa46b0a","year":2024},"citing_paper":{"arxiv_id":"2501.12689","last_updated":"2025-09-04T06:20:55Z","snapshot_observed_at":"2026-08-10T16:51:34.188333Z","submitted_at":"2025-01-22T07:52:38Z","title":"IC-Cache: Efficient Large Language Model Serving via In-context Caching","version":3},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-10T16:59:01.459544Z"},"links":{"citing_paper":"/paper/2501.12689"},"observation_digest":"sha256:dbefbd797bbc29ef11ea78b8e2780fb9941d72ee14254e451e5d3321b26ddf4e","observation_id":"5b4d1226-6145-435e-961e-ed29311ae7da","resolution":{"observed_at":"2026-08-10T16:59:02.079945Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:59:02.067860Z","title":"We can bound this with the union bound: 𝑃(ˆ𝑖𝑇 ≠ 1)≤ 𝑁∑︁ 𝑖=2 𝑃(𝜇𝑖 >𝜇1) (2)","venue":null,"work_id":"0722841f-b2b9-4259-93f7-22a7ac07a59f","year":null},"citing_paper":{"arxiv_id":"2501.12689","last_updated":"2025-09-04T06:20:55Z","snapshot_observed_at":"2026-08-10T16:51:34.188333Z","submitted_at":"2025-01-22T07:52:38Z","title":"IC-Cache: Efficient Large Language Model Serving via In-context Caching","version":3},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-10T16:59:01.462700Z"},"links":{"citing_paper":"/paper/2501.12689"},"observation_digest":"sha256:166f0d8d207abf60e5747515fe587acc6e027428c0c0ad7c5da352108275a508","observation_id":"0a8c8721-424c-4d62-9124-cb322f5dac56","resolution":{"observed_at":"2026-08-10T16:59:02.070905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:59:02.057762Z","title":"We can state this more formally for the number of comparisons,𝑚𝑖(𝑇), for a sufficiently large T: 𝑚𝑖(𝑇)≥ 𝐾 log(𝑇) Δ2 𝑖 (3) where𝐾 is a positive constant","venue":null,"work_id":"8ba90d4d-b4fe-446c-8199-355864e21b07","year":null},"citing_paper":{"arxiv_id":"2501.12689","last_updated":"2025-09-04T06:20:55Z","snapshot_observed_at":"2026-08-10T16:51:34.188333Z","submitted_at":"2025-01-22T07:52:38Z","title":"IC-Cache: Efficient Large Language Model Serving via In-context Caching","version":3},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-10T16:59:01.465836Z"},"links":{"citing_paper":"/paper/2501.12689"},"observation_digest":"sha256:2b4294441c8ec3a0944989b23dbe527c88d982399145b30e20e3f4843bc256b6","observation_id":"fdef6cda-73fe-4b83-a309-51dda7a6e446","resolution":{"observed_at":"2026-08-10T16:59:02.061618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:59:02.048233Z","title":"Let the em- pirical difference be ˆΔ𝑖(𝑚) = 𝜇1−𝜇𝑖 after𝑚 compar- isons, whose true mean is the utility gap Δ𝑖 =𝑈1−𝑈𝑖","venue":null,"work_id":"4776f1c1-660a-4e0a-b2bd-181438ea6c7e","year":null},"citing_paper":{"arxiv_id":"2501.12689","last_updated":"2025-09-04T06:20:55Z","snapshot_observed_at":"2026-08-10T16:51:34.188333Z","submitted_at":"2025-01-22T07:52:38Z","title":"IC-Cache: Efficient Large Language Model Serving via In-context Caching","version":3},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-10T16:59:01.468915Z"},"links":{"citing_paper":"/paper/2501.12689"},"observation_digest":"sha256:235a7a9ef6438c416b4ee347e755592d2bb10e203f0150b02f5d756e5768df5e","observation_id":"29f295ec-864f-4b79-b281-308edef2edff","resolution":{"observed_at":"2026-08-10T16:59:02.051814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:59:02.038636Z","title":null,"venue":null,"work_id":"5bf39661-db61-407e-aa39-c764c8701f69","year":null},"citing_paper":{"arxiv_id":"2501.12689","last_updated":"2025-09-04T06:20:55Z","snapshot_observed_at":"2026-08-10T16:51:34.188333Z","submitted_at":"2025-01-22T07:52:38Z","title":"IC-Cache: Efficient Large Language Model Serving via In-context Caching","version":3},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-10T16:59:01.472164Z"},"links":{"citing_paper":"/paper/2501.12689"},"observation_digest":"sha256:ff1fe613adcb3a8573c3a49c86d4f8e99e21665bfc143635589e4f461c2650fe","observation_id":"f823556b-fdd4-4bbf-b6c4-68c904ce3010","resolution":{"observed_at":"2026-08-10T16:59:02.042112Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:59:02.028867Z","title":"Substitut- ing this result back into the union bound from step 1 gives the final bound","venue":null,"work_id":"44259f8c-ba36-446c-acb3-e0a0de321a35","year":2025},"citing_paper":{"arxiv_id":"2501.12689","last_updated":"2025-09-04T06:20:55Z","snapshot_observed_at":"2026-08-10T16:51:34.188333Z","submitted_at":"2025-01-22T07:52:38Z","title":"IC-Cache: Efficient Large Language Model Serving via In-context Caching","version":3},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-10T16:59:01.475312Z"},"links":{"citing_paper":"/paper/2501.12689"},"observation_digest":"sha256:6c8bac8f02b812725ac5917e73b02a8a7c909936ffabe631e723ca0d248acefa","observation_id":"8b09cd53-4a64-4bdd-978b-c201b058ab8d","resolution":{"observed_at":"2026-08-10T16:59:02.032253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:59:02.019295Z","title":null,"venue":null,"work_id":"40312ec2-87b5-4597-b0d0-cee3d252c0c8","year":null},"citing_paper":{"arxiv_id":"2501.12689","last_updated":"2025-09-04T06:20:55Z","snapshot_observed_at":"2026-08-10T16:51:34.188333Z","submitted_at":"2025-01-22T07:52:38Z","title":"IC-Cache: Efficient Large Language Model Serving via In-context Caching","version":3},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-10T16:59:01.478487Z"},"links":{"citing_paper":"/paper/2501.12689"},"observation_digest":"sha256:6c8fa694567a49f7110cdc667cfea20d24a923e3a241e7dc47bc876bc01c2388","observation_id":"6df4f04f-d3fe-4924-9082-5c8d802e3434","resolution":{"observed_at":"2026-08-10T16:59:02.022550Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:59:02.009604Z","title":null,"venue":null,"work_id":"f20b016b-5375-4bf3-88e6-f5e0b5e4690f","year":null},"citing_paper":{"arxiv_id":"2501.12689","last_updated":"2025-09-04T06:20:55Z","snapshot_observed_at":"2026-08-10T16:51:34.188333Z","submitted_at":"2025-01-22T07:52:38Z","title":"IC-Cache: Efficient Large Language Model Serving via In-context Caching","version":3},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-10T16:59:01.481708Z"},"links":{"citing_paper":"/paper/2501.12689"},"observation_digest":"sha256:4d4b5624564dfb7392f713d331571b43772ea5fb87f9240028b3095f44d36262","observation_id":"9152419b-e6e1-4fb5-af5b-d387d722330a","resolution":{"observed_at":"2026-08-10T16:59:02.012709Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:59:02.000317Z","title":null,"venue":null,"work_id":"abb0edbc-6745-4cba-8651-c42abd9a1da3","year":null},"citing_paper":{"arxiv_id":"2501.12689","last_updated":"2025-09-04T06:20:55Z","snapshot_observed_at":"2026-08-10T16:51:34.188333Z","submitted_at":"2025-01-22T07:52:38Z","title":"IC-Cache: Efficient Large Language Model Serving via In-context Caching","version":3},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-10T16:59:01.484719Z"},"links":{"citing_paper":"/paper/2501.12689"},"observation_digest":"sha256:35dc0e19e6863ee9121e0bec661eeb0deae09a9159e3e3a2ae4881042fafa604","observation_id":"aac84641-c28b-4673-86ee-cb524d096197","resolution":{"observed_at":"2026-08-10T16:59:02.003421Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:59:01.990309Z","title":null,"venue":null,"work_id":"49b49519-473e-4638-a2e2-057577551e91","year":2025},"citing_paper":{"arxiv_id":"2501.12689","last_updated":"2025-09-04T06:20:55Z","snapshot_observed_at":"2026-08-10T16:51:34.188333Z","submitted_at":"2025-01-22T07:52:38Z","title":"IC-Cache: Efficient Large Language Model Serving via In-context Caching","version":3},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-10T16:59:01.487312Z"},"links":{"citing_paper":"/paper/2501.12689"},"observation_digest":"sha256:70449d69684b5b72e22302d057e62d5c8fd3eb5a6f95442b62101ada807e21c6","observation_id":"bb69b9a2-e6f5-45fd-b009-dbb4adbd88f4","resolution":{"observed_at":"2026-08-10T16:59:01.994092Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.12689","last_updated":"2025-09-04T06:20:55Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-10T16:51:34.188333Z","submitted_at":"2025-01-22T07:52:38Z","title":"IC-Cache: Efficient Large Language Model Serving via In-context Caching"},"reference_resolution":{"displayed":92,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":54,"verified_exact":2,"verified_fuzzy":36},"total_outbound_references":92},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 92 of 92 outbound references and 1 inbound Pith citation observation for arXiv:2501.12689."}