{"as_of":"2026-08-19T21:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:85d3cc952c37e10510fa8c28c2c6732ac7a16d2ea08f49fdbe8dbb2dd0a3dcae","coverage":[{"denominator":58,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":58,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T22:27:53.745929Z","state":"measured"},{"denominator":62,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":62,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T12:55:10.063756Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-18T08:51:08.950391Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.07203","last_updated":"2025-05-12T03:22:29Z","snapshot_observed_at":"2026-08-15T22:20:20.959357Z","submitted_at":"2025-05-12T03:22:29Z","title":"PrefillOnly: An Inference Engine for Prefill-only Workloads in Large Language Model Applications","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07203","snapshot_observed_at":"2026-08-04T12:55:10.063756Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.01565","last_updated":"2026-06-18T01:08:24Z","snapshot_observed_at":"2026-08-10T05:37:30.922463Z","submitted_at":"2025-10-02T01:23:32Z","title":"TetriServe: Efficiently Serving Mixed DiT Workloads","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T12:55:10.063756Z"},"links":{"cited_paper":"/paper/2505.07203","citing_paper":"/paper/2510.01565"},"observation_digest":"sha256:6b2a2d6c25a77bae41d4996c84c73b44827b1ec97d09efedb298b2c60a165c5b","observation_id":"eb2e10b5-71de-4c19-8415-8f9c15abf136","resolution":{"observed_at":"2026-08-04T12:55:10.063756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07203","last_updated":"2025-05-12T03:22:29Z","snapshot_observed_at":"2026-08-15T22:20:20.959357Z","submitted_at":"2025-05-12T03:22:29Z","title":"PrefillOnly: An Inference Engine for Prefill-only Workloads in Large Language Model Applications","version":1},"cited_work":{"arxiv_id":"2505.07203","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.07203","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"PrefillOnly: An Inference Engine for Prefill-only Workloads in Large Language Model Applications.arXiv preprint arXiv:2505.07203","venue":null,"work_id":"23f46b9d-8549-49c9-955d-9dff02ed53f4","year":2025},"citing_paper":{"arxiv_id":"2510.08055","last_updated":"2026-04-16T12:39:23Z","snapshot_observed_at":"2026-08-07T14:10:12.842070Z","submitted_at":"2025-10-09T10:41:35Z","title":"From Tokens to Layers: Redefining Stall-Free Scheduling for MoE Serving with Layered Prefill","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-18T08:47:29.759674Z"},"links":{"cited_paper":"/paper/2505.07203","citing_paper":"/paper/2510.08055"},"observation_digest":"sha256:b8ea057968f6964fa4455ba78d52f725394d6e32482e9a7a94dce959902127a8","observation_id":"80f2c909-7b31-4f36-b684-7462641c5c4f","resolution":{"observed_at":"2026-05-18T08:51:08.952905Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07203","last_updated":"2025-05-12T03:22:29Z","snapshot_observed_at":"2026-08-15T22:20:20.959357Z","submitted_at":"2025-05-12T03:22:29Z","title":"PrefillOnly: An Inference Engine for Prefill-only Workloads in Large Language Model Applications","version":1},"cited_work":{"arxiv_id":"2505.07203","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.07203","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"PrefillOnly: An Inference Engine for Prefill-only Workloads in Large Language Model Applications.arXiv preprint arXiv:2505.07203","venue":null,"work_id":"23f46b9d-8549-49c9-955d-9dff02ed53f4","year":2025},"citing_paper":{"arxiv_id":"2604.18529","last_updated":"2026-04-20T17:25:44Z","snapshot_observed_at":"2026-08-12T17:05:28.384765Z","submitted_at":"2026-04-20T17:25:44Z","title":"HybridGen: Efficient LLM Generative Inference via CPU-GPU Hybrid Computing","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T02:48:18.330339Z"},"links":{"cited_paper":"/paper/2505.07203","citing_paper":"/paper/2604.18529"},"observation_digest":"sha256:3aaf16980ef362a1d459fa3a45b30cee77c5f18084f44c3f4d0345912c08b10b","observation_id":"f8d7267a-7304-4f84-a113-e6452afaff3c","resolution":{"observed_at":"2026-05-10T02:48:27.073874Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07203","last_updated":"2025-05-12T03:22:29Z","snapshot_observed_at":"2026-08-15T22:20:20.959357Z","submitted_at":"2025-05-12T03:22:29Z","title":"PrefillOnly: An Inference Engine for Prefill-only Workloads in Large Language Model Applications","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07203","snapshot_observed_at":"2026-08-01T19:51:03.178136Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16836","last_updated":"2026-07-27T11:12:03Z","snapshot_observed_at":"2026-08-18T18:30:36.245041Z","submitted_at":"2026-07-18T14:21:39Z","title":"Beyond Storage: State as a Runtime Control Problem in Parallel and Distributed Systems","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-01T19:51:03.178136Z"},"links":{"cited_paper":"/paper/2505.07203","citing_paper":"/paper/2607.16836"},"observation_digest":"sha256:15b21808ac9e866b9b75f48d18f6c65f5ad6742137811c395c1b36351ba3738b","observation_id":"5179647a-9af1-4c01-919e-362ad2d2382b","resolution":{"observed_at":"2026-08-01T19:51:03.178136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.07203/citation-record","integrity":"/paper/2505.07203/integrity","json":"/paper/2505.07203/citation-record.json","paper":"/paper/2505.07203"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:27:54.766083Z","title":"https: //character.ai/","venue":null,"work_id":"68d36a09-503b-4179-b9dc-4e0723ef6180","year":2024},"citing_paper":{"arxiv_id":"2505.07203","last_updated":"2025-05-12T03:22:29Z","snapshot_observed_at":"2026-08-15T22:20:20.959357Z","submitted_at":"2025-05-12T03:22:29Z","title":"PrefillOnly: An Inference Engine for Prefill-only Workloads in Large Language Model Applications","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T22:27:53.459444Z"},"links":{"citing_paper":"/paper/2505.07203"},"observation_digest":"sha256:7c6e8353d29c7239f280a3c4a7c8a2ecf932ff05e886219bff4f9a3440c1b46f","observation_id":"0243f9e1-63e6-4859-ac0a-d6beb68c31c6","resolution":{"observed_at":"2026-08-15T22:27:54.771323Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:27:54.747505Z","title":"[Online; accessed 2025-04-17]","venue":null,"work_id":"22ae86d6-600a-4898-a1c7-4264db427d57","year":2025},"citing_paper":{"arxiv_id":"2505.07203","last_updated":"2025-05-12T03:22:29Z","snapshot_observed_at":"2026-08-15T22:20:20.959357Z","submitted_at":"2025-05-12T03:22:29Z","title":"PrefillOnly: An Inference Engine for Prefill-only Workloads in Large Language Model Applications","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T22:27:53.465242Z"},"links":{"citing_paper":"/paper/2505.07203"},"observation_digest":"sha256:539b71903357d62863745af5600153f361b57b7c06b3b933a35a52f2aecd9ba3","observation_id":"53d40eb0-3707-4757-b408-28f2da28b813","resolution":{"observed_at":"2026-08-15T22:27:54.752863Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:27:54.730170Z","title":"Taming{Throughput-Latency} tradeoff in{LLM} inference with {Sarathi-Serve}","venue":null,"work_id":"611e2472-4ebf-4398-988e-bef8c761a83f","year":2024},"citing_paper":{"arxiv_id":"2505.07203","last_updated":"2025-05-12T03:22:29Z","snapshot_observed_at":"2026-08-15T22:20:20.959357Z","submitted_at":"2025-05-12T03:22:29Z","title":"PrefillOnly: An Inference Engine for Prefill-only Workloads in Large Language Model Applications","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T22:27:53.470802Z"},"links":{"citing_paper":"/paper/2505.07203"},"observation_digest":"sha256:5e08b4c05f6e5aef0442b838fc8e59f0f1c8bf46aac654081b01dda413fd1009","observation_id":"3bf8fc66-045e-467d-ad8f-671410d9738d","resolution":{"observed_at":"2026-08-15T22:27:54.735576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:27:54.711257Z","title":"Pytorch 2: Faster machine learning through dynamic python bytecode transformation and graph compilation","venue":null,"work_id":"39bb0e39-2849-44f9-987a-f686b689d599","year":2024},"citing_paper":{"arxiv_id":"2505.07203","last_updated":"2025-05-12T03:22:29Z","snapshot_observed_at":"2026-08-15T22:20:20.959357Z","submitted_at":"2025-05-12T03:22:29Z","title":"PrefillOnly: An Inference Engine for Prefill-only Workloads in Large Language Model Applications","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T22:27:53.475751Z"},"links":{"citing_paper":"/paper/2505.07203"},"observation_digest":"sha256:99b0239dd9458c117ede3f8d0ae32e3c4605053af03fdcf862594ee6828c61a3","observation_id":"bf5283b4-44a0-4f54-b508-f081fe947733","resolution":{"observed_at":"2026-08-15T22:27:54.717255Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:27:54.693183Z","title":"The ai code editor","venue":null,"work_id":"618ebb5b-faac-4c21-b2dd-2ef28c63603b","year":2025},"citing_paper":{"arxiv_id":"2505.07203","last_updated":"2025-05-12T03:22:29Z","snapshot_observed_at":"2026-08-15T22:20:20.959357Z","submitted_at":"2025-05-12T03:22:29Z","title":"PrefillOnly: An Inference Engine for Prefill-only Workloads in Large Language Model Applications","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T22:27:53.480802Z"},"links":{"citing_paper":"/paper/2505.07203"},"observation_digest":"sha256:7e0238508a47d1f9b13b77e75b4ea679a551fcf62dcc390257eca456e1390115","observation_id":"ea0f3eef-bd27-4fbe-99c8-d8ab76bd2752","resolution":{"observed_at":"2026-08-15T22:27:54.698347Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:27:54.674539Z","title":"Glimpse: Continuous, real-time object recog- nition on mobile devices","venue":null,"work_id":"ad2d1fb4-ad51-4e21-a836-9789dba98a81","year":2015},"citing_paper":{"arxiv_id":"2505.07203","last_updated":"2025-05-12T03:22:29Z","snapshot_observed_at":"2026-08-15T22:20:20.959357Z","submitted_at":"2025-05-12T03:22:29Z","title":"PrefillOnly: An Inference Engine for Prefill-only Workloads in Large Language Model Applications","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T22:27:53.485859Z"},"links":{"citing_paper":"/paper/2505.07203"},"observation_digest":"sha256:310e35c0cfb33140c495d5f7cd7b95a9b5e81cd7070b7c86d3bc210a7b1e36f8","observation_id":"b9b9b9d6-3fd9-41da-ae41-a92fbcb18c4f","resolution":{"observed_at":"2026-08-15T22:27:54.681002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:27:54.657606Z","title":"Feature engineering for machine learning and data analytics","venue":null,"work_id":"998da241-0e20-455c-8105-ec886abac255","year":2018},"citing_paper":{"arxiv_id":"2505.07203","last_updated":"2025-05-12T03:22:29Z","snapshot_observed_at":"2026-08-15T22:20:20.959357Z","submitted_at":"2025-05-12T03:22:29Z","title":"PrefillOnly: An Inference Engine for Prefill-only Workloads in Large Language Model Applications","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T22:27:53.491208Z"},"links":{"citing_paper":"/paper/2505.07203"},"observation_digest":"sha256:ac307e5e88f0576935e30b8479059067c794a9dd47e39061431cf0f394be57c1","observation_id":"dd654ef5-101c-418e-a198-43a3279fafe2","resolution":{"observed_at":"2026-08-15T22:27:54.663159Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15100","last_updated":"2025-05-12T08:20:08Z","snapshot_observed_at":"2026-08-17T10:14:29.652014Z","submitted_at":"2024-11-22T18:01:37Z","title":"XGrammar: Flexible and Efficient Structured Generation Engine for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15100","snapshot_observed_at":"2026-08-15T22:27:53.495832Z","title":"Xgrammar: Flexible and efficient struc- tured generation engine for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07203","last_updated":"2025-05-12T03:22:29Z","snapshot_observed_at":"2026-08-15T22:20:20.959357Z","submitted_at":"2025-05-12T03:22:29Z","title":"PrefillOnly: An Inference Engine for Prefill-only Workloads in Large Language Model Applications","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T22:27:53.495832Z"},"links":{"cited_paper":"/paper/2411.15100","citing_paper":"/paper/2505.07203"},"observation_digest":"sha256:e04d76195298a6fcebc5e0bf1cd0e70c61bc329d250c355387956bfd1598ab23","observation_id":"e9d28194-8d4e-46e4-8d4e-5690219f1d89","resolution":{"observed_at":"2026-08-15T22:27:53.495832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:27:54.640741Z","title":"Oneadapt: Fast adaptation for deep learning applications via back- propagation","venue":null,"work_id":"78fba8be-f267-49c6-902f-f2bb720b088c","year":2023},"citing_paper":{"arxiv_id":"2505.07203","last_updated":"2025-05-12T03:22:29Z","snapshot_observed_at":"2026-08-15T22:20:20.959357Z","submitted_at":"2025-05-12T03:22:29Z","title":"PrefillOnly: An Inference Engine for Prefill-only Workloads in Large Language Model Applications","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T22:27:53.500782Z"},"links":{"citing_paper":"/paper/2505.07203"},"observation_digest":"sha256:fe9f988b3a4221801f7f04c9175b624152d179f374a71019d4cebc1206e2d37e","observation_id":"01c3e016-8daa-4660-b225-d83c3c8a69e6","resolution":{"observed_at":"2026-08-15T22:27:54.646204Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:27:54.623765Z","title":"Accmpeg: Optimizing video encoding for accurate video analytics","venue":null,"work_id":"843fb561-b38c-49c8-b72f-8dccf4b8b35a","year":2022},"citing_paper":{"arxiv_id":"2505.07203","last_updated":"2025-05-12T03:22:29Z","snapshot_observed_at":"2026-08-15T22:20:20.959357Z","submitted_at":"2025-05-12T03:22:29Z","title":"PrefillOnly: An Inference Engine for Prefill-only Workloads in Large Language Model Applications","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T22:27:53.505752Z"},"links":{"citing_paper":"/paper/2505.07203"},"observation_digest":"sha256:d249e28506ceeca2797b8fe0d7b059476f7672ccbf6d5d481e3c5494a89fc4d7","observation_id":"e9c30c07-e086-4ae1-afaa-1bb06b2273dd","resolution":{"observed_at":"2026-08-15T22:27:54.629176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00566","last_updated":"2024-02-18T01:24:17Z","snapshot_observed_at":"2026-08-16T14:56:10.678984Z","submitted_at":"2023-10-01T03:50:34Z","title":"Empowering Many, Biasing a Few: Generalist Credit Scoring through Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00566","snapshot_observed_at":"2026-08-15T22:27:53.510969Z","title":"Empowering many, biasing a few: Generalist credit scoring through large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.07203","last_updated":"2025-05-12T03:22:29Z","snapshot_observed_at":"2026-08-15T22:20:20.959357Z","submitted_at":"2025-05-12T03:22:29Z","title":"PrefillOnly: An Inference Engine for Prefill-only Workloads in Large Language Model Applications","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T22:27:53.510969Z"},"links":{"cited_paper":"/paper/2310.00566","citing_paper":"/paper/2505.07203"},"observation_digest":"sha256:cbed7a0cc9f4a7a0db35ee2566ba146a39270ff9056fa3038889e5c927097e7d","observation_id":"fd00cd96-e99b-45a2-86cf-6162d77e606f","resolution":{"observed_at":"2026-08-15T22:27:53.510969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:27:53.516094Z","title":"360brew: A decoder-only foundation model for personalized ranking and recommendation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.07203","last_updated":"2025-05-12T03:22:29Z","snapshot_observed_at":"2026-08-15T22:20:20.959357Z","submitted_at":"2025-05-12T03:22:29Z","title":"PrefillOnly: An Inference Engine for Prefill-only Workloads in Large Language Model Applications","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T22:27:53.516094Z"},"links":{"citing_paper":"/paper/2505.07203"},"observation_digest":"sha256:67087e38a096030890422535f0328d4bc31c923448221e6568a70a083ec84286","observation_id":"4919d590-6d62-4440-ba4f-6481f1d2c410","resolution":{"observed_at":"2026-08-15T22:27:53.516094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:27:53.520895Z","title":"Gpt-3: Its nature, scope, limits, and consequences","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.07203","last_updated":"2025-05-12T03:22:29Z","snapshot_observed_at":"2026-08-15T22:20:20.959357Z","submitted_at":"2025-05-12T03:22:29Z","title":"PrefillOnly: An Inference Engine for Prefill-only Workloads in Large Language Model Applications","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T22:27:53.520895Z"},"links":{"citing_paper":"/paper/2505.07203"},"observation_digest":"sha256:eb628f04439ba5eae5f0f551818896f06e158ffd8548195d0a437cf42b5a69fd","observation_id":"a6044832-a151-4b28-ab8c-a25cf61898ab","resolution":{"observed_at":"2026-08-15T22:27:53.520895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:27:54.586680Z","title":"Github copilot - write code faster","venue":null,"work_id":"5b223cd8-c269-4c6d-8b8b-62643787807e","year":2025},"citing_paper":{"arxiv_id":"2505.07203","last_updated":"2025-05-12T03:22:29Z","snapshot_observed_at":"2026-08-15T22:20:20.959357Z","submitted_at":"2025-05-12T03:22:29Z","title":"PrefillOnly: An Inference Engine for Prefill-only Workloads in Large Language Model Applications","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T22:27:53.525803Z"},"links":{"citing_paper":"/paper/2505.07203"},"observation_digest":"sha256:abec04a8faa1367fd22227fbe287ac5782160029bcbe4ec6b057861a98b2a25c","observation_id":"5b5c677f-e06e-4c82-a30f-12d19dbcc643","resolution":{"observed_at":"2026-08-15T22:27:54.592014Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:27:54.571226Z","title":"Tiresias: A {GPU} cluster manager for distributed deep learning","venue":null,"work_id":"1cc3701a-ea2d-4226-aed3-448339ae9b5c","year":2019},"citing_paper":{"arxiv_id":"2505.07203","last_updated":"2025-05-12T03:22:29Z","snapshot_observed_at":"2026-08-15T22:20:20.959357Z","submitted_at":"2025-05-12T03:22:29Z","title":"PrefillOnly: An Inference Engine for Prefill-only Workloads in Large Language Model Applications","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T22:27:53.530420Z"},"links":{"citing_paper":"/paper/2505.07203"},"observation_digest":"sha256:8003146686965169fe416ae8e729690f3b694b5ac7d24477d3f6767b24f34b36","observation_id":"87bf785e-f30f-46f5-bde2-8443c4eac836","resolution":{"observed_at":"2026-08-15T22:27:54.575925Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.16854","last_updated":"2024-04-05T15:19:19Z","snapshot_observed_at":"2026-08-16T15:44:19.759726Z","submitted_at":"2023-03-29T17:03:21Z","title":"AnnoLLM: Making Large Language Models to Be Better Crowdsourced Annotators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.16854","snapshot_observed_at":"2026-08-15T22:27:53.535008Z","title":"Annollm: Making large language models to be better crowdsourced annotators","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07203","last_updated":"2025-05-12T03:22:29Z","snapshot_observed_at":"2026-08-15T22:20:20.959357Z","submitted_at":"2025-05-12T03:22:29Z","title":"PrefillOnly: An Inference Engine for Prefill-only Workloads in Large Language Model Applications","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T22:27:53.535008Z"},"links":{"cited_paper":"/paper/2303.16854","citing_paper":"/paper/2505.07203"},"observation_digest":"sha256:3896ca880a713c948f80658400edc7162917d76436d9072c44224c2855761543","observation_id":"b9c6bfc9-2db1-4ff4-bbd7-c9a99cb3d920","resolution":{"observed_at":"2026-08-15T22:27:53.535008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-17T08:27:45.946180Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-15T22:27:53.540334Z","title":"Kvquant: Towards 10 million context length llm inference with kv cache quanti- zation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07203","last_updated":"2025-05-12T03:22:29Z","snapshot_observed_at":"2026-08-15T22:20:20.959357Z","submitted_at":"2025-05-12T03:22:29Z","title":"PrefillOnly: An Inference Engine for Prefill-only Workloads in Large Language Model Applications","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T22:27:53.540334Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2505.07203"},"observation_digest":"sha256:181aa299c3a38c67b398dc5ef30961679d6bbffce32ce9401ac30d85d674564d","observation_id":"070ec353-da31-46bf-9097-ec604a14edf7","resolution":{"observed_at":"2026-08-15T22:27:53.540334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:27:54.556245Z","title":"Epic: Efficient position-independent context caching for serving large language models, 2024","venue":null,"work_id":"0bb0a320-8d97-4262-9f02-e978d073f254","year":2024},"citing_paper":{"arxiv_id":"2505.07203","last_updated":"2025-05-12T03:22:29Z","snapshot_observed_at":"2026-08-15T22:20:20.959357Z","submitted_at":"2025-05-12T03:22:29Z","title":"PrefillOnly: An Inference Engine for Prefill-only Workloads in Large Language Model Applications","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T22:27:53.545556Z"},"links":{"citing_paper":"/paper/2505.07203"},"observation_digest":"sha256:9edd15d763f4ea24924c779d4c7bca813ac40eaafc93f223c76be4d4860d4612","observation_id":"87b1e661-6b83-44e0-b97f-63c38887672c","resolution":{"observed_at":"2026-08-15T22:27:54.561055Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12457","last_updated":"2024-04-25T06:47:57Z","snapshot_observed_at":"2026-08-19T19:49:59.264961Z","submitted_at":"2024-04-18T18:32:30Z","title":"RAGCache: Efficient Knowledge Caching for Retrieval-Augmented Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12457","snapshot_observed_at":"2026-08-15T22:27:53.550541Z","title":"Ragcache: Efficient knowledge caching for retrieval- augmented generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07203","last_updated":"2025-05-12T03:22:29Z","snapshot_observed_at":"2026-08-15T22:20:20.959357Z","submitted_at":"2025-05-12T03:22:29Z","title":"PrefillOnly: An Inference Engine for Prefill-only Workloads in Large Language Model Applications","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T22:27:53.550541Z"},"links":{"cited_paper":"/paper/2404.12457","citing_paper":"/paper/2505.07203"},"observation_digest":"sha256:10b19111922a63edd4fc0bcde4720c857d8d3382425b4992206dd24735c7bb11","observation_id":"afae9e35-653b-42c7-86ab-913980a668e6","resolution":{"observed_at":"2026-08-15T22:27:53.550541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:27:54.541986Z","title":"Gear: An efficient kv cache com- pression recipe for near-lossless generative inference of llm, 2024","venue":null,"work_id":"79beb729-78f8-40e4-96bf-ed47d2989a4a","year":2024},"citing_paper":{"arxiv_id":"2505.07203","last_updated":"2025-05-12T03:22:29Z","snapshot_observed_at":"2026-08-15T22:20:20.959357Z","submitted_at":"2025-05-12T03:22:29Z","title":"PrefillOnly: An Inference Engine for Prefill-only Workloads in Large Language Model Applications","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T22:27:53.555355Z"},"links":{"citing_paper":"/paper/2505.07203"},"observation_digest":"sha256:cc20b1385b6554ac63eeda3b69ea030a2f94791cbfebdf5b92e87a74b13d0f3d","observation_id":"d26bc59e-c4cb-4528-b497-48d5f1fe3b59","resolution":{"observed_at":"2026-08-15T22:27:54.546569Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:27:54.527458Z","title":"Over-fitting and model tuning","venue":null,"work_id":"4800ebd0-15d6-4112-987d-d58ab3d7a7bd","year":2013},"citing_paper":{"arxiv_id":"2505.07203","last_updated":"2025-05-12T03:22:29Z","snapshot_observed_at":"2026-08-15T22:20:20.959357Z","submitted_at":"2025-05-12T03:22:29Z","title":"PrefillOnly: An Inference Engine for Prefill-only Workloads in Large Language Model Applications","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T22:27:53.559851Z"},"links":{"citing_paper":"/paper/2505.07203"},"observation_digest":"sha256:b3297aa3c571d910bd37c2a1ba225bfe45baf0771e4b7f4453ce3af150fafb24","observation_id":"24550dde-8603-49d5-8f9d-0c92bdc5ac57","resolution":{"observed_at":"2026-08-15T22:27:54.532326Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:27:54.513298Z","title":"Efficient memory management for large language model serving with 13 pagedattention","venue":null,"work_id":"80d34322-d247-4a50-95d6-0bc9aee81da4","year":2023},"citing_paper":{"arxiv_id":"2505.07203","last_updated":"2025-05-12T03:22:29Z","snapshot_observed_at":"2026-08-15T22:20:20.959357Z","submitted_at":"2025-05-12T03:22:29Z","title":"PrefillOnly: An Inference Engine for Prefill-only Workloads in Large Language Model Applications","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T22:27:53.564979Z"},"links":{"citing_paper":"/paper/2505.07203"},"observation_digest":"sha256:6e7bb39f9956515cba209d55409216834be936cf94936e7b137511e488dcd65f","observation_id":"7a2840c0-8f67-4532-a4f5-63002c5bcb22","resolution":{"observed_at":"2026-08-15T22:27:54.517795Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:27:53.569776Z","title":"Efficient memory management for large language model serving with pagedattention","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07203","last_updated":"2025-05-12T03:22:29Z","snapshot_observed_at":"2026-08-15T22:20:20.959357Z","submitted_at":"2025-05-12T03:22:29Z","title":"PrefillOnly: An Inference Engine for Prefill-only Workloads in Large Language Model Applications","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T22:27:53.569776Z"},"links":{"citing_paper":"/paper/2505.07203"},"observation_digest":"sha256:8a4fdd8ef98cc0e92baf3d51a227cf2524a27440dfc3728b3594114dcf967336","observation_id":"a8a825b4-1a37-424a-91a2-8606daec7c64","resolution":{"observed_at":"2026-08-15T22:27:53.569776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.01238","last_updated":"2023-05-07T10:57:51Z","snapshot_observed_at":"2026-08-17T16:47:59.863740Z","submitted_at":"2023-04-03T10:27:53Z","title":"Spam-T5: Benchmarking Large Language Models for Few-Shot Email Spam Detection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.01238","snapshot_observed_at":"2026-08-15T22:27:53.574575Z","title":"Spam-t5: Benchmarking large language models for few-shot email spam detection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07203","last_updated":"2025-05-12T03:22:29Z","snapshot_observed_at":"2026-08-15T22:20:20.959357Z","submitted_at":"2025-05-12T03:22:29Z","title":"PrefillOnly: An Inference Engine for Prefill-only Workloads in Large Language Model Applications","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T22:27:53.574575Z"},"links":{"cited_paper":"/paper/2304.01238","citing_paper":"/paper/2505.07203"},"observation_digest":"sha256:d439e415fd58f171a0e78357bfbcc2e4d2787f8cdf47679f6733b2d1abd89f89","observation_id":"3af2354d-a1b5-4add-80e9-ae4b4bc9219a","resolution":{"observed_at":"2026-08-15T22:27:53.574575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:27:53.579596Z","title":"Depression detection on social media with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07203","last_updated":"2025-05-12T03:22:29Z","snapshot_observed_at":"2026-08-15T22:20:20.959357Z","submitted_at":"2025-05-12T03:22:29Z","title":"PrefillOnly: An Inference Engine for Prefill-only Workloads in Large Language Model Applications","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T22:27:53.579596Z"},"links":{"citing_paper":"/paper/2505.07203"},"observation_digest":"sha256:b553fd348a06f989e891ff2ba03c23f38dd8ff0fd2554cbb53eb89df388edc05","observation_id":"c4d1eb7f-1ea4-4c94-87a7-cf06ed827ba1","resolution":{"observed_at":"2026-08-15T22:27:53.579596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:27:54.490671Z","title":"Reducto: On-camera filtering for resource-efficient real-time video analytics","venue":null,"work_id":"5c6c364e-b9b6-44b7-9aff-dd80306765ab","year":2020},"citing_paper":{"arxiv_id":"2505.07203","last_updated":"2025-05-12T03:22:29Z","snapshot_observed_at":"2026-08-15T22:20:20.959357Z","submitted_at":"2025-05-12T03:22:29Z","title":"PrefillOnly: An Inference Engine for Prefill-only Workloads in Large Language Model Applications","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T22:27:53.584164Z"},"links":{"citing_paper":"/paper/2505.07203"},"observation_digest":"sha256:3c63dc1fafcee1fc12224557fe4f10e3c3e1bfd2bbee03879a27586bb78de96d","observation_id":"40c1f9e7-a35a-4767-85d1-9e452da647be","resolution":{"observed_at":"2026-08-15T22:27:54.495183Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:27:53.588957Z","title":"Terapipe: Token-level pipeline parallelism for training large-scale language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.07203","last_updated":"2025-05-12T03:22:29Z","snapshot_observed_at":"2026-08-15T22:20:20.959357Z","submitted_at":"2025-05-12T03:22:29Z","title":"PrefillOnly: An Inference Engine for Prefill-only Workloads in Large Language Model Applications","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T22:27:53.588957Z"},"links":{"citing_paper":"/paper/2505.07203"},"observation_digest":"sha256:4a68976f679f3405bedf30085141e9a8f02071a63a7e171f2d817248876eaecc","observation_id":"3217ccf5-0339-4387-a970-07e14193a430","resolution":{"observed_at":"2026-08-15T22:27:53.588957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:27:54.466647Z","title":"Edge assisted real-time object detection for mobile augmented reality","venue":null,"work_id":"d2e5a968-2731-4820-ad95-a2718b9937ce","year":2019},"citing_paper":{"arxiv_id":"2505.07203","last_updated":"2025-05-12T03:22:29Z","snapshot_observed_at":"2026-08-15T22:20:20.959357Z","submitted_at":"2025-05-12T03:22:29Z","title":"PrefillOnly: An Inference Engine for Prefill-only Workloads in Large Language Model Applications","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T22:27:53.594621Z"},"links":{"citing_paper":"/paper/2505.07203"},"observation_digest":"sha256:9638ca66b936b0fbb7eb5e98f6f7aab251f121faeb3215291c9c62e0aae2e82c","observation_id":"6496282b-7c4e-4f0c-8a51-4d1587ba24f1","resolution":{"observed_at":"2026-08-15T22:27:54.471905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:27:53.599044Z","title":"Gonzalez, Ion Stoica, and Matei Zaharia","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07203","last_updated":"2025-05-12T03:22:29Z","snapshot_observed_at":"2026-08-15T22:20:20.959357Z","submitted_at":"2025-05-12T03:22:29Z","title":"PrefillOnly: An Inference Engine for Prefill-only Workloads in Large Language Model Applications","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T22:27:53.599044Z"},"links":{"citing_paper":"/paper/2505.07203"},"observation_digest":"sha256:86f289beffe4c0418b2b2288c095324b094701e369ac7193e5222e8dd0363e33","observation_id":"4f462cbd-2303-4fe8-a5dd-47995a8a342c","resolution":{"observed_at":"2026-08-15T22:27:53.599044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.10485","last_updated":"2023-11-14T16:34:00Z","snapshot_observed_at":"2026-08-16T15:14:51.636907Z","submitted_at":"2023-07-19T22:43:57Z","title":"FinGPT: Democratizing Internet-scale Data for Financial Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.10485","snapshot_observed_at":"2026-08-15T22:27:53.604822Z","title":"Fingpt: Democratizing internet-scale data for financial large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07203","last_updated":"2025-05-12T03:22:29Z","snapshot_observed_at":"2026-08-15T22:20:20.959357Z","submitted_at":"2025-05-12T03:22:29Z","title":"PrefillOnly: An Inference Engine for Prefill-only Workloads in Large Language Model Applications","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T22:27:53.604822Z"},"links":{"cited_paper":"/paper/2307.10485","citing_paper":"/paper/2505.07203"},"observation_digest":"sha256:7457fa59e2c33e499b64cd974b69e43e99c1f87b12f4b325dd98d427331d6f1b","observation_id":"f536499a-cf67-4118-b5c5-3fd2b85d6881","resolution":{"observed_at":"2026-08-15T22:27:53.604822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:27:54.442630Z","title":"Cachegen: Kv cache compression and streaming for fast large language model serving","venue":null,"work_id":"55354924-ba15-4156-8264-0479ebdda061","year":2024},"citing_paper":{"arxiv_id":"2505.07203","last_updated":"2025-05-12T03:22:29Z","snapshot_observed_at":"2026-08-15T22:20:20.959357Z","submitted_at":"2025-05-12T03:22:29Z","title":"PrefillOnly: An Inference Engine for Prefill-only Workloads in Large Language Model Applications","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T22:27:53.609858Z"},"links":{"citing_paper":"/paper/2505.07203"},"observation_digest":"sha256:5d5c8916d67b6b696b55d22cd227287ef2c3dc84114b9c0ae38e07fa53ea04f8","observation_id":"cc014c3c-8e22-4e48-902d-c1ad9d1fc420","resolution":{"observed_at":"2026-08-15T22:27:54.447997Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02750","last_updated":"2024-07-25T09:16:05Z","snapshot_observed_at":"2026-08-12T17:03:50.984887Z","submitted_at":"2024-02-05T06:06:47Z","title":"KIVI: A Tuning-Free Asymmetric 2bit Quantization for KV Cache","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02750","snapshot_observed_at":"2026-08-15T22:27:53.620412Z","title":"Kivi: A tuning-free asym- metric 2bit quantization for kv cache","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07203","last_updated":"2025-05-12T03:22:29Z","snapshot_observed_at":"2026-08-15T22:20:20.959357Z","submitted_at":"2025-05-12T03:22:29Z","title":"PrefillOnly: An Inference Engine for Prefill-only Workloads in Large Language Model Applications","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T22:27:53.620412Z"},"links":{"cited_paper":"/paper/2402.02750","citing_paper":"/paper/2505.07203"},"observation_digest":"sha256:3f245013e14db170e877d18d96d8754ac267fc2de3c16e29a1f0d3065da723e9","observation_id":"3e442f03-9673-4d2a-b0de-4f72bf8e1b4d","resolution":{"observed_at":"2026-08-15T22:27:53.620412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:27:54.419015Z","title":"Github - lmcache/lmcache: Redis for llms","venue":null,"work_id":"82c16e25-5587-43c1-ae02-2a7701f81209","year":2025},"citing_paper":{"arxiv_id":"2505.07203","last_updated":"2025-05-12T03:22:29Z","snapshot_observed_at":"2026-08-15T22:20:20.959357Z","submitted_at":"2025-05-12T03:22:29Z","title":"PrefillOnly: An Inference Engine for Prefill-only Workloads in Large Language Model Applications","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T22:27:53.625061Z"},"links":{"citing_paper":"/paper/2505.07203"},"observation_digest":"sha256:79e0d03fd1a28799708e70bc9f3747d3bb3dc9fe66705d5216ea3823b7d167a9","observation_id":"047d1cb1-4bb2-4c18-8fed-76d619473651","resolution":{"observed_at":"2026-08-15T22:27:54.423570Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:27:54.404942Z","title":"Chatgpt: Conversational language model","venue":null,"work_id":"17bb9076-6ec9-468a-9f3d-aa37d393d676","year":2025},"citing_paper":{"arxiv_id":"2505.07203","last_updated":"2025-05-12T03:22:29Z","snapshot_observed_at":"2026-08-15T22:20:20.959357Z","submitted_at":"2025-05-12T03:22:29Z","title":"PrefillOnly: An Inference Engine for Prefill-only Workloads in Large Language Model Applications","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T22:27:53.630135Z"},"links":{"citing_paper":"/paper/2505.07203"},"observation_digest":"sha256:a80a0e79a646cbee0dee8696a211979449d6e3190c7acc5376acfa4000a98aca","observation_id":"07b981e4-390d-4878-af50-bed6259c4cd0","resolution":{"observed_at":"2026-08-15T22:27:54.409538Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:27:54.389452Z","title":"Generative agents: Interac- tive simulacra of human behavior","venue":null,"work_id":"54b38b2f-a11b-4f1c-a261-4e2d0461b561","year":2023},"citing_paper":{"arxiv_id":"2505.07203","last_updated":"2025-05-12T03:22:29Z","snapshot_observed_at":"2026-08-15T22:20:20.959357Z","submitted_at":"2025-05-12T03:22:29Z","title":"PrefillOnly: An Inference Engine for Prefill-only Workloads in Large Language Model Applications","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T22:27:53.635605Z"},"links":{"citing_paper":"/paper/2505.07203"},"observation_digest":"sha256:92ddaf631d1d6b8e4e66c969c38981dfd9211e313a42fd8c387169d12b80b344","observation_id":"4dc108da-b91e-4536-91b3-14426a1005dd","resolution":{"observed_at":"2026-08-15T22:27:54.394551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:27:54.373990Z","title":"Optimus: an efficient dynamic resource scheduler for deep learn- ing clusters","venue":null,"work_id":"732a0540-e3c2-4068-9e00-dbed051c38a9","year":2018},"citing_paper":{"arxiv_id":"2505.07203","last_updated":"2025-05-12T03:22:29Z","snapshot_observed_at":"2026-08-15T22:20:20.959357Z","submitted_at":"2025-05-12T03:22:29Z","title":"PrefillOnly: An Inference Engine for Prefill-only Workloads in Large Language Model Applications","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T22:27:53.640003Z"},"links":{"citing_paper":"/paper/2505.07203"},"observation_digest":"sha256:806a9d83bdf1e402cad371afa157977eddc054579857b507356994e433710657","observation_id":"f0185cbd-b785-46d2-9b5c-d417a446525c","resolution":{"observed_at":"2026-08-15T22:27:54.378675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:27:54.358925Z","title":"Perplexity is a free ai search engine","venue":null,"work_id":"d3c683c0-38fd-4ce4-8003-c9a39ff0b8ca","year":2025},"citing_paper":{"arxiv_id":"2505.07203","last_updated":"2025-05-12T03:22:29Z","snapshot_observed_at":"2026-08-15T22:20:20.959357Z","submitted_at":"2025-05-12T03:22:29Z","title":"PrefillOnly: An Inference Engine for Prefill-only Workloads in Large Language Model Applications","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T22:27:53.644768Z"},"links":{"citing_paper":"/paper/2505.07203"},"observation_digest":"sha256:4f10af573e4685eb3815b9e8e1bac49b532baeaf2dedd9f787133160e924e3ce","observation_id":"8c9461ee-d736-4803-9a83-a4178d128321","resolution":{"observed_at":"2026-08-15T22:27:54.363796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-08-12T10:50:46.357243Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-15T22:27:53.650313Z","title":"Megatron-lm: Training multi- billion parameter language models using model parallelism","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2505.07203","last_updated":"2025-05-12T03:22:29Z","snapshot_observed_at":"2026-08-15T22:20:20.959357Z","submitted_at":"2025-05-12T03:22:29Z","title":"PrefillOnly: An Inference Engine for Prefill-only Workloads in Large Language Model Applications","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T22:27:53.650313Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2505.07203"},"observation_digest":"sha256:9b5bbeb3d5f25ccd831b8e06d86cba7ca16541efb751d33a19b891292d0a71e3","observation_id":"9b1acce1-2265-4fe2-bd50-d0ab5d9a0bcd","resolution":{"observed_at":"2026-08-15T22:27:53.650313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:27:54.344293Z","title":"Rah! recsys–assistant–human: A human-centered recommendation framework with llm agents","venue":null,"work_id":"d68062c9-9286-49ec-a986-3c1eec4c305d","year":2024},"citing_paper":{"arxiv_id":"2505.07203","last_updated":"2025-05-12T03:22:29Z","snapshot_observed_at":"2026-08-15T22:20:20.959357Z","submitted_at":"2025-05-12T03:22:29Z","title":"PrefillOnly: An Inference Engine for Prefill-only Workloads in Large Language Model Applications","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T22:27:53.655137Z"},"links":{"citing_paper":"/paper/2505.07203"},"observation_digest":"sha256:158ee7827ea36fa6525fb2558e3dc7eb4f22cb61872961f24e7ecaffe27133f0","observation_id":"b3927c8b-6136-4ba6-b91a-264d15d65b3a","resolution":{"observed_at":"2026-08-15T22:27:54.348979Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:27:54.329217Z","title":"Playing games with ais: the limits of gpt-3 and similar large language models","venue":null,"work_id":"9b1406f4-ed8a-48f4-bace-69bdb5e9b15b","year":2022},"citing_paper":{"arxiv_id":"2505.07203","last_updated":"2025-05-12T03:22:29Z","snapshot_observed_at":"2026-08-15T22:20:20.959357Z","submitted_at":"2025-05-12T03:22:29Z","title":"PrefillOnly: An Inference Engine for Prefill-only Workloads in Large Language Model Applications","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T22:27:53.660664Z"},"links":{"citing_paper":"/paper/2505.07203"},"observation_digest":"sha256:50b725ab977a5c869eab2cd21340893e921a6306a3d95f10361dd7ad1f44f146","observation_id":"637b7295-4500-4d2f-98b3-98f68cc2d8c1","resolution":{"observed_at":"2026-08-15T22:27:54.334300Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01505","last_updated":"2023-06-25T18:06:25Z","snapshot_observed_at":"2026-08-16T15:36:43.874544Z","submitted_at":"2023-04-30T04:36:05Z","title":"Beyond Classification: Financial Reasoning in State-of-the-Art Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.01505","snapshot_observed_at":"2026-08-15T22:27:53.665157Z","title":"Beyond classification: Financial reasoning in state-of-the-art language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07203","last_updated":"2025-05-12T03:22:29Z","snapshot_observed_at":"2026-08-15T22:20:20.959357Z","submitted_at":"2025-05-12T03:22:29Z","title":"PrefillOnly: An Inference Engine for Prefill-only Workloads in Large Language Model Applications","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T22:27:53.665157Z"},"links":{"cited_paper":"/paper/2305.01505","citing_paper":"/paper/2505.07203"},"observation_digest":"sha256:6594593e25629b50b3790d73c326e1a28dc8b28e7502d473091cc3b609c0be37","observation_id":"2ef96d4e-921a-48b0-a532-543f457614fc","resolution":{"observed_at":"2026-08-15T22:27:53.665157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.10835","last_updated":"2024-01-25T03:50:15Z","snapshot_observed_at":"2026-08-16T15:06:56.337392Z","submitted_at":"2023-08-21T16:35:19Z","title":"Enhancing Recommender Systems with Large Language Model Reasoning Graphs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.10835","snapshot_observed_at":"2026-08-15T22:27:53.671082Z","title":"En- hancing recommender systems with large language model reasoning graphs","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07203","last_updated":"2025-05-12T03:22:29Z","snapshot_observed_at":"2026-08-15T22:20:20.959357Z","submitted_at":"2025-05-12T03:22:29Z","title":"PrefillOnly: An Inference Engine for Prefill-only Workloads in Large Language Model Applications","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T22:27:53.671082Z"},"links":{"cited_paper":"/paper/2308.10835","citing_paper":"/paper/2505.07203"},"observation_digest":"sha256:a271f14df74ed1f3419bc62743dc29048bec1e60f6e5fbe4a72034828a628e98","observation_id":"3925683a-e76d-4d6b-ae8e-78799ab38ecd","resolution":{"observed_at":"2026-08-15T22:27:53.671082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:27:54.313311Z","title":"Chain-of-thought prompt- ing elicits reasoning in large language models","venue":null,"work_id":"cedb077e-08d6-428a-8cb9-28a9b7cbb849","year":2022},"citing_paper":{"arxiv_id":"2505.07203","last_updated":"2025-05-12T03:22:29Z","snapshot_observed_at":"2026-08-15T22:20:20.959357Z","submitted_at":"2025-05-12T03:22:29Z","title":"PrefillOnly: An Inference Engine for Prefill-only Workloads in Large Language Model Applications","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T22:27:53.677053Z"},"links":{"citing_paper":"/paper/2505.07203"},"observation_digest":"sha256:14157f203f0b1f9b120da3b31287546505423aa3c18cb63c4c41504f288269a6","observation_id":"becd3254-6802-4aa7-bf8c-d64054083e98","resolution":{"observed_at":"2026-08-15T22:27:54.319407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:27:53.681837Z","title":"A survey on large language models for recommendation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07203","last_updated":"2025-05-12T03:22:29Z","snapshot_observed_at":"2026-08-15T22:20:20.959357Z","submitted_at":"2025-05-12T03:22:29Z","title":"PrefillOnly: An Inference Engine for Prefill-only Workloads in Large Language Model Applications","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T22:27:53.681837Z"},"links":{"citing_paper":"/paper/2505.07203"},"observation_digest":"sha256:ff7254716c99b03d304f646f902902f73b5b772523d4b684d57e77eec58ce3b8","observation_id":"d6ff7978-52d9-447f-a655-bb4f442ad64e","resolution":{"observed_at":"2026-08-15T22:27:53.681837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:27:54.288597Z","title":"Predict- ing loan default in peer-to-peer lending using narrative data","venue":null,"work_id":"2c841773-c017-4596-bab6-d39656c5dea2","year":2020},"citing_paper":{"arxiv_id":"2505.07203","last_updated":"2025-05-12T03:22:29Z","snapshot_observed_at":"2026-08-15T22:20:20.959357Z","submitted_at":"2025-05-12T03:22:29Z","title":"PrefillOnly: An Inference Engine for Prefill-only Workloads in Large Language Model Applications","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T22:27:53.687345Z"},"links":{"citing_paper":"/paper/2505.07203"},"observation_digest":"sha256:4a179a1e231b24fafe26287f3c757a61ee33280d5e597951a35a1b28d226d186","observation_id":"d5d1acd8-b8a7-4907-9529-8b63e542db75","resolution":{"observed_at":"2026-08-15T22:27:54.293937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02224","last_updated":"2023-06-04T01:07:20Z","snapshot_observed_at":"2026-08-16T17:32:44.710342Z","submitted_at":"2023-06-04T01:07:20Z","title":"Auto-GPT for Online Decision Making: Benchmarks and Additional Opinions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02224","snapshot_observed_at":"2026-08-15T22:27:53.691773Z","title":"Auto-gpt for online deci- sion making: Benchmarks and additional opinions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07203","last_updated":"2025-05-12T03:22:29Z","snapshot_observed_at":"2026-08-15T22:20:20.959357Z","submitted_at":"2025-05-12T03:22:29Z","title":"PrefillOnly: An Inference Engine for Prefill-only Workloads in Large Language Model Applications","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T22:27:53.691773Z"},"links":{"cited_paper":"/paper/2306.02224","citing_paper":"/paper/2505.07203"},"observation_digest":"sha256:5a61594aa4ddc381281756a47e1ef31a4e68dcb6efbc9d3f210cf139aecef3f6","observation_id":"30cf5885-a546-4145-8433-9491ff7869fe","resolution":{"observed_at":"2026-08-15T22:27:53.691773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:27:54.274020Z","title":"Mini- mizing hallucinations and communication costs: Adversarial debate and voting mechanisms in llm-based multi-agents","venue":null,"work_id":"cf3a6b53-3161-4dbe-9293-029ee1bc0268","year":2025},"citing_paper":{"arxiv_id":"2505.07203","last_updated":"2025-05-12T03:22:29Z","snapshot_observed_at":"2026-08-15T22:20:20.959357Z","submitted_at":"2025-05-12T03:22:29Z","title":"PrefillOnly: An Inference Engine for Prefill-only Workloads in Large Language Model Applications","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T22:27:53.696361Z"},"links":{"citing_paper":"/paper/2505.07203"},"observation_digest":"sha256:09ba07e2c368543d642203ab9b83afafa1357673ccb1e27e25ddeb03a8250523","observation_id":"a9da14eb-f966-4f74-9245-ba3710c9315f","resolution":{"observed_at":"2026-08-15T22:27:54.278564Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:27:54.259932Z","title":"Cacheblend: Fast large language model serving for rag with cached knowledge fusion","venue":null,"work_id":"a987fcd8-b900-4397-8367-05bff46c33f5","year":2025},"citing_paper":{"arxiv_id":"2505.07203","last_updated":"2025-05-12T03:22:29Z","snapshot_observed_at":"2026-08-15T22:20:20.959357Z","submitted_at":"2025-05-12T03:22:29Z","title":"PrefillOnly: An Inference Engine for Prefill-only Workloads in Large Language Model Applications","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T22:27:53.700859Z"},"links":{"citing_paper":"/paper/2505.07203"},"observation_digest":"sha256:a5a29c63a4217f3e12eb1dd7b462017cd149db713e2f3d680059fc7e14ca3ca8","observation_id":"0eeba333-fa42-4744-aaf8-95a48fcbdd05","resolution":{"observed_at":"2026-08-15T22:27:54.264743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01005","last_updated":"2025-04-21T20:10:11Z","snapshot_observed_at":"2026-07-06T20:15:36.280948Z","submitted_at":"2025-01-02T02:02:20Z","title":"FlashInfer: Efficient and Customizable Attention Engine for LLM Inference Serving","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01005","snapshot_observed_at":"2026-08-15T22:27:53.706664Z","title":"Flashinfer: Efficient and customizable attention engine for llm inference serving","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.07203","last_updated":"2025-05-12T03:22:29Z","snapshot_observed_at":"2026-08-15T22:20:20.959357Z","submitted_at":"2025-05-12T03:22:29Z","title":"PrefillOnly: An Inference Engine for Prefill-only Workloads in Large Language Model Applications","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T22:27:53.706664Z"},"links":{"cited_paper":"/paper/2501.01005","citing_paper":"/paper/2505.07203"},"observation_digest":"sha256:ca741b295ec9bc451ac15bb87c6970dfeade2cd80dfbc7f2bebf8828cd646a96","observation_id":"899ff7b9-bb18-44ad-bec8-6fb6014d425a","resolution":{"observed_at":"2026-08-15T22:27:53.706664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:27:54.243580Z","title":"Orca: A distributed serving system for {Transformer-Based} generative models","venue":null,"work_id":"cd640de7-0799-4d0f-b517-a34a4c35354c","year":2022},"citing_paper":{"arxiv_id":"2505.07203","last_updated":"2025-05-12T03:22:29Z","snapshot_observed_at":"2026-08-15T22:20:20.959357Z","submitted_at":"2025-05-12T03:22:29Z","title":"PrefillOnly: An Inference Engine for Prefill-only Workloads in Large Language Model Applications","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T22:27:53.711790Z"},"links":{"citing_paper":"/paper/2505.07203"},"observation_digest":"sha256:e72979067efd923fa8da6e78fd4adb4ed0225c2c9ce4632db0517f8d40ebc73c","observation_id":"e751b87d-52b3-4af0-b225-c9c631042b71","resolution":{"observed_at":"2026-08-15T22:27:54.249901Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:27:54.227671Z","title":"Towards explaining the effects of data preprocessing on machine learning","venue":null,"work_id":"72633868-cdf5-4ad9-9a96-416e40777161","year":2019},"citing_paper":{"arxiv_id":"2505.07203","last_updated":"2025-05-12T03:22:29Z","snapshot_observed_at":"2026-08-15T22:20:20.959357Z","submitted_at":"2025-05-12T03:22:29Z","title":"PrefillOnly: An Inference Engine for Prefill-only Workloads in Large Language Model Applications","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T22:27:53.717119Z"},"links":{"citing_paper":"/paper/2505.07203"},"observation_digest":"sha256:713da37f0607fe337af4b7603644b9ba1a4743d82e1e66b236aa7887957f62ee","observation_id":"8e54bc2c-54a8-4dbf-be4f-4961db2a084d","resolution":{"observed_at":"2026-08-15T22:27:54.232773Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:27:54.212827Z","title":"Caravan: practical online learning of in-network ml models with labeling agents","venue":null,"work_id":"2d3e3243-c556-4fc0-b684-ce65fa11dd06","year":2024},"citing_paper":{"arxiv_id":"2505.07203","last_updated":"2025-05-12T03:22:29Z","snapshot_observed_at":"2026-08-15T22:20:20.959357Z","submitted_at":"2025-05-12T03:22:29Z","title":"PrefillOnly: An Inference Engine for Prefill-only Workloads in Large Language Model Applications","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T22:27:53.721623Z"},"links":{"citing_paper":"/paper/2505.07203"},"observation_digest":"sha256:c49830ccec49a2cb69de3ef505e60bbd43aa68efa7834eae27e25c2baa069bc7","observation_id":"51bae741-9221-4c33-a038-53bcb0c90103","resolution":{"observed_at":"2026-08-15T22:27:54.217874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:27:54.197964Z","title":"Ll- maaa: Making large language models as active annotators","venue":null,"work_id":"c777755e-9b9d-4f8e-8cc9-a68f5acd1052","year":2023},"citing_paper":{"arxiv_id":"2505.07203","last_updated":"2025-05-12T03:22:29Z","snapshot_observed_at":"2026-08-15T22:20:20.959357Z","submitted_at":"2025-05-12T03:22:29Z","title":"PrefillOnly: An Inference Engine for Prefill-only Workloads in Large Language Model Applications","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T22:27:53.727069Z"},"links":{"citing_paper":"/paper/2505.07203"},"observation_digest":"sha256:27e12500e8771d298496e3bd8d2e2b4bbdf8cb0819e2441e793daaa06253289e","observation_id":"af44b6bd-290f-4c2e-a910-3c0c899563da","resolution":{"observed_at":"2026-08-15T22:27:54.202824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:27:54.183527Z","title":"H2o: Heavy-hitter oracle for efficient generative in- ference of large language models","venue":null,"work_id":"e2b8862d-cb26-46ec-9413-828f480ed27c","year":2024},"citing_paper":{"arxiv_id":"2505.07203","last_updated":"2025-05-12T03:22:29Z","snapshot_observed_at":"2026-08-15T22:20:20.959357Z","submitted_at":"2025-05-12T03:22:29Z","title":"PrefillOnly: An Inference Engine for Prefill-only Workloads in Large Language Model Applications","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T22:27:53.731317Z"},"links":{"citing_paper":"/paper/2505.07203"},"observation_digest":"sha256:e8f46812ea0d4b16c8dfebe325b869fdeffe6f8958ae5b1cbe69089d589e95e2","observation_id":"46778d6b-fc90-4c16-93a6-ce1a3260d7e2","resolution":{"observed_at":"2026-08-15T22:27:54.188221Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:27:54.169464Z","title":"Mpic: Position-independent multimodal context caching system for efficient mllm serving, 2025","venue":null,"work_id":"1e121a3c-10d6-4b63-9692-2a7d2bc4851f","year":2025},"citing_paper":{"arxiv_id":"2505.07203","last_updated":"2025-05-12T03:22:29Z","snapshot_observed_at":"2026-08-15T22:20:20.959357Z","submitted_at":"2025-05-12T03:22:29Z","title":"PrefillOnly: An Inference Engine for Prefill-only Workloads in Large Language Model Applications","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-15T22:27:53.735827Z"},"links":{"citing_paper":"/paper/2505.07203"},"observation_digest":"sha256:d800018694b2bc49ae923f107e70028994535dda4a4919b3cd0f9d8260dfcbd2","observation_id":"ed04e13f-d7a1-46ca-a052-8cef1fad50b4","resolution":{"observed_at":"2026-08-15T22:27:54.173986Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:27:53.741450Z","title":"Gonzalez, Clark Barrett, and Ying Sheng","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07203","last_updated":"2025-05-12T03:22:29Z","snapshot_observed_at":"2026-08-15T22:20:20.959357Z","submitted_at":"2025-05-12T03:22:29Z","title":"PrefillOnly: An Inference Engine for Prefill-only Workloads in Large Language Model Applications","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-15T22:27:53.741450Z"},"links":{"citing_paper":"/paper/2505.07203"},"observation_digest":"sha256:f5b7eae49abc9a2f35d0bd41d9eb885d8648167e822f971fadace19d7972c527","observation_id":"8488794d-3968-4225-9121-505c1348aa6b","resolution":{"observed_at":"2026-08-15T22:27:53.741450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:27:54.143402Z","title":"{DistServe}: Disaggregating prefill and decoding for goodput-optimized large language model serv- ing","venue":null,"work_id":"ed6b6aca-58a7-4b5f-8b6c-ab4da3ff0b39","year":2024},"citing_paper":{"arxiv_id":"2505.07203","last_updated":"2025-05-12T03:22:29Z","snapshot_observed_at":"2026-08-15T22:20:20.959357Z","submitted_at":"2025-05-12T03:22:29Z","title":"PrefillOnly: An Inference Engine for Prefill-only Workloads in Large Language Model Applications","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-15T22:27:53.745929Z"},"links":{"citing_paper":"/paper/2505.07203"},"observation_digest":"sha256:010dae6fe8a93251ac175b8f96a496e41be9e9e42ec6f407caffc84f7cabd72c","observation_id":"82f531d2-ea1b-43f4-931e-94e4302d6649","resolution":{"observed_at":"2026-08-15T22:27:54.150339Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:27:53.614510Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.07203","last_updated":"2025-05-12T03:22:29Z","snapshot_observed_at":"2026-08-15T22:20:20.959357Z","submitted_at":"2025-05-12T03:22:29Z","title":"PrefillOnly: An Inference Engine for Prefill-only Workloads in Large Language Model Applications","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-15T22:27:53.614510Z"},"links":{"citing_paper":"/paper/2505.07203"},"observation_digest":"sha256:b5072eeb3fca4f05d8978292f52e4692933fc6ddc77b11a8d3f95fae138bf591","observation_id":"7929bbf0-80a4-4cab-94d4-14e929b0c38c","resolution":{"observed_at":"2026-08-15T22:27:53.614510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.07203","last_updated":"2025-05-12T03:22:29Z","latest_version":1,"primary_category":"cs.DC","snapshot_observed_at":"2026-08-15T22:20:20.959357Z","submitted_at":"2025-05-12T03:22:29Z","title":"PrefillOnly: An Inference Engine for Prefill-only Workloads in Large Language Model Applications"},"reference_resolution":{"displayed":58,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":22,"verified_exact":0,"verified_fuzzy":36},"total_outbound_references":58},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 58 of 58 outbound references and 4 inbound Pith citation observations for arXiv:2505.07203."}