{"as_of":"2026-08-10T04:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:84e336d75b53985eec583805124b97250f2e921e012f53a7c7fefab5241f256d","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T11:22:29.015064Z","state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":10,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":10,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T19:10:53.675879Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-23T02:25:19.685963Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.02743","last_updated":"2025-02-04T22:09:43Z","snapshot_observed_at":"2026-08-09T16:32:54.357740Z","submitted_at":"2025-02-04T22:09:43Z","title":"LLM Bandit: Cost-Efficient LLM Generation via Preference-Conditioned Dynamic Routing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02743","snapshot_observed_at":"2026-08-09T19:10:53.675879Z","title":"LLM Bandit: Cost-Efficient LLM Generation via Preference-Conditioned Dy- namic Routing","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.00409","last_updated":"2025-07-21T12:20:06Z","snapshot_observed_at":"2026-08-10T00:34:58.507365Z","submitted_at":"2025-02-01T12:08:38Z","title":"Doing More with Less: A Survey on Routing Strategies for Resource Optimisation in Large Language Model-Based Systems","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-09T19:10:53.675879Z"},"links":{"cited_paper":"/paper/2502.02743","citing_paper":"/paper/2502.00409"},"observation_digest":"sha256:fb2a6d0c72a5168a922308cae6612656ea679a2171d9d588f6b4f09d6d748dc2","observation_id":"f5830e30-ac5e-48ce-b8a8-6c0b04578c76","resolution":{"observed_at":"2026-08-09T19:10:53.675879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02743","last_updated":"2025-02-04T22:09:43Z","snapshot_observed_at":"2026-08-09T16:32:54.357740Z","submitted_at":"2025-02-04T22:09:43Z","title":"LLM Bandit: Cost-Efficient LLM Generation via Preference-Conditioned Dynamic Routing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02743","snapshot_observed_at":"2026-08-07T23:48:01.031696Z","title":"LLM Bandit : Cost-efficient llm generation via preference-conditioned dynamic routing, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.08773","last_updated":"2025-07-22T15:27:33Z","snapshot_observed_at":"2026-08-08T01:13:01.972942Z","submitted_at":"2025-02-12T20:30:28Z","title":"Universal Model Routing for Efficient LLM Inference","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-07T23:48:01.031696Z"},"links":{"cited_paper":"/paper/2502.02743","citing_paper":"/paper/2502.08773"},"observation_digest":"sha256:52368a11003b4d61375f4ddddaa976cc5a172cad5243e132816e6711c69b7321","observation_id":"5f175dcd-2a18-4a06-9aff-522c06734b71","resolution":{"observed_at":"2026-08-07T23:48:01.031696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02743","last_updated":"2025-02-04T22:09:43Z","snapshot_observed_at":"2026-08-09T16:32:54.357740Z","submitted_at":"2025-02-04T22:09:43Z","title":"LLM Bandit: Cost-Efficient LLM Generation via Preference-Conditioned Dynamic Routing","version":1},"cited_work":{"arxiv_id":"2502.02743","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.02743","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Llm bandit: Cost-efficient llm generation via preference-conditioned dynamic routing.arXiv preprint arXiv:2502.02743","venue":null,"work_id":"e4f445e9-13d3-4b98-9be6-0abcc337e6fd","year":2025},"citing_paper":{"arxiv_id":"2502.18036","last_updated":"2026-04-22T02:19:48Z","snapshot_observed_at":"2026-08-02T22:41:05.099083Z","submitted_at":"2025-02-25T09:48:53Z","title":"Harnessing Multiple Large Language Models: A Survey on LLM Ensemble","version":6},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-23T02:22:28.649071Z"},"links":{"cited_paper":"/paper/2502.02743","citing_paper":"/paper/2502.18036"},"observation_digest":"sha256:653dac9bf69f8106125a68f47dda3935b47961c1cc902bdace550255bb4349d7","observation_id":"defab73f-003f-4515-9b8d-a9ca3b81fcb0","resolution":{"observed_at":"2026-05-23T02:25:19.688915Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02743","last_updated":"2025-02-04T22:09:43Z","snapshot_observed_at":"2026-08-09T16:32:54.357740Z","submitted_at":"2025-02-04T22:09:43Z","title":"LLM Bandit: Cost-Efficient LLM Generation via Preference-Conditioned Dynamic Routing","version":1},"cited_work":{"arxiv_id":"2502.02743","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.02743","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Llm bandit: Cost-efficient llm generation via preference-conditioned dynamic routing.arXiv preprint arXiv:2502.02743","venue":null,"work_id":"e4f445e9-13d3-4b98-9be6-0abcc337e6fd","year":2025},"citing_paper":{"arxiv_id":"2505.12601","last_updated":"2026-05-14T18:08:42Z","snapshot_observed_at":"2026-08-02T11:09:30.375825Z","submitted_at":"2025-05-19T01:33:41Z","title":"Rethinking Predictive Modeling for LLM Routing: When Simple kNN Beats Complex Learned Routers","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-22T15:13:28.927880Z"},"links":{"cited_paper":"/paper/2502.02743","citing_paper":"/paper/2505.12601"},"observation_digest":"sha256:0f219a79ada292f140fda89b900d0582fb0d874b3c1493c9f781790ec93b6f80","observation_id":"d272b4e4-cca4-4c1e-a726-0fba4a709c93","resolution":{"observed_at":"2026-05-22T15:14:57.469183Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02743","last_updated":"2025-02-04T22:09:43Z","snapshot_observed_at":"2026-08-09T16:32:54.357740Z","submitted_at":"2025-02-04T22:09:43Z","title":"LLM Bandit: Cost-Efficient LLM Generation via Preference-Conditioned Dynamic Routing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02743","snapshot_observed_at":"2026-08-06T15:06:48.858500Z","title":"Llm bandit: Cost-efficient llm generation via preference-conditioned dynamic routing","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.16731","last_updated":"2025-07-22T16:13:43Z","snapshot_observed_at":"2026-08-07T22:15:08.576638Z","submitted_at":"2025-07-22T16:13:43Z","title":"Collaborative Inference and Learning between Edge SLMs and Cloud LLMs: A Survey of Algorithms, Execution, and Open Challenges","version":1},"reference_index":269,"source":"pdf_text","source_observed_at":"2026-08-06T15:06:48.858500Z"},"links":{"cited_paper":"/paper/2502.02743","citing_paper":"/paper/2507.16731"},"observation_digest":"sha256:8ffa462d791c624736591764b1c06346a760164f08a475608b229f6c9425c652","observation_id":"bd38a840-cdc3-457b-8a7b-8697f654ae00","resolution":{"observed_at":"2026-08-06T15:06:48.858500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02743","last_updated":"2025-02-04T22:09:43Z","snapshot_observed_at":"2026-08-09T16:32:54.357740Z","submitted_at":"2025-02-04T22:09:43Z","title":"LLM Bandit: Cost-Efficient LLM Generation via Preference-Conditioned Dynamic Routing","version":1},"cited_work":{"arxiv_id":"2502.02743","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.02743","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Llm bandit: Cost-efficient llm generation via preference-conditioned dynamic routing.arXiv preprint arXiv:2502.02743","venue":null,"work_id":"e4f445e9-13d3-4b98-9be6-0abcc337e6fd","year":2025},"citing_paper":{"arxiv_id":"2602.07303","last_updated":"2026-04-17T15:29:54Z","snapshot_observed_at":"2026-08-03T09:54:39.877691Z","submitted_at":"2026-02-07T01:30:19Z","title":"KRONE: Scalable LLM-Augmented Log Anomaly Detection via Hierarchical Abstraction","version":3},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-16T06:59:23.030671Z"},"links":{"cited_paper":"/paper/2502.02743","citing_paper":"/paper/2602.07303"},"observation_digest":"sha256:282c5e0a7dbcb55c5e1a4df0757bf4b1ffcd0d625c1d6fab9e899d329bd73916","observation_id":"91f9e57d-68fb-4b1a-95a0-0e34774dda55","resolution":{"observed_at":"2026-05-16T07:00:42.944524Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02743","last_updated":"2025-02-04T22:09:43Z","snapshot_observed_at":"2026-08-09T16:32:54.357740Z","submitted_at":"2025-02-04T22:09:43Z","title":"LLM Bandit: Cost-Efficient LLM Generation via Preference-Conditioned Dynamic Routing","version":1},"cited_work":{"arxiv_id":"2502.02743","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.02743","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Llm bandit: Cost-efficient llm generation via preference-conditioned dynamic routing.arXiv preprint arXiv:2502.02743","venue":null,"work_id":"e4f445e9-13d3-4b98-9be6-0abcc337e6fd","year":2025},"citing_paper":{"arxiv_id":"2604.16583","last_updated":"2026-04-17T14:34:53Z","snapshot_observed_at":"2026-07-29T21:35:15.639209Z","submitted_at":"2026-04-17T14:34:53Z","title":"POLAR: Online Learning for LoRA Adapter Caching and Routing in Edge LLM Serving","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T08:49:43.418576Z"},"links":{"cited_paper":"/paper/2502.02743","citing_paper":"/paper/2604.16583"},"observation_digest":"sha256:91fdce0705774f3d6d85dbcdabcebec62729e703bb460e75473b782960f25a44","observation_id":"510e1c15-fd98-4489-b63e-5fe7d5dfbad7","resolution":{"observed_at":"2026-05-10T08:53:04.247674Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02743","last_updated":"2025-02-04T22:09:43Z","snapshot_observed_at":"2026-08-09T16:32:54.357740Z","submitted_at":"2025-02-04T22:09:43Z","title":"LLM Bandit: Cost-Efficient LLM Generation via Preference-Conditioned Dynamic Routing","version":1},"cited_work":{"arxiv_id":"2502.02743","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.02743","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Llm bandit: Cost-efficient llm generation via preference-conditioned dynamic routing.arXiv preprint arXiv:2502.02743","venue":null,"work_id":"e4f445e9-13d3-4b98-9be6-0abcc337e6fd","year":2025},"citing_paper":{"arxiv_id":"2605.03426","last_updated":"2026-05-05T07:02:50Z","snapshot_observed_at":"2026-07-06T23:16:20.322265Z","submitted_at":"2026-05-05T07:02:50Z","title":"Replacing Parameters with Preferences: Federated Alignment of Heterogeneous Vision-Language Models","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-05-07T04:07:58.031100Z"},"links":{"cited_paper":"/paper/2502.02743","citing_paper":"/paper/2605.03426"},"observation_digest":"sha256:1df11fa14979a3199ab2767dbd43aa4c77809fc7fcd55fa97a9c1a03bb2a2603","observation_id":"1756a5e4-ded6-4a2f-98bb-76b7beae0e24","resolution":{"observed_at":"2026-05-12T10:41:30.884663Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02743","last_updated":"2025-02-04T22:09:43Z","snapshot_observed_at":"2026-08-09T16:32:54.357740Z","submitted_at":"2025-02-04T22:09:43Z","title":"LLM Bandit: Cost-Efficient LLM Generation via Preference-Conditioned Dynamic Routing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02743","snapshot_observed_at":"2026-07-13T01:15:01.090791Z","title":"Llm bandit: Cost-efficient llm generation via preference- conditioned dynamic routing,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08983","last_updated":"2026-07-09T23:13:46Z","snapshot_observed_at":"2026-08-07T15:43:47.874439Z","submitted_at":"2026-07-09T23:13:46Z","title":"SCATE: Learning to Supervise Coding Agents for Cost-Effective Test Generation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-07-13T01:15:01.090791Z"},"links":{"cited_paper":"/paper/2502.02743","citing_paper":"/paper/2607.08983"},"observation_digest":"sha256:b8f08aff7c0e806b477eae30fa6f591e15abbdd1ead270a07cbad1982fdfc834","observation_id":"f8254bf1-e6a1-4fe3-bc5a-24ca5b1d208b","resolution":{"observed_at":"2026-07-13T01:15:01.090791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02743","last_updated":"2025-02-04T22:09:43Z","snapshot_observed_at":"2026-08-09T16:32:54.357740Z","submitted_at":"2025-02-04T22:09:43Z","title":"LLM Bandit: Cost-Efficient LLM Generation via Preference-Conditioned Dynamic Routing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02743","snapshot_observed_at":"2026-08-01T10:14:14.184268Z","title":"LLMbandit: Cost-efficientLLMgenerationviapreference-conditioneddynamicrouting.arXivpreprint arXiv:2502.02743,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20327","last_updated":"2026-07-22T16:14:26Z","snapshot_observed_at":"2026-08-07T18:49:46.472241Z","submitted_at":"2026-07-22T16:14:26Z","title":"PyroDash: Cost-Efficient Token-Level Small-Large Language Model Collaborative Inference","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-01T10:14:14.184268Z"},"links":{"cited_paper":"/paper/2502.02743","citing_paper":"/paper/2607.20327"},"observation_digest":"sha256:5c2c8eb94d1f2d105034c7eb29712cf79044aab9f395d2f49355e8a544f240e4","observation_id":"dc175f25-7347-46ce-9df0-4ad2217144d1","resolution":{"observed_at":"2026-08-01T10:14:14.184268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2502.02743/citation-record","integrity":"/paper/2502.02743/integrity","json":"/paper/2502.02743/citation-record.json","paper":"/paper/2502.02743"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2202.04500","last_updated":"2023-06-02T15:48:13Z","snapshot_observed_at":"2026-08-09T14:36:38.070314Z","submitted_at":"2022-02-09T15:01:59Z","title":"Contextualize Me -- The Case for Context in Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.04500","snapshot_observed_at":"2026-08-09T11:22:28.831842Z","title":"Contextualize me–the case for context in re- inforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02743","last_updated":"2025-02-04T22:09:43Z","snapshot_observed_at":"2026-08-09T16:32:54.357740Z","submitted_at":"2025-02-04T22:09:43Z","title":"LLM Bandit: Cost-Efficient LLM Generation via Preference-Conditioned Dynamic Routing","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-09T11:22:28.831842Z"},"links":{"cited_paper":"/paper/2202.04500","citing_paper":"/paper/2502.02743"},"observation_digest":"sha256:2a07a5c14465e4196cd0db5cf3ba7defb35f2a7db7ddcaebd6c0648770695ba1","observation_id":"930e4926-5eb3-4d39-a6a4-8b94aac96986","resolution":{"observed_at":"2026-08-09T11:22:28.831842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06817","last_updated":"2023-08-11T17:45:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-13T18:55:15Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06817","snapshot_observed_at":"2026-08-09T11:22:28.841954Z","title":"Rt-1: Robotics transformer for real-world control at scale","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02743","last_updated":"2025-02-04T22:09:43Z","snapshot_observed_at":"2026-08-09T16:32:54.357740Z","submitted_at":"2025-02-04T22:09:43Z","title":"LLM Bandit: Cost-Efficient LLM Generation via Preference-Conditioned Dynamic Routing","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-09T11:22:28.841954Z"},"links":{"cited_paper":"/paper/2212.06817","citing_paper":"/paper/2502.02743"},"observation_digest":"sha256:811bc120d747f7a1fdbad16209312ff3590715a01c7416355caaf8d9f7932a78","observation_id":"ab1e82c0-2cf7-45cf-9f26-609349832f23","resolution":{"observed_at":"2026-08-09T11:22:28.841954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.06955","last_updated":"2024-07-13T16:54:28Z","snapshot_observed_at":"2026-07-06T15:41:28.693657Z","submitted_at":"2023-06-12T08:37:38Z","title":"A Brief Review of Hypernetworks in Deep Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.06955","snapshot_observed_at":"2026-08-09T11:22:28.847310Z","title":"K., Zhou, J., Lu, P., Molaei, S., and Clifton, D","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02743","last_updated":"2025-02-04T22:09:43Z","snapshot_observed_at":"2026-08-09T16:32:54.357740Z","submitted_at":"2025-02-04T22:09:43Z","title":"LLM Bandit: Cost-Efficient LLM Generation via Preference-Conditioned Dynamic Routing","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-09T11:22:28.847310Z"},"links":{"cited_paper":"/paper/2306.06955","citing_paper":"/paper/2502.02743"},"observation_digest":"sha256:4ee2cac76e96c6cdc1d1c78fcb4b3810b697af482437b4440929b5e12a5cef98","observation_id":"f08221ad-75b5-4b95-8eb3-3c5aae85adb7","resolution":{"observed_at":"2026-08-09T11:22:28.847310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.05176","last_updated":"2023-05-09T05:11:02Z","snapshot_observed_at":"2026-07-31T18:33:34.529799Z","submitted_at":"2023-05-09T05:11:02Z","title":"FrugalGPT: How to Use Large Language Models While Reducing Cost and Improving Performance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.05176","snapshot_observed_at":"2026-08-09T11:22:28.852947Z","title":"Frugalgpt: How to use large language models while reducing cost and improving performance","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02743","last_updated":"2025-02-04T22:09:43Z","snapshot_observed_at":"2026-08-09T16:32:54.357740Z","submitted_at":"2025-02-04T22:09:43Z","title":"LLM Bandit: Cost-Efficient LLM Generation via Preference-Conditioned Dynamic Routing","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-09T11:22:28.852947Z"},"links":{"cited_paper":"/paper/2305.05176","citing_paper":"/paper/2502.02743"},"observation_digest":"sha256:140ebc066d7dac061d3fe6f338d3e3885832dcfdb6859477118cce86b9b8e27a","observation_id":"1e5c45ba-38d1-4767-8ae1-eba029549a1a","resolution":{"observed_at":"2026-08-09T11:22:28.852947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14618","last_updated":"2024-04-22T23:06:42Z","snapshot_observed_at":"2026-08-08T18:42:25.777499Z","submitted_at":"2024-04-22T23:06:42Z","title":"Hybrid LLM: Cost-Efficient and Quality-Aware Query Routing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14618","snapshot_observed_at":"2026-08-09T11:22:28.858028Z","title":"V ., and Awadallah, A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02743","last_updated":"2025-02-04T22:09:43Z","snapshot_observed_at":"2026-08-09T16:32:54.357740Z","submitted_at":"2025-02-04T22:09:43Z","title":"LLM Bandit: Cost-Efficient LLM Generation via Preference-Conditioned Dynamic Routing","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-09T11:22:28.858028Z"},"links":{"cited_paper":"/paper/2404.14618","citing_paper":"/paper/2502.02743"},"observation_digest":"sha256:4e41c9077a125194854a6155819663ce6cc6e8486ec875cd103c3bb4f44a0998","observation_id":"68fd614a-c29e-46c9-92dd-bf214f6c1da0","resolution":{"observed_at":"2026-08-09T11:22:28.858028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.17173","last_updated":"2025-03-21T14:37:37Z","snapshot_observed_at":"2026-07-30T22:28:26.904599Z","submitted_at":"2024-01-30T17:04:47Z","title":"Zero-Shot Reinforcement Learning via Function Encoders","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.17173","snapshot_observed_at":"2026-08-09T11:22:28.878476Z","title":"Zero-shot rein- forcement learning via function encoders","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02743","last_updated":"2025-02-04T22:09:43Z","snapshot_observed_at":"2026-08-09T16:32:54.357740Z","submitted_at":"2025-02-04T22:09:43Z","title":"LLM Bandit: Cost-Efficient LLM Generation via Preference-Conditioned Dynamic Routing","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-09T11:22:28.878476Z"},"links":{"cited_paper":"/paper/2401.17173","citing_paper":"/paper/2502.02743"},"observation_digest":"sha256:d12df38cea50873588859af1afe8ebd29c1e334b770e0d24f724b124af756e81","observation_id":"8979fb9c-e9a3-44e2-8f3d-7f39bafda339","resolution":{"observed_at":"2026-08-09T11:22:28.878476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.01928","last_updated":"2020-11-03T18:58:39Z","snapshot_observed_at":"2026-08-10T02:55:39.264386Z","submitted_at":"2020-11-03T18:58:39Z","title":"Generalization to New Actions in Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2011.01928","doi":null,"metadata_source":"pith","pith_arxiv_id":"2011.01928","snapshot_observed_at":"2026-08-09T11:22:29.383161Z","title":"Generalization to New Actions in Reinforcement Learning","venue":"cs.LG","work_id":"7b1c34aa-1704-498a-b792-a7f0ce7c4232","year":2020},"citing_paper":{"arxiv_id":"2502.02743","last_updated":"2025-02-04T22:09:43Z","snapshot_observed_at":"2026-08-09T16:32:54.357740Z","submitted_at":"2025-02-04T22:09:43Z","title":"LLM Bandit: Cost-Efficient LLM Generation via Preference-Conditioned Dynamic Routing","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-09T11:22:28.883218Z"},"links":{"cited_paper":"/paper/2011.01928","citing_paper":"/paper/2502.02743"},"observation_digest":"sha256:7f97e4d7a1b7de139877bab3a8f0401f6c3f38d99089a4303ed8afe916fb580f","observation_id":"c8758b8f-16a6-4368-9ef1-576f4dbd4189","resolution":{"observed_at":"2026-08-09T11:22:29.388179Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02561","last_updated":"2023-06-30T21:39:54Z","snapshot_observed_at":"2026-08-05T15:27:19.717152Z","submitted_at":"2023-06-05T03:32:26Z","title":"LLM-Blender: Ensembling Large Language Models with Pairwise Ranking and Generative Fusion","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02561","snapshot_observed_at":"2026-08-09T11:22:28.893446Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02743","last_updated":"2025-02-04T22:09:43Z","snapshot_observed_at":"2026-08-09T16:32:54.357740Z","submitted_at":"2025-02-04T22:09:43Z","title":"LLM Bandit: Cost-Efficient LLM Generation via Preference-Conditioned Dynamic Routing","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-09T11:22:28.893446Z"},"links":{"cited_paper":"/paper/2306.02561","citing_paper":"/paper/2502.02743"},"observation_digest":"sha256:304a5c33dfdabb91f12ec1786aaefc2bb4f8e6fbecd60d53b74a0d1e534c2906","observation_id":"8caa511e-12f4-4ef1-917a-a22af59ca594","resolution":{"observed_at":"2026-08-09T11:22:28.893446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02349","last_updated":"2024-10-30T16:18:57Z","snapshot_observed_at":"2026-07-06T17:11:42.641129Z","submitted_at":"2024-01-04T16:45:01Z","title":"A Survey Analyzing Generalization in Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02349","snapshot_observed_at":"2026-08-09T11:22:28.903294Z","title":"A survey analyzing generalization in deep reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02743","last_updated":"2025-02-04T22:09:43Z","snapshot_observed_at":"2026-08-09T16:32:54.357740Z","submitted_at":"2025-02-04T22:09:43Z","title":"LLM Bandit: Cost-Efficient LLM Generation via Preference-Conditioned Dynamic Routing","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-09T11:22:28.903294Z"},"links":{"cited_paper":"/paper/2401.02349","citing_paper":"/paper/2502.02743"},"observation_digest":"sha256:c42407da09eacd1ed9b8318ef83ec73af127a52f80deb905be68738e9be9e182","observation_id":"8ff53baf-f196-48b2-a4fc-3e5b8ca63220","resolution":{"observed_at":"2026-08-09T11:22:28.903294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.05396","last_updated":"2020-02-15T08:29:25Z","snapshot_observed_at":"2026-08-04T11:18:49.438155Z","submitted_at":"2019-10-11T20:12:52Z","title":"Network Randomization: A Simple Technique for Generalization in Deep Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.05396","snapshot_observed_at":"2026-08-09T11:22:28.908205Z","title":null,"venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2502.02743","last_updated":"2025-02-04T22:09:43Z","snapshot_observed_at":"2026-08-09T16:32:54.357740Z","submitted_at":"2025-02-04T22:09:43Z","title":"LLM Bandit: Cost-Efficient LLM Generation via Preference-Conditioned Dynamic Routing","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-09T11:22:28.908205Z"},"links":{"cited_paper":"/paper/1910.05396","citing_paper":"/paper/2502.02743"},"observation_digest":"sha256:3b843214d0db5344c667985d4681bc8091776ccb69971227d2de8c8e7adf0e31","observation_id":"e845115f-68b9-46d6-903c-d5b9f72ebc25","resolution":{"observed_at":"2026-08-09T11:22:28.908205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-01T19:14:56.803459Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-09T11:22:28.913059Z","title":"Holistic evaluation of language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02743","last_updated":"2025-02-04T22:09:43Z","snapshot_observed_at":"2026-08-09T16:32:54.357740Z","submitted_at":"2025-02-04T22:09:43Z","title":"LLM Bandit: Cost-Efficient LLM Generation via Preference-Conditioned Dynamic Routing","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-09T11:22:28.913059Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2502.02743"},"observation_digest":"sha256:a3cc0da610ea4023b4eaaf5b106317af06259edb1438c691f8c2d4ba3b5cf1ce","observation_id":"e6887e6a-0877-46d1-8f8a-f439804b5877","resolution":{"observed_at":"2026-08-09T11:22:28.913059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08692","last_updated":"2023-11-15T04:40:43Z","snapshot_observed_at":"2026-07-06T16:47:45.504109Z","submitted_at":"2023-11-15T04:40:43Z","title":"Routing to the Expert: Efficient Reward-guided Ensemble of Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08692","snapshot_observed_at":"2026-08-09T11:22:28.917976Z","title":"Routing to the expert: Efficient reward- guided ensemble of large language models.arXiv preprint arXiv:2311.08692,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02743","last_updated":"2025-02-04T22:09:43Z","snapshot_observed_at":"2026-08-09T16:32:54.357740Z","submitted_at":"2025-02-04T22:09:43Z","title":"LLM Bandit: Cost-Efficient LLM Generation via Preference-Conditioned Dynamic Routing","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-09T11:22:28.917976Z"},"links":{"cited_paper":"/paper/2311.08692","citing_paper":"/paper/2502.02743"},"observation_digest":"sha256:9b3df607ca7e1bc5ed79e668bed0a93c5a467ff1d8423089ec39f30e87a651f4","observation_id":"7118ebd6-14d2-4dce-838f-52385c04b611","resolution":{"observed_at":"2026-08-09T11:22:28.917976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02994","last_updated":"2024-01-23T04:43:56Z","snapshot_observed_at":"2026-08-04T14:20:52.474748Z","submitted_at":"2024-01-04T07:45:49Z","title":"Blending Is All You Need: Cheaper, Better Alternative to Trillion-Parameters LLM","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02994","snapshot_observed_at":"2026-08-09T11:22:28.922626Z","title":"Blending is all you need: Cheaper, better alternative to trillion-parameters llm","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02743","last_updated":"2025-02-04T22:09:43Z","snapshot_observed_at":"2026-08-09T16:32:54.357740Z","submitted_at":"2025-02-04T22:09:43Z","title":"LLM Bandit: Cost-Efficient LLM Generation via Preference-Conditioned Dynamic Routing","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-09T11:22:28.922626Z"},"links":{"cited_paper":"/paper/2401.02994","citing_paper":"/paper/2502.02743"},"observation_digest":"sha256:938d82b6e9c4e157f58663851c1a53d5388a8b5c53e4313a47b506a30623b1d0","observation_id":"861a997a-073b-43a2-94a6-107bbd0f4d3e","resolution":{"observed_at":"2026-08-09T11:22:28.922626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12963","last_updated":"2025-01-19T15:59:56Z","snapshot_observed_at":"2026-07-06T16:35:48.413898Z","submitted_at":"2023-10-19T17:57:39Z","title":"AutoMix: Automatically Mixing Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12963","snapshot_observed_at":"2026-08-09T11:22:28.927497Z","title":"P., Mishra, S., Zhou, P., Gupta, A., Rajagopal, D., Kappa- ganthu, K., Yang, Y ., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02743","last_updated":"2025-02-04T22:09:43Z","snapshot_observed_at":"2026-08-09T16:32:54.357740Z","submitted_at":"2025-02-04T22:09:43Z","title":"LLM Bandit: Cost-Efficient LLM Generation via Preference-Conditioned Dynamic Routing","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-09T11:22:28.927497Z"},"links":{"cited_paper":"/paper/2310.12963","citing_paper":"/paper/2502.02743"},"observation_digest":"sha256:212f08c4a8543329d7befb8ec46f4449bb392af752153fcee4d6c7a57ef0b90f","observation_id":"56a7bc7c-ac5f-41a9-9305-3a4ae2b2ba86","resolution":{"observed_at":"2026-08-09T11:22:28.927497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10834","last_updated":"2025-04-22T03:55:14Z","snapshot_observed_at":"2026-08-02T06:57:44.337097Z","submitted_at":"2024-07-15T15:45:07Z","title":"MetaLLM: A High-performant and Cost-efficient Dynamic Framework for Wrapping LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10834","snapshot_observed_at":"2026-08-09T11:22:28.932266Z","title":"H., Hoang, D","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02743","last_updated":"2025-02-04T22:09:43Z","snapshot_observed_at":"2026-08-09T16:32:54.357740Z","submitted_at":"2025-02-04T22:09:43Z","title":"LLM Bandit: Cost-Efficient LLM Generation via Preference-Conditioned Dynamic Routing","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-09T11:22:28.932266Z"},"links":{"cited_paper":"/paper/2407.10834","citing_paper":"/paper/2502.02743"},"observation_digest":"sha256:df0d7182d8cf7514449eacf1cf9079767483a353eeacdada91b802b5affc80e5","observation_id":"6b368b8f-db85-42d1-b243-d9cd52195ce3","resolution":{"observed_at":"2026-08-09T11:22:28.932266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18665","last_updated":"2025-02-23T08:50:33Z","snapshot_observed_at":"2026-07-30T15:06:18.011623Z","submitted_at":"2024-06-26T18:10:22Z","title":"RouteLLM: Learning to Route LLMs with Preference Data","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18665","snapshot_observed_at":"2026-08-09T11:22:28.937025Z","title":"E., Kadous, M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02743","last_updated":"2025-02-04T22:09:43Z","snapshot_observed_at":"2026-08-09T16:32:54.357740Z","submitted_at":"2025-02-04T22:09:43Z","title":"LLM Bandit: Cost-Efficient LLM Generation via Preference-Conditioned Dynamic Routing","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-09T11:22:28.937025Z"},"links":{"cited_paper":"/paper/2406.18665","citing_paper":"/paper/2502.02743"},"observation_digest":"sha256:0190b96af52dfcc33f88f68ba69b2787fa8a9869a01df79ffe825163d54bf599","observation_id":"4bc06a7a-4b64-47ae-956f-70ef1f0c2b6e","resolution":{"observed_at":"2026-08-09T11:22:28.937025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:22:29.665656Z","title":"Policy gradient approaches for multi- objective sequential decision making","venue":null,"work_id":"ffb644f3-38a7-44f3-9cf7-54de5ce1ce78","year":2014},"citing_paper":{"arxiv_id":"2502.02743","last_updated":"2025-02-04T22:09:43Z","snapshot_observed_at":"2026-08-09T16:32:54.357740Z","submitted_at":"2025-02-04T22:09:43Z","title":"LLM Bandit: Cost-Efficient LLM Generation via Preference-Conditioned Dynamic Routing","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-09T11:22:28.941947Z"},"links":{"citing_paper":"/paper/2502.02743"},"observation_digest":"sha256:2421037237d4f743adbecb41f31d10d96ddf34bdd7e3b34d4ef09f8d1058efed","observation_id":"781a6906-2980-41b7-abcd-10f70612d8fc","resolution":{"observed_at":"2026-08-09T11:22:29.670077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12950","last_updated":"2024-01-31T19:47:26Z","snapshot_observed_at":"2026-07-06T16:10:07.931347Z","submitted_at":"2023-08-24T17:39:13Z","title":"Code Llama: Open Foundation Models for Code","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12950","snapshot_observed_at":"2026-08-09T11:22:28.951454Z","title":"E., Adi, Y ., Liu, J., Sauvestre, R., Remez, T., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02743","last_updated":"2025-02-04T22:09:43Z","snapshot_observed_at":"2026-08-09T16:32:54.357740Z","submitted_at":"2025-02-04T22:09:43Z","title":"LLM Bandit: Cost-Efficient LLM Generation via Preference-Conditioned Dynamic Routing","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-09T11:22:28.951454Z"},"links":{"cited_paper":"/paper/2308.12950","citing_paper":"/paper/2502.02743"},"observation_digest":"sha256:a3fcb830a4927e501b87138750bdf478f68846c3845ce72412a229b0d01a8e33","observation_id":"ddd3671f-54e5-4db2-8dbc-cc9743eaef93","resolution":{"observed_at":"2026-08-09T11:22:28.951454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1506.02438","last_updated":"2018-10-20T18:55:07Z","snapshot_observed_at":"2026-08-09T23:04:15.431743Z","submitted_at":"2015-06-08T11:12:48Z","title":"High-Dimensional Continuous Control Using Generalized Advantage Estimation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1506.02438","snapshot_observed_at":"2026-08-09T11:22:28.956335Z","title":"High-dimensional continuous control using generalized advantage estimation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02743","last_updated":"2025-02-04T22:09:43Z","snapshot_observed_at":"2026-08-09T16:32:54.357740Z","submitted_at":"2025-02-04T22:09:43Z","title":"LLM Bandit: Cost-Efficient LLM Generation via Preference-Conditioned Dynamic Routing","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-09T11:22:28.956335Z"},"links":{"cited_paper":"/paper/1506.02438","citing_paper":"/paper/2502.02743"},"observation_digest":"sha256:060bd3b80499a7d5b91ebfaebca06c5a0f73f6084f2b15b27836fe353cc85e02","observation_id":"34e4d833-4bb7-4021-99dd-8bb6a123b9c0","resolution":{"observed_at":"2026-08-09T11:22:28.956335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15789","last_updated":"2023-09-27T17:08:40Z","snapshot_observed_at":"2026-08-06T08:57:12.331150Z","submitted_at":"2023-09-27T17:08:40Z","title":"Large Language Model Routing with Benchmark Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15789","snapshot_observed_at":"2026-08-09T11:22:28.965591Z","title":"Large language model routing with benchmark datasets","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02743","last_updated":"2025-02-04T22:09:43Z","snapshot_observed_at":"2026-08-09T16:32:54.357740Z","submitted_at":"2025-02-04T22:09:43Z","title":"LLM Bandit: Cost-Efficient LLM Generation via Preference-Conditioned Dynamic Routing","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-09T11:22:28.965591Z"},"links":{"cited_paper":"/paper/2309.15789","citing_paper":"/paper/2502.02743"},"observation_digest":"sha256:db0739fd632af4c0f2861c7f0fbae0a9ac01727c8e8ec2bea98ffc03d3403892","observation_id":"1c83dd08-bb53-46d1-9d34-4656e4372d80","resolution":{"observed_at":"2026-08-09T11:22:28.965591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18924","last_updated":"2024-06-27T06:31:51Z","snapshot_observed_at":"2026-08-05T06:15:58.899284Z","submitted_at":"2024-06-27T06:31:51Z","title":"Learning Pareto Set for Multi-Objective Continuous Robot Control","version":1},"cited_work":{"arxiv_id":"2406.18924","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.18924","snapshot_observed_at":"2026-08-09T11:22:29.140390Z","title":"Learning Pareto Set for Multi-Objective Continuous Robot Control","venue":"cs.AI","work_id":"d9e3a3c4-a317-4a2b-9df1-d93f8ecbb56a","year":2024},"citing_paper":{"arxiv_id":"2502.02743","last_updated":"2025-02-04T22:09:43Z","snapshot_observed_at":"2026-08-09T16:32:54.357740Z","submitted_at":"2025-02-04T22:09:43Z","title":"LLM Bandit: Cost-Efficient LLM Generation via Preference-Conditioned Dynamic Routing","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-09T11:22:28.970295Z"},"links":{"cited_paper":"/paper/2406.18924","citing_paper":"/paper/2502.02743"},"observation_digest":"sha256:174e2c8ffbac65f4b005955fcdae439e0f45b50424e1bdc148d51309fe4bd46b","observation_id":"97cda4cc-c528-4627-90f9-479cb6c9a8dc","resolution":{"observed_at":"2026-08-09T11:22:29.145635Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1809.02591","last_updated":"2020-12-12T12:57:19Z","snapshot_observed_at":"2026-08-06T22:01:26.067104Z","submitted_at":"2018-09-07T17:32:19Z","title":"Learning Invariances for Policy Generalization","version":2},"cited_work":{"arxiv_id":"1809.02591","doi":null,"metadata_source":"pith","pith_arxiv_id":"1809.02591","snapshot_observed_at":"2026-08-09T11:22:29.116478Z","title":"Learning Invariances for Policy Generalization","venue":"cs.LG","work_id":"a488c802-672d-486f-95cb-87e36b832334","year":2018},"citing_paper":{"arxiv_id":"2502.02743","last_updated":"2025-02-04T22:09:43Z","snapshot_observed_at":"2026-08-09T16:32:54.357740Z","submitted_at":"2025-02-04T22:09:43Z","title":"LLM Bandit: Cost-Efficient LLM Generation via Preference-Conditioned Dynamic Routing","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-09T11:22:28.974763Z"},"links":{"cited_paper":"/paper/1809.02591","citing_paper":"/paper/2502.02743"},"observation_digest":"sha256:ea76667ebebc227a2cba31c14b814ce8b549959a023d90b8973f099cd8f3f1f5","observation_id":"7ac6d6da-8e32-4b34-a0dd-9d1b9d623bdb","resolution":{"observed_at":"2026-08-09T11:22:29.123383Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.10742","last_updated":"2021-04-07T01:57:14Z","snapshot_observed_at":"2026-07-06T09:30:32.320227Z","submitted_at":"2020-06-18T17:59:35Z","title":"Learning Invariant Representations for Reinforcement Learning without Reconstruction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.10742","snapshot_observed_at":"2026-08-09T11:22:28.984591Z","title":"Learning invariant representations for rein- forcement learning without reconstruction","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2502.02743","last_updated":"2025-02-04T22:09:43Z","snapshot_observed_at":"2026-08-09T16:32:54.357740Z","submitted_at":"2025-02-04T22:09:43Z","title":"LLM Bandit: Cost-Efficient LLM Generation via Preference-Conditioned Dynamic Routing","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-09T11:22:28.984591Z"},"links":{"cited_paper":"/paper/2006.10742","citing_paper":"/paper/2502.02743"},"observation_digest":"sha256:37a8a94f6b3eaea350f0e8b342b78c4c60bda0b5e9fe539f3943dc922eedd674","observation_id":"5c4ad380-aff4-4c88-8cf5-3c28898c07a3","resolution":{"observed_at":"2026-08-09T11:22:28.984591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1710.09412","last_updated":"2018-04-27T21:39:25Z","snapshot_observed_at":"2026-08-08T10:28:19.597631Z","submitted_at":"2017-10-25T18:30:49Z","title":"mixup: Beyond Empirical Risk Minimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.09412","snapshot_observed_at":"2026-08-09T11:22:28.989984Z","title":"mixup: Beyond empirical risk minimization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02743","last_updated":"2025-02-04T22:09:43Z","snapshot_observed_at":"2026-08-09T16:32:54.357740Z","submitted_at":"2025-02-04T22:09:43Z","title":"LLM Bandit: Cost-Efficient LLM Generation via Preference-Conditioned Dynamic Routing","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-09T11:22:28.989984Z"},"links":{"cited_paper":"/paper/1710.09412","citing_paper":"/paper/2502.02743"},"observation_digest":"sha256:ff666ba5efda45a0b4b92fefe55f84da813b3706cc63b7b52ec80fae41406524","observation_id":"02f2f55a-38e9-40d5-bf87-24070dd32974","resolution":{"observed_at":"2026-08-09T11:22:28.989984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:22:29.650706Z","title":"Theoretical Analysis A.1","venue":null,"work_id":"e52e336c-e8a4-4645-b964-6abba121bbe9","year":2019},"citing_paper":{"arxiv_id":"2502.02743","last_updated":"2025-02-04T22:09:43Z","snapshot_observed_at":"2026-08-09T16:32:54.357740Z","submitted_at":"2025-02-04T22:09:43Z","title":"LLM Bandit: Cost-Efficient LLM Generation via Preference-Conditioned Dynamic Routing","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-09T11:22:28.999316Z"},"links":{"citing_paper":"/paper/2502.02743"},"observation_digest":"sha256:a1481e66a754667ec2d3c461d67a82ec789cab4706ec1f9ace2cfb2c8f7b57d0","observation_id":"c214eea0-a91b-4855-8df1-705d464f4073","resolution":{"observed_at":"2026-08-09T11:22:29.656086Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:22:29.634408Z","title":"With the calibrated evaluation scores ¯p on a prompt x and a user preference vector ω, the routing action is determined by ˆa = arg maxk∈{k1,k2} ωT [¯pk, −ck]","venue":null,"work_id":"e197d2e9-7851-489e-b53e-0b3f5efcde1b","year":2020},"citing_paper":{"arxiv_id":"2502.02743","last_updated":"2025-02-04T22:09:43Z","snapshot_observed_at":"2026-08-09T16:32:54.357740Z","submitted_at":"2025-02-04T22:09:43Z","title":"LLM Bandit: Cost-Efficient LLM Generation via Preference-Conditioned Dynamic Routing","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-09T11:22:29.004445Z"},"links":{"citing_paper":"/paper/2502.02743"},"observation_digest":"sha256:9dd5ff6ff045a75ad37b14dee94d72920f2c902e53ca3f432c50666e9d39f028","observation_id":"8c20daa2-5818-4673-b3e8-828e12b16eaf","resolution":{"observed_at":"2026-08-09T11:22:29.639945Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:22:29.603722Z","title":"To account for varying user preferences, we evaluate RouteLLM using a range of different thresholds","venue":null,"work_id":"d19180d2-33a0-433b-8425-0d7d74b49e14","year":2024},"citing_paper":{"arxiv_id":"2502.02743","last_updated":"2025-02-04T22:09:43Z","snapshot_observed_at":"2026-08-09T16:32:54.357740Z","submitted_at":"2025-02-04T22:09:43Z","title":"LLM Bandit: Cost-Efficient LLM Generation via Preference-Conditioned Dynamic Routing","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-09T11:22:29.015064Z"},"links":{"citing_paper":"/paper/2502.02743"},"observation_digest":"sha256:16d84e12c7be17c6fd3c280db9377300159dde13766066434e133730595b2d7a","observation_id":"0dd9f0e1-a8bf-40d0-8d7e-9155cee582bc","resolution":{"observed_at":"2026-08-09T11:22:29.608747Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:22:29.619210Z","title":"The estimated cost of invoking the models for processing 1M input tokens and generating 1M output tokens","venue":null,"work_id":"8fd0efd5-fe1f-4521-9684-7301f36b0702","year":2024},"citing_paper":{"arxiv_id":"2502.02743","last_updated":"2025-02-04T22:09:43Z","snapshot_observed_at":"2026-08-09T16:32:54.357740Z","submitted_at":"2025-02-04T22:09:43Z","title":"LLM Bandit: Cost-Efficient LLM Generation via Preference-Conditioned Dynamic Routing","version":1},"reference_index":128,"source":"pdf_text","source_observed_at":"2026-08-09T11:22:29.009937Z"},"links":{"citing_paper":"/paper/2502.02743"},"observation_digest":"sha256:3f49e60224125e01854de207d8e6793e8484ab86509cd6dd8d1ae52899f58e25","observation_id":"37ef9fe1-ced8-4d73-a939-e44e61d7c86a","resolution":{"observed_at":"2026-08-09T11:22:29.624214Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.00123","last_updated":"2020-01-17T23:25:22Z","snapshot_observed_at":"2026-08-09T08:49:17.514020Z","submitted_at":"2018-09-29T00:52:34Z","title":"Generalization and Regularization in DQN","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.00123","snapshot_observed_at":"2026-08-09T11:22:28.868513Z","title":"C., and Bowling, M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02743","last_updated":"2025-02-04T22:09:43Z","snapshot_observed_at":"2026-08-09T16:32:54.357740Z","submitted_at":"2025-02-04T22:09:43Z","title":"LLM Bandit: Cost-Efficient LLM Generation via Preference-Conditioned Dynamic Routing","version":1},"reference_index":1967,"source":"pdf_text","source_observed_at":"2026-08-09T11:22:28.868513Z"},"links":{"cited_paper":"/paper/1810.00123","citing_paper":"/paper/2502.02743"},"observation_digest":"sha256:b1994d4262481e122786b5370ac26b5b7bf0cac4fa4b953be2c5d214f3994bcb","observation_id":"ec076800-faf5-4fb0-86b8-f4e561d1f171","resolution":{"observed_at":"2026-08-09T11:22:28.868513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:22:29.680943Z","title":"and Doshi-Velez, F","venue":null,"work_id":"6f536051-ba98-4551-9a0d-f9a3e7761f00","year":2014},"citing_paper":{"arxiv_id":"2502.02743","last_updated":"2025-02-04T22:09:43Z","snapshot_observed_at":"2026-08-09T16:32:54.357740Z","submitted_at":"2025-02-04T22:09:43Z","title":"LLM Bandit: Cost-Efficient LLM Generation via Preference-Conditioned Dynamic Routing","version":1},"reference_index":1987,"source":"pdf_text","source_observed_at":"2026-08-09T11:22:28.898237Z"},"links":{"citing_paper":"/paper/2502.02743"},"observation_digest":"sha256:1371983610b95ab0316d54f60a99244351ad96cdf5cb402417b7b622fd15cce3","observation_id":"345d3ba7-16d1-4ae9-87e7-68e07391531d","resolution":{"observed_at":"2026-08-09T11:22:29.686218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.02134","last_updated":"2024-05-03T14:38:59Z","snapshot_observed_at":"2026-07-31T01:43:43.437617Z","submitted_at":"2024-05-03T14:38:59Z","title":"Optimising Calls to Large Language Models with Uncertainty-Based Two-Tier Selection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.02134","snapshot_observed_at":"2026-08-09T11:22:28.946558Z","title":"Optimising calls to large language models with uncertainty-based two-tier selection","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02743","last_updated":"2025-02-04T22:09:43Z","snapshot_observed_at":"2026-08-09T16:32:54.357740Z","submitted_at":"2025-02-04T22:09:43Z","title":"LLM Bandit: Cost-Efficient LLM Generation via Preference-Conditioned Dynamic Routing","version":1},"reference_index":1999,"source":"pdf_text","source_observed_at":"2026-08-09T11:22:28.946558Z"},"links":{"cited_paper":"/paper/2405.02134","citing_paper":"/paper/2502.02743"},"observation_digest":"sha256:edd531c976f181fe3dfc373ffb6450686eae79c088505d75187045d450884c30","observation_id":"82e5d072-7412-4b14-85bf-29d062e5d1ac","resolution":{"observed_at":"2026-08-09T11:22:28.946558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.11601","last_updated":"2023-08-23T17:34:17Z","snapshot_observed_at":"2026-07-06T16:09:09.018523Z","submitted_at":"2023-08-22T17:48:24Z","title":"Tryage: Real-time, intelligent Routing of User Prompts to Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.11601","snapshot_observed_at":"2026-08-09T11:22:28.873531Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02743","last_updated":"2025-02-04T22:09:43Z","snapshot_observed_at":"2026-08-09T16:32:54.357740Z","submitted_at":"2025-02-04T22:09:43Z","title":"LLM Bandit: Cost-Efficient LLM Generation via Preference-Conditioned Dynamic Routing","version":1},"reference_index":2013,"source":"pdf_text","source_observed_at":"2026-08-09T11:22:28.873531Z"},"links":{"cited_paper":"/paper/2308.11601","citing_paper":"/paper/2502.02743"},"observation_digest":"sha256:9f753189183afc998de2bd605400c1e7b817d57a2f2dccdfff640ac1f0aafb79","observation_id":"be890cb1-f802-4b56-bfe0-83c21c0d636d","resolution":{"observed_at":"2026-08-09T11:22:28.873531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01542","last_updated":"2024-05-09T16:04:20Z","snapshot_observed_at":"2026-07-06T16:26:46.131908Z","submitted_at":"2023-10-02T18:31:35Z","title":"Fusing Models with Complementary Expertise","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01542","snapshot_observed_at":"2026-08-09T11:22:28.979953Z","title":"M., Sun, Y ., Kundu, S., Xing, E., and Yurochkin, M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02743","last_updated":"2025-02-04T22:09:43Z","snapshot_observed_at":"2026-08-09T16:32:54.357740Z","submitted_at":"2025-02-04T22:09:43Z","title":"LLM Bandit: Cost-Efficient LLM Generation via Preference-Conditioned Dynamic Routing","version":1},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-09T11:22:28.979953Z"},"links":{"cited_paper":"/paper/2310.01542","citing_paper":"/paper/2502.02743"},"observation_digest":"sha256:c9536188b2ccd7f4f832ae8873752187c50339a2cfa7dcc639181800212a47d9","observation_id":"0747d94e-aab5-475b-b68e-592ed4edb145","resolution":{"observed_at":"2026-08-09T11:22:28.979953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-09T11:22:28.961052Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02743","last_updated":"2025-02-04T22:09:43Z","snapshot_observed_at":"2026-08-09T16:32:54.357740Z","submitted_at":"2025-02-04T22:09:43Z","title":"LLM Bandit: Cost-Efficient LLM Generation via Preference-Conditioned Dynamic Routing","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-09T11:22:28.961052Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2502.02743"},"observation_digest":"sha256:c75548dd3528f5bea5bcde768e4f2840121dc4e2232ec11cb6374b8324dfe44e","observation_id":"5eb8273e-0ad3-4fce-95c9-6fe0f4f378a9","resolution":{"observed_at":"2026-08-09T11:22:28.961052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.15587","last_updated":"2021-12-03T05:40:31Z","snapshot_observed_at":"2026-08-06T22:06:23.346843Z","submitted_at":"2021-06-29T17:21:59Z","title":"Generalization of Reinforcement Learning with Policy-Aware Adversarial Data Augmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.15587","snapshot_observed_at":"2026-08-09T11:22:28.994652Z","title":"and Guo, Y","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02743","last_updated":"2025-02-04T22:09:43Z","snapshot_observed_at":"2026-08-09T16:32:54.357740Z","submitted_at":"2025-02-04T22:09:43Z","title":"LLM Bandit: Cost-Efficient LLM Generation via Preference-Conditioned Dynamic Routing","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-09T11:22:28.994652Z"},"links":{"cited_paper":"/paper/2106.15587","citing_paper":"/paper/2502.02743"},"observation_digest":"sha256:967df411d2a9c6d30800a1433b26cc6c6433cfb4db590601466e35a29d138f91","observation_id":"9050406b-4c85-4912-ab30-6fd5499245ce","resolution":{"observed_at":"2026-08-09T11:22:28.994652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-09T11:22:28.813999Z","title":"L., Almeida, D., Altenschmidt, J., Altman, S., Anadkat, S., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02743","last_updated":"2025-02-04T22:09:43Z","snapshot_observed_at":"2026-08-09T16:32:54.357740Z","submitted_at":"2025-02-04T22:09:43Z","title":"LLM Bandit: Cost-Efficient LLM Generation via Preference-Conditioned Dynamic Routing","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-09T11:22:28.813999Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2502.02743"},"observation_digest":"sha256:64c27d5dd7c1fb936140d2f6607fc2317321d887bcbcdc535b957537f342f266","observation_id":"c2891f28-fd3c-481a-bd48-daa7ea2de030","resolution":{"observed_at":"2026-08-09T11:22:28.813999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-08T06:16:25.839566Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-09T11:22:28.888358Z","title":"Q., Sablayrolles, A., Roux, A., Mensch, A., Savary, B., Bamford, C., Chaplot, D","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02743","last_updated":"2025-02-04T22:09:43Z","snapshot_observed_at":"2026-08-09T16:32:54.357740Z","submitted_at":"2025-02-04T22:09:43Z","title":"LLM Bandit: Cost-Efficient LLM Generation via Preference-Conditioned Dynamic Routing","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-09T11:22:28.888358Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2502.02743"},"observation_digest":"sha256:1355599b6a68cf2a7ed39416852ba735bb3e042b780ce8083d1ffaf2ac2a97ac","observation_id":"20a156f6-5bdc-4bd0-88c5-e00dcfde39b3","resolution":{"observed_at":"2026-08-09T11:22:28.888358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.07914","last_updated":"2023-05-29T19:29:13Z","snapshot_observed_at":"2026-07-06T13:42:28.585870Z","submitted_at":"2022-08-16T19:23:02Z","title":"PD-MORL: Preference-Driven Multi-Objective Reinforcement Learning Algorithm","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.07914","snapshot_observed_at":"2026-08-09T11:22:28.826130Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02743","last_updated":"2025-02-04T22:09:43Z","snapshot_observed_at":"2026-08-09T16:32:54.357740Z","submitted_at":"2025-02-04T22:09:43Z","title":"LLM Bandit: Cost-Efficient LLM Generation via Preference-Conditioned Dynamic Routing","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-09T11:22:28.826130Z"},"links":{"cited_paper":"/paper/2208.07914","citing_paper":"/paper/2502.02743"},"observation_digest":"sha256:fc7cfccd0de7833042ec002e9eccb11cb3e571b87f36446c3e7c57d8c6285647","observation_id":"f57a25b6-fd3f-4e7a-b931-8f65302520c6","resolution":{"observed_at":"2026-08-09T11:22:28.826130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.10040","last_updated":"2019-04-02T14:17:40Z","snapshot_observed_at":"2026-08-03T12:17:10.040125Z","submitted_at":"2019-04-02T14:17:40Z","title":"A Survey on Practical Applications of Multi-Armed and Contextual Bandits","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.10040","snapshot_observed_at":"2026-08-09T11:22:28.836851Z","title":"and Rish, I","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2502.02743","last_updated":"2025-02-04T22:09:43Z","snapshot_observed_at":"2026-08-09T16:32:54.357740Z","submitted_at":"2025-02-04T22:09:43Z","title":"LLM Bandit: Cost-Efficient LLM Generation via Preference-Conditioned Dynamic Routing","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-09T11:22:28.836851Z"},"links":{"cited_paper":"/paper/1904.10040","citing_paper":"/paper/2502.02743"},"observation_digest":"sha256:96c431ec879af54187f0ffc5a757c6c8612b0a790567112d502ed40dff1c79c1","observation_id":"405d56ad-0241-441e-9b31-ee974e60cd36","resolution":{"observed_at":"2026-08-09T11:22:28.836851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.05265","last_updated":"2021-03-18T13:58:01Z","snapshot_observed_at":"2026-07-06T10:32:19.938039Z","submitted_at":"2021-01-13T18:55:43Z","title":"Contrastive Behavioral Similarity Embeddings for Generalization in Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.05265","snapshot_observed_at":"2026-08-09T11:22:28.820492Z","title":"C., Castro, P","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02743","last_updated":"2025-02-04T22:09:43Z","snapshot_observed_at":"2026-08-09T16:32:54.357740Z","submitted_at":"2025-02-04T22:09:43Z","title":"LLM Bandit: Cost-Efficient LLM Generation via Preference-Conditioned Dynamic Routing","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-09T11:22:28.820492Z"},"links":{"cited_paper":"/paper/2101.05265","citing_paper":"/paper/2502.02743"},"observation_digest":"sha256:5f2f809c9957eb11f75c2938814d7dc3bbbbf1ac037209a6a8d365a8fc2d1d31","observation_id":"fcce90a7-c71b-49de-b617-8e48fbfcdadf","resolution":{"observed_at":"2026-08-09T11:22:28.820492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07408","last_updated":"2023-06-12T20:21:40Z","snapshot_observed_at":"2026-07-06T15:41:47.403922Z","submitted_at":"2023-06-12T20:21:40Z","title":"Robust Reinforcement Learning through Efficient Adversarial Herding","version":1},"cited_work":{"arxiv_id":"2306.07408","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.07408","snapshot_observed_at":"2026-08-09T11:22:29.450462Z","title":"Robust Reinforcement Learning through Efficient Adversarial Herding","venue":"cs.LG","work_id":"571990c6-307a-40c0-ab70-0cfc1cfecf2d","year":2023},"citing_paper":{"arxiv_id":"2502.02743","last_updated":"2025-02-04T22:09:43Z","snapshot_observed_at":"2026-08-09T16:32:54.357740Z","submitted_at":"2025-02-04T22:09:43Z","title":"LLM Bandit: Cost-Efficient LLM Generation via Preference-Conditioned Dynamic Routing","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-09T11:22:28.863181Z"},"links":{"cited_paper":"/paper/2306.07408","citing_paper":"/paper/2502.02743"},"observation_digest":"sha256:dd92a350a99b8cec1071ec25aab5cd17a57159ae69d91d8567a4098a4fb58759","observation_id":"4ea73457-752d-4539-9bd2-390d37b57dfe","resolution":{"observed_at":"2026-08-09T11:22:29.455816Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2502.02743","last_updated":"2025-02-04T22:09:43Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T16:32:54.357740Z","submitted_at":"2025-02-04T22:09:43Z","title":"LLM Bandit: Cost-Efficient LLM Generation via Preference-Conditioned Dynamic Routing"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":31,"verified_exact":4,"verified_fuzzy":5},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 10 inbound Pith citation observations for arXiv:2502.02743."}