{"as_of":"2026-08-10T04:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:088136dd4e60e94f274bd8017934551b53bf602f302098fcffd83caf6e938def","coverage":[{"denominator":104,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:56:57.070193Z","state":"measured"},{"denominator":106,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":106,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":6,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":6,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T19:10:53.372941Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":1,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.06579","snapshot_observed_at":"2026-08-09T19:10:53.372941Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.00409","last_updated":"2025-07-21T12:20:06Z","snapshot_observed_at":"2026-08-10T00:34:58.507365Z","submitted_at":"2025-02-01T12:08:38Z","title":"Doing More with Less: A Survey on Routing Strategies for Resource Optimisation in Large Language Model-Based Systems","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-09T19:10:53.372941Z"},"links":{"cited_paper":"/paper/2506.06579","citing_paper":"/paper/2502.00409"},"observation_digest":"sha256:9980b5d2a5cabe5883b7363f9d23546069ade08d4257c339edd9f280e6509824","observation_id":"8bd8a001-206d-4097-95ca-4f1690881d27","resolution":{"observed_at":"2026-08-09T19:10:53.372941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.06579","snapshot_observed_at":"2026-08-04T19:34:25.790205Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09193","last_updated":"2025-09-11T07:09:30Z","snapshot_observed_at":"2026-08-07T07:37:18.552922Z","submitted_at":"2025-09-11T07:09:30Z","title":"AI Reasoning for Wireless Communications and Networking: A Survey and Perspectives","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-04T19:34:25.790205Z"},"links":{"cited_paper":"/paper/2506.06579","citing_paper":"/paper/2509.09193"},"observation_digest":"sha256:5b23505091eded3961aca2349f75743fc26e7c409ae97b81115300aa39dbe483","observation_id":"51c91ec7-75e7-407b-bacb-1972153792d3","resolution":{"observed_at":"2026-08-04T19:34:25.790205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"cited_work":{"arxiv_id":"2506.06579","doi":"10.48550/arxiv.2506.06579","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.06579","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Towards efficient multi-llm inference: Characterization and analysis of llm routing and hierarchical techniques","venue":"ArXiv.org","work_id":"aa68a473-69c6-46c7-b732-df1a11a89102","year":2025},"citing_paper":{"arxiv_id":"2605.01111","last_updated":"2026-05-01T21:31:59Z","snapshot_observed_at":"2026-07-06T23:14:24.758147Z","submitted_at":"2026-05-01T21:31:59Z","title":"When Less is Enough: Efficient Inference via Collaborative Reasoning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:04.267404Z"},"links":{"cited_paper":"/paper/2506.06579","citing_paper":"/paper/2605.01111"},"observation_digest":"sha256:3ca24ed495efe574638bfab0466e69a6f6c08ed265fe34703b2e56e49a49d0bc","observation_id":"744745d6-6957-4b28-bb15-51ab1b51eaec","resolution":{"observed_at":"2026-05-11T15:41:42.531986Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"cited_work":{"arxiv_id":"2506.06579","doi":"10.48550/arxiv.2506.06579","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.06579","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Towards efficient multi-llm inference: Characterization and analysis of llm routing and hierarchical techniques","venue":"ArXiv.org","work_id":"aa68a473-69c6-46c7-b732-df1a11a89102","year":2025},"citing_paper":{"arxiv_id":"2605.11317","last_updated":"2026-05-11T23:07:33Z","snapshot_observed_at":"2026-07-06T23:23:11.928199Z","submitted_at":"2026-05-11T23:07:33Z","title":"SOMA: Efficient Multi-turn LLM Serving via Small Language Model","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-13T01:37:27.361504Z"},"links":{"cited_paper":"/paper/2506.06579","citing_paper":"/paper/2605.11317"},"observation_digest":"sha256:70bbb7a0c4f338230281e062999654842dfcd46127ca4371611b108eb80e8ed8","observation_id":"34674ce5-e34d-40c4-97ff-f856eab0a7c5","resolution":{"observed_at":"2026-05-13T01:42:04.221906Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"cited_work":{"arxiv_id":"2506.06579","doi":"10.48550/arxiv.2506.06579","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.06579","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Towards efficient multi-llm inference: Characterization and analysis of llm routing and hierarchical techniques","venue":"ArXiv.org","work_id":"aa68a473-69c6-46c7-b732-df1a11a89102","year":2025},"citing_paper":{"arxiv_id":"2606.06840","last_updated":"2026-06-05T02:32:24Z","snapshot_observed_at":"2026-08-05T15:03:33.373071Z","submitted_at":"2026-06-05T02:32:24Z","title":"Characterize Then Distill: Mechanistic Reasoning in Large Output Spaces","version":1},"reference_index":141,"source":"arxiv_source","source_observed_at":"2026-06-27T22:22:52.690010Z"},"links":{"cited_paper":"/paper/2506.06579","citing_paper":"/paper/2606.06840"},"observation_digest":"sha256:917340b49cb1ddb0263320cad7439ff2f37eb50f169d6e5940535fc9de4dba33","observation_id":"4f495410-efb5-4926-87f1-8dcf3557bdb5","resolution":{"observed_at":"2026-06-27T22:31:21.605739Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"cited_work":{"arxiv_id":"2506.06579","doi":"10.48550/arxiv.2506.06579","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.06579","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Towards efficient multi-llm inference: Characterization and analysis of llm routing and hierarchical techniques","venue":"ArXiv.org","work_id":"aa68a473-69c6-46c7-b732-df1a11a89102","year":2025},"citing_paper":{"arxiv_id":"2606.06924","last_updated":"2026-06-05T05:42:00Z","snapshot_observed_at":"2026-08-06T11:49:12.989321Z","submitted_at":"2026-06-05T05:42:00Z","title":"From Sampled Outcomes to Capability Distributions: Rethinking Supervision for LLM Routing","version":1},"reference_index":147,"source":"arxiv_source","source_observed_at":"2026-06-27T22:54:28.452796Z"},"links":{"cited_paper":"/paper/2506.06579","citing_paper":"/paper/2606.06924"},"observation_digest":"sha256:ad65c1533b76ea1fa0b3795b14c0f8272930321a1ff08c77e70388f1c2530f36","observation_id":"4fbda2fd-a0ef-45e3-b4ae-6be656850ee8","resolution":{"observed_at":"2026-07-02T16:17:08.806454Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.06579/citation-record","integrity":"/paper/2506.06579/integrity","json":"/paper/2506.06579/citation-record.json","paper":"/paper/2506.06579"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-07-30T09:12:38.100527Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-07T05:56:56.676293Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.676293Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:fac9ed3aad9209ab3a9b84ba072ed23fa5ffc28fc28e65a9c78e941b7951a05e","observation_id":"18d0f5d8-50b3-4731-9b87-671596bc7b41","resolution":{"observed_at":"2026-08-07T05:56:56.676293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:56:56.681421Z","title":"Gpt-3: What is it good for,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.681421Z"},"links":{"citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:cc4a23f401af7282903427e8b3f319e70d636482dc616f895019d14c4eb4e148","observation_id":"81b4d2ff-f2a3-422a-9949-b79583aae3c4","resolution":{"observed_at":"2026-08-07T05:56:56.681421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02954","last_updated":"2024-01-05T18:59:13Z","snapshot_observed_at":"2026-08-02T13:11:16.882565Z","submitted_at":"2024-01-05T18:59:13Z","title":"DeepSeek LLM: Scaling Open-Source Language Models with Longtermism","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02954","snapshot_observed_at":"2026-08-07T05:56:56.685256Z","title":"Deepseek llm: Scaling open-source language models with longtermism,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.685256Z"},"links":{"cited_paper":"/paper/2401.02954","citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:e0ec10005b8008d720243bd337ee62403bf68f728e790d9d8ba52a0e2fa043ed","observation_id":"05ee312a-aeb1-4c58-afe7-62044f8759ee","resolution":{"observed_at":"2026-08-07T05:56:56.685256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.18921","last_updated":"2025-03-20T05:23:42Z","snapshot_observed_at":"2026-07-06T18:52:34.247456Z","submitted_at":"2024-07-09T13:47:05Z","title":"Mobile Edge Intelligence for Large Language Models: A Contemporary Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.18921","snapshot_observed_at":"2026-08-07T05:56:56.689467Z","title":"Mobile edge intelligence for large language models: A contemporary survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.689467Z"},"links":{"cited_paper":"/paper/2407.18921","citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:64ded98bd351dc45aeab07d72096ec6b5a9a7b24c661acbfe8549447582c42a9","observation_id":"b3796b1a-f0bc-4e92-a908-bdbe0898d0e7","resolution":{"observed_at":"2026-08-07T05:56:56.689467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01799","last_updated":"2024-04-24T04:58:46Z","snapshot_observed_at":"2026-08-09T10:27:23.354418Z","submitted_at":"2024-02-02T06:29:34Z","title":"Faster and Lighter LLMs: A Survey on Current Challenges and Way Forward","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01799","snapshot_observed_at":"2026-08-07T05:56:56.693866Z","title":"Faster and lighter llms: A survey on current challenges and way forward,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.693866Z"},"links":{"cited_paper":"/paper/2402.01799","citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:8efe5ebc76b6e5fd35d0ca8683dc2302188469f07eac3db267fba9645ec364e3","observation_id":"46ff31e9-dd1b-46b2-96a3-52481f9c4c92","resolution":{"observed_at":"2026-08-07T05:56:56.693866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08092","last_updated":"2024-09-23T07:37:34Z","snapshot_observed_at":"2026-08-09T14:18:39.128715Z","submitted_at":"2024-01-16T03:35:26Z","title":"A Survey of Resource-efficient LLM and Multimodal Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08092","snapshot_observed_at":"2026-08-07T05:56:56.698136Z","title":"A survey of resource-efficient llm and mul- timodal foundation models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.698136Z"},"links":{"cited_paper":"/paper/2401.08092","citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:384969ccb000325f2decd74d41d6f991e619c3038e8024b58a5c3c3e18a37bd7","observation_id":"33ce2435-327e-49b8-953f-09acee7540f3","resolution":{"observed_at":"2026-08-07T05:56:56.698136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:56:56.703061Z","title":"Efficient compressing and tuning methods for large language models: A systematic literature review,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.703061Z"},"links":{"citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:6eb6a5ccff0fa3a133ce37f3d3244f453f895a4de8afa22c67b86ad0dbfac2f0","observation_id":"9fab6bad-1562-4300-b2ef-c1200ed5900d","resolution":{"observed_at":"2026-08-07T05:56:56.703061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13372","last_updated":"2024-06-27T22:44:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-20T08:08:54Z","title":"LlamaFactory: Unified Efficient Fine-Tuning of 100+ Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13372","snapshot_observed_at":"2026-08-07T05:56:56.706799Z","title":"Llamafactory: Unified efficient fine-tuning of 100+ language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.706799Z"},"links":{"cited_paper":"/paper/2403.13372","citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:c600b42c3e148180b459d07afb393241f06fa30c7f4a8157906184584f50ec1f","observation_id":"61647dc1-bbbe-496c-bfb1-6c23b4989b34","resolution":{"observed_at":"2026-08-07T05:56:56.706799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2504.08764","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:56:57.782657Z","title":"Evaluation of the phi-3-mini slm for identification of texts related to medicine, health, and sports injuries,","venue":null,"work_id":"c903c324-775b-41f9-b3cc-972e91c8cfe8","year":2025},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.710904Z"},"links":{"citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:6f587fc6a1dc025a67f8be6dd0558d353edc7769ddd63a36b8b4bfe539f5d89d","observation_id":"3e1f6fc4-ce73-4bd6-988b-01bc1c177bbd","resolution":{"observed_at":"2026-08-07T05:56:57.788517Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:56:56.714951Z","title":"Harnessing moderate- sized language models for reliable patient data deidentification in emergency department records: Algorithm development, validation, and implementation study,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.714951Z"},"links":{"citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:bb2c2b37349ea081d80179a9a297aea80ac402a36344ce71bfe7f3285cc7ce7e","observation_id":"e5184609-c34b-4f89-b9d8-454290dbc810","resolution":{"observed_at":"2026-08-07T05:56:56.714951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:56:56.718751Z","title":"Overview of small language models in practice,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.718751Z"},"links":{"citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:a9943f6f5aac5d49d423e3ac6cf134e0efcade3634f72e4578faa92bb086741e","observation_id":"ef61aed4-6660-40d4-a88f-3ed439004692","resolution":{"observed_at":"2026-08-07T05:56:56.718751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10834","last_updated":"2025-04-22T03:55:14Z","snapshot_observed_at":"2026-08-02T06:57:44.337097Z","submitted_at":"2024-07-15T15:45:07Z","title":"MetaLLM: A High-performant and Cost-efficient Dynamic Framework for Wrapping LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10834","snapshot_observed_at":"2026-08-07T05:56:56.722420Z","title":"Metallm: A high-performant and cost- efficient dynamic framework for wrapping llms,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.722420Z"},"links":{"cited_paper":"/paper/2407.10834","citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:20cc4b59560856e99913000a1cd4dad13b5f7206b4d2e9eb393d69dc117bccbd","observation_id":"25ca84e2-fe07-4ddb-9284-b90423a8e8de","resolution":{"observed_at":"2026-08-07T05:56:56.722420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03046","last_updated":"2023-10-03T22:16:13Z","snapshot_observed_at":"2026-07-06T16:27:51.438846Z","submitted_at":"2023-10-03T22:16:13Z","title":"EcoAssistant: Using LLM Assistant More Affordably and Accurately","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03046","snapshot_observed_at":"2026-08-07T05:56:56.726464Z","title":"Ecoassistant: Using llm assistant more affordably and accurately,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.726464Z"},"links":{"cited_paper":"/paper/2310.03046","citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:639c889c30e3dc1618438a4b7c3bab7090d5068d65715b8e7a5ce6afa2c737cc","observation_id":"5cf3d3c2-0771-478c-a869-9735cf428956","resolution":{"observed_at":"2026-08-07T05:56:56.726464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.05176","last_updated":"2023-05-09T05:11:02Z","snapshot_observed_at":"2026-07-31T18:33:34.529799Z","submitted_at":"2023-05-09T05:11:02Z","title":"FrugalGPT: How to Use Large Language Models While Reducing Cost and Improving Performance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.05176","snapshot_observed_at":"2026-08-07T05:56:56.730282Z","title":"Frugalgpt: How to use large language models while reducing cost and improving performance,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.730282Z"},"links":{"cited_paper":"/paper/2305.05176","citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:34ff2f7e6a985723b5fe02e2205b9063ed411806372df06b9acee02ee86b93f3","observation_id":"ebb02bfe-3add-451a-adfe-b3185ef308e7","resolution":{"observed_at":"2026-08-07T05:56:56.730282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00467","last_updated":"2024-05-01T12:04:28Z","snapshot_observed_at":"2026-08-03T15:18:25.179746Z","submitted_at":"2024-05-01T12:04:28Z","title":"Harnessing the Power of Multiple Minds: Lessons Learned from LLM Routing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00467","snapshot_observed_at":"2026-08-07T05:56:56.734663Z","title":"Harnessing the power of multiple minds: Lessons learned from llm routing,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.734663Z"},"links":{"cited_paper":"/paper/2405.00467","citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:c8ebed5e317a7c8d4c2c053a045e7c461dbcd419f38624a6ddd6544c8f091a4b","observation_id":"1adff952-db0e-4c63-9f30-5560021ae50e","resolution":{"observed_at":"2026-08-07T05:56:56.734663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08692","last_updated":"2023-11-15T04:40:43Z","snapshot_observed_at":"2026-07-06T16:47:45.504109Z","submitted_at":"2023-11-15T04:40:43Z","title":"Routing to the Expert: Efficient Reward-guided Ensemble of Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08692","snapshot_observed_at":"2026-08-07T05:56:56.738323Z","title":"Routing to the expert: Efficient reward-guided ensemble of large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.738323Z"},"links":{"cited_paper":"/paper/2311.08692","citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:49b69fe1c9217d54895990b32f4f7b7b70ff4680018c7961f40f7ddd33b2b6af","observation_id":"c53fac9d-a16e-49b1-9c65-099db0fc7b9b","resolution":{"observed_at":"2026-08-07T05:56:56.738323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10657","last_updated":"2025-05-20T14:59:21Z","snapshot_observed_at":"2026-08-08T08:35:41.016025Z","submitted_at":"2025-03-08T04:07:07Z","title":"RouterEval: A Comprehensive Benchmark for Routing LLMs to Explore Model-level Scaling Up in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10657","snapshot_observed_at":"2026-08-07T05:56:56.742261Z","title":"Routereval: A comprehensive benchmark for routing llms to explore model-level scaling up in llms,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.742261Z"},"links":{"cited_paper":"/paper/2503.10657","citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:7a35c14fc3b4c5bf075d8780c8825c430951acd948c766d3ac6d6e50ea5e150a","observation_id":"e13a777d-61db-46c8-bd3e-3388bac034aa","resolution":{"observed_at":"2026-08-07T05:56:56.742261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12031","last_updated":"2024-03-28T17:56:28Z","snapshot_observed_at":"2026-08-09T22:21:33.340392Z","submitted_at":"2024-03-18T17:59:04Z","title":"RouterBench: A Benchmark for Multi-LLM Routing System","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12031","snapshot_observed_at":"2026-08-07T05:56:56.746355Z","title":"Routerbench: A benchmark for multi-llm routing system,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.746355Z"},"links":{"cited_paper":"/paper/2403.12031","citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:7f295482c6b5b56b8c83453cf8648bca59022c85c6968f18e3214b5d09071f01","observation_id":"109d4bb6-2963-4afc-a98d-8f293c457236","resolution":{"observed_at":"2026-08-07T05:56:56.746355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14294","last_updated":"2024-07-19T04:47:36Z","snapshot_observed_at":"2026-07-06T18:03:47.096406Z","submitted_at":"2024-04-22T15:53:08Z","title":"A Survey on Efficient Inference for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14294","snapshot_observed_at":"2026-08-07T05:56:56.750392Z","title":"A survey on efficient inference for large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.750392Z"},"links":{"cited_paper":"/paper/2404.14294","citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:3a8365c2d4a5e3ae5235ab336e7218dd4df8988634b88e686be7ad646228a8ce","observation_id":"e14414f2-d12c-4f9d-85c1-466be764662a","resolution":{"observed_at":"2026-08-07T05:56:56.750392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.00625","last_updated":"2024-12-29T17:38:32Z","snapshot_observed_at":"2026-08-03T07:09:22.905094Z","submitted_at":"2024-01-01T01:12:42Z","title":"Beyond Efficiency: A Systematic Survey of Resource-Efficient Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.00625","snapshot_observed_at":"2026-08-07T05:56:56.754256Z","title":"Beyond efficiency: A systematic survey of resource-efficient large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.754256Z"},"links":{"cited_paper":"/paper/2401.00625","citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:8696fc2e18cb268c6fe04a9fba6a4a4300d722b193f655dac3004d667550fc45","observation_id":"5e8ed8fa-1544-40d7-b95d-3d65bd8a07dd","resolution":{"observed_at":"2026-08-07T05:56:56.754256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20306","last_updated":"2024-03-29T17:22:48Z","snapshot_observed_at":"2026-08-09T08:03:52.911293Z","submitted_at":"2024-03-29T17:22:48Z","title":"Towards Greener LLMs: Bringing Energy-Efficiency to the Forefront of LLM Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20306","snapshot_observed_at":"2026-08-07T05:56:56.758394Z","title":"To- wards greener llms: Bringing energy-efficiency to the forefront of llm inference,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.758394Z"},"links":{"cited_paper":"/paper/2403.20306","citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:4ddd0d5e801ae71f349041a49f918dba23d4b55c56c8304018eec6fc9ece8834","observation_id":"0c823151-99af-4d27-9d87-0b6c60cb9593","resolution":{"observed_at":"2026-08-07T05:56:56.758394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12391","last_updated":"2024-07-17T08:11:47Z","snapshot_observed_at":"2026-07-06T18:47:37.971415Z","submitted_at":"2024-07-17T08:11:47Z","title":"LLM Inference Serving: Survey of Recent Advances and Opportunities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12391","snapshot_observed_at":"2026-08-07T05:56:56.762293Z","title":"Llm inference serv- ing: Survey of recent advances and opportunities,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.762293Z"},"links":{"cited_paper":"/paper/2407.12391","citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:e1b9409875ea391720f86b88eaeb0a8d4ab8f7bdc139aedf1cb76e72ea65d57a","observation_id":"23b5ca1b-7de2-48db-b85d-84b7783cced2","resolution":{"observed_at":"2026-08-07T05:56:56.762293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15234","last_updated":"2025-07-23T10:11:55Z","snapshot_observed_at":"2026-08-05T06:23:34.302204Z","submitted_at":"2023-12-23T11:57:53Z","title":"Towards Efficient Generative Large Language Model Serving: A Survey from Algorithms to Systems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15234","snapshot_observed_at":"2026-08-07T05:56:56.766216Z","title":"Towards efficient generative large language model serving: A survey from algorithms to systems,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.766216Z"},"links":{"cited_paper":"/paper/2312.15234","citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:bf56eb565b045484000883db5b620d1a87073f976937af52f15ff5ef465afdc2","observation_id":"8a93df01-9df9-49f3-a6fd-8babc8be4a46","resolution":{"observed_at":"2026-08-07T05:56:56.766216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16363","last_updated":"2024-05-01T20:42:28Z","snapshot_observed_at":"2026-08-01T22:52:35.092898Z","submitted_at":"2024-02-26T07:33:05Z","title":"LLM Inference Unveiled: Survey and Roofline Model Insights","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16363","snapshot_observed_at":"2026-08-07T05:56:56.770100Z","title":"Llm inference unveiled: Survey and roofline model insights,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.770100Z"},"links":{"cited_paper":"/paper/2402.16363","citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:8a5592e4636882000f354c7683283488755a5ff9b6c896d6dae70f4f1f4ad524","observation_id":"1d8ad172-a5ce-46a3-ad55-399e14c4ea5e","resolution":{"observed_at":"2026-08-07T05:56:56.770100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00678","last_updated":"2024-04-18T18:10:28Z","snapshot_observed_at":"2026-08-02T09:37:08.520958Z","submitted_at":"2023-12-01T16:00:25Z","title":"The Efficiency Spectrum of Large Language Models: An Algorithmic Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00678","snapshot_observed_at":"2026-08-07T05:56:56.774041Z","title":"The efficiency spectrum of large language models: An algorithmic survey,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.774041Z"},"links":{"cited_paper":"/paper/2312.00678","citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:ed8d10507b101d7523cb3c11434f7f340ac547a845276af4a28052f06325ed43","observation_id":"5a9e363e-7f67-4f63-9e44-a51864a34603","resolution":{"observed_at":"2026-08-07T05:56:56.774041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18036","last_updated":"2026-04-22T02:19:48Z","snapshot_observed_at":"2026-08-02T22:41:05.099083Z","submitted_at":"2025-02-25T09:48:53Z","title":"Harnessing Multiple Large Language Models: A Survey on LLM Ensemble","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.18036","snapshot_observed_at":"2026-08-07T05:56:56.778198Z","title":"Harnessing multiple large language models: A survey on llm ensemble,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.778198Z"},"links":{"cited_paper":"/paper/2502.18036","citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:3ffe405dde03377d4950b9fe4843dd879435fb9a1d54763c9ee92c87d773a28d","observation_id":"eb037d63-9b43-4127-a192-d9fc29db83ea","resolution":{"observed_at":"2026-08-07T05:56:56.778198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07460","last_updated":"2025-05-12T11:48:42Z","snapshot_observed_at":"2026-08-07T15:47:54.514869Z","submitted_at":"2025-05-12T11:48:42Z","title":"A Survey on Collaborative Mechanisms Between Large and Small Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07460","snapshot_observed_at":"2026-08-07T05:56:56.786194Z","title":"A survey on collaborative mech- anisms between large and small language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.786194Z"},"links":{"cited_paper":"/paper/2505.07460","citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:1a2ca3f41ed081a75737ca9297f9952f15de3509913ad25d7d881910a30d19ff","observation_id":"6039e81e-d05b-4f0a-ae3f-a52ab2991376","resolution":{"observed_at":"2026-08-07T05:56:56.786194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06204","last_updated":"2025-04-09T13:54:59Z","snapshot_observed_at":"2026-08-07T19:39:57.333135Z","submitted_at":"2024-06-26T16:34:33Z","title":"A Survey on Mixture of Experts in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06204","snapshot_observed_at":"2026-08-07T05:56:56.789923Z","title":"A survey on mixture of experts,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.789923Z"},"links":{"cited_paper":"/paper/2407.06204","citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:ebab5d8a3c94afefe29d6cb1007de49135d80b570aa0542ef7bd039736209f4f","observation_id":"5de78550-fd1b-4748-9cb0-1c7e64efeb56","resolution":{"observed_at":"2026-08-07T05:56:56.789923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:56:56.793800Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.793800Z"},"links":{"citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:63b3f2edc43046c13fdd526ab739d80f6d5874f6f1e8f302f1fd7f8cd5c5e290","observation_id":"3577678f-29a4-4934-b91a-f0345d91bd84","resolution":{"observed_at":"2026-08-07T05:56:56.793800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:56:56.797365Z","title":"Improving text classification with transformer,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.797365Z"},"links":{"citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:0bddd35c85df29f3490b2df9fdb4f658a5ca00e337bd795df00b0835001b0f47","observation_id":"0bbbec51-4dd0-4c8b-a035-89a8f7eb3720","resolution":{"observed_at":"2026-08-07T05:56:56.797365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1806.00187","last_updated":"2018-09-04T23:19:27Z","snapshot_observed_at":"2026-07-06T06:42:25.746932Z","submitted_at":"2018-06-01T04:33:16Z","title":"Scaling Neural Machine Translation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.00187","snapshot_observed_at":"2026-08-07T05:56:56.800726Z","title":"Scaling neural machine translation,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.800726Z"},"links":{"cited_paper":"/paper/1806.00187","citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:ec474b3efd5433c087a202df4b387c9b653372f5bfdc1078ec9fe7c203144319","observation_id":"978ff6f8-5e7e-437d-be5b-5011412a4460","resolution":{"observed_at":"2026-08-07T05:56:56.800726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:56:56.804693Z","title":"Block-skim: Efficient question answering for transformer,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.804693Z"},"links":{"citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:9dc9d15da1e334a255c54b4df8e05df2779b0a42100da795ce8d6af55db2ed06","observation_id":"be4655b7-aea5-4364-b2f2-dd5ae28b5a34","resolution":{"observed_at":"2026-08-07T05:56:56.804693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:56:56.808452Z","title":"An attentive survey of attention models,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.808452Z"},"links":{"citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:6d0bd97ef8ef891818cfd9b42c73a958dcdebee0481ae9db29c2ea8e7460679c","observation_id":"b2660a75-897a-4d33-bb3f-35ccf3443b7f","resolution":{"observed_at":"2026-08-07T05:56:56.808452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:56:56.811824Z","title":"Attention, please! a survey of neural attention models in deep learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.811824Z"},"links":{"citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:54a45f5a5a776799b0650b495a3db9af9f645f78aca2cd37d91cb5b8d89dee61","observation_id":"c6c1e688-a417-42a8-b552-c22a9386b9f3","resolution":{"observed_at":"2026-08-07T05:56:56.811824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:56:56.815532Z","title":"Show and tell: A neural image caption generator,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.815532Z"},"links":{"citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:3f5ba6e3d6bc928af954992b5c361f5acb2dc081144aedb96375546b55c8ea79","observation_id":"6710cb2b-7a60-47f6-bbc8-cc316fb1a6b0","resolution":{"observed_at":"2026-08-07T05:56:56.815532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:56:56.819461Z","title":"Deep learning,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.819461Z"},"links":{"citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:587aa88e4994f716e5cba953be5232d69258ec3f453cf6e1cb0b6e4cc5df1782","observation_id":"3ae31ecd-3f5e-4c04-b5b3-662fbbc0d25d","resolution":{"observed_at":"2026-08-07T05:56:56.819461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:56:56.823248Z","title":"Deep learning,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.823248Z"},"links":{"citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:bca6a8ab35e182582edb4345a0a1d967cdb0d8e1da56d689bf82f4fb1ea5a914","observation_id":"19dd7d3c-cf54-4f03-9153-8cece3bdd3da","resolution":{"observed_at":"2026-08-07T05:56:56.823248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:56:56.827223Z","title":"Long short-term memory,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.827223Z"},"links":{"citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:07ecbe9bf0b1275e8fab7044124163e0813172a60d2aea9835762aa2512481c6","observation_id":"ed2ed15a-de27-4b25-a446-5ba96e48fe8b","resolution":{"observed_at":"2026-08-07T05:56:56.827223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.09617","last_updated":"2023-05-16T17:11:29Z","snapshot_observed_at":"2026-08-03T08:52:05.725675Z","submitted_at":"2023-05-16T17:11:29Z","title":"Towards Expert-Level Medical Question Answering with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.09617","snapshot_observed_at":"2026-08-07T05:56:56.830717Z","title":"Towards expert- level medical question answering with large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.830717Z"},"links":{"cited_paper":"/paper/2305.09617","citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:c8ca7941f1d6aa23a9d7cac2bd0828e0c09621a7ce9eeb1f8fbb8b6d3e994e1a","observation_id":"91a31ed1-48ed-4645-aca7-f84d249d3ae8","resolution":{"observed_at":"2026-08-07T05:56:56.830717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:56:56.834768Z","title":"Training data-efficient image transformers & distillation through attention,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.834768Z"},"links":{"citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:8e2a824019f597a9a6c2e9f71940c795a4c3817a97b29fe474b9024196eeb601","observation_id":"61ad6437-42e6-421f-a37d-6989b2f3066d","resolution":{"observed_at":"2026-08-07T05:56:56.834768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00952","last_updated":"2024-07-01T04:13:25Z","snapshot_observed_at":"2026-08-09T00:00:59.056808Z","submitted_at":"2024-07-01T04:13:25Z","title":"SplitLoRA: A Split Parameter-Efficient Fine-Tuning Framework for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00952","snapshot_observed_at":"2026-08-07T05:56:56.838942Z","title":"Splitlora: A split parameter-efficient fine-tuning framework for large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.838942Z"},"links":{"cited_paper":"/paper/2407.00952","citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:0969e1aca28d6533f35ccc958191b5c21487ad9ab6a4f56a4a11dd32b094e10b","observation_id":"026b1338-c47b-486d-8f6f-1b19e7c41a99","resolution":{"observed_at":"2026-08-07T05:56:56.838942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.11942","last_updated":"2020-02-09T03:00:18Z","snapshot_observed_at":"2026-07-06T08:24:44.631342Z","submitted_at":"2019-09-26T07:06:13Z","title":"ALBERT: A Lite BERT for Self-supervised Learning of Language Representations","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.11942","snapshot_observed_at":"2026-08-07T05:56:56.843455Z","title":"Albert: A lite bert for self-supervised learning of language representations,","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.843455Z"},"links":{"cited_paper":"/paper/1909.11942","citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:ed66124e02891a7be62bf22f6ab2b465f8ff3e3361df9ab27b45250c8891d6bf","observation_id":"17d69191-bd0e-4a14-bc3c-c4a18dc13238","resolution":{"observed_at":"2026-08-07T05:56:56.843455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:56:56.847663Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.847663Z"},"links":{"citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:55bf84bb3b76e15b7a373baf6236f427f51512d97186bff12705d78afe076b22","observation_id":"022ef8eb-2881-47dd-8cf3-a1b946ccdd12","resolution":{"observed_at":"2026-08-07T05:56:56.847663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:56:56.851308Z","title":"Gpt-4 is here: what scientists think,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.851308Z"},"links":{"citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:c9a937590df9240ea043aaaccf6019f72509b694f993525da98cce36a5789a72","observation_id":"f37dcbe8-5666-47ea-9135-c094306895a8","resolution":{"observed_at":"2026-08-07T05:56:56.851308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:56:56.854998Z","title":"Language mod- els are few-shot learners,","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.854998Z"},"links":{"citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:06a4a74ea28d18747d0387d991bd23593ef3957b80abdaeaea50256377f5e1ff","observation_id":"7d9c7891-7d51-4166-a825-b38212f263f3","resolution":{"observed_at":"2026-08-07T05:56:56.854998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:56:56.858659Z","title":"Multimodal deep learning","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.858659Z"},"links":{"citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:295ca36878e7ddab6e85c24df3860d51b831aa6ba4046985ae1d65dc9c3fc685","observation_id":"5296042b-7465-4dcb-acdb-81f0fe42a09e","resolution":{"observed_at":"2026-08-07T05:56:56.858659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:56:56.862350Z","title":"Multimodal machine learning: A survey and taxonomy,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.862350Z"},"links":{"citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:e12e597bfad964108300e791c963174d439b5d8dec249b0578457ab83e004a7f","observation_id":"22078948-1812-47f7-aa95-707bf650affd","resolution":{"observed_at":"2026-08-07T05:56:56.862350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:56:56.866015Z","title":"Multimodal transformer for unaligned multimodal language sequences,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.866015Z"},"links":{"citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:384cb5971e5994c24f5386b3367f372ef4380169aa743138041942fa73ddfc6e","observation_id":"81b85cd3-5be3-4683-a409-c9a9637d77f2","resolution":{"observed_at":"2026-08-07T05:56:56.866015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T05:56:56.869757Z","title":"Gpt-4 technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.869757Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:ead646559f0b2f63943e207ec25a168d49aedd0e11161d043c988635d73680ea","observation_id":"c9922b25-8d4c-44a1-a3b3-5ced6bfeb68f","resolution":{"observed_at":"2026-08-07T05:56:56.869757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:56:56.873536Z","title":"Crossner: Evaluating cross-domain named entity recognition,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.873536Z"},"links":{"citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:64ad9bbd997485183294d13ff81f23e55df751f15666b70ea40dfe6c19c57699","observation_id":"afed7e32-5d07-4dbe-837e-0300bfc2d845","resolution":{"observed_at":"2026-08-07T05:56:56.873536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:56:56.877137Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.877137Z"},"links":{"citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:b9b479891d84ed331674f3f8b93ccc4482ed98223d3c6f486042cc864925ead9","observation_id":"770a5b30-5cab-4377-97c3-9a1bac24c3d7","resolution":{"observed_at":"2026-08-07T05:56:56.877137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07258","last_updated":"2022-07-12T23:45:14Z","snapshot_observed_at":"2026-08-02T09:20:40.804790Z","submitted_at":"2021-08-16T17:50:08Z","title":"On the Opportunities and Risks of Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07258","snapshot_observed_at":"2026-08-07T05:56:56.880936Z","title":"On the opportunities and risks of foundation models,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.880936Z"},"links":{"cited_paper":"/paper/2108.07258","citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:e9227ea6de681e0d4defef47f14321b936183f20b0311f90d20d0c8c8c82551a","observation_id":"087f0a8a-8a25-44d6-bc85-4db173ac2277","resolution":{"observed_at":"2026-08-07T05:56:56.880936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:56:56.885110Z","title":"Xtext language engineering for everyone,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.885110Z"},"links":{"citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:8d91a499825a1fff52c132c0432d69729613e07ffc365db20bb7265dccfe65c9","observation_id":"bade9839-b308-4cfe-bf10-2a8dc2d847d5","resolution":{"observed_at":"2026-08-07T05:56:56.885110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:56:56.888633Z","title":"Align before fuse: Vision and language representation learning with momentum distillation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.888633Z"},"links":{"citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:61e7b916f14c244d721cb0c985adcfa19cf3f24a70675b8de13bf3713bdbe0b4","observation_id":"ec150ed6-967c-40c8-a0fa-2959ee49851e","resolution":{"observed_at":"2026-08-07T05:56:56.888633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:56:56.892388Z","title":"Training language models to follow instructions with human feedback,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.892388Z"},"links":{"citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:0e6998e5edea86b7876d03240f49f141a0941fb66054ea1ddf8baf8099610fa4","observation_id":"1a5c4180-e441-4f2a-9a48-1367d5f4289d","resolution":{"observed_at":"2026-08-07T05:56:56.892388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-02T12:55:25.835610Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13676","snapshot_observed_at":"2026-08-07T05:56:56.896718Z","title":"Hymba: A hybrid-head architecture for small language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.896718Z"},"links":{"cited_paper":"/paper/2411.13676","citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:94249408070e145f2a8d0dddcae44885c70d2c32bf49a89a768268f3d73899bd","observation_id":"3b22685c-af14-40c0-8907-133b90e7a683","resolution":{"observed_at":"2026-08-07T05:56:56.896718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.03350","last_updated":"2024-12-28T09:18:36Z","snapshot_observed_at":"2026-08-09T21:50:12.548839Z","submitted_at":"2024-11-04T04:43:01Z","title":"A Comprehensive Survey of Small Language Models in the Era of Large Language Models: Techniques, Enhancements, Applications, Collaboration with LLMs, and Trustworthiness","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.03350","snapshot_observed_at":"2026-08-07T05:56:56.900912Z","title":"A comprehensive survey of small language models in the era of large language models: Techniques, en- hancements, applications, collaboration with llms, and trustworthiness,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.900912Z"},"links":{"cited_paper":"/paper/2411.03350","citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:5cd654aae1d1239adb19454f0171cf6dbb40e34ca7af42af65ea881bfc6a0a3b","observation_id":"b3a4de7e-c2fd-4b95-a2d4-19d0257026f4","resolution":{"observed_at":"2026-08-07T05:56:56.900912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15790","last_updated":"2025-02-26T06:34:55Z","snapshot_observed_at":"2026-08-09T12:29:50.691670Z","submitted_at":"2024-09-24T06:36:56Z","title":"Small Language Models: Survey, Measurements, and Insights","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.15790","snapshot_observed_at":"2026-08-07T05:56:56.904953Z","title":"Small language models: Survey, measurements, and insights,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.904953Z"},"links":{"cited_paper":"/paper/2409.15790","citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:9a1ce03c817d9392b720c6e4eb37f3801bd1e1c5e04b289ace6ae1194d30b36c","observation_id":"b66c68af-5e7d-4b6a-b49d-f98e1538b848","resolution":{"observed_at":"2026-08-07T05:56:56.904953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.11817","last_updated":"2025-02-13T08:11:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-22T10:26:14Z","title":"Hallucination is Inevitable: An Innate Limitation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.11817","snapshot_observed_at":"2026-08-07T05:56:56.908957Z","title":"Hallucination is inevitable: An innate limitation of large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.908957Z"},"links":{"cited_paper":"/paper/2401.11817","citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:a4297bc5c01642c521263a0361c04235d4aa408921d83814cec8319fc362916d","observation_id":"ec4eb572-b1a4-4129-b4ec-aee6e84b0c0c","resolution":{"observed_at":"2026-08-07T05:56:56.908957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:56:58.070334Z","title":"A survey on hallucination in large language models: Principles, taxonomy, challenges, and open questions,","venue":null,"work_id":"d8105bc3-efbc-4fdd-8fba-8f0d5a8ade97","year":2024},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.912852Z"},"links":{"citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:85c910bdb9de977b879c6e7702dcd0b3e7664b5a1d4c7245b46a9d86225a2595","observation_id":"d1c0e700-7c5e-4bb3-ad41-ee82a0f844d6","resolution":{"observed_at":"2026-08-07T05:56:58.074869Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:56:58.057815Z","title":"Towards trustworthy llms: a review on debiasing and dehallucinating in large language models,","venue":null,"work_id":"81794935-b3ac-4a9e-b196-0d251101819c","year":2024},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.916756Z"},"links":{"citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:43977b345987041efb4b063eeaefee751b632eb72226faa1b42f2af002cd0ef5","observation_id":"0edc626f-8814-43c8-b43b-70c8fc73aec6","resolution":{"observed_at":"2026-08-07T05:56:58.062327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:56:56.920457Z","title":"Sometimes painful but certainly promising: Feasibility and trade-offs of language model inference at the edge,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.920457Z"},"links":{"citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:45e09757c2fde743b62c106be862b0999d3a13504c23e60dd2f858f509309799","observation_id":"c7ad77f5-909c-45ae-9d6b-93fce6f8cad5","resolution":{"observed_at":"2026-08-07T05:56:56.920457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.11601","last_updated":"2023-08-23T17:34:17Z","snapshot_observed_at":"2026-07-06T16:09:09.018523Z","submitted_at":"2023-08-22T17:48:24Z","title":"Tryage: Real-time, intelligent Routing of User Prompts to Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.11601","snapshot_observed_at":"2026-08-07T05:56:56.924187Z","title":"Tryage: Real-time, intelligent rout- ing of user prompts to large language model,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.924187Z"},"links":{"cited_paper":"/paper/2308.11601","citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:9bc785e9c207eaa036a3227e735b86cda7a3aaee7e009110aaf109313aa10ec1","observation_id":"5b153ab8-f3a6-4034-be29-cb7af28c0ff2","resolution":{"observed_at":"2026-08-07T05:56:56.924187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:56:58.046800Z","title":"Fly-swat or cannon? cost- effective language model choice via meta-modeling,","venue":null,"work_id":"44dea3af-60d0-41af-8312-eef6162df9b2","year":2024},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.928196Z"},"links":{"citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:6bb445bdaa53a050dda9a2cd2b1f0e7f7f2a3e68289c2fb5679b48a20cf71c6d","observation_id":"2763b83c-da63-41cd-9755-02619710b949","resolution":{"observed_at":"2026-08-07T05:56:58.050512Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.13979","last_updated":"2024-10-02T08:51:45Z","snapshot_observed_at":"2026-08-02T08:13:53.554753Z","submitted_at":"2024-01-25T06:45:32Z","title":"Routoo: Learning to Route to Large Language Models Effectively","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.13979","snapshot_observed_at":"2026-08-07T05:56:56.932292Z","title":"Leeroo orchestrator: Elevating llms performance through model integration,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.932292Z"},"links":{"cited_paper":"/paper/2401.13979","citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:57803b0405b55a37f37fa108a5242e356ea7efc524a70250f7f41801aec9b09d","observation_id":"3eb1df40-ec5d-4c25-9ffe-fb80b44b4a74","resolution":{"observed_at":"2026-08-07T05:56:56.932292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14618","last_updated":"2024-04-22T23:06:42Z","snapshot_observed_at":"2026-08-08T18:42:25.777499Z","submitted_at":"2024-04-22T23:06:42Z","title":"Hybrid LLM: Cost-Efficient and Quality-Aware Query Routing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14618","snapshot_observed_at":"2026-08-07T05:56:56.936401Z","title":"Hybrid llm: Cost-efficient and quality-aware query routing,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.936401Z"},"links":{"cited_paper":"/paper/2404.14618","citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:55a548bb23e33ad91aa61382e151baece77d3e19c50ef74b40d45c97f3b445fe","observation_id":"369e619b-111c-4d37-9083-b7527010f245","resolution":{"observed_at":"2026-08-07T05:56:56.936401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15130","last_updated":"2024-05-24T01:05:37Z","snapshot_observed_at":"2026-08-09T17:54:32.510507Z","submitted_at":"2024-05-24T01:05:37Z","title":"OptLLM: Optimal Assignment of Queries to Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.15130","snapshot_observed_at":"2026-08-07T05:56:56.940328Z","title":"Optllm: Optimal assignment of queries to large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.940328Z"},"links":{"cited_paper":"/paper/2405.15130","citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:b2be3980cabc4d626439073123b57d000b38232c0fb86ea7a318dd51f8f3806d","observation_id":"df27739d-3704-40bb-8686-deff835a0c54","resolution":{"observed_at":"2026-08-07T05:56:56.940328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:56:58.034901Z","title":"Chatgpt,","venue":null,"work_id":"a9f5a268-c1ad-45a8-bbed-098fd99af05c","year":2022},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.944254Z"},"links":{"citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:0a8b188fe9e0d0b42dba9a09801718509946ce208d86a1426860c25a0f56d8e0","observation_id":"0c9c37a1-40eb-474b-8550-5c81a28095c2","resolution":{"observed_at":"2026-08-07T05:56:58.039550Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:56:58.024338Z","title":"Amazon titan in amazon bedrock,","venue":null,"work_id":"e9ac0d8d-5289-4655-b36f-1d93609c80c4","year":2023},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.947839Z"},"links":{"citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:03dd55f085622434b37ed941e701dd7489e4e7fb17fdf9d7dd36f1114028b7d2","observation_id":"42d3dc4a-2a64-41c9-99a2-6b0499547c30","resolution":{"observed_at":"2026-08-07T05:56:58.028097Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:56:58.013921Z","title":null,"venue":null,"work_id":"10e94fc9-0350-4803-bda9-40274ad733cd","year":2023},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.951394Z"},"links":{"citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:08dde7fab8907c9e899fed019b35c95fe8b345dbf81d554056c9ac99c7e2ddf8","observation_id":"f221f8e4-7d12-4957-84a7-c3924a8fdfe8","resolution":{"observed_at":"2026-08-07T05:56:58.017464Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:56:58.003772Z","title":null,"venue":null,"work_id":"8b017624-5707-4edd-9ee2-f0443714c365","year":2023},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.955137Z"},"links":{"citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:68954ff5bf4e11ff5b6241f1e7a33d24bf67e2c2cf5b2d0d104777472019d354","observation_id":"b1854396-ee05-40c7-bc01-4155a4feb7b4","resolution":{"observed_at":"2026-08-07T05:56:58.007120Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18665","last_updated":"2025-02-23T08:50:33Z","snapshot_observed_at":"2026-07-30T15:06:18.011623Z","submitted_at":"2024-06-26T18:10:22Z","title":"RouteLLM: Learning to Route LLMs with Preference Data","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18665","snapshot_observed_at":"2026-08-07T05:56:56.958761Z","title":"Routellm: Learning to route llms with preference data,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.958761Z"},"links":{"cited_paper":"/paper/2406.18665","citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:d2fd1a7654a1913343637a3c73b87679d51a468d78e52cbc8f478332975c74d0","observation_id":"03951d37-536d-408e-baeb-00a54b6df901","resolution":{"observed_at":"2026-08-07T05:56:56.958761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.13561","last_updated":"2023-10-20T15:01:55Z","snapshot_observed_at":"2026-08-04T18:27:13.730932Z","submitted_at":"2023-10-20T15:01:55Z","title":"Cache & Distil: Optimising API Calls to Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.13561","snapshot_observed_at":"2026-08-07T05:56:56.962993Z","title":"Cache & dis- til: Optimising api calls to large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.962993Z"},"links":{"cited_paper":"/paper/2310.13561","citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:5c08f5212622d814189421617223b0bf4e12ac0838799cd3693b71b5cb35dafa","observation_id":"ddbcf273-44eb-4338-99b8-695ce6e04f59","resolution":{"observed_at":"2026-08-07T05:56:56.962993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12963","last_updated":"2025-01-19T15:59:56Z","snapshot_observed_at":"2026-07-06T16:35:48.413898Z","submitted_at":"2023-10-19T17:57:39Z","title":"AutoMix: Automatically Mixing Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12963","snapshot_observed_at":"2026-08-07T05:56:56.966738Z","title":"Automix: Automatically mixing language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.966738Z"},"links":{"cited_paper":"/paper/2310.12963","citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:39e245d078361bbcac008065f0ec7fff5c7d4c85c0445b188a3c6489978e0c19","observation_id":"fd6524a2-e721-4cb8-8606-52316e8eb167","resolution":{"observed_at":"2026-08-07T05:56:56.966738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.13757","last_updated":"2024-09-15T15:12:45Z","snapshot_observed_at":"2026-07-06T19:18:57.862380Z","submitted_at":"2024-09-15T15:12:45Z","title":"Efficient Hybrid Inference for LLMs: Reward-Based Token Modelling with Selective Cloud Assistance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.13757","snapshot_observed_at":"2026-08-07T05:56:56.970762Z","title":"Efficient hybrid inference for llms: Reward- based token modelling with selective cloud assistance,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.970762Z"},"links":{"cited_paper":"/paper/2409.13757","citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:2c11385e2bde615f191e7b0b10435507af10cd2bfcf79508b10fb265f53cb02b","observation_id":"6547ef9b-67bb-4c49-a87f-454fe5b60ac1","resolution":{"observed_at":"2026-08-07T05:56:56.970762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.02134","last_updated":"2024-05-03T14:38:59Z","snapshot_observed_at":"2026-07-31T01:43:43.437617Z","submitted_at":"2024-05-03T14:38:59Z","title":"Optimising Calls to Large Language Models with Uncertainty-Based Two-Tier Selection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.02134","snapshot_observed_at":"2026-08-07T05:56:56.974688Z","title":"Optimising calls to large lan- guage models with uncertainty-based two-tier selection,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.974688Z"},"links":{"cited_paper":"/paper/2405.02134","citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:290f974cab7483b0fc2fc5ec80f5f8d10a56fbf948d6b2ef24f64a17b8894863","observation_id":"41f0d6a2-dacd-4685-9ca5-421c3cbd558c","resolution":{"observed_at":"2026-08-07T05:56:56.974688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:56:56.978614Z","title":"Query by committee,","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.978614Z"},"links":{"citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:430787d846e0ab724f14535227d0f2691c2d09ea42a3ece79b9ba91e7e9a96aa","observation_id":"39d584d9-4d79-42ad-a834-f6714631ce83","resolution":{"observed_at":"2026-08-07T05:56:56.978614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:56:57.987190Z","title":"A review on edge large language models: Design, execution, and applications,","venue":null,"work_id":"96a0ce57-a82e-492a-8dee-5751fb6b5323","year":2025},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.982111Z"},"links":{"citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:7049b83fc477d777451b935555f42439671abc6fe76118cd6bea8b8d6e25e1f5","observation_id":"bc603551-9d84-4c2e-8cea-a0e8cf2a4c24","resolution":{"observed_at":"2026-08-07T05:56:57.990897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00088","last_updated":"2024-09-14T04:01:09Z","snapshot_observed_at":"2026-08-09T15:51:34.120794Z","submitted_at":"2024-08-26T03:33:36Z","title":"On-Device Language Models: A Comprehensive Review","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00088","snapshot_observed_at":"2026-08-07T05:56:56.985768Z","title":"On-device language models: A comprehensive review,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.985768Z"},"links":{"cited_paper":"/paper/2409.00088","citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:3ded4f04b7a6cb2b4cbc7425d61b83783cf51b4829604218a87a9688cc7bdba4","observation_id":"92755cfd-9dbb-452b-be1b-aa346eb0f90f","resolution":{"observed_at":"2026-08-07T05:56:56.985768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02561","last_updated":"2023-06-30T21:39:54Z","snapshot_observed_at":"2026-08-05T15:27:19.717152Z","submitted_at":"2023-06-05T03:32:26Z","title":"LLM-Blender: Ensembling Large Language Models with Pairwise Ranking and Generative Fusion","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02561","snapshot_observed_at":"2026-08-07T05:56:56.989615Z","title":"Llm-blender: Ensembling large language models with pairwise ranking and generative fusion,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.989615Z"},"links":{"cited_paper":"/paper/2306.02561","citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:8f0cd14c842eed2fce4274f14930ee8483e1a251667278db0d176c461fb7e68a","observation_id":"b897ca20-8400-4e57-94b6-ba9e268f6016","resolution":{"observed_at":"2026-08-07T05:56:56.989615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:56:57.976969Z","title":"Research","venue":null,"work_id":"b2af8ddb-985b-4830-b19b-2ffb8809608d","year":2024},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.993763Z"},"links":{"citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:bf2036f0583f2b85ad6b8a2f5c97bd3ca855e619f2075c58634cdef827f560db","observation_id":"48890071-a8b5-4073-b2c3-b0e37f358712","resolution":{"observed_at":"2026-08-07T05:56:57.980441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:56:57.966659Z","title":null,"venue":null,"work_id":"64b14fb1-7afc-4954-86fb-e6dd9b25e73e","year":2024},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.997453Z"},"links":{"citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:b96d63225c83f467f5a4f390282a806b0c4ea453f2126c12c968238eaeafb392","observation_id":"6d0c202c-d3d9-4b8f-aace-aa73d8d9d901","resolution":{"observed_at":"2026-08-07T05:56:57.970312Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:56:57.956069Z","title":"Edge-first language model inference: Mod- els, metrics, and tradeoffs,","venue":null,"work_id":"603323cf-a4e5-42e4-873b-5c0694d8b8a8","year":2025},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:57.001152Z"},"links":{"citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:805e2751752cc5f07d6e6acd1cb1469cdafc4bd29d6e56c588bf8aa2468d212c","observation_id":"b853f9ce-101b-432a-bc3d-cfbee91bce19","resolution":{"observed_at":"2026-08-07T05:56:57.959881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07584","last_updated":"2024-07-22T07:07:06Z","snapshot_observed_at":"2026-07-06T17:58:43.506575Z","submitted_at":"2024-04-11T09:17:12Z","title":"UltraEval: A Lightweight Platform for Flexible and Comprehensive Evaluation for LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07584","snapshot_observed_at":"2026-08-07T05:56:57.004691Z","title":"Ultraeval: A lightweight platform for flexible and comprehensive evaluation for llms,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:57.004691Z"},"links":{"cited_paper":"/paper/2404.07584","citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:539c9a344d75b8bd370f6cb26222d101fade13ec7df68d83868cf0d197597840","observation_id":"47546da5-a959-4dd8-ae59-e3497242d1d4","resolution":{"observed_at":"2026-08-07T05:56:57.004691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07000","last_updated":"2024-08-30T01:19:42Z","snapshot_observed_at":"2026-07-06T18:43:47.559289Z","submitted_at":"2024-07-09T16:13:26Z","title":"Etalon: Holistic Performance Evaluation Framework for LLM Inference Systems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07000","snapshot_observed_at":"2026-08-07T05:56:57.008858Z","title":"Etalon: Holistic performance evaluation framework for llm inference systems,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:57.008858Z"},"links":{"cited_paper":"/paper/2407.07000","citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:24f662a55137afcbaaddc2d1b9756d2fdd55fa86cab377b6480d3f285b468f65","observation_id":"f2707b7c-9c27-42ad-9a28-db59fb148ffb","resolution":{"observed_at":"2026-08-07T05:56:57.008858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.13601","last_updated":"2024-05-28T05:36:23Z","snapshot_observed_at":"2026-08-09T14:50:09.702964Z","submitted_at":"2024-01-24T17:10:45Z","title":"MM-LLMs: Recent Advances in MultiModal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.13601","snapshot_observed_at":"2026-08-07T05:56:57.013028Z","title":"Mm-llms: Recent advances in multimodal large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:57.013028Z"},"links":{"cited_paper":"/paper/2401.13601","citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:7a47ab5f8390bf2f69a51d604f331b0d4d37c9e0813b0d46e3c60ff227c5b3aa","observation_id":"f8fee592-837e-4d70-81fa-7623c76188d6","resolution":{"observed_at":"2026-08-07T05:56:57.013028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.00425","last_updated":"2025-08-10T04:13:03Z","snapshot_observed_at":"2026-08-10T01:23:32.232654Z","submitted_at":"2025-02-01T13:08:02Z","title":"MQuant: Unleashing the Inference Potential of Multimodal Large Language Models via Full Static Quantization","version":2},"cited_work":{"arxiv_id":"2502.00425","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.00425","snapshot_observed_at":"2026-08-07T05:56:57.204200Z","title":"MQuant: Unleashing the Inference Potential of Multimodal Large Language Models via Full Static Quantization","venue":"cs.CV","work_id":"1ddf5ae0-58ac-4c03-8e43-787b44730e95","year":2025},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:57.016882Z"},"links":{"cited_paper":"/paper/2502.00425","citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:275724500a3ae39ec470e936f66e65ea4d31638d13f233422221f51de5a40fa5","observation_id":"0a64c309-4bed-4ea1-9647-9e54130324de","resolution":{"observed_at":"2026-08-07T05:56:57.208416Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:56:57.945959Z","title":"Multimodal large language models in health care: applications, challenges, and future outlook,","venue":null,"work_id":"a7a75943-e57e-456c-890e-be2d616bc3d7","year":2024},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:57.020774Z"},"links":{"citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:3abfe4fa0a19166fa5602150ecbc777542f120c3f0047a1e8dd43d1ba14cbfd6","observation_id":"0d5ee2e9-8d16-4ba5-9f93-528ee93467ee","resolution":{"observed_at":"2026-08-07T05:56:57.949512Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:56:57.935315Z","title":"Ma-lmm: Memory-augmented large multimodal model for long-term video understanding,","venue":null,"work_id":"8eb2c771-2a11-4c21-a8a8-cef554e37146","year":2024},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:57.024727Z"},"links":{"citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:21c859a83eb87b8e0b624176c28c7992b7b3f7b6768a76ede3d2ecef91f510fe","observation_id":"37db8c79-d54a-49f6-9a13-f52a9e9359da","resolution":{"observed_at":"2026-08-07T05:56:57.939194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:56:57.924247Z","title":"Lexical complexity predic- tion: An overview,","venue":null,"work_id":"ed3ea335-ebbf-4311-ad77-9f9bd7a5ff90","year":2023},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:57.028587Z"},"links":{"citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:0efc4c01c433daaf9e0e382654ad0f653df61406228b11b9891368919dc17274","observation_id":"8356649b-3d40-4c5e-8c39-f0310af58151","resolution":{"observed_at":"2026-08-07T05:56:57.927904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:56:57.913054Z","title":"Collaborative cross- modal fusion with large language model for recommendation,","venue":null,"work_id":"e8aa88f4-dd8a-409b-bd99-72a09632f675","year":2024},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:57.032260Z"},"links":{"citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:d7f3fb48390663d2367a40cb4639dcd9f3a67ffdfe0a88c6c6d27a227f623edb","observation_id":"45265c53-9cc2-4c58-ad15-7189185fc78c","resolution":{"observed_at":"2026-08-07T05:56:57.916891Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14882","last_updated":"2025-03-19T04:21:27Z","snapshot_observed_at":"2026-08-08T03:39:53.157362Z","submitted_at":"2025-03-19T04:21:27Z","title":"Communication-Efficient Distributed On-Device LLM Inference Over Wireless Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14882","snapshot_observed_at":"2026-08-07T05:56:57.036167Z","title":"Communication-efficient distributed on-device llm inference over wireless networks,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:57.036167Z"},"links":{"cited_paper":"/paper/2503.14882","citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:9dd45790472cc6cc2da527dc4a11310cf131e16a0b14b411b599b1769766fe58","observation_id":"639313a1-8624-4d86-bd63-0c21eb2fcc4b","resolution":{"observed_at":"2026-08-07T05:56:57.036167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.13510","last_updated":"2025-01-07T18:16:17Z","snapshot_observed_at":"2026-07-06T19:05:26.961192Z","submitted_at":"2024-08-24T08:12:22Z","title":"Intelligent Router for LLM Workloads: Improving Performance Through Workload-Aware Load Balancing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.13510","snapshot_observed_at":"2026-08-07T05:56:57.040284Z","title":"Intelligent router for llm workloads: Improving performance through workload-aware scheduling,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:57.040284Z"},"links":{"cited_paper":"/paper/2408.13510","citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:ff38c55c6dca100895c2f6eff1cc3757d0cae4178f02a1309819acc70ed51ad0","observation_id":"f9cf4371-264d-46b4-9bf7-326b519ac0a1","resolution":{"observed_at":"2026-08-07T05:56:57.040284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08014","last_updated":"2025-02-27T17:56:08Z","snapshot_observed_at":"2026-08-09T18:51:33.288500Z","submitted_at":"2024-10-10T15:09:52Z","title":"Privacy-preserved LLM Cascade via CoT-enhanced Policy Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08014","snapshot_observed_at":"2026-08-07T05:56:57.044447Z","title":"Llm cas- cade with multi-objective optimal consideration,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:57.044447Z"},"links":{"cited_paper":"/paper/2410.08014","citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:a75fd1ee99ad63a711d31e49ea40c0a58a1ee4148cedde506ee4946f599d59e3","observation_id":"5fa027e9-05a7-4355-bc66-3c02c9e9534c","resolution":{"observed_at":"2026-08-07T05:56:57.044447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.00409","last_updated":"2025-07-21T12:20:06Z","snapshot_observed_at":"2026-08-10T00:34:58.507365Z","submitted_at":"2025-02-01T12:08:38Z","title":"Doing More with Less: A Survey on Routing Strategies for Resource Optimisation in Large Language Model-Based Systems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.00409","snapshot_observed_at":"2026-08-07T05:56:57.048415Z","title":"Doing more with less–implementing routing strategies in large language model-based systems: An extended survey,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:57.048415Z"},"links":{"cited_paper":"/paper/2502.00409","citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:6de6b5c080c92c1613783e8c291294dd1a1110b6e1631172d010d349c5ddc352","observation_id":"19bbad48-bb75-497c-ae97-ff936e166272","resolution":{"observed_at":"2026-08-07T05:56:57.048415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15248","last_updated":"2024-07-21T19:23:45Z","snapshot_observed_at":"2026-08-08T13:09:55.107196Z","submitted_at":"2024-07-21T19:23:45Z","title":"XAI meets LLMs: A Survey of the Relation between Explainable AI and Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15248","snapshot_observed_at":"2026-08-07T05:56:57.052089Z","title":"Xai meets llms: A survey of the relation between explainable ai and large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:57.052089Z"},"links":{"cited_paper":"/paper/2407.15248","citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:3bfe58a6f38aa0e02ed2db9e99e9c13b90efde16f06c2e3c76e9223c4eb3a6a5","observation_id":"ccf21cc0-c770-4c37-83a8-322785e006a9","resolution":{"observed_at":"2026-08-07T05:56:57.052089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.12170","last_updated":"2024-12-12T06:27:12Z","snapshot_observed_at":"2026-08-09T02:58:39.663949Z","submitted_at":"2024-12-12T06:27:12Z","title":"PickLLM: Context-Aware RL-Assisted Large Language Model Routing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.12170","snapshot_observed_at":"2026-08-07T05:56:57.056470Z","title":"Pickllm: Context- aware rl-assisted large language model routing,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:57.056470Z"},"links":{"cited_paper":"/paper/2412.12170","citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:6db89551d666e81dd040714c730a08d3550fc00e3cf5d3aec05e6b928140fb11","observation_id":"65439416-3169-4241-99f4-6904b9f83c1c","resolution":{"observed_at":"2026-08-07T05:56:57.056470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10785","last_updated":"2023-11-16T18:42:37Z","snapshot_observed_at":"2026-07-06T16:49:13.099946Z","submitted_at":"2023-11-16T18:42:37Z","title":"Text Sanitization Beyond Specific Domains: Zero-Shot Redaction & Substitution with Large Language Models","version":1},"cited_work":{"arxiv_id":"2311.10785","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.10785","snapshot_observed_at":"2026-08-07T05:56:57.132675Z","title":"Text Sanitization Beyond Specific Domains: Zero-Shot Redaction & Substitution with Large Language Models","venue":"cs.CL","work_id":"a890b15b-7213-4e9e-9000-8abbe2a37b5c","year":2023},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:57.062055Z"},"links":{"cited_paper":"/paper/2311.10785","citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:81abce361138167cbd0412f8fc0d7136ffce6bde267872f9c1b96285eec2cd7e","observation_id":"2c26cbc3-633d-40a4-8602-45546a00ee96","resolution":{"observed_at":"2026-08-07T05:56:57.138941Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:56:57.902523Z","title":"Trusted llm inference on the edge with smart contracts,","venue":null,"work_id":"258c380d-707b-4a47-988b-783202b30b30","year":2024},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:57.066381Z"},"links":{"citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:e3a376614e923bf0f5e3b946947e27ae568353cedbd167e00e7aec21182454f9","observation_id":"f6fcb862-cb94-4226-a586-8dd499f3a109","resolution":{"observed_at":"2026-08-07T05:56:57.906148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02486","last_updated":"2025-02-21T01:13:08Z","snapshot_observed_at":"2026-08-05T09:53:25.030382Z","submitted_at":"2024-10-03T13:48:35Z","title":"Encryption-Friendly LLM Architecture","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02486","snapshot_observed_at":"2026-08-07T05:56:57.070193Z","title":"Encryption-friendly llm architecture,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:57.070193Z"},"links":{"cited_paper":"/paper/2410.02486","citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:c64822072fa83a3a61b3180ccf09ad3b5c66cc9a6edf875c0fdc9c7aa0d87194","observation_id":"055c6e2d-3fc3-4bae-b046-10296140e601","resolution":{"observed_at":"2026-08-07T05:56:57.070193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":84,"verified_exact":3,"verified_fuzzy":13},"total_outbound_references":104},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 100 of 104 outbound references and 6 inbound Pith citation observations for arXiv:2506.06579."}