{"as_of":"2026-08-10T15:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b0706a7b9703ac0a0c4d9ff9a92ffcbf15e4a01cd860e276b08cdef7fa4118e3","coverage":[{"denominator":60,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":60,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T00:43:29.577850Z","state":"measured"},{"denominator":63,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":63,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:07:40.215851Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T08:15:31.617791Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.18107","last_updated":"2025-06-07T00:03:08Z","snapshot_observed_at":"2026-08-10T09:14:26.425079Z","submitted_at":"2025-01-30T03:16:44Z","title":"Scaling Inference-Efficient Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.18107","snapshot_observed_at":"2026-08-07T05:07:40.215851Z","title":"Scaling inference-efficient language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00004","last_updated":"2025-07-10T17:08:40Z","snapshot_observed_at":"2026-08-10T12:28:57.343429Z","submitted_at":"2025-06-10T14:47:48Z","title":"A Theory of Inference Compute Scaling: Reasoning through Directed Stochastic Skill Search","version":2},"reference_index":174,"source":"pdf_text","source_observed_at":"2026-08-07T05:07:40.215851Z"},"links":{"cited_paper":"/paper/2501.18107","citing_paper":"/paper/2507.00004"},"observation_digest":"sha256:b76f0e02fef6a477a909115b2c8d5ba7796a8888f58e3298fc6e86019cd1bbd0","observation_id":"49760f12-0291-4357-a221-0caf1b0379f9","resolution":{"observed_at":"2026-08-07T05:07:40.215851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18107","last_updated":"2025-06-07T00:03:08Z","snapshot_observed_at":"2026-08-10T09:14:26.425079Z","submitted_at":"2025-01-30T03:16:44Z","title":"Scaling Inference-Efficient Language Models","version":2},"cited_work":{"arxiv_id":"2501.18107","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.18107","snapshot_observed_at":"2026-07-01T08:15:31.617791Z","title":"Scaling inference-efficient language mod- els.arXiv preprint arXiv:2501.18107","venue":null,"work_id":"64faa5e2-75c5-47c0-8bb2-d1509e288e2b","year":null},"citing_paper":{"arxiv_id":"2510.18245","last_updated":"2026-05-13T04:16:31Z","snapshot_observed_at":"2026-08-08T00:42:38.787054Z","submitted_at":"2025-10-21T03:08:48Z","title":"Scaling Laws Meet Model Architecture: Toward Inference-Efficient LLMs","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-18T05:30:11.389756Z"},"links":{"cited_paper":"/paper/2501.18107","citing_paper":"/paper/2510.18245"},"observation_digest":"sha256:303227b1c6ddfab50df9035a9e8d5d66036bc2fd3019e21fb1ce3ded40637495","observation_id":"b109582b-e94e-4858-853b-129ad6b632fc","resolution":{"observed_at":"2026-05-18T05:30:54.965606Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18107","last_updated":"2025-06-07T00:03:08Z","snapshot_observed_at":"2026-08-10T09:14:26.425079Z","submitted_at":"2025-01-30T03:16:44Z","title":"Scaling Inference-Efficient Language Models","version":2},"cited_work":{"arxiv_id":"2501.18107","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.18107","snapshot_observed_at":"2026-07-01T08:15:31.617791Z","title":"Scaling inference-efficient language mod- els.arXiv preprint arXiv:2501.18107","venue":null,"work_id":"64faa5e2-75c5-47c0-8bb2-d1509e288e2b","year":null},"citing_paper":{"arxiv_id":"2606.00047","last_updated":"2026-05-01T08:30:27Z","snapshot_observed_at":"2026-07-06T23:40:46.825645Z","submitted_at":"2026-05-01T08:30:27Z","title":"Comprehensive AI governance requires addressing non-model gains","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-07-01T08:11:23.860723Z"},"links":{"cited_paper":"/paper/2501.18107","citing_paper":"/paper/2606.00047"},"observation_digest":"sha256:e7cf530bbe322058a5533e9591ac61a0b6aed07d4820c028b545e417c4a34534","observation_id":"ad67b25a-8e8c-41f2-9975-9de5ae1c9a41","resolution":{"observed_at":"2026-07-01T08:15:31.619579Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.18107/citation-record","integrity":"/paper/2501.18107/integrity","json":"/paper/2501.18107/citation-record.json","paper":"/paper/2501.18107"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:43:30.420324Z","title":"Results over vLLM In this section, we first evaluate the inference efficiency of open-source large language models over vLLM using NVIDIA Tesla A100 Ampere 40 GB GPU","venue":null,"work_id":"7fa99e70-4d5e-4075-8683-2810b82f61d1","year":2023},"citing_paper":{"arxiv_id":"2501.18107","last_updated":"2025-06-07T00:03:08Z","snapshot_observed_at":"2026-08-10T09:14:26.425079Z","submitted_at":"2025-01-30T03:16:44Z","title":"Scaling Inference-Efficient Language Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T00:43:29.561143Z"},"links":{"citing_paper":"/paper/2501.18107"},"observation_digest":"sha256:845ceee382ee516efc51d2b23a0ae5e7dd21df8c0c8499f38501eb80b83a7786","observation_id":"08438660-135f-4f83-8318-11db118c05cf","resolution":{"observed_at":"2026-08-10T00:43:30.440594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12370","last_updated":"2025-07-02T20:37:41Z","snapshot_observed_at":"2026-08-07T03:52:12.288342Z","submitted_at":"2025-01-21T18:51:15Z","title":"Parameters vs FLOPs: Scaling Laws for Optimal Sparsity for Mixture-of-Experts Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12370","snapshot_observed_at":"2026-08-10T00:43:28.592940Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.18107","last_updated":"2025-06-07T00:03:08Z","snapshot_observed_at":"2026-08-10T09:14:26.425079Z","submitted_at":"2025-01-30T03:16:44Z","title":"Scaling Inference-Efficient Language Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T00:43:28.592940Z"},"links":{"cited_paper":"/paper/2501.12370","citing_paper":"/paper/2501.18107"},"observation_digest":"sha256:c2e266e16cf92e4b49293f77646d223c9bd1eedce73e2c6f0533fece5d746b43","observation_id":"2b1402f3-23ec-4a99-b4c5-b2d7da5810f7","resolution":{"observed_at":"2026-08-10T00:43:28.592940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:43:30.517518Z","title":"dmodel is the hidden size, fsize is the intermediate size,n layers is the number of layers, andn heads is the number of attention heads","venue":null,"work_id":"39d19ffd-efaa-47f5-9ec8-4376103b7d1a","year":2024},"citing_paper":{"arxiv_id":"2501.18107","last_updated":"2025-06-07T00:03:08Z","snapshot_observed_at":"2026-08-10T09:14:26.425079Z","submitted_at":"2025-01-30T03:16:44Z","title":"Scaling Inference-Efficient Language Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T00:43:29.422891Z"},"links":{"citing_paper":"/paper/2501.18107"},"observation_digest":"sha256:703b328c323f6cca3cedb7e4da0d0a3912bfa3623f45d57e4a2b7a4b6ab50516","observation_id":"e99b4b80-e0aa-44e4-bb15-535bb83e9156","resolution":{"observed_at":"2026-08-10T00:43:30.521770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:43:28.620437Z","title":"D., Dhariwal, P., Neelakantan, A., Shyam, P., Sastry, G., Askell, A., et al","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2501.18107","last_updated":"2025-06-07T00:03:08Z","snapshot_observed_at":"2026-08-10T09:14:26.425079Z","submitted_at":"2025-01-30T03:16:44Z","title":"Scaling Inference-Efficient Language Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T00:43:28.620437Z"},"links":{"citing_paper":"/paper/2501.18107"},"observation_digest":"sha256:e085e135a80b351c9b6b31bb8f52c7590f0517e69560a87b5de49974c039076c","observation_id":"f8420ad8-50cf-478b-8687-4f560a193fe0","resolution":{"observed_at":"2026-08-10T00:43:28.620437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.10044","last_updated":"2019-05-24T05:48:49Z","snapshot_observed_at":"2026-07-06T07:55:12.121264Z","submitted_at":"2019-05-24T05:48:49Z","title":"BoolQ: Exploring the Surprising Difficulty of Natural Yes/No Questions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.10044","snapshot_observed_at":"2026-08-10T00:43:28.624251Z","title":"Boolq: Exploring the surprising difficulty of natural yes/no questions.arXiv preprint arXiv:1905.10044,","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2501.18107","last_updated":"2025-06-07T00:03:08Z","snapshot_observed_at":"2026-08-10T09:14:26.425079Z","submitted_at":"2025-01-30T03:16:44Z","title":"Scaling Inference-Efficient Language Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T00:43:28.624251Z"},"links":{"cited_paper":"/paper/1905.10044","citing_paper":"/paper/2501.18107"},"observation_digest":"sha256:7a31e67390f199414985054f3c2b55a867f7160bb931a7e719fd10ab97e7fbac","observation_id":"a6c22c8c-5962-4fbf-8814-178c017b4dad","resolution":{"observed_at":"2026-08-10T00:43:28.624251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:43:30.505763Z","title":"The evaluated models include LLaMA (Touvron et al., 2023a), Qwen (Yang et al., 2024), Gemma (Team et al., 2024a;b), and MiniCPM (Hu et al., 2024)","venue":null,"work_id":"b32385dd-6457-4293-a5e1-b254a998d363","year":2024},"citing_paper":{"arxiv_id":"2501.18107","last_updated":"2025-06-07T00:03:08Z","snapshot_observed_at":"2026-08-10T09:14:26.425079Z","submitted_at":"2025-01-30T03:16:44Z","title":"Scaling Inference-Efficient Language Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T00:43:29.459723Z"},"links":{"citing_paper":"/paper/2501.18107"},"observation_digest":"sha256:0b4b2d83547ca4befcb441a1ec18efdf811bae9029154d4ce0b6e7f4d905070e","observation_id":"41086873-bfa6-4052-9826-7283fb07b62a","resolution":{"observed_at":"2026-08-10T00:43:30.510314Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08540","last_updated":"2024-06-14T20:21:05Z","snapshot_observed_at":"2026-08-10T12:51:53.068218Z","submitted_at":"2024-03-13T13:54:00Z","title":"Language models scale reliably with over-training and on downstream tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08540","snapshot_observed_at":"2026-08-10T00:43:28.854869Z","title":"Gadre, S","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.18107","last_updated":"2025-06-07T00:03:08Z","snapshot_observed_at":"2026-08-10T09:14:26.425079Z","submitted_at":"2025-01-30T03:16:44Z","title":"Scaling Inference-Efficient Language Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T00:43:28.854869Z"},"links":{"cited_paper":"/paper/2403.08540","citing_paper":"/paper/2501.18107"},"observation_digest":"sha256:5c66d7658701c9e3740074651c02d935cb1a0b4b0f9f341250533fc9f3e4c22e","observation_id":"9acfc0b0-95f6-439f-97a1-f5df976f7a35","resolution":{"observed_at":"2026-08-10T00:43:28.854869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13276","last_updated":"2025-02-17T02:24:47Z","snapshot_observed_at":"2026-08-05T05:19:17.395325Z","submitted_at":"2024-10-17T07:07:09Z","title":"SeerAttention: Learning Intrinsic Sparse Attention in Your LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13276","snapshot_observed_at":"2026-08-10T00:43:28.887469Z","title":"K.-H., Cao, T., Yang, F., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.18107","last_updated":"2025-06-07T00:03:08Z","snapshot_observed_at":"2026-08-10T09:14:26.425079Z","submitted_at":"2025-01-30T03:16:44Z","title":"Scaling Inference-Efficient Language Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T00:43:28.887469Z"},"links":{"cited_paper":"/paper/2410.13276","citing_paper":"/paper/2501.18107"},"observation_digest":"sha256:8d7360cd80710d64797b5420ead8a6068bad4820a7e3132fe840c1c2b8a5a062","observation_id":"8a484819-c134-4763-9cce-a00b0300d799","resolution":{"observed_at":"2026-08-10T00:43:28.887469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04519","last_updated":"2025-01-08T14:12:57Z","snapshot_observed_at":"2026-08-04T20:57:22.329262Z","submitted_at":"2025-01-08T14:12:57Z","title":"rStar-Math: Small LLMs Can Master Math Reasoning with Self-Evolved Deep Thinking","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04519","snapshot_observed_at":"2026-08-10T00:43:28.905055Z","title":"L., Liu, Y ., Shang, N., Sun, Y ., Zhu, Y ., Yang, F., and Yang, M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.18107","last_updated":"2025-06-07T00:03:08Z","snapshot_observed_at":"2026-08-10T09:14:26.425079Z","submitted_at":"2025-01-30T03:16:44Z","title":"Scaling Inference-Efficient Language Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T00:43:28.905055Z"},"links":{"cited_paper":"/paper/2501.04519","citing_paper":"/paper/2501.18107"},"observation_digest":"sha256:4ece56f2ee29f4348534cdf4176c7a486588b9b1de9d776589793c35fc982b95","observation_id":"034e27fd-824d-48e9-bf03-ea75755be632","resolution":{"observed_at":"2026-08-10T00:43:28.905055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-10T00:43:28.919255Z","title":"Deepseek-r1: In- centivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.18107","last_updated":"2025-06-07T00:03:08Z","snapshot_observed_at":"2026-08-10T09:14:26.425079Z","submitted_at":"2025-01-30T03:16:44Z","title":"Scaling Inference-Efficient Language Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T00:43:28.919255Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2501.18107"},"observation_digest":"sha256:32073a9c15f99475af093c8e395645c9115eff994f7958a8c51b6343cb973397","observation_id":"cb9179df-6538-4e28-954a-eebf8fb915fa","resolution":{"observed_at":"2026-08-10T00:43:28.919255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-10T12:35:09.020030Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-10T00:43:28.925640Z","title":"GitHub repository","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2501.18107","last_updated":"2025-06-07T00:03:08Z","snapshot_observed_at":"2026-08-10T09:14:26.425079Z","submitted_at":"2025-01-30T03:16:44Z","title":"Scaling Inference-Efficient Language Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T00:43:28.925640Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2501.18107"},"observation_digest":"sha256:0218e04ef69393cd2bc35d0a047ef3ca3028f6c040768c88f2515a088457cca3","observation_id":"ad7d11a5-4b1c-45e8-946d-01b54697d36b","resolution":{"observed_at":"2026-08-10T00:43:28.925640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-10T00:43:28.929669Z","title":"Measuring math- ematical problem solving with the math dataset.arXiv preprint arXiv:2103.03874,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.18107","last_updated":"2025-06-07T00:03:08Z","snapshot_observed_at":"2026-08-10T09:14:26.425079Z","submitted_at":"2025-01-30T03:16:44Z","title":"Scaling Inference-Efficient Language Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T00:43:28.929669Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2501.18107"},"observation_digest":"sha256:0acf91ecb209d6d808542d58175577f2bf61bd0444aa56314238cb4d4b19c8db","observation_id":"d53c4378-4f48-474a-af51-15bfe863e5a9","resolution":{"observed_at":"2026-08-10T00:43:28.929669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-08-09T19:52:33.533277Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-10T00:43:28.933586Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.18107","last_updated":"2025-06-07T00:03:08Z","snapshot_observed_at":"2026-08-10T09:14:26.425079Z","submitted_at":"2025-01-30T03:16:44Z","title":"Scaling Inference-Efficient Language Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T00:43:28.933586Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2501.18107"},"observation_digest":"sha256:5f08f35c9dadef67f36ab2ae83f53f2cb612d07bfc05ddb50362da88b43aa126","observation_id":"af18da9b-6d42-4283-9145-de574b0b3f52","resolution":{"observed_at":"2026-08-10T00:43:28.933586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06395","last_updated":"2024-06-03T08:54:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-09T15:36:50Z","title":"MiniCPM: Unveiling the Potential of Small Language Models with Scalable Training Strategies","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06395","snapshot_observed_at":"2026-08-10T00:43:28.937752Z","title":"Minicpm: Unveiling the potential of small language models with scalable train- ing strategies.arXiv preprint arXiv:2404.06395,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.18107","last_updated":"2025-06-07T00:03:08Z","snapshot_observed_at":"2026-08-10T09:14:26.425079Z","submitted_at":"2025-01-30T03:16:44Z","title":"Scaling Inference-Efficient Language Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T00:43:28.937752Z"},"links":{"cited_paper":"/paper/2404.06395","citing_paper":"/paper/2501.18107"},"observation_digest":"sha256:04c6d35d842dac82a44f1d96e100fc28b68c5559b009e816555e6a682f197a67","observation_id":"54d7b0e2-73b2-4a48-a3b9-f20cc31d373c","resolution":{"observed_at":"2026-08-10T00:43:28.937752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.12017","last_updated":"2023-01-30T05:25:59Z","snapshot_observed_at":"2026-08-02T23:44:31.455796Z","submitted_at":"2022-12-22T19:56:09Z","title":"OPT-IML: Scaling Language Model Instruction Meta Learning through the Lens of Generalization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.12017","snapshot_observed_at":"2026-08-10T00:43:28.941174Z","title":"V ., Pasunuru, R., Mihaylov, T., Simig, D., Yu, P., Shuster, K., Wang, T., Liu, Q., Koura, P","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.18107","last_updated":"2025-06-07T00:03:08Z","snapshot_observed_at":"2026-08-10T09:14:26.425079Z","submitted_at":"2025-01-30T03:16:44Z","title":"Scaling Inference-Efficient Language Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T00:43:28.941174Z"},"links":{"cited_paper":"/paper/2212.12017","citing_paper":"/paper/2501.18107"},"observation_digest":"sha256:6c3540ce1554db904d4e6af2ed1da3608473072c679f3da90d0d0b053216f04c","observation_id":"5eb28230-aa94-400e-806e-1f4f1ac094ca","resolution":{"observed_at":"2026-08-10T00:43:28.941174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02490","last_updated":"2024-10-30T14:53:22Z","snapshot_observed_at":"2026-08-07T20:59:29.819833Z","submitted_at":"2024-07-02T17:59:56Z","title":"MInference 1.0: Accelerating Pre-filling for Long-Context LLMs via Dynamic Sparse Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02490","snapshot_observed_at":"2026-08-10T00:43:28.945003Z","title":"H., Li, D., Lin, C.-Y ., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.18107","last_updated":"2025-06-07T00:03:08Z","snapshot_observed_at":"2026-08-10T09:14:26.425079Z","submitted_at":"2025-01-30T03:16:44Z","title":"Scaling Inference-Efficient Language Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T00:43:28.945003Z"},"links":{"cited_paper":"/paper/2407.02490","citing_paper":"/paper/2501.18107"},"observation_digest":"sha256:9d6946f3ab3776fe7b9c09a039b1177ea03499f283ea6b82f3b72561477ac27f","observation_id":"d2582b16-804f-4781-8624-a8375140aac3","resolution":{"observed_at":"2026-08-10T00:43:28.945003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-10T00:43:28.949049Z","title":"B., Chess, B., Child, R., Gray, S., Radford, A., Wu, J., and Amodei, D","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2501.18107","last_updated":"2025-06-07T00:03:08Z","snapshot_observed_at":"2026-08-10T09:14:26.425079Z","submitted_at":"2025-01-30T03:16:44Z","title":"Scaling Inference-Efficient Language Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T00:43:28.949049Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2501.18107"},"observation_digest":"sha256:3525a915fd21afb607ebb98091ba6945a91d713303ece7f425486a188ba511aa","observation_id":"b79f3d96-6d66-44fc-abbb-039d5df1ac2a","resolution":{"observed_at":"2026-08-10T00:43:28.949049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07871","last_updated":"2024-02-12T18:33:47Z","snapshot_observed_at":"2026-08-10T05:40:29.232133Z","submitted_at":"2024-02-12T18:33:47Z","title":"Scaling Laws for Fine-Grained Mixture of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07871","snapshot_observed_at":"2026-08-10T00:43:28.952649Z","title":"Scaling laws for fine-grained mixture of experts.arXiv preprint arXiv:2402.07871,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.18107","last_updated":"2025-06-07T00:03:08Z","snapshot_observed_at":"2026-08-10T09:14:26.425079Z","submitted_at":"2025-01-30T03:16:44Z","title":"Scaling Inference-Efficient Language Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T00:43:28.952649Z"},"links":{"cited_paper":"/paper/2402.07871","citing_paper":"/paper/2501.18107"},"observation_digest":"sha256:9639a207454c86fbd24e37893f5479fa0cf21d236a5cd8f84cb4ed6ae3833209","observation_id":"743d0cea-2e11-4eb2-99ef-552c3de26c33","resolution":{"observed_at":"2026-08-10T00:43:28.952649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04330","last_updated":"2024-11-30T02:42:31Z","snapshot_observed_at":"2026-08-04T07:47:22.112536Z","submitted_at":"2024-11-07T00:10:10Z","title":"Scaling Laws for Precision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04330","snapshot_observed_at":"2026-08-10T00:43:28.956199Z","title":"F., Bordelon, B., Muen- nighoff, N., Paul, M., Pehlevan, C., R´e, C., and Raghu- nathan, A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.18107","last_updated":"2025-06-07T00:03:08Z","snapshot_observed_at":"2026-08-10T09:14:26.425079Z","submitted_at":"2025-01-30T03:16:44Z","title":"Scaling Inference-Efficient Language Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T00:43:28.956199Z"},"links":{"cited_paper":"/paper/2411.04330","citing_paper":"/paper/2501.18107"},"observation_digest":"sha256:1b45630637bb49638dc247e1f6790aa9b68eeeab002e55c36e6b0dde5b1fa0d6","observation_id":"666f646f-b6b1-47c6-95dd-a7f66d8fcb67","resolution":{"observed_at":"2026-08-10T00:43:28.956199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11794","last_updated":"2025-04-21T17:48:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-17T17:42:57Z","title":"DataComp-LM: In search of the next generation of training sets for language models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11794","snapshot_observed_at":"2026-08-10T00:43:28.960173Z","title":"Datacomp- lm: In search of the next generation of training sets for lan- guage models.arXiv preprint arXiv:2406.11794,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.18107","last_updated":"2025-06-07T00:03:08Z","snapshot_observed_at":"2026-08-10T09:14:26.425079Z","submitted_at":"2025-01-30T03:16:44Z","title":"Scaling Inference-Efficient Language Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T00:43:28.960173Z"},"links":{"cited_paper":"/paper/2406.11794","citing_paper":"/paper/2501.18107"},"observation_digest":"sha256:c181db746f7e6e8de942ee37e828aac92ec6804cfa85ed2d2307df8831379d6d","observation_id":"779028af-5f12-49e8-b0c4-84a3dd7a88cc","resolution":{"observed_at":"2026-08-10T00:43:28.960173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-10T00:43:28.964120Z","title":"Deepseek-v2: A strong, economical, and efficient mixture-of-experts language model.arXiv preprint arXiv:2405.04434, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.18107","last_updated":"2025-06-07T00:03:08Z","snapshot_observed_at":"2026-08-10T09:14:26.425079Z","submitted_at":"2025-01-30T03:16:44Z","title":"Scaling Inference-Efficient Language Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T00:43:28.964120Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2501.18107"},"observation_digest":"sha256:55a8772c2042f67113ca2351429559e67102b13dba8e0640dd7b22d31fc1a6a0","observation_id":"9dffec26-ad04-42ff-8152-7cac27223013","resolution":{"observed_at":"2026-08-10T00:43:28.964120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:43:30.540637Z","title":"MLC-LLM, 2023-2025","venue":null,"work_id":"854a7131-d1f3-4263-9cb6-e43e915d4cff","year":2023},"citing_paper":{"arxiv_id":"2501.18107","last_updated":"2025-06-07T00:03:08Z","snapshot_observed_at":"2026-08-10T09:14:26.425079Z","submitted_at":"2025-01-30T03:16:44Z","title":"Scaling Inference-Efficient Language Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T00:43:28.967586Z"},"links":{"citing_paper":"/paper/2501.18107"},"observation_digest":"sha256:e98b5c0e1b4aaf77838732db61343520e92880aabaa14f2db73706766b015ac3","observation_id":"2d390137-7835-4a37-bb3a-ab1eb0fed272","resolution":{"observed_at":"2026-08-10T00:43:30.544383Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.06139","last_updated":"2017-12-27T20:43:02Z","snapshot_observed_at":"2026-08-02T02:13:21.763849Z","submitted_at":"2017-12-17T16:36:26Z","title":"TensorFlow-Serving: Flexible, High-Performance ML Serving","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.06139","snapshot_observed_at":"2026-08-10T00:43:28.971214Z","title":"Tensorflow- serving: Flexible, high-performance ml serving.arXiv preprint arXiv:1712.06139,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.18107","last_updated":"2025-06-07T00:03:08Z","snapshot_observed_at":"2026-08-10T09:14:26.425079Z","submitted_at":"2025-01-30T03:16:44Z","title":"Scaling Inference-Efficient Language Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T00:43:28.971214Z"},"links":{"cited_paper":"/paper/1712.06139","citing_paper":"/paper/2501.18107"},"observation_digest":"sha256:d602a5a4666322ee729f42674b32090c39e39d8b7ca6613e6b4ef75dc3c2a38c","observation_id":"c39a3c32-edfa-4498-a651-cb7a50cd9876","resolution":{"observed_at":"2026-08-10T00:43:28.971214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.00448","last_updated":"2025-04-14T10:11:13Z","snapshot_observed_at":"2026-08-09T11:34:40.162228Z","submitted_at":"2023-12-31T10:53:58Z","title":"Beyond Chinchilla-Optimal: Accounting for Inference in Language Model Scaling Laws","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.00448","snapshot_observed_at":"2026-08-10T00:43:29.139416Z","title":"Beyond chinchilla-optimal: Accounting for inference in language model scaling laws.arXiv preprint arXiv:2401.00448,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.18107","last_updated":"2025-06-07T00:03:08Z","snapshot_observed_at":"2026-08-10T09:14:26.425079Z","submitted_at":"2025-01-30T03:16:44Z","title":"Scaling Inference-Efficient Language Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T00:43:29.139416Z"},"links":{"cited_paper":"/paper/2401.00448","citing_paper":"/paper/2501.18107"},"observation_digest":"sha256:ef2a47ae2fafaac0ac568ce256dea1079a411d2dea818bb6bc23911437bf716c","observation_id":"d03d123a-ee22-4941-be21-0958ae264f8a","resolution":{"observed_at":"2026-08-10T00:43:29.139416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.02150","last_updated":"2019-11-06T00:19:05Z","snapshot_observed_at":"2026-07-06T08:35:01.386074Z","submitted_at":"2019-11-06T00:19:05Z","title":"Fast Transformer Decoding: One Write-Head is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.02150","snapshot_observed_at":"2026-08-10T00:43:29.171747Z","title":"Fast transformer decoding: One write-head is all you need.arXiv preprint arXiv:1911.02150,","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2501.18107","last_updated":"2025-06-07T00:03:08Z","snapshot_observed_at":"2026-08-10T09:14:26.425079Z","submitted_at":"2025-01-30T03:16:44Z","title":"Scaling Inference-Efficient Language Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T00:43:29.171747Z"},"links":{"cited_paper":"/paper/1911.02150","citing_paper":"/paper/2501.18107"},"observation_digest":"sha256:1d7226037a27bad00a669d1331cc9caf951ceb436564d94806b7249e8ecb6f33","observation_id":"2b19d0a3-c7a2-490a-9d9e-b3bd645aac06","resolution":{"observed_at":"2026-08-10T00:43:29.171747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-08-10T00:43:29.181113Z","title":"Scaling llm test- time compute optimally can be more effective than scal- ing model parameters.arXiv preprint arXiv:2408.03314,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.18107","last_updated":"2025-06-07T00:03:08Z","snapshot_observed_at":"2026-08-10T09:14:26.425079Z","submitted_at":"2025-01-30T03:16:44Z","title":"Scaling Inference-Efficient Language Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T00:43:29.181113Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2501.18107"},"observation_digest":"sha256:ae454df4d930c1074c1c4b9d6654e613e5dc9db8a09610713d14411185633c12","observation_id":"8097040e-2e6c-40b2-a1bd-28c807b7bda2","resolution":{"observed_at":"2026-08-10T00:43:29.181113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.13623","last_updated":"2024-11-01T02:41:36Z","snapshot_observed_at":"2026-08-08T09:36:33.967744Z","submitted_at":"2024-07-18T15:58:54Z","title":"Scaling Laws with Vocabulary: Larger Models Deserve Larger Vocabularies","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.13623","snapshot_observed_at":"2026-08-10T00:43:29.213990Z","title":"Scaling laws with vocabulary: Larger models deserve larger vocabularies.arXiv preprint arXiv:2407.13623,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.18107","last_updated":"2025-06-07T00:03:08Z","snapshot_observed_at":"2026-08-10T09:14:26.425079Z","submitted_at":"2025-01-30T03:16:44Z","title":"Scaling Inference-Efficient Language Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T00:43:29.213990Z"},"links":{"cited_paper":"/paper/2407.13623","citing_paper":"/paper/2501.18107"},"observation_digest":"sha256:dbfb7b17435659a8ae6b16bb2727ad21bfa6aa053191833e307db7f2514d5dd8","observation_id":"65e47aa4-c5d0-4a68-944d-b62ee373bee7","resolution":{"observed_at":"2026-08-10T00:43:29.213990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.10686","last_updated":"2022-01-30T16:42:46Z","snapshot_observed_at":"2026-07-06T11:50:13.578611Z","submitted_at":"2021-09-22T12:29:15Z","title":"Scale Efficiently: Insights from Pre-training and Fine-tuning Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.10686","snapshot_observed_at":"2026-08-10T00:43:29.237192Z","title":"W., Narang, S., Yogatama, D., Vaswani, A., and Metzler, D","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.18107","last_updated":"2025-06-07T00:03:08Z","snapshot_observed_at":"2026-08-10T09:14:26.425079Z","submitted_at":"2025-01-30T03:16:44Z","title":"Scaling Inference-Efficient Language Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T00:43:29.237192Z"},"links":{"cited_paper":"/paper/2109.10686","citing_paper":"/paper/2501.18107"},"observation_digest":"sha256:c227721f3c8b1ee88161cbf864d4dad479278ad9ca0184c0d115081f4aac6138","observation_id":"dc59e599-d3da-4b64-9257-7944773488cd","resolution":{"observed_at":"2026-08-10T00:43:29.237192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08295","last_updated":"2024-04-16T12:52:47Z","snapshot_observed_at":"2026-08-03T03:29:01.959523Z","submitted_at":"2024-03-13T06:59:16Z","title":"Gemma: Open Models Based on Gemini Research and Technology","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08295","snapshot_observed_at":"2026-08-10T00:43:29.244586Z","title":"S., Love, J., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.18107","last_updated":"2025-06-07T00:03:08Z","snapshot_observed_at":"2026-08-10T09:14:26.425079Z","submitted_at":"2025-01-30T03:16:44Z","title":"Scaling Inference-Efficient Language Models","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T00:43:29.244586Z"},"links":{"cited_paper":"/paper/2403.08295","citing_paper":"/paper/2501.18107"},"observation_digest":"sha256:022ee92f686556d43639b8b37e81d3325fefbd9a1c3a3ea562c8e55da6793535","observation_id":"8bfdace5-9950-45a0-85f6-edef190d15f8","resolution":{"observed_at":"2026-08-10T00:43:29.244586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1804.07461","last_updated":"2019-02-22T23:53:34Z","snapshot_observed_at":"2026-07-06T06:34:26.609892Z","submitted_at":"2018-04-20T06:35:04Z","title":"GLUE: A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.07461","snapshot_observed_at":"2026-08-10T00:43:29.248752Z","title":"Glue: A multi-task benchmark and analysis plat- form for natural language understanding.arXiv preprint arXiv:1804.07461,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.18107","last_updated":"2025-06-07T00:03:08Z","snapshot_observed_at":"2026-08-10T09:14:26.425079Z","submitted_at":"2025-01-30T03:16:44Z","title":"Scaling Inference-Efficient Language Models","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T00:43:29.248752Z"},"links":{"cited_paper":"/paper/1804.07461","citing_paper":"/paper/2501.18107"},"observation_digest":"sha256:baa4fd179401db5c18e9d5a29e84e0bfa2d13dcb240c86814d14a21f89452419","observation_id":"1a995995-f6c7-451f-a4e0-6671d0b5e10b","resolution":{"observed_at":"2026-08-10T00:43:29.248752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.03771","last_updated":"2020-07-14T03:42:34Z","snapshot_observed_at":"2026-07-06T08:27:58.343233Z","submitted_at":"2019-10-09T03:23:22Z","title":"HuggingFace's Transformers: State-of-the-art Natural Language Processing","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.03771","snapshot_observed_at":"2026-08-10T00:43:29.252725Z","title":"Huggingface’s transformers: State-of-the- art natural language processing.arXiv preprint arXiv:1910.03771,","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2501.18107","last_updated":"2025-06-07T00:03:08Z","snapshot_observed_at":"2026-08-10T09:14:26.425079Z","submitted_at":"2025-01-30T03:16:44Z","title":"Scaling Inference-Efficient Language Models","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T00:43:29.252725Z"},"links":{"cited_paper":"/paper/1910.03771","citing_paper":"/paper/2501.18107"},"observation_digest":"sha256:26b697ab614f40f3501a7f1dbbbbe2e2aa0338174d16a2f98dc2f6f6402d2268","observation_id":"320db702-f16d-48ef-9b86-197de543fb9e","resolution":{"observed_at":"2026-08-10T00:43:29.252725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10819","last_updated":"2024-10-14T17:59:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-14T17:59:58Z","title":"DuoAttention: Efficient Long-Context LLM Inference with Retrieval and Streaming Heads","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10819","snapshot_observed_at":"2026-08-10T00:43:29.260648Z","title":"Duoattention: Efficient long-context llm inference with retrieval and streaming heads.arXiv preprint arXiv:2410.10819,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.18107","last_updated":"2025-06-07T00:03:08Z","snapshot_observed_at":"2026-08-10T09:14:26.425079Z","submitted_at":"2025-01-30T03:16:44Z","title":"Scaling Inference-Efficient Language Models","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T00:43:29.260648Z"},"links":{"cited_paper":"/paper/2410.10819","citing_paper":"/paper/2501.18107"},"observation_digest":"sha256:c4048f2337f36445a8057b5b2fda66f518e7e8ea274c9057d845176274311c9a","observation_id":"e8361014-a9c4-4b52-ae56-22eb6041ae8c","resolution":{"observed_at":"2026-08-10T00:43:29.260648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01528","last_updated":"2025-02-05T03:17:28Z","snapshot_observed_at":"2026-08-07T15:36:09.160949Z","submitted_at":"2024-02-02T16:15:24Z","title":"Decoding Speculative Decoding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01528","snapshot_observed_at":"2026-08-10T00:43:29.264303Z","title":"Decoding speculative decoding.arXiv preprint arXiv:2402.01528,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.18107","last_updated":"2025-06-07T00:03:08Z","snapshot_observed_at":"2026-08-10T09:14:26.425079Z","submitted_at":"2025-01-30T03:16:44Z","title":"Scaling Inference-Efficient Language Models","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T00:43:29.264303Z"},"links":{"cited_paper":"/paper/2402.01528","citing_paper":"/paper/2501.18107"},"observation_digest":"sha256:8197e9d284c7b86e2a87fdce3b0a1b0f262a9564f5f6f4525df678e5e68dce58","observation_id":"79f4d5c7-acd7-4733-ac4d-20ae0c18214a","resolution":{"observed_at":"2026-08-10T00:43:29.264303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-10T00:43:29.268157Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.18107","last_updated":"2025-06-07T00:03:08Z","snapshot_observed_at":"2026-08-10T09:14:26.425079Z","submitted_at":"2025-01-30T03:16:44Z","title":"Scaling Inference-Efficient Language Models","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T00:43:29.268157Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2501.18107"},"observation_digest":"sha256:1d4c4924e7d055027c99ba13514279481e53fcd6eb25d34e6b026be629b24c10","observation_id":"130af53b-c465-461f-ad57-d562fce51fa9","resolution":{"observed_at":"2026-08-10T00:43:29.268157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-10T00:43:29.271945Z","title":"Minicpm-v: A gpt-4v level mllm on your phone.arXiv preprint arXiv:2408.01800,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.18107","last_updated":"2025-06-07T00:03:08Z","snapshot_observed_at":"2026-08-10T09:14:26.425079Z","submitted_at":"2025-01-30T03:16:44Z","title":"Scaling Inference-Efficient Language Models","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T00:43:29.271945Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2501.18107"},"observation_digest":"sha256:a9a051ce24d50850da5e30dca98fc2c41a2d4ae6808f7eeb386e1da18025e312","observation_id":"6edbb00f-43ea-488c-9d79-e57a745fb3d2","resolution":{"observed_at":"2026-08-10T00:43:29.271945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01005","last_updated":"2025-04-21T20:10:11Z","snapshot_observed_at":"2026-07-06T20:15:36.280948Z","submitted_at":"2025-01-02T02:02:20Z","title":"FlashInfer: Efficient and Customizable Attention Engine for LLM Inference Serving","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01005","snapshot_observed_at":"2026-08-10T00:43:29.275583Z","title":"Flash- infer: Efficient and customizable attention engine for llm inference serving.arXiv preprint arXiv:2501.01005,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.18107","last_updated":"2025-06-07T00:03:08Z","snapshot_observed_at":"2026-08-10T09:14:26.425079Z","submitted_at":"2025-01-30T03:16:44Z","title":"Scaling Inference-Efficient Language Models","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T00:43:29.275583Z"},"links":{"cited_paper":"/paper/2501.01005","citing_paper":"/paper/2501.18107"},"observation_digest":"sha256:fc7b66d440e9388bac3620b8163bd6981e65b0f68968f19c5821f629a9a1ed33","observation_id":"71770aef-bfb3-4c91-8934-b4b558f885c0","resolution":{"observed_at":"2026-08-10T00:43:29.275583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11089","last_updated":"2025-02-27T09:01:21Z","snapshot_observed_at":"2026-08-07T14:17:15.942844Z","submitted_at":"2025-02-16T11:53:44Z","title":"Native Sparse Attention: Hardware-Aligned and Natively Trainable Sparse Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11089","snapshot_observed_at":"2026-08-10T00:43:29.279768Z","title":"Native sparse attention: Hardware-aligned and natively trainable sparse attention.arXiv preprint arXiv:2502.11089,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.18107","last_updated":"2025-06-07T00:03:08Z","snapshot_observed_at":"2026-08-10T09:14:26.425079Z","submitted_at":"2025-01-30T03:16:44Z","title":"Scaling Inference-Efficient Language Models","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T00:43:29.279768Z"},"links":{"cited_paper":"/paper/2502.11089","citing_paper":"/paper/2501.18107"},"observation_digest":"sha256:f504815f8fad5a961f129ee43a94c4d7b77014cfec822507a6687b18fbbf82b6","observation_id":"7e502ea8-cd4f-44bb-a91c-8aacd2cf5bc5","resolution":{"observed_at":"2026-08-10T00:43:29.279768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.07830","last_updated":"2019-05-19T23:57:23Z","snapshot_observed_at":"2026-07-31T00:09:56.948833Z","submitted_at":"2019-05-19T23:57:23Z","title":"HellaSwag: Can a Machine Really Finish Your Sentence?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.07830","snapshot_observed_at":"2026-08-10T00:43:29.317998Z","title":"Hellaswag: Can a machine really finish your sentence? arXiv preprint arXiv:1905.07830,","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2501.18107","last_updated":"2025-06-07T00:03:08Z","snapshot_observed_at":"2026-08-10T09:14:26.425079Z","submitted_at":"2025-01-30T03:16:44Z","title":"Scaling Inference-Efficient Language Models","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T00:43:29.317998Z"},"links":{"cited_paper":"/paper/1905.07830","citing_paper":"/paper/2501.18107"},"observation_digest":"sha256:1c4d679c0d250f781bcc40960da5bf3689fe4c028b9f376a2d6d1bd743fd3d5b","observation_id":"00bc4bce-51e1-4033-a47d-bff38ca9befd","resolution":{"observed_at":"2026-08-10T00:43:29.317998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-08-06T03:13:37.403059Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-08-10T00:43:29.358954Z","title":"V ., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.18107","last_updated":"2025-06-07T00:03:08Z","snapshot_observed_at":"2026-08-10T09:14:26.425079Z","submitted_at":"2025-01-30T03:16:44Z","title":"Scaling Inference-Efficient Language Models","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T00:43:29.358954Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2501.18107"},"observation_digest":"sha256:078d79d49ed8c1d5182de04e364e6d606c740c67f46820510a5b2d34b1c3782f","observation_id":"f36b0fb5-36bf-46ce-bafd-12008f918a7d","resolution":{"observed_at":"2026-08-10T00:43:29.358954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:43:30.463835Z","title":"(Center) We indicate the relationship between inference latency and hidden size with the number of layers fixed","venue":null,"work_id":"8f815b23-8c27-41fe-9e7f-c80233fa16ae","year":2000},"citing_paper":{"arxiv_id":"2501.18107","last_updated":"2025-06-07T00:03:08Z","snapshot_observed_at":"2026-08-10T09:14:26.425079Z","submitted_at":"2025-01-30T03:16:44Z","title":"Scaling Inference-Efficient Language Models","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-10T00:43:29.557585Z"},"links":{"citing_paper":"/paper/2501.18107"},"observation_digest":"sha256:0a175aeec0546b16610410e37fdcc14b0c87730ad5cc15950e46d7143d919340","observation_id":"9809848f-786e-40cc-b902-b7d36b2a17df","resolution":{"observed_at":"2026-08-10T00:43:30.471291Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:43:30.379642Z","title":"The evaluated models include LLaMA (Touvron et al., 2023a), Qwen (Yang et al., 2024), Gemma (Team et al., 2024a;b), and MiniCPM (Hu et al., 2024)","venue":null,"work_id":"f27e4658-c181-4b19-9cda-2b254ed2d715","year":2024},"citing_paper":{"arxiv_id":"2501.18107","last_updated":"2025-06-07T00:03:08Z","snapshot_observed_at":"2026-08-10T09:14:26.425079Z","submitted_at":"2025-01-30T03:16:44Z","title":"Scaling Inference-Efficient Language Models","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-10T00:43:29.564505Z"},"links":{"citing_paper":"/paper/2501.18107"},"observation_digest":"sha256:06b366d263ea3812ddc389812e58377800cbe58b45baab239655a0436e026c67","observation_id":"92eb9d33-d361-4bba-9201-2c641ead1be5","resolution":{"observed_at":"2026-08-10T00:43:30.400895Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:43:30.236039Z","title":null,"venue":null,"work_id":"b7c109a5-2348-4be1-bfcb-b10b4fb6273c","year":2000},"citing_paper":{"arxiv_id":"2501.18107","last_updated":"2025-06-07T00:03:08Z","snapshot_observed_at":"2026-08-10T09:14:26.425079Z","submitted_at":"2025-01-30T03:16:44Z","title":"Scaling Inference-Efficient Language Models","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-10T00:43:29.567890Z"},"links":{"citing_paper":"/paper/2501.18107"},"observation_digest":"sha256:4f74bea5f08698dc5135a832ed9af148a2ee2c9684b17394831a6abfa6d0de8d","observation_id":"c0cfc69b-3642-40db-ac9d-47249834c10f","resolution":{"observed_at":"2026-08-10T00:43:30.324478Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:43:30.142461Z","title":null,"venue":null,"work_id":"98d391b1-1b4d-4538-977b-0d313b7a0392","year":null},"citing_paper":{"arxiv_id":"2501.18107","last_updated":"2025-06-07T00:03:08Z","snapshot_observed_at":"2026-08-10T09:14:26.425079Z","submitted_at":"2025-01-30T03:16:44Z","title":"Scaling Inference-Efficient Language Models","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-10T00:43:29.571468Z"},"links":{"citing_paper":"/paper/2501.18107"},"observation_digest":"sha256:4e431f34ec4e1f1dad4f56d5aa72518a541393eca42efd3cb1564d893f0968ac","observation_id":"8b000cb5-25d9-4ce2-bc4c-40069c0d50c6","resolution":{"observed_at":"2026-08-10T00:43:30.178497Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:43:30.130818Z","title":null,"venue":null,"work_id":"725153ce-1d3a-4bbf-a9b7-fc87cbbdc065","year":null},"citing_paper":{"arxiv_id":"2501.18107","last_updated":"2025-06-07T00:03:08Z","snapshot_observed_at":"2026-08-10T09:14:26.425079Z","submitted_at":"2025-01-30T03:16:44Z","title":"Scaling Inference-Efficient Language Models","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-10T00:43:29.574447Z"},"links":{"citing_paper":"/paper/2501.18107"},"observation_digest":"sha256:de9b19af2a7a7d66e90c5b6f9fe16c34e983854ae7077adccaf6bed7ee182c7e","observation_id":"a6da3976-01ab-456d-9366-3039c7b87aaa","resolution":{"observed_at":"2026-08-10T00:43:30.134727Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:43:30.119330Z","title":null,"venue":null,"work_id":"d20455eb-e866-406c-81e5-c4ac149d5605","year":null},"citing_paper":{"arxiv_id":"2501.18107","last_updated":"2025-06-07T00:03:08Z","snapshot_observed_at":"2026-08-10T09:14:26.425079Z","submitted_at":"2025-01-30T03:16:44Z","title":"Scaling Inference-Efficient Language Models","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-10T00:43:29.577850Z"},"links":{"citing_paper":"/paper/2501.18107"},"observation_digest":"sha256:b8f04c3dfeefa5197d90a56ccdbabb2ffc4b96110200ff30afd7683735d35251","observation_id":"459ddbfe-1a6c-4f01-bc00-a4463a9c4683","resolution":{"observed_at":"2026-08-10T00:43:30.123552Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:43:30.484446Z","title":null,"venue":null,"work_id":"204d4b84-b8f5-49b7-8e1a-08b67672e14c","year":2000},"citing_paper":{"arxiv_id":"2501.18107","last_updated":"2025-06-07T00:03:08Z","snapshot_observed_at":"2026-08-10T09:14:26.425079Z","submitted_at":"2025-01-30T03:16:44Z","title":"Scaling Inference-Efficient Language Models","version":2},"reference_index":256,"source":"pdf_text","source_observed_at":"2026-08-10T00:43:29.537141Z"},"links":{"citing_paper":"/paper/2501.18107"},"observation_digest":"sha256:6fe91e46a0e13f09c9dc5abd38ce60b6bb805e5ce27ee4d66cad86998d5c4c0d","observation_id":"e805e0bf-72d8-4660-b255-d504e1315cfe","resolution":{"observed_at":"2026-08-10T00:43:30.496911Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17453","last_updated":"2024-04-07T00:56:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-29T17:59:56Z","title":"Efficient Streaming Language Models with Attention Sinks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17453","snapshot_observed_at":"2026-08-10T00:43:29.256420Z","title":"Ef- ficient streaming language models with attention sinks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.18107","last_updated":"2025-06-07T00:03:08Z","snapshot_observed_at":"2026-08-10T09:14:26.425079Z","submitted_at":"2025-01-30T03:16:44Z","title":"Scaling Inference-Efficient Language Models","version":2},"reference_index":1921,"source":"pdf_text","source_observed_at":"2026-08-10T00:43:29.256420Z"},"links":{"cited_paper":"/paper/2309.17453","citing_paper":"/paper/2501.18107"},"observation_digest":"sha256:44255d31214efd066a15ea1cbd68e916caf179dd5bb1b675225b428adc90fe02","observation_id":"6266e32d-d3a6-4a57-b7b7-76549fca7d7b","resolution":{"observed_at":"2026-08-10T00:43:29.256420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04615","last_updated":"2023-06-12T17:51:15Z","snapshot_observed_at":"2026-07-06T13:19:12.109592Z","submitted_at":"2022-06-09T17:05:34Z","title":"Beyond the Imitation Game: Quantifying and extrapolating the capabilities of language models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.04615","snapshot_observed_at":"2026-08-10T00:43:29.198924Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.18107","last_updated":"2025-06-07T00:03:08Z","snapshot_observed_at":"2026-08-10T09:14:26.425079Z","submitted_at":"2025-01-30T03:16:44Z","title":"Scaling Inference-Efficient Language Models","version":2},"reference_index":1961,"source":"pdf_text","source_observed_at":"2026-08-10T00:43:29.198924Z"},"links":{"cited_paper":"/paper/2206.04615","citing_paper":"/paper/2501.18107"},"observation_digest":"sha256:523b922808b289e521d1e03dbeb77c8e33702d2b7076dce5e0a023a7d1be062a","observation_id":"ef6e98a8-048f-41af-abf5-fa1949c0175f","resolution":{"observed_at":"2026-08-10T00:43:29.198924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.10938","last_updated":"2024-10-01T23:38:10Z","snapshot_observed_at":"2026-07-06T18:15:54.402568Z","submitted_at":"2024-05-17T17:49:44Z","title":"Observational Scaling Laws and the Predictability of Language Model Performance","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.10938","snapshot_observed_at":"2026-08-10T00:43:29.116548Z","title":"J., and Hashimoto, T","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.18107","last_updated":"2025-06-07T00:03:08Z","snapshot_observed_at":"2026-08-10T09:14:26.425079Z","submitted_at":"2025-01-30T03:16:44Z","title":"Scaling Inference-Efficient Language Models","version":2},"reference_index":2011,"source":"pdf_text","source_observed_at":"2026-08-10T00:43:29.116548Z"},"links":{"cited_paper":"/paper/2405.10938","citing_paper":"/paper/2501.18107"},"observation_digest":"sha256:f434445c6a73901740cd949d4cc042987cbd730b60b9505727535eedb3b78ec9","observation_id":"72478f8f-797d-4a77-8054-4166b6a683fe","resolution":{"observed_at":"2026-08-10T00:43:29.116548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06195","last_updated":"2024-08-12T14:42:13Z","snapshot_observed_at":"2026-08-09T16:44:49.698332Z","submitted_at":"2024-08-12T14:42:13Z","title":"Mutual Reasoning Makes Smaller LLMs Stronger Problem-Solvers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06195","snapshot_observed_at":"2026-08-10T00:43:29.080074Z","title":"L., Yang, F., and Yang, M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.18107","last_updated":"2025-06-07T00:03:08Z","snapshot_observed_at":"2026-08-10T09:14:26.425079Z","submitted_at":"2025-01-30T03:16:44Z","title":"Scaling Inference-Efficient Language Models","version":2},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-10T00:43:29.080074Z"},"links":{"cited_paper":"/paper/2408.06195","citing_paper":"/paper/2501.18107"},"observation_digest":"sha256:f2196d3ab874dbf95a014fff5573c9ef8119959c0b096a63a3b47bda3857346b","observation_id":"5f881308-29a5-4563-ba0e-b23af1b6e46f","resolution":{"observed_at":"2026-08-10T00:43:29.080074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.06031","last_updated":"2016-06-20T09:37:17Z","snapshot_observed_at":"2026-08-05T16:27:22.031013Z","submitted_at":"2016-06-20T09:37:17Z","title":"The LAMBADA dataset: Word prediction requiring a broad discourse context","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.06031","snapshot_observed_at":"2026-08-10T00:43:29.016527Z","title":"N., Bernardi, R., Pezzelle, S., Baroni, M., Boleda, G., and Fern´andez, R","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.18107","last_updated":"2025-06-07T00:03:08Z","snapshot_observed_at":"2026-08-10T09:14:26.425079Z","submitted_at":"2025-01-30T03:16:44Z","title":"Scaling Inference-Efficient Language Models","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-10T00:43:29.016527Z"},"links":{"cited_paper":"/paper/1606.06031","citing_paper":"/paper/2501.18107"},"observation_digest":"sha256:7b83b7c8ec3c6c41cb557afe41bd976db10833072915fa06684d1b14a45d08af","observation_id":"f4d96b4e-56c0-4bf1-98d8-0e3684f6fc53","resolution":{"observed_at":"2026-08-10T00:43:29.016527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-10T00:43:28.768781Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.18107","last_updated":"2025-06-07T00:03:08Z","snapshot_observed_at":"2026-08-10T09:14:26.425079Z","submitted_at":"2025-01-30T03:16:44Z","title":"Scaling Inference-Efficient Language Models","version":2},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-10T00:43:28.768781Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2501.18107"},"observation_digest":"sha256:5b066c812c9b34414a728b44e07f62a85141d2eb11ae4042b01b535c853869d1","observation_id":"c9fc260f-b242-46db-99aa-ed15d558a6b6","resolution":{"observed_at":"2026-08-10T00:43:28.768781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-10T00:43:28.672091Z","title":"Think you have solved question answering? try arc, the ai2 reasoning challenge","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.18107","last_updated":"2025-06-07T00:03:08Z","snapshot_observed_at":"2026-08-10T09:14:26.425079Z","submitted_at":"2025-01-30T03:16:44Z","title":"Scaling Inference-Efficient Language Models","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-10T00:43:28.672091Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2501.18107"},"observation_digest":"sha256:1eb5d96132a95d5f6321a7ec5404e63e742f174d4e607113301340bff56514a9","observation_id":"e3130bf6-75bc-4e61-824d-6417abde6ec9","resolution":{"observed_at":"2026-08-10T00:43:28.672091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06745","last_updated":"2022-04-14T04:00:27Z","snapshot_observed_at":"2026-07-06T13:00:12.148951Z","submitted_at":"2022-04-14T04:00:27Z","title":"GPT-NeoX-20B: An Open-Source Autoregressive Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06745","snapshot_observed_at":"2026-08-10T00:43:28.612128Z","title":"Gpt-neox-20b: An open-source autoregressive language model.arXiv preprint arXiv:2204.06745,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.18107","last_updated":"2025-06-07T00:03:08Z","snapshot_observed_at":"2026-08-10T09:14:26.425079Z","submitted_at":"2025-01-30T03:16:44Z","title":"Scaling Inference-Efficient Language Models","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-10T00:43:28.612128Z"},"links":{"cited_paper":"/paper/2204.06745","citing_paper":"/paper/2501.18107"},"observation_digest":"sha256:10529f79f8f8b86eed1d79095dfe1af454fe02bda89344e039d0166c77a51cb9","observation_id":"9fce7d57-3670-412a-b473-88a41959fe5e","resolution":{"observed_at":"2026-08-10T00:43:28.612128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-10T00:43:28.819084Z","title":"The llama 3 herd of models.arXiv preprint arXiv:2407.21783,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.18107","last_updated":"2025-06-07T00:03:08Z","snapshot_observed_at":"2026-08-10T09:14:26.425079Z","submitted_at":"2025-01-30T03:16:44Z","title":"Scaling Inference-Efficient Language Models","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-10T00:43:28.819084Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2501.18107"},"observation_digest":"sha256:b61e7c1977abd0f63854bd7f1a9ece69a24f28362cda7262bc6b0705f9a99813","observation_id":"f9b70a2b-b9ac-4d21-ad99-c0df5c2c6344","resolution":{"observed_at":"2026-08-10T00:43:28.819084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21787","last_updated":"2024-12-30T19:03:24Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:57:25Z","title":"Large Language Monkeys: Scaling Inference Compute with Repeated Sampling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21787","snapshot_observed_at":"2026-08-10T00:43:28.616404Z","title":"V ., R´e, C., and Mirhoseini, A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.18107","last_updated":"2025-06-07T00:03:08Z","snapshot_observed_at":"2026-08-10T09:14:26.425079Z","submitted_at":"2025-01-30T03:16:44Z","title":"Scaling Inference-Efficient Language Models","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-10T00:43:28.616404Z"},"links":{"cited_paper":"/paper/2407.21787","citing_paper":"/paper/2501.18107"},"observation_digest":"sha256:c802adf942fa43b61e40ed98f24d9b8ac3e13f85c32a06f8bbbbe80b780a0dd0","observation_id":"764af2e5-a84a-46ec-ab84-f40ab30dc6e6","resolution":{"observed_at":"2026-08-10T00:43:28.616404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-10T00:43:28.607548Z","title":"Qwen technical report.arXiv preprint arXiv:2309.16609,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.18107","last_updated":"2025-06-07T00:03:08Z","snapshot_observed_at":"2026-08-10T09:14:26.425079Z","submitted_at":"2025-01-30T03:16:44Z","title":"Scaling Inference-Efficient Language Models","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-10T00:43:28.607548Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2501.18107"},"observation_digest":"sha256:92b7e99cb751ea5bd9ac96a6d6d96e23bf8658707c2775e57da922cf5a1d9024","observation_id":"2a3c5454-eb55-4b54-8778-c051d3ff73bf","resolution":{"observed_at":"2026-08-10T00:43:28.607548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08905","last_updated":"2024-12-12T03:37:41Z","snapshot_observed_at":"2026-08-05T04:04:21.846023Z","submitted_at":"2024-12-12T03:37:41Z","title":"Phi-4 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.08905","snapshot_observed_at":"2026-08-10T00:43:28.585716Z","title":"J., Javaheripi, M., Kauffmann, P., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.18107","last_updated":"2025-06-07T00:03:08Z","snapshot_observed_at":"2026-08-10T09:14:26.425079Z","submitted_at":"2025-01-30T03:16:44Z","title":"Scaling Inference-Efficient Language Models","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-10T00:43:28.585716Z"},"links":{"cited_paper":"/paper/2412.08905","citing_paper":"/paper/2501.18107"},"observation_digest":"sha256:96acfaa3afab464b5a5acaf3e3697e8c2ef02022bb4efa4399af5a25cc98fe64","observation_id":"615efc87-a32f-4aea-8c20-8bfd1f41ff8c","resolution":{"observed_at":"2026-08-10T00:43:28.585716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08058","last_updated":"2024-04-27T22:45:39Z","snapshot_observed_at":"2026-07-06T17:43:36.124362Z","submitted_at":"2024-03-12T20:10:04Z","title":"CHAI: Clustered Head Attention for Efficient LLM Inference","version":2},"cited_work":{"arxiv_id":"2403.08058","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.08058","snapshot_observed_at":"2026-08-10T00:43:30.080447Z","title":"CHAI: Clustered Head Attention for Efficient LLM Inference","venue":"cs.LG","work_id":"17a139a3-932c-44d4-b0cb-cc1b41d39f13","year":2024},"citing_paper":{"arxiv_id":"2501.18107","last_updated":"2025-06-07T00:03:08Z","snapshot_observed_at":"2026-08-10T09:14:26.425079Z","submitted_at":"2025-01-30T03:16:44Z","title":"Scaling Inference-Efficient Language Models","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-10T00:43:28.601962Z"},"links":{"cited_paper":"/paper/2403.08058","citing_paper":"/paper/2501.18107"},"observation_digest":"sha256:0bbb0319d4921e6698d066a6baa595a7bf006ee5977a44c1c67d18aff5bc5455","observation_id":"9965cdfd-08b6-47ba-9256-79a8b6f2a577","resolution":{"observed_at":"2026-08-10T00:43:30.086880Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:43:30.529266Z","title":null,"venue":null,"work_id":"b69372d0-194a-4e0c-94ae-b9480a7cb4dc","year":2000},"citing_paper":{"arxiv_id":"2501.18107","last_updated":"2025-06-07T00:03:08Z","snapshot_observed_at":"2026-08-10T09:14:26.425079Z","submitted_at":"2025-01-30T03:16:44Z","title":"Scaling Inference-Efficient Language Models","version":2},"reference_index":2048,"source":"pdf_text","source_observed_at":"2026-08-10T00:43:29.385782Z"},"links":{"citing_paper":"/paper/2501.18107"},"observation_digest":"sha256:75693c3f9b2a15ecdb42ca70eb14e5c28f1833e887f1ed96c13863573cd5c9ed","observation_id":"8e4fcd9c-f716-4138-b306-c9f8e6b8b30e","resolution":{"observed_at":"2026-08-10T00:43:30.533224Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.18107","last_updated":"2025-06-07T00:03:08Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-10T09:14:26.425079Z","submitted_at":"2025-01-30T03:16:44Z","title":"Scaling Inference-Efficient Language Models"},"reference_resolution":{"displayed":60,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":53,"verified_exact":1,"verified_fuzzy":6},"total_outbound_references":60},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 60 of 60 outbound references and 3 inbound Pith citation observations for arXiv:2501.18107."}