{"as_of":"2026-08-10T09:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:81939df3c8780ae0cd3dae736f49a3a648c6d29c40a2f4175bb41c28ab650036","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":28,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":28,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":28,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T16:40:27.024729Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":6,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2307.11088","last_updated":"2023-10-04T10:04:25Z","snapshot_observed_at":"2026-08-09T07:56:50.464493Z","submitted_at":"2023-07-20T17:59:41Z","title":"L-Eval: Instituting Standardized Evaluation for Long Context Language Models","version":3},"cited_work":{"arxiv_id":"2307.11088","doi":"10.48550/arxiv.2307.11088","metadata_source":"arxiv_reference","pith_arxiv_id":"2307.11088","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2307.11088 , archivePrefix=","venue":"arXiv (Cornell University)","work_id":"8c5b99fd-55bf-4d88-b148-8bb61e28ee99","year":2024},"citing_paper":{"arxiv_id":"2308.14508","last_updated":"2024-06-19T04:00:32Z","snapshot_observed_at":"2026-08-08T03:49:18.086396Z","submitted_at":"2023-08-28T11:53:40Z","title":"LongBench: A Bilingual, Multitask Benchmark for Long Context Understanding","version":2},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-05-12T20:22:10.482509Z"},"links":{"cited_paper":"/paper/2307.11088","citing_paper":"/paper/2308.14508"},"observation_digest":"sha256:59da7efdb70f8ca4f0e5e9d4ad201ab1e2e95fcfa8c5613840ac1bce28920952","observation_id":"d221e3e8-9e3c-49c4-bd7f-865d78f8f29e","resolution":{"observed_at":"2026-05-12T20:22:10.690217Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.11088","last_updated":"2023-10-04T10:04:25Z","snapshot_observed_at":"2026-08-09T07:56:50.464493Z","submitted_at":"2023-07-20T17:59:41Z","title":"L-Eval: Instituting Standardized Evaluation for Long Context Language Models","version":3},"cited_work":{"arxiv_id":"2307.11088","doi":"10.48550/arxiv.2307.11088","metadata_source":"arxiv_reference","pith_arxiv_id":"2307.11088","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2307.11088 , archivePrefix=","venue":"arXiv (Cornell University)","work_id":"8c5b99fd-55bf-4d88-b148-8bb61e28ee99","year":2024},"citing_paper":{"arxiv_id":"2403.17297","last_updated":"2024-03-26T00:53:24Z","snapshot_observed_at":"2026-08-02T11:10:24.263044Z","submitted_at":"2024-03-26T00:53:24Z","title":"InternLM2 Technical Report","version":1},"reference_index":147,"source":"arxiv_source","source_observed_at":"2026-05-15T11:44:38.066501Z"},"links":{"cited_paper":"/paper/2307.11088","citing_paper":"/paper/2403.17297"},"observation_digest":"sha256:e4818aa83971260fccf70b83df04ab6a17259f5ffe6e540179903f6e47697926","observation_id":"c8d343fb-e86f-43e3-9e17-4839fb1389e0","resolution":{"observed_at":"2026-05-15T11:44:38.169759Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.11088","last_updated":"2023-10-04T10:04:25Z","snapshot_observed_at":"2026-08-09T07:56:50.464493Z","submitted_at":"2023-07-20T17:59:41Z","title":"L-Eval: Instituting Standardized Evaluation for Long Context Language Models","version":3},"cited_work":{"arxiv_id":"2307.11088","doi":"10.48550/arxiv.2307.11088","metadata_source":"arxiv_reference","pith_arxiv_id":"2307.11088","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2307.11088 , archivePrefix=","venue":"arXiv (Cornell University)","work_id":"8c5b99fd-55bf-4d88-b148-8bb61e28ee99","year":2024},"citing_paper":{"arxiv_id":"2403.19887","last_updated":"2024-07-03T14:30:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-28T23:55:06Z","title":"Jamba: A Hybrid Transformer-Mamba Language Model","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-13T14:11:27.156350Z"},"links":{"cited_paper":"/paper/2307.11088","citing_paper":"/paper/2403.19887"},"observation_digest":"sha256:ad6911924dfc80a6a4967fd13ddeeabd596ee3b7eebf3ed159a45114f054fd00","observation_id":"aa329656-4e69-4293-9776-6404ff6d1aec","resolution":{"observed_at":"2026-05-13T14:11:27.181188Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.11088","last_updated":"2023-10-04T10:04:25Z","snapshot_observed_at":"2026-08-09T07:56:50.464493Z","submitted_at":"2023-07-20T17:59:41Z","title":"L-Eval: Instituting Standardized Evaluation for Long Context Language Models","version":3},"cited_work":{"arxiv_id":"2307.11088","doi":"10.48550/arxiv.2307.11088","metadata_source":"arxiv_reference","pith_arxiv_id":"2307.11088","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2307.11088 , archivePrefix=","venue":"arXiv (Cornell University)","work_id":"8c5b99fd-55bf-4d88-b148-8bb61e28ee99","year":2024},"citing_paper":{"arxiv_id":"2404.14469","last_updated":"2024-06-17T03:01:58Z","snapshot_observed_at":"2026-08-07T22:57:56.263839Z","submitted_at":"2024-04-22T17:42:58Z","title":"SnapKV: LLM Knows What You are Looking for Before Generation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-13T12:57:43.036674Z"},"links":{"cited_paper":"/paper/2307.11088","citing_paper":"/paper/2404.14469"},"observation_digest":"sha256:72ceb055b5aa1c75ee9eb163622fb7c3b69a7e0daf7a8ec7ef0180643ce5a4bf","observation_id":"348f8151-5ca1-48bc-9cdc-d068db0934af","resolution":{"observed_at":"2026-05-13T12:57:43.115018Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.11088","last_updated":"2023-10-04T10:04:25Z","snapshot_observed_at":"2026-08-09T07:56:50.464493Z","submitted_at":"2023-07-20T17:59:41Z","title":"L-Eval: Instituting Standardized Evaluation for Long Context Language Models","version":3},"cited_work":{"arxiv_id":"2307.11088","doi":"10.48550/arxiv.2307.11088","metadata_source":"arxiv_reference","pith_arxiv_id":"2307.11088","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2307.11088 , archivePrefix=","venue":"arXiv (Cornell University)","work_id":"8c5b99fd-55bf-4d88-b148-8bb61e28ee99","year":2024},"citing_paper":{"arxiv_id":"2411.15594","last_updated":"2025-10-19T10:32:43Z","snapshot_observed_at":"2026-08-02T10:23:50.881300Z","submitted_at":"2024-11-23T16:03:35Z","title":"A Survey on LLM-as-a-Judge","version":6},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-23T17:33:13.394338Z"},"links":{"cited_paper":"/paper/2307.11088","citing_paper":"/paper/2411.15594"},"observation_digest":"sha256:1c01612d0a76501cb335ac5f398c3d6571e3c2d1db31d5ad7883a15e4eb94d14","observation_id":"708c150c-2790-420c-91d6-24f836508ca8","resolution":{"observed_at":"2026-05-23T17:35:44.190233Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.11088","last_updated":"2023-10-04T10:04:25Z","snapshot_observed_at":"2026-08-09T07:56:50.464493Z","submitted_at":"2023-07-20T17:59:41Z","title":"L-Eval: Instituting Standardized Evaluation for Long Context Language Models","version":3},"cited_work":{"arxiv_id":"2307.11088","doi":"10.48550/arxiv.2307.11088","metadata_source":"arxiv_reference","pith_arxiv_id":"2307.11088","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2307.11088 , archivePrefix=","venue":"arXiv (Cornell University)","work_id":"8c5b99fd-55bf-4d88-b148-8bb61e28ee99","year":2024},"citing_paper":{"arxiv_id":"2502.01941","last_updated":"2026-05-12T08:04:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-04T02:23:06Z","title":"Semantic Integrity Matters: Benchmarking and Preserving High-Density Reasoning in KV Cache Compression","version":4},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-05-23T04:15:36.906263Z"},"links":{"cited_paper":"/paper/2307.11088","citing_paper":"/paper/2502.01941"},"observation_digest":"sha256:7b35729718863f4de8713dc9778aac6351264cf534150ca283021c6f7d1cf483","observation_id":"20812d0f-3b1c-40d3-b55f-2f68fbd2ea98","resolution":{"observed_at":"2026-05-23T04:17:31.131311Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.11088","last_updated":"2023-10-04T10:04:25Z","snapshot_observed_at":"2026-08-09T07:56:50.464493Z","submitted_at":"2023-07-20T17:59:41Z","title":"L-Eval: Instituting Standardized Evaluation for Long Context Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.11088","snapshot_observed_at":"2026-08-08T16:40:27.024729Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06139","last_updated":"2025-05-22T05:45:05Z","snapshot_observed_at":"2026-08-10T04:40:40.719875Z","submitted_at":"2025-02-10T04:02:18Z","title":"LCIRC: A Recurrent Compression Approach for Efficient Long-form Context and Query Dependent Modeling in LLMs","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-08T16:40:27.024729Z"},"links":{"cited_paper":"/paper/2307.11088","citing_paper":"/paper/2502.06139"},"observation_digest":"sha256:c4b1c7803cd94a55af4da33c7765845f3039b4b97678d04d777f065d4d946911","observation_id":"0b9aa49d-cfd0-4eeb-8e50-347e486a28c1","resolution":{"observed_at":"2026-08-08T16:40:27.024729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.11088","last_updated":"2023-10-04T10:04:25Z","snapshot_observed_at":"2026-08-09T07:56:50.464493Z","submitted_at":"2023-07-20T17:59:41Z","title":"L-Eval: Instituting Standardized Evaluation for Long Context Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.11088","snapshot_observed_at":"2026-08-08T16:11:43.095401Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08662","last_updated":"2025-06-02T04:54:00Z","snapshot_observed_at":"2026-08-09T07:57:07.000139Z","submitted_at":"2025-02-10T09:34:15Z","title":"RoToR: Towards More Reliable Responses for Order-Invariant Inputs","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-08T16:11:43.095401Z"},"links":{"cited_paper":"/paper/2307.11088","citing_paper":"/paper/2502.08662"},"observation_digest":"sha256:b96abd3e4b2698e6a8d8397971c009e46502893afdfe381a4690652be5ea783f","observation_id":"33655849-7d56-47b8-bcb1-57779644c1ff","resolution":{"observed_at":"2026-08-08T16:11:43.095401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.11088","last_updated":"2023-10-04T10:04:25Z","snapshot_observed_at":"2026-08-09T07:56:50.464493Z","submitted_at":"2023-07-20T17:59:41Z","title":"L-Eval: Instituting Standardized Evaluation for Long Context Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.11088","snapshot_observed_at":"2026-08-07T14:52:12.226319Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17296","last_updated":"2025-05-22T21:23:20Z","snapshot_observed_at":"2026-08-09T05:52:01.092080Z","submitted_at":"2025-05-22T21:23:20Z","title":"SELF: Self-Extend the Context Length With Logistic Growth Function","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T14:52:12.226319Z"},"links":{"cited_paper":"/paper/2307.11088","citing_paper":"/paper/2505.17296"},"observation_digest":"sha256:0ac2bf5fcab591b616b517aacb0173379ffd5e1575debd2f508c74533ed77748","observation_id":"70a77ed3-9a1e-415b-9807-bd91984977d1","resolution":{"observed_at":"2026-08-07T14:52:12.226319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.11088","last_updated":"2023-10-04T10:04:25Z","snapshot_observed_at":"2026-08-09T07:56:50.464493Z","submitted_at":"2023-07-20T17:59:41Z","title":"L-Eval: Instituting Standardized Evaluation for Long Context Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.11088","snapshot_observed_at":"2026-08-07T14:20:24.321920Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19293","last_updated":"2026-06-02T22:08:40Z","snapshot_observed_at":"2026-08-07T14:15:05.692688Z","submitted_at":"2025-05-25T19:58:31Z","title":"100-LongBench: Are de facto Long-Context Benchmarks Literally Evaluating Long-Context Ability?","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T14:20:24.321920Z"},"links":{"cited_paper":"/paper/2307.11088","citing_paper":"/paper/2505.19293"},"observation_digest":"sha256:b7cc7d2cb830b603acbe8f0b975ef4aba8df68f9506a56c88fcedb2b93678630","observation_id":"c728fe26-7aa8-4634-9e18-24b52d96d5b0","resolution":{"observed_at":"2026-08-07T14:20:24.321920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.11088","last_updated":"2023-10-04T10:04:25Z","snapshot_observed_at":"2026-08-09T07:56:50.464493Z","submitted_at":"2023-07-20T17:59:41Z","title":"L-Eval: Instituting Standardized Evaluation for Long Context Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.11088","snapshot_observed_at":"2026-08-07T14:08:05.311060Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19959","last_updated":"2025-07-30T16:46:12Z","snapshot_observed_at":"2026-08-09T01:20:29.114355Z","submitted_at":"2025-05-26T13:21:18Z","title":"MiniLongBench: The Low-cost Long Context Understanding Benchmark for Large Language Models","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T14:08:05.311060Z"},"links":{"cited_paper":"/paper/2307.11088","citing_paper":"/paper/2505.19959"},"observation_digest":"sha256:21d8f8b01013197bd18d18230aa934b96892bf83cb88602a026de2107dd4c09d","observation_id":"c2baec95-7bfa-4e92-aac5-fcc38b2ae39b","resolution":{"observed_at":"2026-08-07T14:08:05.311060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.11088","last_updated":"2023-10-04T10:04:25Z","snapshot_observed_at":"2026-08-09T07:56:50.464493Z","submitted_at":"2023-07-20T17:59:41Z","title":"L-Eval: Instituting Standardized Evaluation for Long Context Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.11088","snapshot_observed_at":"2026-08-07T15:31:42.196733Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02000","last_updated":"2025-06-23T01:41:05Z","snapshot_observed_at":"2026-08-07T15:25:33.498661Z","submitted_at":"2025-05-20T20:54:37Z","title":"NovelHopQA: Diagnosing Multi-Hop Reasoning Failures in Long Narrative Contexts","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T15:31:42.196733Z"},"links":{"cited_paper":"/paper/2307.11088","citing_paper":"/paper/2506.02000"},"observation_digest":"sha256:5032381691da721a182cdeb3690f3212325430cea80784e6f7114488dbb3a72a","observation_id":"bdf90adb-491d-4380-8de7-725ff8812b0c","resolution":{"observed_at":"2026-08-07T15:31:42.196733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.11088","last_updated":"2023-10-04T10:04:25Z","snapshot_observed_at":"2026-08-09T07:56:50.464493Z","submitted_at":"2023-07-20T17:59:41Z","title":"L-Eval: Instituting Standardized Evaluation for Long Context Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.11088","snapshot_observed_at":"2026-08-07T04:13:17.656859Z","title":"L-eval: Instituting standardized evaluation for long context language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11440","last_updated":"2025-06-13T03:38:29Z","snapshot_observed_at":"2026-08-10T03:25:08.984777Z","submitted_at":"2025-06-13T03:38:29Z","title":"AbsenceBench: Language Models Can't Tell What's Missing","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T04:13:17.656859Z"},"links":{"cited_paper":"/paper/2307.11088","citing_paper":"/paper/2506.11440"},"observation_digest":"sha256:a912561b243054e3ac47c0112596d14e85c12dfc88922b6b177e688a986b6c7e","observation_id":"56e6fd7a-77b1-4878-bb0d-11a3c679c1f8","resolution":{"observed_at":"2026-08-07T04:13:17.656859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.11088","last_updated":"2023-10-04T10:04:25Z","snapshot_observed_at":"2026-08-09T07:56:50.464493Z","submitted_at":"2023-07-20T17:59:41Z","title":"L-Eval: Instituting Standardized Evaluation for Long Context Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.11088","snapshot_observed_at":"2026-08-07T00:49:24.771230Z","title":"L-eval: Instituting standardized evaluation for long context language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12666","last_updated":"2025-06-14T23:57:54Z","snapshot_observed_at":"2026-08-09T18:04:24.482206Z","submitted_at":"2025-06-14T23:57:54Z","title":"LIFELONG SOTOPIA: Evaluating Social Intelligence of Language Agents Over Lifelong Social Interactions","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T00:49:24.771230Z"},"links":{"cited_paper":"/paper/2307.11088","citing_paper":"/paper/2506.12666"},"observation_digest":"sha256:a0f669bbc0f2c0960d094846be49a9ce7f75e9a4c5a0e6c8fa1fb4131e1ceea4","observation_id":"82c4ea3c-aa9d-4bed-b09c-22bdf7a69a5f","resolution":{"observed_at":"2026-08-07T00:49:24.771230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.11088","last_updated":"2023-10-04T10:04:25Z","snapshot_observed_at":"2026-08-09T07:56:50.464493Z","submitted_at":"2023-07-20T17:59:41Z","title":"L-Eval: Instituting Standardized Evaluation for Long Context Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.11088","snapshot_observed_at":"2026-08-06T23:42:28.878915Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21605","last_updated":"2025-06-20T10:09:23Z","snapshot_observed_at":"2026-08-09T07:57:05.355577Z","submitted_at":"2025-06-20T10:09:23Z","title":"MemBench: Towards More Comprehensive Evaluation on the Memory of LLM-based Agents","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T23:42:28.878915Z"},"links":{"cited_paper":"/paper/2307.11088","citing_paper":"/paper/2506.21605"},"observation_digest":"sha256:c47249271489700553788e63cb85c53ba94042928066d6126f3add4b36c737aa","observation_id":"33b0b05f-9ba4-49ce-8965-5daa01945269","resolution":{"observed_at":"2026-08-06T23:42:28.878915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.11088","last_updated":"2023-10-04T10:04:25Z","snapshot_observed_at":"2026-08-09T07:56:50.464493Z","submitted_at":"2023-07-20T17:59:41Z","title":"L-Eval: Instituting Standardized Evaluation for Long Context Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.11088","snapshot_observed_at":"2026-08-06T15:56:57.854965Z","title":"L- eval: Instituting standardized evaluation for long context lan- guage models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.14675","last_updated":"2025-07-19T16:03:34Z","snapshot_observed_at":"2026-08-09T00:51:52.133273Z","submitted_at":"2025-07-19T16:03:34Z","title":"Docopilot: Improving Multimodal Models for Document-Level Understanding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T15:56:57.854965Z"},"links":{"cited_paper":"/paper/2307.11088","citing_paper":"/paper/2507.14675"},"observation_digest":"sha256:61db8f9780cfb54d82907239209264b82465496359e0886309f11d2c98170240","observation_id":"f45e1cf2-8d80-4731-a64b-81c54cb0c73a","resolution":{"observed_at":"2026-08-06T15:56:57.854965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.11088","last_updated":"2023-10-04T10:04:25Z","snapshot_observed_at":"2026-08-09T07:56:50.464493Z","submitted_at":"2023-07-20T17:59:41Z","title":"L-Eval: Instituting Standardized Evaluation for Long Context Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.11088","snapshot_observed_at":"2026-08-03T12:42:30.058516Z","title":"L-eval: Instituting standardized evaluation for long context language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2601.02023","last_updated":"2026-07-14T21:47:31Z","snapshot_observed_at":"2026-08-08T04:32:46.940287Z","submitted_at":"2026-01-05T11:30:56Z","title":"Not All Needles Are Found: How Fact Distribution and Don't Make It Up Prompts Shape Retrieval, Reasoning, and Hallucination in Long-Context LLMs","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T12:42:30.058516Z"},"links":{"cited_paper":"/paper/2307.11088","citing_paper":"/paper/2601.02023"},"observation_digest":"sha256:d909561ee864790864382c1cc08285ba4ea5a1d81c967a92e081e292ffe681b6","observation_id":"8e835c7a-4d13-4570-86c9-3b8f29da5fc3","resolution":{"observed_at":"2026-08-03T12:42:30.058516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.11088","last_updated":"2023-10-04T10:04:25Z","snapshot_observed_at":"2026-08-09T07:56:50.464493Z","submitted_at":"2023-07-20T17:59:41Z","title":"L-Eval: Instituting Standardized Evaluation for Long Context Language Models","version":3},"cited_work":{"arxiv_id":"2307.11088","doi":"10.48550/arxiv.2307.11088","metadata_source":"arxiv_reference","pith_arxiv_id":"2307.11088","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2307.11088 , archivePrefix=","venue":"arXiv (Cornell University)","work_id":"8c5b99fd-55bf-4d88-b148-8bb61e28ee99","year":2024},"citing_paper":{"arxiv_id":"2604.20131","last_updated":"2026-04-22T02:58:51Z","snapshot_observed_at":"2026-07-06T23:06:40.154278Z","submitted_at":"2026-04-22T02:58:51Z","title":"Whose Story Gets Told? Positionality and Bias in LLM Summaries of Life Narratives","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-05-10T01:00:41.543394Z"},"links":{"cited_paper":"/paper/2307.11088","citing_paper":"/paper/2604.20131"},"observation_digest":"sha256:7dbc25f357933de483813809675dcf127ea4c2ebdd6e01ae2e612ce458e455cc","observation_id":"797f398f-5c61-45d9-acde-db8426259afe","resolution":{"observed_at":"2026-05-10T01:04:50.201027Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.11088","last_updated":"2023-10-04T10:04:25Z","snapshot_observed_at":"2026-08-09T07:56:50.464493Z","submitted_at":"2023-07-20T17:59:41Z","title":"L-Eval: Instituting Standardized Evaluation for Long Context Language Models","version":3},"cited_work":{"arxiv_id":"2307.11088","doi":"10.48550/arxiv.2307.11088","metadata_source":"arxiv_reference","pith_arxiv_id":"2307.11088","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2307.11088 , archivePrefix=","venue":"arXiv (Cornell University)","work_id":"8c5b99fd-55bf-4d88-b148-8bb61e28ee99","year":2024},"citing_paper":{"arxiv_id":"2604.27085","last_updated":"2026-04-29T18:26:13Z","snapshot_observed_at":"2026-07-06T23:12:38.453388Z","submitted_at":"2026-04-29T18:26:13Z","title":"Efficient Training on Multiple Consumer GPUs with RoundPipe","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-07T10:37:22.251566Z"},"links":{"cited_paper":"/paper/2307.11088","citing_paper":"/paper/2604.27085"},"observation_digest":"sha256:b1dd71d6f1373caba835314078b1f26af0f2bfaef6495601de903db41af94120","observation_id":"96ae3ef3-36cd-4cf3-b0b5-c422572678f0","resolution":{"observed_at":"2026-05-12T09:31:26.839097Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.11088","last_updated":"2023-10-04T10:04:25Z","snapshot_observed_at":"2026-08-09T07:56:50.464493Z","submitted_at":"2023-07-20T17:59:41Z","title":"L-Eval: Instituting Standardized Evaluation for Long Context Language Models","version":3},"cited_work":{"arxiv_id":"2307.11088","doi":"10.48550/arxiv.2307.11088","metadata_source":"arxiv_reference","pith_arxiv_id":"2307.11088","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2307.11088 , archivePrefix=","venue":"arXiv (Cornell University)","work_id":"8c5b99fd-55bf-4d88-b148-8bb61e28ee99","year":2024},"citing_paper":{"arxiv_id":"2605.03375","last_updated":"2026-05-05T05:33:11Z","snapshot_observed_at":"2026-07-06T23:16:20.322265Z","submitted_at":"2026-05-05T05:33:11Z","title":"Tutti: Making SSD-Backed KV Cache Practical for Long-Context LLM Serving","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-09T16:19:33.613685Z"},"links":{"cited_paper":"/paper/2307.11088","citing_paper":"/paper/2605.03375"},"observation_digest":"sha256:d6d1bbb7436f235aa392b3ed3e8a3a04b31b9376a321ac3b70556e4d834ddde3","observation_id":"d630b536-3192-4570-86ac-9e54bffbd585","resolution":{"observed_at":"2026-05-11T16:31:10.427339Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.11088","last_updated":"2023-10-04T10:04:25Z","snapshot_observed_at":"2026-08-09T07:56:50.464493Z","submitted_at":"2023-07-20T17:59:41Z","title":"L-Eval: Instituting Standardized Evaluation for Long Context Language Models","version":3},"cited_work":{"arxiv_id":"2307.11088","doi":"10.48550/arxiv.2307.11088","metadata_source":"arxiv_reference","pith_arxiv_id":"2307.11088","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2307.11088 , archivePrefix=","venue":"arXiv (Cornell University)","work_id":"8c5b99fd-55bf-4d88-b148-8bb61e28ee99","year":2024},"citing_paper":{"arxiv_id":"2605.14589","last_updated":"2026-06-02T09:12:16Z","snapshot_observed_at":"2026-07-06T23:25:58.895612Z","submitted_at":"2026-05-14T09:00:03Z","title":"EndPrompt: Efficient Long-Context Extension via Terminal Anchoring","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-15T01:32:32.967922Z"},"links":{"cited_paper":"/paper/2307.11088","citing_paper":"/paper/2605.14589"},"observation_digest":"sha256:7945fe4eba1a1bcc84f9615db5f76365d488ce63cf1022af21376eafcb2a4dd4","observation_id":"8b982927-667f-479e-936f-73af253b2cc8","resolution":{"observed_at":"2026-05-15T01:33:27.224830Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.11088","last_updated":"2023-10-04T10:04:25Z","snapshot_observed_at":"2026-08-09T07:56:50.464493Z","submitted_at":"2023-07-20T17:59:41Z","title":"L-Eval: Instituting Standardized Evaluation for Long Context Language Models","version":3},"cited_work":{"arxiv_id":"2307.11088","doi":"10.48550/arxiv.2307.11088","metadata_source":"arxiv_reference","pith_arxiv_id":"2307.11088","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2307.11088 , archivePrefix=","venue":"arXiv (Cornell University)","work_id":"8c5b99fd-55bf-4d88-b148-8bb61e28ee99","year":2024},"citing_paper":{"arxiv_id":"2605.14589","last_updated":"2026-06-02T09:12:16Z","snapshot_observed_at":"2026-07-06T23:25:58.895612Z","submitted_at":"2026-05-14T09:00:03Z","title":"EndPrompt: Efficient Long-Context Extension via Terminal Anchoring","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-30T21:13:23.148984Z"},"links":{"cited_paper":"/paper/2307.11088","citing_paper":"/paper/2605.14589"},"observation_digest":"sha256:df2a04d0bd864e152b2cc9b78190319dad4c75ceb155783c96efb70bc7d6764e","observation_id":"1375033c-3ef9-4768-b005-fb1777f324a1","resolution":{"observed_at":"2026-06-30T21:15:03.983326Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.11088","last_updated":"2023-10-04T10:04:25Z","snapshot_observed_at":"2026-08-09T07:56:50.464493Z","submitted_at":"2023-07-20T17:59:41Z","title":"L-Eval: Instituting Standardized Evaluation for Long Context Language Models","version":3},"cited_work":{"arxiv_id":"2307.11088","doi":"10.48550/arxiv.2307.11088","metadata_source":"arxiv_reference","pith_arxiv_id":"2307.11088","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2307.11088 , archivePrefix=","venue":"arXiv (Cornell University)","work_id":"8c5b99fd-55bf-4d88-b148-8bb61e28ee99","year":2024},"citing_paper":{"arxiv_id":"2605.23170","last_updated":"2026-05-22T02:42:41Z","snapshot_observed_at":"2026-08-03T03:47:34.013785Z","submitted_at":"2026-05-22T02:42:41Z","title":"Positional Failures in Long-Context LLMs: A Blind Spot in Reasoning Benchmarks","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-05-25T04:58:15.184063Z"},"links":{"cited_paper":"/paper/2307.11088","citing_paper":"/paper/2605.23170"},"observation_digest":"sha256:105925fd28a4bb924d48014d341b266ee2dd54b7705fe5e02964e094e8575388","observation_id":"caa6a0ab-d8f0-4702-aa93-ccb1681042ee","resolution":{"observed_at":"2026-05-25T05:00:21.921291Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.11088","last_updated":"2023-10-04T10:04:25Z","snapshot_observed_at":"2026-08-09T07:56:50.464493Z","submitted_at":"2023-07-20T17:59:41Z","title":"L-Eval: Instituting Standardized Evaluation for Long Context Language Models","version":3},"cited_work":{"arxiv_id":"2307.11088","doi":"10.48550/arxiv.2307.11088","metadata_source":"arxiv_reference","pith_arxiv_id":"2307.11088","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2307.11088 , archivePrefix=","venue":"arXiv (Cornell University)","work_id":"8c5b99fd-55bf-4d88-b148-8bb61e28ee99","year":2024},"citing_paper":{"arxiv_id":"2605.24414","last_updated":"2026-05-23T05:57:30Z","snapshot_observed_at":"2026-08-08T12:13:53.897636Z","submitted_at":"2026-05-23T05:57:30Z","title":"JT-SAFE-V2: Safety-by-Design Foundation Model with World-Context Data","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-30T13:45:38.305767Z"},"links":{"cited_paper":"/paper/2307.11088","citing_paper":"/paper/2605.24414"},"observation_digest":"sha256:ec675b60312c80889de45bcc4d9b93f56058fcfc4a2b297b5d6848bb90fbef79","observation_id":"9fb53eed-2b60-435b-b151-dde4fd5a5034","resolution":{"observed_at":"2026-06-30T13:54:44.114006Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.11088","last_updated":"2023-10-04T10:04:25Z","snapshot_observed_at":"2026-08-09T07:56:50.464493Z","submitted_at":"2023-07-20T17:59:41Z","title":"L-Eval: Instituting Standardized Evaluation for Long Context Language Models","version":3},"cited_work":{"arxiv_id":"2307.11088","doi":"10.48550/arxiv.2307.11088","metadata_source":"arxiv_reference","pith_arxiv_id":"2307.11088","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2307.11088 , archivePrefix=","venue":"arXiv (Cornell University)","work_id":"8c5b99fd-55bf-4d88-b148-8bb61e28ee99","year":2024},"citing_paper":{"arxiv_id":"2606.17391","last_updated":"2026-06-16T01:04:55Z","snapshot_observed_at":"2026-08-07T20:36:16.553798Z","submitted_at":"2026-06-16T01:04:55Z","title":"NarrativeWorldBench: A Frontier-Saturated Benchmark and a Latent World Model for Long-Horizon Co-Creative Audio Drama","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-27T01:48:08.794210Z"},"links":{"cited_paper":"/paper/2307.11088","citing_paper":"/paper/2606.17391"},"observation_digest":"sha256:9612cfeacaa69dc045b3bb1dca900ee90b110cf24a7e74dc5af1f898257eec7d","observation_id":"2c31c983-3808-4be8-bb80-78fd0a9f8580","resolution":{"observed_at":"2026-07-03T19:28:52.462812Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.11088","last_updated":"2023-10-04T10:04:25Z","snapshot_observed_at":"2026-08-09T07:56:50.464493Z","submitted_at":"2023-07-20T17:59:41Z","title":"L-Eval: Instituting Standardized Evaluation for Long Context Language Models","version":3},"cited_work":{"arxiv_id":"2307.11088","doi":"10.48550/arxiv.2307.11088","metadata_source":"arxiv_reference","pith_arxiv_id":"2307.11088","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2307.11088 , archivePrefix=","venue":"arXiv (Cornell University)","work_id":"8c5b99fd-55bf-4d88-b148-8bb61e28ee99","year":2024},"citing_paper":{"arxiv_id":"2606.27705","last_updated":"2026-06-26T04:07:41Z","snapshot_observed_at":"2026-08-09T18:28:04.718985Z","submitted_at":"2026-06-26T04:07:41Z","title":"Mitigating Position Bias in Transformers via Layer-Specific Positional Embedding Scaling","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-06-29T04:59:00.304723Z"},"links":{"cited_paper":"/paper/2307.11088","citing_paper":"/paper/2606.27705"},"observation_digest":"sha256:b27be32dff3a808549c963ce7c9f2a6bc80ac2f7fe1f220119c64a1bb71e93cd","observation_id":"dbaa4e11-876c-4eb7-a43f-42d4accbe3c0","resolution":{"observed_at":"2026-06-29T19:03:51.865567Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.11088","last_updated":"2023-10-04T10:04:25Z","snapshot_observed_at":"2026-08-09T07:56:50.464493Z","submitted_at":"2023-07-20T17:59:41Z","title":"L-Eval: Instituting Standardized Evaluation for Long Context Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.11088","snapshot_observed_at":"2026-08-01T07:12:16.866244Z","title":"arXiv preprint arXiv:2307.11088 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-08T08:48:36.880078Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:16.866244Z"},"links":{"cited_paper":"/paper/2307.11088","citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:f4231dcc910eb19e8ad018cdabd63ef2be4967c73a1307c3078ac596e576d7f0","observation_id":"a077d62c-96f8-46b0-b0c1-5554bd719916","resolution":{"observed_at":"2026-08-01T07:12:16.866244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.11088","last_updated":"2023-10-04T10:04:25Z","snapshot_observed_at":"2026-08-09T07:56:50.464493Z","submitted_at":"2023-07-20T17:59:41Z","title":"L-Eval: Instituting Standardized Evaluation for Long Context Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.11088","snapshot_observed_at":"2026-08-01T02:37:54.577072Z","title":"L-eval: Instituting standardized evaluation for long- context language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.25380","last_updated":"2026-07-28T07:34:53Z","snapshot_observed_at":"2026-08-08T07:59:40.180280Z","submitted_at":"2026-07-28T07:34:53Z","title":"Memory for Large Language Models","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-01T02:37:54.577072Z"},"links":{"cited_paper":"/paper/2307.11088","citing_paper":"/paper/2607.25380"},"observation_digest":"sha256:70379e94b51f8a257f779f166787b7c0245147e37e4f6da0535e0eac6b7a3f07","observation_id":"1903ada6-956f-477c-8e7f-bdaae9c022d4","resolution":{"observed_at":"2026-08-01T02:37:54.577072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2307.11088/citation-record","integrity":"/paper/2307.11088/integrity","json":"/paper/2307.11088/citation-record.json","paper":"/paper/2307.11088"},"outbound":[],"paper":{"arxiv_id":"2307.11088","last_updated":"2023-10-04T10:04:25Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-09T07:56:50.464493Z","submitted_at":"2023-07-20T17:59:41Z","title":"L-Eval: Instituting Standardized Evaluation for Long Context Language Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 28 inbound Pith citation observations for arXiv:2307.11088."}