{"as_of":"2026-08-15T10:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9ba34233502940fcc2698b335d744cda48d16561ca2c1e7a60e9c617eb6639ff","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T04:19:26.848892Z","state":"measured"},{"denominator":71,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":71,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":40,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T17:11:01.995426Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":2,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.10910","last_updated":"2025-06-12T17:22:37Z","snapshot_observed_at":"2026-08-08T22:49:29.831091Z","submitted_at":"2025-06-12T17:22:37Z","title":"Magistral","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10910","snapshot_observed_at":"2026-08-06T15:55:42.560228Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.14683","last_updated":"2025-07-19T16:21:23Z","snapshot_observed_at":"2026-08-13T20:23:27.352924Z","submitted_at":"2025-07-19T16:21:23Z","title":"MiroMind-M1: An Open-Source Advancement in Mathematical Reasoning via Context-Aware Multi-Stage Policy Optimization","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T15:55:42.560228Z"},"links":{"cited_paper":"/paper/2506.10910","citing_paper":"/paper/2507.14683"},"observation_digest":"sha256:f230b962028cc895f6c4d41e7c566e6708e653fcf8e8832f9ed0977335a746fc","observation_id":"55adf272-4e07-4ef0-975f-904dc0245558","resolution":{"observed_at":"2026-08-06T15:55:42.560228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10910","last_updated":"2025-06-12T17:22:37Z","snapshot_observed_at":"2026-08-08T22:49:29.831091Z","submitted_at":"2025-06-12T17:22:37Z","title":"Magistral","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10910","snapshot_observed_at":"2026-08-06T14:53:04.564942Z","title":"Magistral","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-09T23:40:29.433863Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:04.564942Z"},"links":{"cited_paper":"/paper/2506.10910","citing_paper":"/paper/2507.17512"},"observation_digest":"sha256:8dcca1066882600c2ff204fc2766fbf4996989a042e926b21ccb62c827d70e4e","observation_id":"47fa10e6-114b-4b08-b746-7b13c998cd2c","resolution":{"observed_at":"2026-08-06T14:53:04.564942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10910","last_updated":"2025-06-12T17:22:37Z","snapshot_observed_at":"2026-08-08T22:49:29.831091Z","submitted_at":"2025-06-12T17:22:37Z","title":"Magistral","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10910","snapshot_observed_at":"2026-08-06T13:07:09.588485Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-14T04:52:19.396797Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:09.588485Z"},"links":{"cited_paper":"/paper/2506.10910","citing_paper":"/paper/2507.21053"},"observation_digest":"sha256:20f9fa4bdc8b0b10e7b47f697b623a4e20dc6e77e3834a2ee7ae1b3a25285529","observation_id":"b779c2bb-1bff-4a9e-b9c9-72297ed03027","resolution":{"observed_at":"2026-08-06T13:07:09.588485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10910","last_updated":"2025-06-12T17:22:37Z","snapshot_observed_at":"2026-08-08T22:49:29.831091Z","submitted_at":"2025-06-12T17:22:37Z","title":"Magistral","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10910","snapshot_observed_at":"2026-08-06T01:02:46.136737Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.03979","last_updated":"2025-08-06T00:14:18Z","snapshot_observed_at":"2026-08-13T15:57:44.514748Z","submitted_at":"2025-08-06T00:14:18Z","title":"Confidence-Weighted Token Set Cover for Early Hypothesis Pruning in Self-Consistency","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T01:02:46.136737Z"},"links":{"cited_paper":"/paper/2506.10910","citing_paper":"/paper/2508.03979"},"observation_digest":"sha256:fdfc760541eb5cccde39818723f045cab7fc8f31c5bdaf510ad18504cc9684b8","observation_id":"7edf36cd-5d18-4ee0-97ca-7ebc8605bc18","resolution":{"observed_at":"2026-08-06T01:02:46.136737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10910","last_updated":"2025-06-12T17:22:37Z","snapshot_observed_at":"2026-08-08T22:49:29.831091Z","submitted_at":"2025-06-12T17:22:37Z","title":"Magistral","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10910","snapshot_observed_at":"2026-08-05T16:32:54.579019Z","title":"Jiang, Andy Lo, et al","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.18255","last_updated":"2025-09-02T17:12:12Z","snapshot_observed_at":"2026-08-13T15:01:58.323767Z","submitted_at":"2025-08-25T17:45:06Z","title":"Hermes 4 Technical Report","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T16:32:54.579019Z"},"links":{"cited_paper":"/paper/2506.10910","citing_paper":"/paper/2508.18255"},"observation_digest":"sha256:29bf918ff887d198b06e783a51e6ffc3b96bff370b0170c31c91baaeb6db6a48","observation_id":"45628e2c-bc46-4f8f-9750-044521932656","resolution":{"observed_at":"2026-08-05T16:32:54.579019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10910","last_updated":"2025-06-12T17:22:37Z","snapshot_observed_at":"2026-08-08T22:49:29.831091Z","submitted_at":"2025-06-12T17:22:37Z","title":"Magistral","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10910","snapshot_observed_at":"2026-08-05T14:57:39.459947Z","title":"Magistral.arXiv preprint arXiv:2506.10910,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.20722","last_updated":"2025-08-28T12:45:25Z","snapshot_observed_at":"2026-08-14T18:22:45.199437Z","submitted_at":"2025-08-28T12:45:25Z","title":"rStar2-Agent: Agentic Reasoning Technical Report","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T14:57:39.459947Z"},"links":{"cited_paper":"/paper/2506.10910","citing_paper":"/paper/2508.20722"},"observation_digest":"sha256:73b8db8b2220ead9af2d018588ef685f264cbda53f8c2fbaa243e5494188c700","observation_id":"a6555b84-43a2-475f-b906-cd989fed6db3","resolution":{"observed_at":"2026-08-05T14:57:39.459947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10910","last_updated":"2025-06-12T17:22:37Z","snapshot_observed_at":"2026-08-08T22:49:29.831091Z","submitted_at":"2025-06-12T17:22:37Z","title":"Magistral","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10910","snapshot_observed_at":"2026-08-04T16:07:38.099803Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-14T21:41:31.710262Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":144,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:38.099803Z"},"links":{"cited_paper":"/paper/2506.10910","citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:a8d9bae5546e1a608513186f4b7e43c13a5b1ff5cf37086de1a95edb84cff8cc","observation_id":"cd458219-c9f1-439e-ba58-d2f6ef8fa086","resolution":{"observed_at":"2026-08-04T16:07:38.099803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10910","last_updated":"2025-06-12T17:22:37Z","snapshot_observed_at":"2026-08-08T22:49:29.831091Z","submitted_at":"2025-06-12T17:22:37Z","title":"Magistral","version":1},"cited_work":{"arxiv_id":"2506.10910","doi":"10.48550/arxiv.2506.10910","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10910","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Magistral","venue":"ArXiv.org","work_id":"ae3fa57b-d81e-4022-ab02-51763900103b","year":2025},"citing_paper":{"arxiv_id":"2510.07239","last_updated":"2026-05-17T13:01:38Z","snapshot_observed_at":"2026-08-15T00:13:51.225744Z","submitted_at":"2025-10-08T17:06:20Z","title":"Red-Bandit: Test-Time Adaptation for LLM Red-Teaming via Bandit-Guided LoRA Experts","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-21T20:53:58.198974Z"},"links":{"cited_paper":"/paper/2506.10910","citing_paper":"/paper/2510.07239"},"observation_digest":"sha256:302c3701c76a170fd42f1b1b09a47d37152daac920753ae355b34e2a160bace4","observation_id":"6bfc45b6-5981-4322-8ba9-320755b5e74a","resolution":{"observed_at":"2026-05-21T20:54:21.599958Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-05-23T10:52:47.043971+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T10:52:47.043971+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10910","last_updated":"2025-06-12T17:22:37Z","snapshot_observed_at":"2026-08-08T22:49:29.831091Z","submitted_at":"2025-06-12T17:22:37Z","title":"Magistral","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10910","snapshot_observed_at":"2026-08-04T10:07:52.637167Z","title":"Magistral","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.11713","last_updated":"2026-06-01T17:06:08Z","snapshot_observed_at":"2026-08-15T02:54:48.270724Z","submitted_at":"2025-10-13T17:59:35Z","title":"Are Large Reasoning Models Interruptible?","version":4},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-04T10:07:52.637167Z"},"links":{"cited_paper":"/paper/2506.10910","citing_paper":"/paper/2510.11713"},"observation_digest":"sha256:f4cc58e53894a74a1c869572253b366b744affad7745ace5ba5e04d5b67f899b","observation_id":"f6298168-ee72-4d00-936c-212358e8e52e","resolution":{"observed_at":"2026-08-04T10:07:52.637167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10910","last_updated":"2025-06-12T17:22:37Z","snapshot_observed_at":"2026-08-08T22:49:29.831091Z","submitted_at":"2025-06-12T17:22:37Z","title":"Magistral","version":1},"cited_work":{"arxiv_id":"2506.10910","doi":"10.48550/arxiv.2506.10910","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10910","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Magistral","venue":"ArXiv.org","work_id":"ae3fa57b-d81e-4022-ab02-51763900103b","year":2025},"citing_paper":{"arxiv_id":"2601.08584","last_updated":"2026-01-13T14:06:03Z","snapshot_observed_at":"2026-08-12T22:11:58.919874Z","submitted_at":"2026-01-13T14:06:03Z","title":"Ministral 3","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-14T19:12:24.627033Z"},"links":{"cited_paper":"/paper/2506.10910","citing_paper":"/paper/2601.08584"},"observation_digest":"sha256:f23a16d8095a37191b4832bed3472e061721f591ae7793c352692f07654926c8","observation_id":"8f14ebbe-2e79-4187-a375-14693ba94948","resolution":{"observed_at":"2026-05-14T19:12:24.787396Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-05-23T10:52:47.043971+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T10:52:47.043971+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10910","last_updated":"2025-06-12T17:22:37Z","snapshot_observed_at":"2026-08-08T22:49:29.831091Z","submitted_at":"2025-06-12T17:22:37Z","title":"Magistral","version":1},"cited_work":{"arxiv_id":"2506.10910","doi":"10.48550/arxiv.2506.10910","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10910","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Magistral","venue":"ArXiv.org","work_id":"ae3fa57b-d81e-4022-ab02-51763900103b","year":2025},"citing_paper":{"arxiv_id":"2601.18734","last_updated":"2026-03-20T15:40:19Z","snapshot_observed_at":"2026-08-13T14:47:47.249767Z","submitted_at":"2026-01-26T17:56:50Z","title":"Self-Distilled Reasoner: On-Policy Self-Distillation for Large Language Models","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-12T03:54:30.992080Z"},"links":{"cited_paper":"/paper/2506.10910","citing_paper":"/paper/2601.18734"},"observation_digest":"sha256:554f0020a5285c6e08349fa77b645d72ccf8c6bc663eeb8b92f02de6f23cdf92","observation_id":"44d95e98-01b7-446c-8e6f-a5982282210a","resolution":{"observed_at":"2026-05-12T03:54:31.109524Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-05-23T10:52:47.043971+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T10:52:47.043971+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10910","last_updated":"2025-06-12T17:22:37Z","snapshot_observed_at":"2026-08-08T22:49:29.831091Z","submitted_at":"2025-06-12T17:22:37Z","title":"Magistral","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10910","snapshot_observed_at":"2026-08-03T00:57:01.017891Z","title":"URL https: //doi.org/10.48550/arXiv.2506.10910","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2602.11072","last_updated":"2026-07-22T13:29:14Z","snapshot_observed_at":"2026-08-15T04:49:37.311005Z","submitted_at":"2026-02-11T17:41:01Z","title":"Simultaneous Speech-to-Speech Translation Without Aligned Data","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-03T00:57:01.017891Z"},"links":{"cited_paper":"/paper/2506.10910","citing_paper":"/paper/2602.11072"},"observation_digest":"sha256:e434e15dc14eca23b9f0c1f3dbcb813d0ff1cde2123c92c1f228e2b97e4219ff","observation_id":"66e62282-7e92-4464-b7fd-5efd6a4a2270","resolution":{"observed_at":"2026-08-03T00:57:01.017891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10910","last_updated":"2025-06-12T17:22:37Z","snapshot_observed_at":"2026-08-08T22:49:29.831091Z","submitted_at":"2025-06-12T17:22:37Z","title":"Magistral","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10910","snapshot_observed_at":"2026-08-02T23:14:39.407159Z","title":"Rastogi, A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.14862","last_updated":"2026-05-27T11:05:26Z","snapshot_observed_at":"2026-08-14T20:42:26.038738Z","submitted_at":"2026-02-16T15:54:52Z","title":"The Well-Tempered Classifier: Some Elementary Properties of Temperature Scaling","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-02T23:14:39.407159Z"},"links":{"cited_paper":"/paper/2506.10910","citing_paper":"/paper/2602.14862"},"observation_digest":"sha256:8759d154c40f1b96248d59e8322ae166b17b165607d08578826b451e9d1d1034","observation_id":"7f4e80d6-e4f4-42ed-ba6b-3d5c09ab1a63","resolution":{"observed_at":"2026-08-02T23:14:39.407159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10910","last_updated":"2025-06-12T17:22:37Z","snapshot_observed_at":"2026-08-08T22:49:29.831091Z","submitted_at":"2025-06-12T17:22:37Z","title":"Magistral","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10910","snapshot_observed_at":"2026-08-02T20:07:28.015727Z","title":"arXiv preprint arXiv:2506.10910 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.24060","last_updated":"2026-02-27T14:49:05Z","snapshot_observed_at":"2026-08-07T04:43:39.387088Z","submitted_at":"2026-02-27T14:49:05Z","title":"Task Complexity Matters: An Empirical Study of Reasoning in LLMs for Sentiment Analysis","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T20:07:28.015727Z"},"links":{"cited_paper":"/paper/2506.10910","citing_paper":"/paper/2602.24060"},"observation_digest":"sha256:05705ca4c66cd33757ec806f995f76dc64c204d0cdda0ba2321339fc77164434","observation_id":"2f7f2d9e-b2fd-4310-9f85-63e6be00e0ed","resolution":{"observed_at":"2026-08-02T20:07:28.015727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10910","last_updated":"2025-06-12T17:22:37Z","snapshot_observed_at":"2026-08-08T22:49:29.831091Z","submitted_at":"2025-06-12T17:22:37Z","title":"Magistral","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10910","snapshot_observed_at":"2026-08-02T20:05:40.456510Z","title":"arXiv preprint arXiv:2506.10910 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.24068","last_updated":"2026-02-27T14:58:13Z","snapshot_observed_at":"2026-08-13T00:25:35.107916Z","submitted_at":"2026-02-27T14:58:13Z","title":"A Novel Hierarchical Multi-Agent System for Payments Using LLMs","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T20:05:40.456510Z"},"links":{"cited_paper":"/paper/2506.10910","citing_paper":"/paper/2602.24068"},"observation_digest":"sha256:449737b5a0a3e5e9f2ddcbced1d0eeecf87cc32ad5f1d7dd85ca3bfc19248e69","observation_id":"4c23408e-dc3c-4095-a984-bb2e6ebd51b7","resolution":{"observed_at":"2026-08-02T20:05:40.456510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10910","last_updated":"2025-06-12T17:22:37Z","snapshot_observed_at":"2026-08-08T22:49:29.831091Z","submitted_at":"2025-06-12T17:22:37Z","title":"Magistral","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10910","snapshot_observed_at":"2026-08-02T20:05:56.999962Z","title":"Magistral.arXiv preprint arXiv:2506.10910,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.24173","last_updated":"2026-06-22T14:14:54Z","snapshot_observed_at":"2026-08-06T03:16:28.646628Z","submitted_at":"2026-02-27T16:52:52Z","title":"LemmaBench: A Live, Research-Level Benchmark to Evaluate LLM Capabilities in Mathematics","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T20:05:56.999962Z"},"links":{"cited_paper":"/paper/2506.10910","citing_paper":"/paper/2602.24173"},"observation_digest":"sha256:b47fbc5815087dc740cfdbcd53492cc4e00073e3f08ce48a04bf732b636be535","observation_id":"44806c9e-e9ac-4a7b-916d-e5f39cb499c4","resolution":{"observed_at":"2026-08-02T20:05:56.999962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10910","last_updated":"2025-06-12T17:22:37Z","snapshot_observed_at":"2026-08-08T22:49:29.831091Z","submitted_at":"2025-06-12T17:22:37Z","title":"Magistral","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10910","snapshot_observed_at":"2026-08-02T17:05:14.494409Z","title":"arXiv preprint arXiv:2506.10910 (2025) 18 Authors Suppressed Due to Excessive Length","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.29759","last_updated":"2026-07-16T04:13:36Z","snapshot_observed_at":"2026-08-14T15:51:18.914270Z","submitted_at":"2026-03-31T14:00:10Z","title":"TSHA: A Benchmark for Visual Language Models in Trustworthy Safety Hazard Assessment Scenarios","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T17:05:14.494409Z"},"links":{"cited_paper":"/paper/2506.10910","citing_paper":"/paper/2603.29759"},"observation_digest":"sha256:96469fedcc913ebf167c391acaada8d225966c522f5aebdfd141a07ba6e5f3d1","observation_id":"fee22f91-491a-47a8-8cf6-b9927dcdba70","resolution":{"observed_at":"2026-08-02T17:05:14.494409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10910","last_updated":"2025-06-12T17:22:37Z","snapshot_observed_at":"2026-08-08T22:49:29.831091Z","submitted_at":"2025-06-12T17:22:37Z","title":"Magistral","version":1},"cited_work":{"arxiv_id":"2506.10910","doi":"10.48550/arxiv.2506.10910","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10910","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Magistral","venue":"ArXiv.org","work_id":"ae3fa57b-d81e-4022-ab02-51763900103b","year":2025},"citing_paper":{"arxiv_id":"2604.13371","last_updated":"2026-04-15T00:35:22Z","snapshot_observed_at":"2026-08-14T07:53:30.635871Z","submitted_at":"2026-04-15T00:35:22Z","title":"Empirical Evidence of Complexity-Induced Limits in Large Language Models on Finite Discrete State-Space Problems with Explicit Validity Constraints","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-05-10T14:12:45.438246Z"},"links":{"cited_paper":"/paper/2506.10910","citing_paper":"/paper/2604.13371"},"observation_digest":"sha256:f13a116d76d025b6cf90a08e8f943941b80ff4e70da7b107218f80edf6fe0a26","observation_id":"8a26308b-c52a-449b-b4aa-de02d9f608a0","resolution":{"observed_at":"2026-05-10T14:15:29.394776Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-05-23T10:52:47.043971+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T10:52:47.043971+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10910","last_updated":"2025-06-12T17:22:37Z","snapshot_observed_at":"2026-08-08T22:49:29.831091Z","submitted_at":"2025-06-12T17:22:37Z","title":"Magistral","version":1},"cited_work":{"arxiv_id":"2506.10910","doi":"10.48550/arxiv.2506.10910","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10910","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Magistral","venue":"ArXiv.org","work_id":"ae3fa57b-d81e-4022-ab02-51763900103b","year":2025},"citing_paper":{"arxiv_id":"2604.16259","last_updated":"2026-04-17T17:17:55Z","snapshot_observed_at":"2026-08-12T19:06:49.955269Z","submitted_at":"2026-04-17T17:17:55Z","title":"Beyond Distribution Sharpening: The Importance of Task Rewards","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-05-10T08:07:14.691463Z"},"links":{"cited_paper":"/paper/2506.10910","citing_paper":"/paper/2604.16259"},"observation_digest":"sha256:271e93f4d0a82a9f530ee95cff17d280e53f074d9645e02d455949d17ca1ccbc","observation_id":"54215b74-247f-4322-b231-219345a6c660","resolution":{"observed_at":"2026-05-10T09:08:27.020410Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-05-23T10:52:47.043971+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T10:52:47.043971+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10910","last_updated":"2025-06-12T17:22:37Z","snapshot_observed_at":"2026-08-08T22:49:29.831091Z","submitted_at":"2025-06-12T17:22:37Z","title":"Magistral","version":1},"cited_work":{"arxiv_id":"2506.10910","doi":"10.48550/arxiv.2506.10910","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10910","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Magistral","venue":"ArXiv.org","work_id":"ae3fa57b-d81e-4022-ab02-51763900103b","year":2025},"citing_paper":{"arxiv_id":"2604.17614","last_updated":"2026-04-19T20:58:25Z","snapshot_observed_at":"2026-08-14T08:41:23.060090Z","submitted_at":"2026-04-19T20:58:25Z","title":"Characterizing Model-Native Skills","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-05-10T05:42:49.694715Z"},"links":{"cited_paper":"/paper/2506.10910","citing_paper":"/paper/2604.17614"},"observation_digest":"sha256:713c0a1c51334fa047c0bf9cf2a41e11a29e4c2db81b0670de87421c4e6d534f","observation_id":"034b9bc8-cef4-4c22-ae27-69e9705552b9","resolution":{"observed_at":"2026-05-10T06:06:19.473510Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-05-23T10:52:47.043971+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T10:52:47.043971+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10910","last_updated":"2025-06-12T17:22:37Z","snapshot_observed_at":"2026-08-08T22:49:29.831091Z","submitted_at":"2025-06-12T17:22:37Z","title":"Magistral","version":1},"cited_work":{"arxiv_id":"2506.10910","doi":"10.48550/arxiv.2506.10910","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10910","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Magistral","venue":"ArXiv.org","work_id":"ae3fa57b-d81e-4022-ab02-51763900103b","year":2025},"citing_paper":{"arxiv_id":"2604.17957","last_updated":"2026-04-20T08:39:13Z","snapshot_observed_at":"2026-08-11T04:46:04.671429Z","submitted_at":"2026-04-20T08:39:13Z","title":"Process Reward Models Meet Planning: Generating Precise and Scalable Datasets for Step-Level Rewards","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-05-10T04:40:52.854907Z"},"links":{"cited_paper":"/paper/2506.10910","citing_paper":"/paper/2604.17957"},"observation_digest":"sha256:4aae3785411bc4bd029c8ea51b2759f5af0af0e8bc70212f39682b8836236bcf","observation_id":"fe227479-5036-4c4e-9c4a-efa2eac81788","resolution":{"observed_at":"2026-05-10T04:45:21.193991Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-05-23T10:52:47.043971+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T10:52:47.043971+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10910","last_updated":"2025-06-12T17:22:37Z","snapshot_observed_at":"2026-08-08T22:49:29.831091Z","submitted_at":"2025-06-12T17:22:37Z","title":"Magistral","version":1},"cited_work":{"arxiv_id":"2506.10910","doi":"10.48550/arxiv.2506.10910","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10910","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Magistral","venue":"ArXiv.org","work_id":"ae3fa57b-d81e-4022-ab02-51763900103b","year":2025},"citing_paper":{"arxiv_id":"2604.19440","last_updated":"2026-04-21T13:16:45Z","snapshot_observed_at":"2026-08-03T04:28:53.538807Z","submitted_at":"2026-04-21T13:16:45Z","title":"What Makes an LLM a Good Optimizer? A Trajectory Analysis of LLM-Guided Evolutionary Search","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T02:19:18.121220Z"},"links":{"cited_paper":"/paper/2506.10910","citing_paper":"/paper/2604.19440"},"observation_digest":"sha256:8c180804ba3acae008fa6e7081cbb622e52b2e669b559611c82ef39561c4981e","observation_id":"58c87324-1eda-4b9c-9218-514685fecf62","resolution":{"observed_at":"2026-05-11T13:06:05.595526Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-05-23T10:52:47.043971+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T10:52:47.043971+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10910","last_updated":"2025-06-12T17:22:37Z","snapshot_observed_at":"2026-08-08T22:49:29.831091Z","submitted_at":"2025-06-12T17:22:37Z","title":"Magistral","version":1},"cited_work":{"arxiv_id":"2506.10910","doi":"10.48550/arxiv.2506.10910","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10910","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Magistral","venue":"ArXiv.org","work_id":"ae3fa57b-d81e-4022-ab02-51763900103b","year":2025},"citing_paper":{"arxiv_id":"2604.21593","last_updated":"2026-05-03T05:05:27Z","snapshot_observed_at":"2026-08-02T15:02:48.325985Z","submitted_at":"2026-04-23T12:19:14Z","title":"Language as a Latent Variable for Reasoning Optimization","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-05-09T21:40:37.499246Z"},"links":{"cited_paper":"/paper/2506.10910","citing_paper":"/paper/2604.21593"},"observation_digest":"sha256:46fd39885d312c2b559e720944a9f80944b46a83a1cd3b40cbf989ee97dc3c67","observation_id":"68576317-78a5-4df6-8851-12825ea438f8","resolution":{"observed_at":"2026-05-11T14:31:06.613349Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-05-23T10:52:47.043971+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T10:52:47.043971+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10910","last_updated":"2025-06-12T17:22:37Z","snapshot_observed_at":"2026-08-08T22:49:29.831091Z","submitted_at":"2025-06-12T17:22:37Z","title":"Magistral","version":1},"cited_work":{"arxiv_id":"2506.10910","doi":"10.48550/arxiv.2506.10910","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10910","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Magistral","venue":"ArXiv.org","work_id":"ae3fa57b-d81e-4022-ab02-51763900103b","year":2025},"citing_paper":{"arxiv_id":"2604.23813","last_updated":"2026-04-26T17:26:06Z","snapshot_observed_at":"2026-08-11T01:23:51.796022Z","submitted_at":"2026-04-26T17:26:06Z","title":"ShredBench: Evaluating the Semantic Reasoning Capabilities of Multimodal LLMs in Document Reconstruction","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-08T06:34:56.032634Z"},"links":{"cited_paper":"/paper/2506.10910","citing_paper":"/paper/2604.23813"},"observation_digest":"sha256:88b5c7656aef4bfcdaa5712e7bf45e1f1c95f6f8f86364d1a50d3ae8831e49d8","observation_id":"163e5329-0c8b-416f-b23e-05fd51ef83ca","resolution":{"observed_at":"2026-05-11T21:11:15.966281Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-05-23T10:52:47.043971+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T10:52:47.043971+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10910","last_updated":"2025-06-12T17:22:37Z","snapshot_observed_at":"2026-08-08T22:49:29.831091Z","submitted_at":"2025-06-12T17:22:37Z","title":"Magistral","version":1},"cited_work":{"arxiv_id":"2506.10910","doi":"10.48550/arxiv.2506.10910","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10910","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Magistral","venue":"ArXiv.org","work_id":"ae3fa57b-d81e-4022-ab02-51763900103b","year":2025},"citing_paper":{"arxiv_id":"2605.00817","last_updated":"2026-08-03T16:34:49Z","snapshot_observed_at":"2026-08-11T16:04:46.012941Z","submitted_at":"2026-05-01T17:55:47Z","title":"When LLMs Stop Following Steps: A Diagnostic Study of Procedural Execution in Language Models","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-05-09T18:51:59.402906Z"},"links":{"cited_paper":"/paper/2506.10910","citing_paper":"/paper/2605.00817"},"observation_digest":"sha256:62a686cebb0b7b4fcc45bdebf5f6268f918481380cb77df7bf982bb549bf9f6f","observation_id":"3288c138-cde4-4090-805b-18756e46e300","resolution":{"observed_at":"2026-05-11T16:06:06.496149Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-05-23T10:52:47.043971+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T10:52:47.043971+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10910","last_updated":"2025-06-12T17:22:37Z","snapshot_observed_at":"2026-08-08T22:49:29.831091Z","submitted_at":"2025-06-12T17:22:37Z","title":"Magistral","version":1},"cited_work":{"arxiv_id":"2506.10910","doi":"10.48550/arxiv.2506.10910","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10910","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Magistral","venue":"ArXiv.org","work_id":"ae3fa57b-d81e-4022-ab02-51763900103b","year":2025},"citing_paper":{"arxiv_id":"2605.00817","last_updated":"2026-08-03T16:34:49Z","snapshot_observed_at":"2026-08-11T16:04:46.012941Z","submitted_at":"2026-05-01T17:55:47Z","title":"When LLMs Stop Following Steps: A Diagnostic Study of Procedural Execution in Language Models","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-07-01T07:48:28.381924Z"},"links":{"cited_paper":"/paper/2506.10910","citing_paper":"/paper/2605.00817"},"observation_digest":"sha256:7077ce43ebce77ca5f2c9524223d4bf76b7cd192b0ac0d535ad7d46e8b545196","observation_id":"79c6f8be-3c78-4651-b24a-d1ed5273043c","resolution":{"observed_at":"2026-07-01T07:55:31.085847Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-05-23T10:52:47.043971+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T10:52:47.043971+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10910","last_updated":"2025-06-12T17:22:37Z","snapshot_observed_at":"2026-08-08T22:49:29.831091Z","submitted_at":"2025-06-12T17:22:37Z","title":"Magistral","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10910","snapshot_observed_at":"2026-08-04T05:20:33.269530Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.00817","last_updated":"2026-08-03T16:34:49Z","snapshot_observed_at":"2026-08-11T16:04:46.012941Z","submitted_at":"2026-05-01T17:55:47Z","title":"When LLMs Stop Following Steps: A Diagnostic Study of Procedural Execution in Language Models","version":4},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-04T05:20:33.269530Z"},"links":{"cited_paper":"/paper/2506.10910","citing_paper":"/paper/2605.00817"},"observation_digest":"sha256:f5e195d340fca79a21cce5f9ea82eff5ad1dc8558822ab2d0ad26784f03389a0","observation_id":"a26de0a7-cdf0-4b87-9f9f-cda7263cef3d","resolution":{"observed_at":"2026-08-04T05:20:33.269530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10910","last_updated":"2025-06-12T17:22:37Z","snapshot_observed_at":"2026-08-08T22:49:29.831091Z","submitted_at":"2025-06-12T17:22:37Z","title":"Magistral","version":1},"cited_work":{"arxiv_id":"2506.10910","doi":"10.48550/arxiv.2506.10910","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10910","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Magistral","venue":"ArXiv.org","work_id":"ae3fa57b-d81e-4022-ab02-51763900103b","year":2025},"citing_paper":{"arxiv_id":"2605.17497","last_updated":"2026-05-17T15:14:24Z","snapshot_observed_at":"2026-08-05T13:27:59.292796Z","submitted_at":"2026-05-17T15:14:24Z","title":"Self-Supervised On-Policy Distillation for Reasoning Language Models","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-05-20T14:42:55.368104Z"},"links":{"cited_paper":"/paper/2506.10910","citing_paper":"/paper/2605.17497"},"observation_digest":"sha256:6b47255e2f7dcc62e264b134f0fbf90708fb4615d2fee5a9136da7ff86a1135a","observation_id":"8ba3c1fa-e843-4348-b259-15b6efe9335f","resolution":{"observed_at":"2026-05-20T14:43:21.816674Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-05-23T10:52:47.043971+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T10:52:47.043971+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10910","last_updated":"2025-06-12T17:22:37Z","snapshot_observed_at":"2026-08-08T22:49:29.831091Z","submitted_at":"2025-06-12T17:22:37Z","title":"Magistral","version":1},"cited_work":{"arxiv_id":"2506.10910","doi":"10.48550/arxiv.2506.10910","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10910","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Magistral","venue":"ArXiv.org","work_id":"ae3fa57b-d81e-4022-ab02-51763900103b","year":2025},"citing_paper":{"arxiv_id":"2605.23926","last_updated":"2026-04-21T05:32:02Z","snapshot_observed_at":"2026-07-06T23:34:03.934151Z","submitted_at":"2026-04-21T05:32:02Z","title":"How Much Thinking is Enough? Quantifying and Understanding Redundancy in LLM Reasoning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-05T10:18:18.717871Z"},"links":{"cited_paper":"/paper/2506.10910","citing_paper":"/paper/2605.23926"},"observation_digest":"sha256:07d19178f1f09c12a4d25f41dcb9057e09cbeb530731068440ef7deb45247d81","observation_id":"3b6793d2-7bf7-4271-80e8-b6900abc0ea9","resolution":{"observed_at":"2026-07-05T10:20:57.186398Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-05-23T10:52:47.043971+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T10:52:47.043971+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10910","last_updated":"2025-06-12T17:22:37Z","snapshot_observed_at":"2026-08-08T22:49:29.831091Z","submitted_at":"2025-06-12T17:22:37Z","title":"Magistral","version":1},"cited_work":{"arxiv_id":"2506.10910","doi":"10.48550/arxiv.2506.10910","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10910","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Magistral","venue":"ArXiv.org","work_id":"ae3fa57b-d81e-4022-ab02-51763900103b","year":2025},"citing_paper":{"arxiv_id":"2606.02113","last_updated":"2026-06-01T11:45:50Z","snapshot_observed_at":"2026-07-06T23:42:35.063977Z","submitted_at":"2026-06-01T11:45:50Z","title":"A Primer in Post-Training Reasoning Data: What We Know About How It Works","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-28T14:40:21.583101Z"},"links":{"cited_paper":"/paper/2506.10910","citing_paper":"/paper/2606.02113"},"observation_digest":"sha256:73c93909776c48064caadbca0e60ddedb214ec07cddab1c373f41179997f6f19","observation_id":"1b858ce7-4e44-4d77-a08b-8ca5bbb14aa8","resolution":{"observed_at":"2026-07-01T23:06:20.508069Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-05-23T10:52:47.043971+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T10:52:47.043971+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10910","last_updated":"2025-06-12T17:22:37Z","snapshot_observed_at":"2026-08-08T22:49:29.831091Z","submitted_at":"2025-06-12T17:22:37Z","title":"Magistral","version":1},"cited_work":{"arxiv_id":"2506.10910","doi":"10.48550/arxiv.2506.10910","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10910","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Magistral","venue":"ArXiv.org","work_id":"ae3fa57b-d81e-4022-ab02-51763900103b","year":2025},"citing_paper":{"arxiv_id":"2606.07422","last_updated":"2026-06-08T19:53:59Z","snapshot_observed_at":"2026-08-13T09:44:21.884297Z","submitted_at":"2026-06-05T16:16:59Z","title":"The Masked Advantage: Uncovering Local-Language Access to Cultural Knowledge in LLMs","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-06-27T22:08:45.988451Z"},"links":{"cited_paper":"/paper/2506.10910","citing_paper":"/paper/2606.07422"},"observation_digest":"sha256:d806a315939615b83e34b5642c833f583f63e163d3b66cafbc62c97968e070e5","observation_id":"a2212d16-e9e4-4e84-9124-6dc20dae2279","resolution":{"observed_at":"2026-07-02T17:07:13.147843Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-05-23T10:52:47.043971+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T10:52:47.043971+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10910","last_updated":"2025-06-12T17:22:37Z","snapshot_observed_at":"2026-08-08T22:49:29.831091Z","submitted_at":"2025-06-12T17:22:37Z","title":"Magistral","version":1},"cited_work":{"arxiv_id":"2506.10910","doi":"10.48550/arxiv.2506.10910","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10910","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Magistral","venue":"ArXiv.org","work_id":"ae3fa57b-d81e-4022-ab02-51763900103b","year":2025},"citing_paper":{"arxiv_id":"2606.17220","last_updated":"2026-06-15T19:09:31Z","snapshot_observed_at":"2026-07-06T23:52:52.701429Z","submitted_at":"2026-06-15T19:09:31Z","title":"When Rules Learn: A Self-Evolving Agent for Legal Case Retrieval","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-06-27T03:35:30.841853Z"},"links":{"cited_paper":"/paper/2506.10910","citing_paper":"/paper/2606.17220"},"observation_digest":"sha256:fb125424c37daee8ae4dc4d3ca71d147c796ee6ed7794b2b7c5f68148a0ab0dc","observation_id":"25d944ad-0225-4817-aa40-72d6a6956ee1","resolution":{"observed_at":"2026-07-03T17:58:47.158738Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-05-23T10:52:47.043971+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T10:52:47.043971+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10910","last_updated":"2025-06-12T17:22:37Z","snapshot_observed_at":"2026-08-08T22:49:29.831091Z","submitted_at":"2025-06-12T17:22:37Z","title":"Magistral","version":1},"cited_work":{"arxiv_id":"2506.10910","doi":"10.48550/arxiv.2506.10910","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10910","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Magistral","venue":"ArXiv.org","work_id":"ae3fa57b-d81e-4022-ab02-51763900103b","year":2025},"citing_paper":{"arxiv_id":"2606.18284","last_updated":"2026-06-10T02:04:29Z","snapshot_observed_at":"2026-08-14T01:56:24.853455Z","submitted_at":"2026-06-10T02:04:29Z","title":"Breaking the Solver Bottleneck: Training Task Generators at the Learnable Frontier","version":1},"reference_index":133,"source":"arxiv_source","source_observed_at":"2026-06-27T10:36:09.211639Z"},"links":{"cited_paper":"/paper/2506.10910","citing_paper":"/paper/2606.18284"},"observation_digest":"sha256:62feb1429f849ec70864cc412e8858f55a56bd3b99e7cfbeed3e9d701d32e677","observation_id":"3658b2d5-21c7-4ed9-b73f-9483efdbd014","resolution":{"observed_at":"2026-07-03T09:07:47.307984Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-05-23T10:52:47.043971+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T10:52:47.043971+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10910","last_updated":"2025-06-12T17:22:37Z","snapshot_observed_at":"2026-08-08T22:49:29.831091Z","submitted_at":"2025-06-12T17:22:37Z","title":"Magistral","version":1},"cited_work":{"arxiv_id":"2506.10910","doi":"10.48550/arxiv.2506.10910","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10910","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Magistral","venue":"ArXiv.org","work_id":"ae3fa57b-d81e-4022-ab02-51763900103b","year":2025},"citing_paper":{"arxiv_id":"2606.30789","last_updated":"2026-07-01T14:28:25Z","snapshot_observed_at":"2026-08-14T11:50:09.016534Z","submitted_at":"2026-06-29T18:19:09Z","title":"Predictable GRPO: A Closed-Form Model of Training Dynamics","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-01T06:40:47.911021Z"},"links":{"cited_paper":"/paper/2506.10910","citing_paper":"/paper/2606.30789"},"observation_digest":"sha256:bc60ed9aa052c46b122d4857da1bb877b1fac5814ae9ad0f6fe7d6e40c865fb7","observation_id":"91a0ab2b-7c07-45aa-9722-061ead9fff09","resolution":{"observed_at":"2026-07-01T06:45:29.603748Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-05-23T10:52:47.043971+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T10:52:47.043971+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10910","last_updated":"2025-06-12T17:22:37Z","snapshot_observed_at":"2026-08-08T22:49:29.831091Z","submitted_at":"2025-06-12T17:22:37Z","title":"Magistral","version":1},"cited_work":{"arxiv_id":"2506.10910","doi":"10.48550/arxiv.2506.10910","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10910","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Magistral","venue":"ArXiv.org","work_id":"ae3fa57b-d81e-4022-ab02-51763900103b","year":2025},"citing_paper":{"arxiv_id":"2606.30789","last_updated":"2026-07-01T14:28:25Z","snapshot_observed_at":"2026-08-14T11:50:09.016534Z","submitted_at":"2026-06-29T18:19:09Z","title":"Predictable GRPO: A Closed-Form Model of Training Dynamics","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-02T20:26:15.667646Z"},"links":{"cited_paper":"/paper/2506.10910","citing_paper":"/paper/2606.30789"},"observation_digest":"sha256:5392e62d35599bf0a4aa583e02f96278447f0bafa07f093f3a3217850b3fedaf","observation_id":"c4f07051-995b-4380-ae9c-81404c659281","resolution":{"observed_at":"2026-07-02T20:27:21.687480Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-05-23T10:52:47.043971+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T10:52:47.043971+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10910","last_updated":"2025-06-12T17:22:37Z","snapshot_observed_at":"2026-08-08T22:49:29.831091Z","submitted_at":"2025-06-12T17:22:37Z","title":"Magistral","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10910","snapshot_observed_at":"2026-07-14T14:12:44.286699Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.10114","last_updated":"2026-07-11T04:30:43Z","snapshot_observed_at":"2026-08-15T08:20:20.557315Z","submitted_at":"2026-07-11T04:30:43Z","title":"Cost of Reasoning in non-English Languages: A Case Study on Japanese","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-07-14T14:12:44.286699Z"},"links":{"cited_paper":"/paper/2506.10910","citing_paper":"/paper/2607.10114"},"observation_digest":"sha256:ea8f31bf10ca4fc2f762b92b41d911e953397b8d323bfa28b10161c57a915d15","observation_id":"7dbec6d2-9bca-4ca5-9c09-a0e8a27e7e55","resolution":{"observed_at":"2026-07-14T14:12:44.286699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10910","last_updated":"2025-06-12T17:22:37Z","snapshot_observed_at":"2026-08-08T22:49:29.831091Z","submitted_at":"2025-06-12T17:22:37Z","title":"Magistral","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10910","snapshot_observed_at":"2026-08-01T08:36:30.534949Z","title":"arXiv preprint arXiv:2506.10910 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21090","last_updated":"2026-07-23T09:20:38Z","snapshot_observed_at":"2026-08-13T09:06:20.160036Z","submitted_at":"2026-07-23T09:20:38Z","title":"Training Large Language Models for Self-Explanation Faithfulness","version":1},"reference_index":145,"source":"arxiv_source","source_observed_at":"2026-08-01T08:36:30.534949Z"},"links":{"cited_paper":"/paper/2506.10910","citing_paper":"/paper/2607.21090"},"observation_digest":"sha256:4c55645948a16455dbbfb94592ddeae5a8a38373ec772aa5c85c8e0ae07a9a38","observation_id":"1941e2df-6267-42b0-98bb-c2f57dc50f90","resolution":{"observed_at":"2026-08-01T08:36:30.534949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10910","last_updated":"2025-06-12T17:22:37Z","snapshot_observed_at":"2026-08-08T22:49:29.831091Z","submitted_at":"2025-06-12T17:22:37Z","title":"Magistral","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10910","snapshot_observed_at":"2026-08-01T11:48:50.895042Z","title":"In Proceedings of the Ninth Conference on Machine Translation, pages 1440–1453, Miami, Florida, USA","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.26640","last_updated":"2026-07-29T09:01:59Z","snapshot_observed_at":"2026-08-09T12:35:36.768026Z","submitted_at":"2026-07-29T09:01:59Z","title":"Contrastive ESA: Human Evaluation of Multiple Translations at Once","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-01T11:48:50.895042Z"},"links":{"cited_paper":"/paper/2506.10910","citing_paper":"/paper/2607.26640"},"observation_digest":"sha256:01dcef4abde8a07287c870ad0c0cc96c1ca4a717cd87932f8a2ce1594af256fb","observation_id":"b9076e27-ef59-4b11-8172-d2e50da442da","resolution":{"observed_at":"2026-08-01T11:48:50.895042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10910","last_updated":"2025-06-12T17:22:37Z","snapshot_observed_at":"2026-08-08T22:49:29.831091Z","submitted_at":"2025-06-12T17:22:37Z","title":"Magistral","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10910","snapshot_observed_at":"2026-08-04T10:56:20.082102Z","title":"Magistral.arXiv preprint arXiv:2506.10910, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02238","last_updated":"2026-08-03T13:51:12Z","snapshot_observed_at":"2026-08-08T23:32:24.960414Z","submitted_at":"2026-08-03T13:51:12Z","title":"Trustworthy AI in Digital Health: A Comprehensive Review of Robustness and Explainability","version":1},"reference_index":108,"source":"pdf_text","source_observed_at":"2026-08-04T10:56:20.082102Z"},"links":{"cited_paper":"/paper/2506.10910","citing_paper":"/paper/2608.02238"},"observation_digest":"sha256:8417451afb3af55917b8f25c057d4d502735c6cc07a399cc1cf2253a9180b823","observation_id":"ebb49bd1-9cb4-4867-8d6d-5f47806d1d42","resolution":{"observed_at":"2026-08-04T10:56:20.082102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10910","last_updated":"2025-06-12T17:22:37Z","snapshot_observed_at":"2026-08-08T22:49:29.831091Z","submitted_at":"2025-06-12T17:22:37Z","title":"Magistral","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10910","snapshot_observed_at":"2026-08-08T17:11:01.995426Z","title":"arXiv preprint arXiv:2506.10910 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05250","last_updated":"2026-08-05T15:57:43Z","snapshot_observed_at":"2026-08-12T13:59:08.677646Z","submitted_at":"2026-08-05T15:57:43Z","title":"Beyond Full-Model Rollback: AuroSFT for Adapter-State Multi-Task Fine-Tuning","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-08T17:11:01.995426Z"},"links":{"cited_paper":"/paper/2506.10910","citing_paper":"/paper/2608.05250"},"observation_digest":"sha256:9edcde3f06eff839ded500ab58171baa4fe8a1c32bf1a8983f02602b9d063759","observation_id":"63f9a6ff-2722-4a98-bdb1-3722d656b668","resolution":{"observed_at":"2026-08-08T17:11:01.995426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.10910/citation-record","integrity":"/paper/2506.10910/integrity","json":"/paper/2506.10910/citation-record.json","paper":"/paper/2506.10910"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2006.05990","last_updated":"2020-06-10T17:59:03Z","snapshot_observed_at":"2026-08-14T07:14:28.634639Z","submitted_at":"2020-06-10T17:59:03Z","title":"What Matters In On-Policy Reinforcement Learning? A Large-Scale Empirical Study","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.05990","snapshot_observed_at":"2026-08-07T04:19:22.151310Z","title":"What matters in on-policy reinforcement learning? a large-scale empirical study, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.10910","last_updated":"2025-06-12T17:22:37Z","snapshot_observed_at":"2026-08-08T22:49:29.831091Z","submitted_at":"2025-06-12T17:22:37Z","title":"Magistral","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T04:19:22.151310Z"},"links":{"cited_paper":"/paper/2006.05990","citing_paper":"/paper/2506.10910"},"observation_digest":"sha256:7742c940c6a225af70f37cb195aa37f7c674e4280a73c9798de44552c7404b71","observation_id":"58df91f7-f6d0-43f2-914c-f803515f43e7","resolution":{"observed_at":"2026-08-07T04:19:22.151310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-13T15:58:13.809876Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T04:19:22.289997Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10910","last_updated":"2025-06-12T17:22:37Z","snapshot_observed_at":"2026-08-08T22:49:29.831091Z","submitted_at":"2025-06-12T17:22:37Z","title":"Magistral","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T04:19:22.289997Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.10910"},"observation_digest":"sha256:3203e16ab0862db7162c19b93474bd8e13353b0e77a7e5f7a8489ba488598683","observation_id":"5c547a00-d3e3-4bef-9df6-0750e017b308","resolution":{"observed_at":"2026-08-07T04:19:22.289997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:19:29.077336Z","title":"Impala: Scalable distributed deep-rl with importance weighted actor-learner architectures","venue":null,"work_id":"6d12fea2-8b71-4b86-947c-8829918431d8","year":2018},"citing_paper":{"arxiv_id":"2506.10910","last_updated":"2025-06-12T17:22:37Z","snapshot_observed_at":"2026-08-08T22:49:29.831091Z","submitted_at":"2025-06-12T17:22:37Z","title":"Magistral","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T04:19:22.472941Z"},"links":{"citing_paper":"/paper/2506.10910"},"observation_digest":"sha256:698aea0426832bef16e17347e2fefa35af957b63ab779f782b9efd1e4c964404","observation_id":"5704b324-819e-4fe2-bbb4-d084dc1041c6","resolution":{"observed_at":"2026-08-07T04:19:29.137514Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:19:28.864226Z","title":"Polyglot Benchmark","venue":null,"work_id":"187fb60e-4cd5-4fb3-8f40-7dabdf6e0ab9","year":2024},"citing_paper":{"arxiv_id":"2506.10910","last_updated":"2025-06-12T17:22:37Z","snapshot_observed_at":"2026-08-08T22:49:29.831091Z","submitted_at":"2025-06-12T17:22:37Z","title":"Magistral","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T04:19:22.624332Z"},"links":{"citing_paper":"/paper/2506.10910"},"observation_digest":"sha256:a5059c5e3f5aafea90c1a43a66755ae6dd6cc5025512a9f2f1b3df4488ec7a0f","observation_id":"67e25e8a-2b82-49b5-921b-5f515a8f23fb","resolution":{"observed_at":"2026-08-07T04:19:28.977000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04178","last_updated":"2025-06-05T02:21:52Z","snapshot_observed_at":"2026-08-15T05:34:45.227001Z","submitted_at":"2025-06-04T17:25:39Z","title":"OpenThoughts: Data Recipes for Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.04178","snapshot_observed_at":"2026-08-07T04:19:22.778940Z","title":"Merrill, Tatsunori Hashimoto, Yejin Choi, Jenia Jitsev, Reinhard Heckel, Maheswaran Sathiamoorthy, Alexandros G","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10910","last_updated":"2025-06-12T17:22:37Z","snapshot_observed_at":"2026-08-08T22:49:29.831091Z","submitted_at":"2025-06-12T17:22:37Z","title":"Magistral","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T04:19:22.778940Z"},"links":{"cited_paper":"/paper/2506.04178","citing_paper":"/paper/2506.10910"},"observation_digest":"sha256:c6bde2231f668cecb5e6d8ece964efae23f96d61a5e05d5d28c168ce4f6e818e","observation_id":"5003029f-9c06-4414-9506-4461b56d06f7","resolution":{"observed_at":"2026-08-07T04:19:22.778940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-07T04:19:22.981703Z","title":"Measuring mathematical problem solving with the math dataset","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.10910","last_updated":"2025-06-12T17:22:37Z","snapshot_observed_at":"2026-08-08T22:49:29.831091Z","submitted_at":"2025-06-12T17:22:37Z","title":"Magistral","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T04:19:22.981703Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2506.10910"},"observation_digest":"sha256:9e1800cefed97a1c577a484cb9ab2430e1845255a5e8d54c38c391557c34b2d2","observation_id":"68a4518f-83be-443b-9663-c4830f70049d","resolution":{"observed_at":"2026-08-07T04:19:22.981703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11143","last_updated":"2025-10-09T12:22:46Z","snapshot_observed_at":"2026-08-12T12:08:23.520312Z","submitted_at":"2024-05-20T01:04:40Z","title":"OpenRLHF: An Easy-to-use, Scalable and High-performance RLHF Framework","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.11143","snapshot_observed_at":"2026-08-07T04:19:23.130127Z","title":"Openrlhf: An easy-to-use, scalable and high-performance rlhf framework","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10910","last_updated":"2025-06-12T17:22:37Z","snapshot_observed_at":"2026-08-08T22:49:29.831091Z","submitted_at":"2025-06-12T17:22:37Z","title":"Magistral","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T04:19:23.130127Z"},"links":{"cited_paper":"/paper/2405.11143","citing_paper":"/paper/2506.10910"},"observation_digest":"sha256:2777edf700a5822ff816586028111569bc20be40e2d731f110fca48804d38756","observation_id":"8d724e63-8a2b-4c53-9039-7a7c68ed16e7","resolution":{"observed_at":"2026-08-07T04:19:23.130127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.24290","last_updated":"2025-07-05T09:01:04Z","snapshot_observed_at":"2026-08-12T18:49:18.486177Z","submitted_at":"2025-03-31T16:36:05Z","title":"Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.24290","snapshot_observed_at":"2026-08-07T04:19:23.278363Z","title":"Open-reasoner-zero: An open source approach to scaling up reinforcement learning on the base model, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10910","last_updated":"2025-06-12T17:22:37Z","snapshot_observed_at":"2026-08-08T22:49:29.831091Z","submitted_at":"2025-06-12T17:22:37Z","title":"Magistral","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T04:19:23.278363Z"},"links":{"cited_paper":"/paper/2503.24290","citing_paper":"/paper/2506.10910"},"observation_digest":"sha256:314e25a83cc2e4d94a6ff901bedb52f31a336003f5c02a5f37fb14afa368e872","observation_id":"3aaefb17-6335-4a84-9917-cbe598a1b973","resolution":{"observed_at":"2026-08-07T04:19:23.278363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:19:23.479130Z","title":"Open r1: A fully open reproduction of deepseek-r1, January 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10910","last_updated":"2025-06-12T17:22:37Z","snapshot_observed_at":"2026-08-08T22:49:29.831091Z","submitted_at":"2025-06-12T17:22:37Z","title":"Magistral","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T04:19:23.479130Z"},"links":{"citing_paper":"/paper/2506.10910"},"observation_digest":"sha256:36ac24ba2b98892cd664bb53b3ad4f33030a0106ab5b5c3774e236b42befa0a2","observation_id":"cbf1b255-9e5c-4119-80eb-1f58bd63ee53","resolution":{"observed_at":"2026-08-07T04:19:23.479130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-07T04:19:23.630431Z","title":"Openai o1 system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10910","last_updated":"2025-06-12T17:22:37Z","snapshot_observed_at":"2026-08-08T22:49:29.831091Z","submitted_at":"2025-06-12T17:22:37Z","title":"Magistral","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T04:19:23.630431Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2506.10910"},"observation_digest":"sha256:d7fb702a22487518100e98b94e52c329a6513a5616b380492d667322454bf8d7","observation_id":"48ba2a9f-8a07-4070-8b93-7762621a965a","resolution":{"observed_at":"2026-08-07T04:19:23.630431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07974","last_updated":"2024-06-06T17:41:21Z","snapshot_observed_at":"2026-08-13T09:04:30.125777Z","submitted_at":"2024-03-12T17:58:04Z","title":"LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07974","snapshot_observed_at":"2026-08-07T04:19:23.789584Z","title":"Livecodebench: Holistic and contamination free evaluation of large language models for code","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10910","last_updated":"2025-06-12T17:22:37Z","snapshot_observed_at":"2026-08-08T22:49:29.831091Z","submitted_at":"2025-06-12T17:22:37Z","title":"Magistral","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T04:19:23.789584Z"},"links":{"cited_paper":"/paper/2403.07974","citing_paper":"/paper/2506.10910"},"observation_digest":"sha256:a2f808309346a80a5ec919a1eb7f57ac4f790ca4832a15909b17f3fe89125e0a","observation_id":"0b17f5c1-93e3-476c-9a23-20a2d86b9f3f","resolution":{"observed_at":"2026-08-07T04:19:23.789584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1612.03651","last_updated":"2016-12-12T12:51:03Z","snapshot_observed_at":"2026-08-14T21:26:00.948905Z","submitted_at":"2016-12-12T12:51:03Z","title":"FastText.zip: Compressing text classification models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1612.03651","snapshot_observed_at":"2026-08-07T04:19:23.974974Z","title":"Fasttext.zip: Compressing text classification models","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.10910","last_updated":"2025-06-12T17:22:37Z","snapshot_observed_at":"2026-08-08T22:49:29.831091Z","submitted_at":"2025-06-12T17:22:37Z","title":"Magistral","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T04:19:23.974974Z"},"links":{"cited_paper":"/paper/1612.03651","citing_paper":"/paper/2506.10910"},"observation_digest":"sha256:73c22ee8bbbd4cca2da5d338591abbe376344e451bc86510c20e51399231063b","observation_id":"f778baa5-f855-40d6-b5b6-d2f99d9e1d71","resolution":{"observed_at":"2026-08-07T04:19:23.974974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.09913","last_updated":"2018-11-07T06:25:20Z","snapshot_observed_at":"2026-08-14T19:59:34.463193Z","submitted_at":"2017-12-28T16:15:42Z","title":"Visualizing the Loss Landscape of Neural Nets","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.09913","snapshot_observed_at":"2026-08-07T04:19:24.080434Z","title":"Visualizing the loss landscape of neural nets, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.10910","last_updated":"2025-06-12T17:22:37Z","snapshot_observed_at":"2026-08-08T22:49:29.831091Z","submitted_at":"2025-06-12T17:22:37Z","title":"Magistral","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T04:19:24.080434Z"},"links":{"cited_paper":"/paper/1712.09913","citing_paper":"/paper/2506.10910"},"observation_digest":"sha256:a5470d3aceeecd29562c20301b72419f47884ff3748b21e9471ea9e4a80e1fc5","observation_id":"fec18fcf-db8d-4007-8074-085886f07043","resolution":{"observed_at":"2026-08-07T04:19:24.080434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-08-13T12:34:54.476684Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-08-07T04:19:24.249365Z","title":"Understanding r1-zero-like training: A critical perspective","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10910","last_updated":"2025-06-12T17:22:37Z","snapshot_observed_at":"2026-08-08T22:49:29.831091Z","submitted_at":"2025-06-12T17:22:37Z","title":"Magistral","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T04:19:24.249365Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2506.10910"},"observation_digest":"sha256:e913ff92a65d430a124de9bd0bc74a95ddbf9b6fe4421def74f71b233a989a1e","observation_id":"b9445add-fb95-4f97-8b48-afd2089ea90f","resolution":{"observed_at":"2026-08-07T04:19:24.249365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:19:24.433838Z","title":"Mathvista: Evaluating mathematical reasoning of foundation models in visual contexts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10910","last_updated":"2025-06-12T17:22:37Z","snapshot_observed_at":"2026-08-08T22:49:29.831091Z","submitted_at":"2025-06-12T17:22:37Z","title":"Magistral","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T04:19:24.433838Z"},"links":{"citing_paper":"/paper/2506.10910"},"observation_digest":"sha256:268f7ceac10c4a5d5eaf8faa45bbde030e683b561f50fdfa0ff635794fa6720d","observation_id":"628e55f3-111d-414e-b23d-9926e437097c","resolution":{"observed_at":"2026-08-07T04:19:24.433838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:19:28.538082Z","title":"Mistral large 2","venue":null,"work_id":"c00ff0b3-05d9-4d2a-98b1-52d4090f0ddb","year":2024},"citing_paper":{"arxiv_id":"2506.10910","last_updated":"2025-06-12T17:22:37Z","snapshot_observed_at":"2026-08-08T22:49:29.831091Z","submitted_at":"2025-06-12T17:22:37Z","title":"Magistral","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T04:19:24.559640Z"},"links":{"citing_paper":"/paper/2506.10910"},"observation_digest":"sha256:d33fc9ccaf879eee81a6fa473ba61d42cf54639739a2e38bace4dce34ec84194","observation_id":"b9cbcabf-32ce-4767-bc51-ebc7e5781d15","resolution":{"observed_at":"2026-08-07T04:19:28.649078Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:19:28.213702Z","title":"Mistral medium 3","venue":null,"work_id":"fdfa697d-b142-4cb6-93d0-43555b77792f","year":2025},"citing_paper":{"arxiv_id":"2506.10910","last_updated":"2025-06-12T17:22:37Z","snapshot_observed_at":"2026-08-08T22:49:29.831091Z","submitted_at":"2025-06-12T17:22:37Z","title":"Magistral","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T04:19:24.717927Z"},"links":{"citing_paper":"/paper/2506.10910"},"observation_digest":"sha256:83e860e403994a22da5eb6180349ae283b481ffb806a617f33bd00b07ae4bbe6","observation_id":"ba51863e-03b3-4038-9708-26edd0658d47","resolution":{"observed_at":"2026-08-07T04:19:28.343947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18252","last_updated":"2025-04-26T08:33:32Z","snapshot_observed_at":"2026-08-12T22:16:24.645746Z","submitted_at":"2024-10-23T19:59:50Z","title":"Asynchronous RLHF: Faster and More Efficient Off-Policy RL for Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18252","snapshot_observed_at":"2026-08-07T04:19:24.817910Z","title":"Asynchronous rlhf: Faster and more efficient off-policy rl for language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10910","last_updated":"2025-06-12T17:22:37Z","snapshot_observed_at":"2026-08-08T22:49:29.831091Z","submitted_at":"2025-06-12T17:22:37Z","title":"Magistral","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T04:19:24.817910Z"},"links":{"cited_paper":"/paper/2410.18252","citing_paper":"/paper/2506.10910"},"observation_digest":"sha256:c0f551f6d71df78ce151b5d22e8211dd79d88f233539ca12599aaf41232830c4","observation_id":"80499156-04c0-4aec-b60a-9c656f3b4258","resolution":{"observed_at":"2026-08-07T04:19:24.817910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:19:27.900340Z","title":"Codeforces cots","venue":null,"work_id":"d6c6f1e7-2880-4ec1-bdc1-9454a63724b4","year":2025},"citing_paper":{"arxiv_id":"2506.10910","last_updated":"2025-06-12T17:22:37Z","snapshot_observed_at":"2026-08-08T22:49:29.831091Z","submitted_at":"2025-06-12T17:22:37Z","title":"Magistral","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T04:19:24.973926Z"},"links":{"citing_paper":"/paper/2506.10910"},"observation_digest":"sha256:a135518da8ef3d4a353590ba41794e93c2d4113d4073e221b812b26ddb6700db","observation_id":"24591ab7-adab-4bca-adea-f95306197332","resolution":{"observed_at":"2026-08-07T04:19:28.009074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.14249","last_updated":"2026-02-20T04:23:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-24T05:27:46Z","title":"Humanity's Last Exam","version":10},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.14249","snapshot_observed_at":"2026-08-07T04:19:25.101520Z","title":"Humanity's last exam","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10910","last_updated":"2025-06-12T17:22:37Z","snapshot_observed_at":"2026-08-08T22:49:29.831091Z","submitted_at":"2025-06-12T17:22:37Z","title":"Magistral","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T04:19:25.101520Z"},"links":{"cited_paper":"/paper/2501.14249","citing_paper":"/paper/2506.10910"},"observation_digest":"sha256:60622b62ffb2db754ff44acb7318699fc2eee431e9e2699f15b6213ea1d53b0a","observation_id":"4c805a10-7964-4e0b-9367-b218e3a0d53c","resolution":{"observed_at":"2026-08-07T04:19:25.101520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:19:25.209936Z","title":"Gpqa: A graduate-level google-proof q&a benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10910","last_updated":"2025-06-12T17:22:37Z","snapshot_observed_at":"2026-08-08T22:49:29.831091Z","submitted_at":"2025-06-12T17:22:37Z","title":"Magistral","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T04:19:25.209936Z"},"links":{"citing_paper":"/paper/2506.10910"},"observation_digest":"sha256:117a9ffbda3866621c508f37752bef97e5ab9dbe154cc79ee28d8dc006d88110","observation_id":"21d0f88c-bac0-4a20-ba78-ad10edf48079","resolution":{"observed_at":"2026-08-07T04:19:25.209936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:19:27.694107Z","title":"Iterative methods for sparse linear systems","venue":null,"work_id":"2b8bf4b1-dfcd-4fc1-a4d7-90677c718918","year":2003},"citing_paper":{"arxiv_id":"2506.10910","last_updated":"2025-06-12T17:22:37Z","snapshot_observed_at":"2026-08-08T22:49:29.831091Z","submitted_at":"2025-06-12T17:22:37Z","title":"Magistral","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T04:19:25.393789Z"},"links":{"citing_paper":"/paper/2506.10910"},"observation_digest":"sha256:15974def77e0f13129ccfcf428d9c8325cd2444ca2cf0551a15979cede4b2897","observation_id":"948f4ce8-b893-48e3-a349-082b1c6adf57","resolution":{"observed_at":"2026-08-07T04:19:27.763019Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T04:19:25.552219Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.10910","last_updated":"2025-06-12T17:22:37Z","snapshot_observed_at":"2026-08-08T22:49:29.831091Z","submitted_at":"2025-06-12T17:22:37Z","title":"Magistral","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T04:19:25.552219Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2506.10910"},"observation_digest":"sha256:d561a81cdd02b4dd6063d083eb89c5494a83d6d0cf0068ce30bd0c1c655f7b9f","observation_id":"d77bcf82-acb8-45a3-8aff-7a87174bf9c7","resolution":{"observed_at":"2026-08-07T04:19:25.552219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T04:19:25.739088Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10910","last_updated":"2025-06-12T17:22:37Z","snapshot_observed_at":"2026-08-08T22:49:29.831091Z","submitted_at":"2025-06-12T17:22:37Z","title":"Magistral","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T04:19:25.739088Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2506.10910"},"observation_digest":"sha256:b56136519f4e079de760a4aaab200350471bdbaa014b27954848bb879cdf09f1","observation_id":"6a9d1a23-b828-4223-af6c-82725fa9ac0b","resolution":{"observed_at":"2026-08-07T04:19:25.739088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-08-07T04:19:25.902064Z","title":"Hybridflow: A flexible and efficient rlhf framework","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10910","last_updated":"2025-06-12T17:22:37Z","snapshot_observed_at":"2026-08-08T22:49:29.831091Z","submitted_at":"2025-06-12T17:22:37Z","title":"Magistral","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T04:19:25.902064Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2506.10910"},"observation_digest":"sha256:a28f03fc7920112471eaa576804c253c95b4d46d5870942cd7092767fda3f394","observation_id":"7f4314a9-ef00-41f8-afec-0260a50552f4","resolution":{"observed_at":"2026-08-07T04:19:25.902064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01939","last_updated":"2025-11-13T10:08:29Z","snapshot_observed_at":"2026-08-13T06:08:42.070209Z","submitted_at":"2025-06-02T17:54:39Z","title":"Beyond the 80/20 Rule: High-Entropy Minority Tokens Drive Effective Reinforcement Learning for LLM Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.01939","snapshot_observed_at":"2026-08-07T04:19:26.065118Z","title":"Beyond the 80/20 rule: High-entropy minority tokens drive effective reinforcement learning for llm reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10910","last_updated":"2025-06-12T17:22:37Z","snapshot_observed_at":"2026-08-08T22:49:29.831091Z","submitted_at":"2025-06-12T17:22:37Z","title":"Magistral","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T04:19:26.065118Z"},"links":{"cited_paper":"/paper/2506.01939","citing_paper":"/paper/2506.10910"},"observation_digest":"sha256:2750be17de61aecfd98646fb910e190270462c4a37448169ff92f58bdf4bddb9","observation_id":"b0e1489a-96a4-46bd-90f8-18784a3d8458","resolution":{"observed_at":"2026-08-07T04:19:26.065118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24034","last_updated":"2025-06-02T01:49:51Z","snapshot_observed_at":"2026-08-13T20:34:22.010534Z","submitted_at":"2025-05-29T22:14:15Z","title":"LlamaRL: A Distributed Asynchronous Reinforcement Learning Framework for Efficient Large-scale LLM Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24034","snapshot_observed_at":"2026-08-07T04:19:26.241394Z","title":"Llamarl: A distributed asynchronous reinforcement learning framework for efficient large-scale llm trainin","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10910","last_updated":"2025-06-12T17:22:37Z","snapshot_observed_at":"2026-08-08T22:49:29.831091Z","submitted_at":"2025-06-12T17:22:37Z","title":"Magistral","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T04:19:26.241394Z"},"links":{"cited_paper":"/paper/2505.24034","citing_paper":"/paper/2506.10910"},"observation_digest":"sha256:6ebd9b8f505d691c4f77ba349d8b6ae7bd4eb7bc3d2e50f621e1b68e689125f6","observation_id":"62aa2849-4bc7-4bce-953f-b36661f1c2ce","resolution":{"observed_at":"2026-08-07T04:19:26.241394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T04:19:26.415218Z","title":"Dapo: An open-source llm reinforcement learning system at scale","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10910","last_updated":"2025-06-12T17:22:37Z","snapshot_observed_at":"2026-08-08T22:49:29.831091Z","submitted_at":"2025-06-12T17:22:37Z","title":"Magistral","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T04:19:26.415218Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2506.10910"},"observation_digest":"sha256:88e5560a077c725233c2c231430c9e3dc4ab705e91bbcbd3df3929db8ff778f7","observation_id":"df998082-8d39-4586-bd26-e31f6501b6fd","resolution":{"observed_at":"2026-08-07T04:19:26.415218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:19:26.563646Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10910","last_updated":"2025-06-12T17:22:37Z","snapshot_observed_at":"2026-08-08T22:49:29.831091Z","submitted_at":"2025-06-12T17:22:37Z","title":"Magistral","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T04:19:26.563646Z"},"links":{"citing_paper":"/paper/2506.10910"},"observation_digest":"sha256:49364f104e3741c469afcfd2186e5956520deff2c4cd243417afe973c393b506","observation_id":"afb421ca-e8f2-4607-8461-078a57556093","resolution":{"observed_at":"2026-08-07T04:19:26.563646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:19:27.475145Z","title":"Mmmu-pro: A more robust multi-discipline multimodal understanding benchmark","venue":null,"work_id":"f1661e63-831f-44f1-a36d-cd85134cb5e0","year":2025},"citing_paper":{"arxiv_id":"2506.10910","last_updated":"2025-06-12T17:22:37Z","snapshot_observed_at":"2026-08-08T22:49:29.831091Z","submitted_at":"2025-06-12T17:22:37Z","title":"Magistral","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T04:19:26.723792Z"},"links":{"citing_paper":"/paper/2506.10910"},"observation_digest":"sha256:c69dd883ea428245111567c0d39e743101ecd8dd724ce5688c47ab7f26beb758","observation_id":"7f2c72e9-0ff2-4342-a537-1c5365d8db3d","resolution":{"observed_at":"2026-08-07T04:19:27.582378Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07911","last_updated":"2023-11-14T05:13:55Z","snapshot_observed_at":"2026-07-06T16:47:08.877195Z","submitted_at":"2023-11-14T05:13:55Z","title":"Instruction-Following Evaluation for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07911","snapshot_observed_at":"2026-08-07T04:19:26.848892Z","title":"Instruction-following evaluation for large language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10910","last_updated":"2025-06-12T17:22:37Z","snapshot_observed_at":"2026-08-08T22:49:29.831091Z","submitted_at":"2025-06-12T17:22:37Z","title":"Magistral","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T04:19:26.848892Z"},"links":{"cited_paper":"/paper/2311.07911","citing_paper":"/paper/2506.10910"},"observation_digest":"sha256:c80c802cc6d76ee6bd383b9ae2fe43c4119aa161efa92b0fb6bb0b54f22181f2","observation_id":"52cca6b6-2d53-4db9-9b01-09a147b99b98","resolution":{"observed_at":"2026-08-07T04:19:26.848892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.10910","last_updated":"2025-06-12T17:22:37Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-08T22:49:29.831091Z","submitted_at":"2025-06-12T17:22:37Z","title":"Magistral"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":24,"verified_exact":0,"verified_fuzzy":7},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 40 inbound Pith citation observations for arXiv:2506.10910."}