{"as_of":"2026-08-10T02:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7847b43bcd862e7dd1fdfec6356d303fe4955da55ae0c1fa973cedcb2ee5248d","coverage":[{"denominator":63,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":63,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:02:38.886258Z","state":"measured"},{"denominator":63,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":63,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.01327/citation-record","integrity":"/paper/2507.01327/integrity","json":"/paper/2507.01327/citation-record.json","paper":"/paper/2507.01327"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.14740","last_updated":"2024-02-26T18:26:25Z","snapshot_observed_at":"2026-08-09T14:30:33.899591Z","submitted_at":"2024-02-22T17:52:34Z","title":"Back to Basics: Revisiting REINFORCE Style Optimization for Learning from Human Feedback in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14740","snapshot_observed_at":"2026-08-06T21:02:36.942746Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-09T00:46:58.233525Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:36.942746Z"},"links":{"cited_paper":"/paper/2402.14740","citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:918e8ad65f4fdc484dee2be26da5cd62f86efdf14a34391d41d52dc5c68609df","observation_id":"31a208ec-737b-4732-823d-902ac8dc57a8","resolution":{"observed_at":"2026-08-06T21:02:36.942746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18438","last_updated":"2025-01-31T15:39:00Z","snapshot_observed_at":"2026-08-09T23:27:27.306621Z","submitted_at":"2025-01-30T15:45:56Z","title":"o3-mini vs DeepSeek-R1: Which One is Safer?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.18438","snapshot_observed_at":"2026-08-06T21:02:37.032293Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-09T00:46:58.233525Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:37.032293Z"},"links":{"cited_paper":"/paper/2501.18438","citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:42665eaa46ef32a62d0cbe1e002e4145f2faf9d9dfe9bd0bf42e72bf779b21c0","observation_id":"5f9e17e1-3cc5-483a-b922-d22bd53228f7","resolution":{"observed_at":"2026-08-06T21:02:37.032293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-06T21:02:37.183211Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-09T00:46:58.233525Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:37.183211Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:ff8d7a533f66e17b2e78a6c9e94b9ae8c575f6ec6b1d975fca8a642cb877c5a1","observation_id":"14b9f2ce-14ee-4cf7-a291-fb1d8309115d","resolution":{"observed_at":"2026-08-06T21:02:37.183211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:02:40.230211Z","title":null,"venue":null,"work_id":"a60430c9-297b-4dff-9fda-ea19687cc6c1","year":1995},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-09T00:46:58.233525Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:37.319463Z"},"links":{"citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:6a614e849fef4e10ff67b08765c1aa0acd5ed4462327d6ecf804001d08609ccc","observation_id":"0d5c8270-2ff8-49f1-b33a-2dbbc9d82af1","resolution":{"observed_at":"2026-08-06T21:02:40.234899Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03216","last_updated":"2025-12-12T11:26:32Z","snapshot_observed_at":"2026-07-06T17:25:35.493362Z","submitted_at":"2024-02-05T17:26:49Z","title":"M3-Embedding: Multi-Linguality, Multi-Functionality, Multi-Granularity Text Embeddings Through Self-Knowledge Distillation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03216","snapshot_observed_at":"2026-08-06T21:02:37.502465Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-09T00:46:58.233525Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:37.502465Z"},"links":{"cited_paper":"/paper/2402.03216","citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:256ece4bba631c2ae41d82ae2943a6159126bd091e125ea967f71f73087257cf","observation_id":"023fce87-47f5-49f7-8100-39b5698eaf4c","resolution":{"observed_at":"2026-08-06T21:02:37.502465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:02:37.699455Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-09T00:46:58.233525Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:37.699455Z"},"links":{"citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:6f036284110b4521d295b9fa4d1320f5fda451b8ff137f9c6269d0e13166992f","observation_id":"0aa882ab-7b75-4db8-8aef-e46eea1ddc3a","resolution":{"observed_at":"2026-08-06T21:02:37.699455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17161","last_updated":"2025-05-26T17:16:45Z","snapshot_observed_at":"2026-08-09T18:26:12.869738Z","submitted_at":"2025-01-28T18:59:44Z","title":"SFT Memorizes, RL Generalizes: A Comparative Study of Foundation Model Post-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17161","snapshot_observed_at":"2026-08-06T21:02:37.820378Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-09T00:46:58.233525Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:37.820378Z"},"links":{"cited_paper":"/paper/2501.17161","citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:8f8eed9f2c22e0def7eb2754eb9644806bd8ee116014f2692fba329722efa3a3","observation_id":"86e7978e-5dd8-4787-9961-5830e10eec17","resolution":{"observed_at":"2026-08-06T21:02:37.820378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:02:40.215914Z","title":null,"venue":null,"work_id":"d6f23526-ef0a-49c6-9288-4218298825fe","year":2024},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-09T00:46:58.233525Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:37.955406Z"},"links":{"citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:a3ae30e87edfe8c41c5363e45c4d9c906bdbbbb6545896db48541dfa98b10e3c","observation_id":"ce74fb56-f1ee-4738-a1c1-2e2a673cc6c3","resolution":{"observed_at":"2026-08-06T21:02:40.220572Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:02:40.201207Z","title":null,"venue":null,"work_id":"6d1af688-f471-4b12-99ec-3326df663f69","year":2024},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-09T00:46:58.233525Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:38.044785Z"},"links":{"citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:e8011eb5f9514a6ebc94b4004569628dd73b7275153a4264281bc2e820f0edb2","observation_id":"c657feba-84a2-4a22-8038-9a9c4d28439b","resolution":{"observed_at":"2026-08-06T21:02:40.205589Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:02:38.151830Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-09T00:46:58.233525Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:38.151830Z"},"links":{"citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:a47dce5222aa115743b732c83bdec157b23992b15d69d7bd3512fce80dc41e8a","observation_id":"b4835359-7fc4-40df-b9fd-6224fa5dd951","resolution":{"observed_at":"2026-08-06T21:02:38.151830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18576","last_updated":"2025-01-30T18:45:51Z","snapshot_observed_at":"2026-08-09T22:54:35.291169Z","submitted_at":"2025-01-30T18:45:51Z","title":"Token-Hungry, Yet Precise: DeepSeek R1 Highlights the Need for Multi-Step Reasoning Over Speed in MATH","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.18576","snapshot_observed_at":"2026-08-06T21:02:38.200430Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-09T00:46:58.233525Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:38.200430Z"},"links":{"cited_paper":"/paper/2501.18576","citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:951dffb5d5fe8ecaf7b4fbcb81a9ce316a085a63c3be3922bd37b6bbfd8b8a5f","observation_id":"2c2ad01c-1d6e-4ccf-abb3-9329f1992d0e","resolution":{"observed_at":"2026-08-06T21:02:38.200430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:02:40.176099Z","title":null,"venue":null,"work_id":"bd161eae-d876-46f4-908c-f02467ba5470","year":2021},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-09T00:46:58.233525Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:38.263726Z"},"links":{"citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:29b8c84dcfc70f716c74a2373e6efea3826ccb43558b08c834c3f73c1d7ec034","observation_id":"a1327e2c-c0e8-4beb-85d4-dfe89e595765","resolution":{"observed_at":"2026-08-06T21:02:40.180524Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T21:02:38.448293Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-09T00:46:58.233525Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:38.448293Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:8650a030362f6b2a19862e71c44e5d9538ccdcd01d9b114d55341550e2cfb876","observation_id":"e57f1145-b8fc-42c4-bed9-231ca0008c03","resolution":{"observed_at":"2026-08-06T21:02:38.448293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:02:40.160789Z","title":null,"venue":null,"work_id":"1296d730-bf54-4f95-8db5-74cb8b03c8be","year":1960},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-09T00:46:58.233525Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:38.528388Z"},"links":{"citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:4156700ae808891861168cd622642976cdad61d6b8c211fafa2951e99b165f8e","observation_id":"8878cbaa-47b4-4a76-80a2-7262b7f49da0","resolution":{"observed_at":"2026-08-06T21:02:40.165410Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03262","last_updated":"2025-11-10T15:11:13Z","snapshot_observed_at":"2026-08-02T05:27:47.490711Z","submitted_at":"2025-01-04T02:08:06Z","title":"REINFORCE++: Stabilizing Critic-Free Policy Optimization with Global Advantage Normalization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03262","snapshot_observed_at":"2026-08-06T21:02:38.646820Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-09T00:46:58.233525Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:38.646820Z"},"links":{"cited_paper":"/paper/2501.03262","citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:c3493aac91607f2f439c136945913a1c998685d2652feeb111e8fa380ab9cac8","observation_id":"dd28b2ec-b78f-4368-bd84-ba7e374f707d","resolution":{"observed_at":"2026-08-06T21:02:38.646820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-06T21:02:38.664449Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-09T00:46:58.233525Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:38.664449Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:80d108d41970ab97dc6c2f3e74c54705bec4d98c4e68b0c39e5f5454d8063db4","observation_id":"9c259246-689b-4490-928f-5ad5de36cd71","resolution":{"observed_at":"2026-08-06T21:02:38.664449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-06T21:02:38.671165Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-09T00:46:58.233525Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:38.671165Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:948fbe8ed5600728a375ef06c6dfb133dad3c3b4dc202ba92bf90cda7d1d050c","observation_id":"b7e29413-02af-4dc8-8d42-a5e0a05c3671","resolution":{"observed_at":"2026-08-06T21:02:38.671165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:02:38.676052Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-09T00:46:58.233525Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:38.676052Z"},"links":{"citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:61ec8c53ada6ca5b5f6e96d360adf2aa5b3e0b469bfa88a7a69417810506d3a1","observation_id":"f43a6cd5-3164-47a8-a521-720e6188e685","resolution":{"observed_at":"2026-08-06T21:02:38.676052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:02:38.681209Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-09T00:46:58.233525Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:38.681209Z"},"links":{"citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:c61e942f0314aad7d0e164d5fb14a4bffb7e0303102ea2b4626cb97e5034fc3b","observation_id":"12f06d24-1b9c-4673-bf13-d373f5c1b33a","resolution":{"observed_at":"2026-08-06T21:02:38.681209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.03281","last_updated":"2023-08-07T03:52:59Z","snapshot_observed_at":"2026-08-04T23:10:23.964516Z","submitted_at":"2023-08-07T03:52:59Z","title":"Towards General Text Embeddings with Multi-stage Contrastive Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.03281","snapshot_observed_at":"2026-08-06T21:02:38.685458Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-09T00:46:58.233525Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:38.685458Z"},"links":{"cited_paper":"/paper/2308.03281","citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:2c0d54de6f589835ba549fe97f28b39bba984699bf88e0cd7a58a7ca9060eb89","observation_id":"3b8e6642-fd7f-4db2-babd-ce61d14f1753","resolution":{"observed_at":"2026-08-06T21:02:38.685458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10505","last_updated":"2024-05-16T02:22:23Z","snapshot_observed_at":"2026-08-09T00:46:31.152615Z","submitted_at":"2023-10-16T15:25:14Z","title":"ReMax: A Simple, Effective, and Efficient Reinforcement Learning Method for Aligning Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10505","snapshot_observed_at":"2026-08-06T21:02:38.690014Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-09T00:46:58.233525Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:38.690014Z"},"links":{"cited_paper":"/paper/2310.10505","citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:ab91233368033dcff3de9b6fa06adb3b6c9040fced4047eeeb7072bc28304963","observation_id":"6cb29d71-2aa2-4135-8315-01a3eedbb761","resolution":{"observed_at":"2026-08-06T21:02:38.690014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:02:38.694881Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-09T00:46:58.233525Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:38.694881Z"},"links":{"citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:fc584a215eae35af51dc8a013ccd26fc35010acfc0161759d0eb639d43a2ad53","observation_id":"a3d2dc45-2930-4ced-9b96-f57ef3b601f6","resolution":{"observed_at":"2026-08-06T21:02:38.694881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-08-06T21:02:38.699466Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-09T00:46:58.233525Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:38.699466Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:ea5460c1489e6e773dbb625bd651fffe95353e822ef227313c6875701f42c388","observation_id":"806618c4-0cc6-4a35-9b9a-34319bb0c842","resolution":{"observed_at":"2026-08-06T21:02:38.699466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:02:38.704508Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-09T00:46:58.233525Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:38.704508Z"},"links":{"citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:654b388a5238e4ad49b7a90c6032bb4b4331baece81f7d14d7bf033afffbcf64","observation_id":"7586d958-0dc2-4586-9fd6-44af33d8ac51","resolution":{"observed_at":"2026-08-06T21:02:38.704508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.12837","last_updated":"2022-10-20T14:04:10Z","snapshot_observed_at":"2026-08-01T15:23:39.998892Z","submitted_at":"2022-02-25T17:25:19Z","title":"Rethinking the Role of Demonstrations: What Makes In-Context Learning Work?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.12837","snapshot_observed_at":"2026-08-06T21:02:38.709251Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-09T00:46:58.233525Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:38.709251Z"},"links":{"cited_paper":"/paper/2202.12837","citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:aedf1810d9e71eccbfcdec20fcd0de27f328742d4db3a551521528cf93d109d2","observation_id":"07392453-e916-4d8d-8ef8-bc9b199f4f63","resolution":{"observed_at":"2026-08-06T21:02:38.709251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:02:40.125373Z","title":null,"venue":null,"work_id":"ecd38286-03e9-453f-a493-49eba791de09","year":2025},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-09T00:46:58.233525Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:38.713899Z"},"links":{"citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:5f7bc7c33d1e13e41d2b539d2f7ea3a73eaa347591030d8c614f2d2934285f1c","observation_id":"9aeb3252-57f0-4b23-9cf4-20a64e488caa","resolution":{"observed_at":"2026-08-06T21:02:40.129593Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:02:40.111174Z","title":null,"venue":null,"work_id":"2c88482f-ae7a-4e7a-8779-258b2eb409f4","year":2024},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-09T00:46:58.233525Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:38.718779Z"},"links":{"citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:80aa854f012724d0f8ab90de7321d5e7e7e2c6289cc1f6b10f17200825002479","observation_id":"b96b7442-c81b-4c59-80d4-041fdf07e4dd","resolution":{"observed_at":"2026-08-06T21:02:40.115473Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:02:40.096306Z","title":null,"venue":null,"work_id":"c6b5c040-631d-4680-8746-da8a43de407e","year":2021},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-09T00:46:58.233525Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:38.723190Z"},"links":{"citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:71256da40eafe883208c632dbdd5a9c8005d964291d3c994c88b061db147f642","observation_id":"8d6d9956-b807-470b-ad2e-2f02d026acf9","resolution":{"observed_at":"2026-08-06T21:02:40.100897Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T21:02:38.727798Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-09T00:46:58.233525Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:38.727798Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:8e7da7251755760d1ed8bb504ab2cc382fcf6fdcab347263b21407f8fd0d009c","observation_id":"ceacf498-c68d-439d-9547-2842c0e27f5d","resolution":{"observed_at":"2026-08-06T21:02:38.727798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:02:40.080804Z","title":null,"venue":null,"work_id":"3ff80188-cbc9-4a73-97b6-4ca5873fb977","year":2024},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-09T00:46:58.233525Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:38.732475Z"},"links":{"citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:e81d9d6dcb4a665d0987e8a80e872b34b1f6270aab6c982834d68b57ef99d512","observation_id":"f1d61937-ff6d-4540-bd52-7cfa4ed879ee","resolution":{"observed_at":"2026-08-06T21:02:40.085501Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:02:38.736901Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-09T00:46:58.233525Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:38.736901Z"},"links":{"citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:16d58113e3421cdfc01ce4b42eb4f2225560c5ce164f260011891bc786d7685e","observation_id":"04ea2fdc-426e-4521-8c9c-92d6778a9918","resolution":{"observed_at":"2026-08-06T21:02:38.736901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.14289","last_updated":"2021-09-19T04:46:17Z","snapshot_observed_at":"2026-08-09T21:40:02.654691Z","submitted_at":"2021-04-27T19:49:39Z","title":"Multi-class Text Classification using BERT-based Active Learning","version":2},"cited_work":{"arxiv_id":"2104.14289","doi":null,"metadata_source":"pith","pith_arxiv_id":"2104.14289","snapshot_observed_at":"2026-08-06T21:02:39.428255Z","title":"Multi-class Text Classification using BERT-based Active Learning","venue":"cs.IR","work_id":"c696470c-74a2-427d-a8c0-3f11357e3ec8","year":2021},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-09T00:46:58.233525Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:38.741316Z"},"links":{"cited_paper":"/paper/2104.14289","citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:53f09ff8cd69c190d704546344a5777e74075000cdef457c52f9c3ea95621e11","observation_id":"a00037ce-f4da-4fb2-ba28-2a7ffbd0fbe1","resolution":{"observed_at":"2026-08-06T21:02:39.432882Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:02:40.055345Z","title":null,"venue":null,"work_id":"09a77883-92e1-4573-8eb4-ac6ffe0b3c20","year":2022},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-09T00:46:58.233525Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:38.746100Z"},"links":{"citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:af49bd993279c4d49eb7fe57f0ba6bff431f71874c228b2decfa4a21d1ea7398","observation_id":"32ffb3d0-ec8e-4c7b-b520-c4910cf7dc8b","resolution":{"observed_at":"2026-08-06T21:02:40.059976Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-06T21:02:38.750400Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-09T00:46:58.233525Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:38.750400Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:467c01411dc49594f9797f6ddab068906229406a7c09b23d37b9405f770cc0d6","observation_id":"0591341e-520c-4e6c-af89-90d0f5dffecf","resolution":{"observed_at":"2026-08-06T21:02:38.750400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:02:38.754928Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-09T00:46:58.233525Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:38.754928Z"},"links":{"citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:a6b7c7a3c8e6345e72ca1a402102106ccf335f77c659c2419add8812b04e01cf","observation_id":"c7ace076-2e60-4f14-8da7-2890c9818394","resolution":{"observed_at":"2026-08-06T21:02:38.754928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:02:40.031382Z","title":null,"venue":null,"work_id":"5d92f8bc-e44e-45bb-ac31-3ddab8b16e4c","year":2025},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-09T00:46:58.233525Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:38.758816Z"},"links":{"citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:f9d1370dd0ab2f8008cc8e034adae36d90321dfa84a442e84832fac5663285fa","observation_id":"d9babff3-870f-4bcd-b9bc-6ed2395b8610","resolution":{"observed_at":"2026-08-06T21:02:40.035515Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.11455","last_updated":"2019-04-25T16:54:02Z","snapshot_observed_at":"2026-08-09T08:22:39.290723Z","submitted_at":"2019-04-25T16:54:02Z","title":"Ray Interference: a Source of Plateaus in Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.11455","snapshot_observed_at":"2026-08-06T21:02:38.763176Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-09T00:46:58.233525Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:38.763176Z"},"links":{"cited_paper":"/paper/1904.11455","citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:13eefbd640db94398692c18453638459e8dee85123029dcc156a8f9a56ac8c93","observation_id":"2715de2e-6c1d-45f2-ac73-649341fc1bea","resolution":{"observed_at":"2026-08-06T21:02:38.763176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-06T21:02:38.767702Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-09T00:46:58.233525Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:38.767702Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:618d578fc4e5155596af757f9e0fbbdac04071208627862c2e1f98cf00c272f2","observation_id":"7b522326-3a75-4857-915a-6ccf1c508f45","resolution":{"observed_at":"2026-08-06T21:02:38.767702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-06T21:02:38.776906Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-09T00:46:58.233525Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:38.776906Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:f8dc776118176bb76053b33134d68d680477b144686eba1cc7b0046e13b852cd","observation_id":"fdb864e8-2e6b-4ad6-92e9-26720e25ec49","resolution":{"observed_at":"2026-08-06T21:02:38.776906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-08-06T21:02:38.781944Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-09T00:46:58.233525Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:38.781944Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:7fb8f7894cababdd23f1a7c6ad8a758485dd0defa9ac6dba1ea6e4a8c201427f","observation_id":"4571d06d-73c8-4ff6-83e7-161d0e3e36d0","resolution":{"observed_at":"2026-08-06T21:02:38.781944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-06T21:02:38.786360Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-09T00:46:58.233525Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:38.786360Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:a4dd28ae1d3e79f1409cab1256654cf83bfeaa2f51e6092c4a52417d6e665183","observation_id":"042cd7d2-6082-4890-bce1-bb2480a4d2e9","resolution":{"observed_at":"2026-08-06T21:02:38.786360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:02:40.016839Z","title":null,"venue":null,"work_id":"b9ba8c87-ce5e-4b68-bfa6-a29baa30a796","year":1993},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-09T00:46:58.233525Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:38.790628Z"},"links":{"citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:deebb8d60e1ad1dbf4c17e5dec3f91eedc7f37a83847d11e43f7041f72860684","observation_id":"e05d6af9-440d-4d16-bb6d-5ce7cc0b3662","resolution":{"observed_at":"2026-08-06T21:02:40.021093Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-08-06T21:02:38.794746Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-09T00:46:58.233525Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:38.794746Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:2f217d7637b0c065da73b4a2b0fe6bf564ef40b4126d368a0078215f8a527e0b","observation_id":"11905553-2ea7-4744-ad24-d71fc44b1561","resolution":{"observed_at":"2026-08-06T21:02:38.794746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01854","last_updated":"2023-10-03T07:34:30Z","snapshot_observed_at":"2026-08-08T08:22:51.231355Z","submitted_at":"2023-10-03T07:34:30Z","title":"Fine-tuned vs. Prompt-tuned Supervised Representations: Which Better Account for Brain Language Representations?","version":1},"cited_work":{"arxiv_id":"2310.01854","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.01854","snapshot_observed_at":"2026-08-06T21:02:39.290422Z","title":"Fine-tuned vs. Prompt-tuned Supervised Representations: Which Better Account for Brain Language Representations?","venue":"cs.AI","work_id":"a4af2fe4-cc52-4651-a80d-549835d84eed","year":2023},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-09T00:46:58.233525Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:38.799491Z"},"links":{"cited_paper":"/paper/2310.01854","citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:886b33b0b8165264407042f7e3b5e00b1a298ef8f09c4b4ce16d3068f48cc2a6","observation_id":"9e72aea4-7d5f-474f-be6f-67a07e0a119e","resolution":{"observed_at":"2026-08-06T21:02:39.295404Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-06T21:02:38.804100Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-09T00:46:58.233525Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:38.804100Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:0e90a32d1641471d365ebcc2c33f36b1f44b436402e1547adc165aa73949f812","observation_id":"8a02cf4b-ebfd-4335-aac8-44d35fa87c26","resolution":{"observed_at":"2026-08-06T21:02:38.804100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-06T21:02:38.808953Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-09T00:46:58.233525Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:38.808953Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:b18de3273c77a550716b8cc5281f7b7652d8cd5d19de8c265f2db6a993dce9e0","observation_id":"df9f09b6-8183-466e-98d8-68bd965f2c22","resolution":{"observed_at":"2026-08-06T21:02:38.808953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.03893","last_updated":"2023-08-30T03:38:22Z","snapshot_observed_at":"2026-08-07T01:46:48.713323Z","submitted_at":"2023-04-08T02:41:40Z","title":"ChatGPT Empowered Long-Step Robot Control in Various Environments: A Case Application","version":6},"cited_work":{"arxiv_id":"2304.03893","doi":null,"metadata_source":"pith","pith_arxiv_id":"2304.03893","snapshot_observed_at":"2026-08-06T21:02:39.232809Z","title":"ChatGPT Empowered Long-Step Robot Control in Various Environments: A Case Application","venue":"cs.RO","work_id":"86658c33-b3ad-4ce5-a61c-953e75b87207","year":2023},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-09T00:46:58.233525Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:38.813932Z"},"links":{"cited_paper":"/paper/2304.03893","citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:064c2af62668ebace00cc2c33eeb1e5b4aaccf1262c0c1dc7279b34d6341f58e","observation_id":"33e7ef3a-5699-49e0-8229-fa15229b2143","resolution":{"observed_at":"2026-08-06T21:02:39.239638Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.01652","last_updated":"2022-02-08T20:26:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-09-03T17:55:52Z","title":"Finetuned Language Models Are Zero-Shot Learners","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.01652","snapshot_observed_at":"2026-08-06T21:02:38.818681Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-09T00:46:58.233525Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:38.818681Z"},"links":{"cited_paper":"/paper/2109.01652","citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:42bb8b7014bc078ca74c4f957cda0822f1e31b367d519d763d7333f3d278fcbf","observation_id":"5765637a-d77e-4077-9058-a0f4022bc6d1","resolution":{"observed_at":"2026-08-06T21:02:38.818681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:02:40.002232Z","title":null,"venue":null,"work_id":"ce018d36-7ce1-4168-bcc4-7c77cd158d14","year":2022},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-09T00:46:58.233525Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:38.823905Z"},"links":{"citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:6eb03730ac75f62a7c637fb1bf4c1b9695ec67c005f14472225ba75ab01f118f","observation_id":"8e8d32ef-5428-4420-81a6-7d0ec150fb46","resolution":{"observed_at":"2026-08-06T21:02:40.006437Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:02:38.828256Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-09T00:46:58.233525Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:38.828256Z"},"links":{"citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:1f7a3eb3e6f1c74d3443864d49b4c39e69a79a8acf1b0e49dbda4387d441b58f","observation_id":"dd18e72e-1c9a-4bbb-92b7-fee9f47c2141","resolution":{"observed_at":"2026-08-06T21:02:38.828256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14768","last_updated":"2025-02-20T17:49:26Z","snapshot_observed_at":"2026-08-04T12:32:53.090165Z","submitted_at":"2025-02-20T17:49:26Z","title":"Logic-RL: Unleashing LLM Reasoning with Rule-Based Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14768","snapshot_observed_at":"2026-08-06T21:02:38.833031Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-09T00:46:58.233525Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:38.833031Z"},"links":{"cited_paper":"/paper/2502.14768","citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:b9d6eb8a1b46123f39cf667eefd5c0af6eecec4f11aab92d96def26c3f796479","observation_id":"20842445-d568-402d-b50f-703292704157","resolution":{"observed_at":"2026-08-06T21:02:38.833031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:02:39.977446Z","title":null,"venue":null,"work_id":"2024cb05-c6f3-46c4-beaa-08af75b1313d","year":2024},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-09T00:46:58.233525Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:38.837355Z"},"links":{"citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:a7a8a3038d7768e15ea0ab08843e17de98a11424b8d572ccdd5ec1c4da3d7f8b","observation_id":"4dc20609-ed91-4ef5-a216-9aa1bdba487c","resolution":{"observed_at":"2026-08-06T21:02:39.981747Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:02:38.841898Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-09T00:46:58.233525Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:38.841898Z"},"links":{"citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:b3af514cffa44fc9baa8ce548abd1b2bdc4a1ef703248728677367fff309553a","observation_id":"777fff92-f2f1-415f-9946-188530af05c8","resolution":{"observed_at":"2026-08-06T21:02:38.841898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-06T21:02:38.846079Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-09T00:46:58.233525Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:38.846079Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:f65f8c81f3883a91a3f74850483792c6322c3d2f885a12083237792e3ae1a0d8","observation_id":"c1c42d31-9ed7-48d7-8c42-8cefef7bf7ad","resolution":{"observed_at":"2026-08-06T21:02:38.846079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:02:39.952608Z","title":null,"venue":null,"work_id":"f01b1f7e-a55e-48a9-a8f4-aac295a9677b","year":2019},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-09T00:46:58.233525Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:38.851156Z"},"links":{"citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:6e482d798c96571a08a07762505b05e9131bdbed64fe708026dc9f25828cc45f","observation_id":"1bb0e20d-945b-41d7-a4a4-30fc039d6810","resolution":{"observed_at":"2026-08-06T21:02:39.957748Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-06T21:02:38.855807Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-09T00:46:58.233525Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:38.855807Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:20dbb36e731a01d75c152cdedd16c6ddd55162c49716e662646b6dc21525eb9b","observation_id":"48d27688-5e9e-45c2-a2d9-51bd55bfa345","resolution":{"observed_at":"2026-08-06T21:02:38.855807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-08-07T15:57:22.394744Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.00551","snapshot_observed_at":"2026-08-06T21:02:38.860058Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-09T00:46:58.233525Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:38.860058Z"},"links":{"cited_paper":"/paper/2505.00551","citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:a9bcd9cbec62bd666c0b7bef042a4bb979cca515f61ecdca8f09d61bcb0fa3b8","observation_id":"71613651-96da-44e0-bf60-01d6a1a7ebf9","resolution":{"observed_at":"2026-08-06T21:02:38.860058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:02:38.864617Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-09T00:46:58.233525Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:38.864617Z"},"links":{"citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:9c8c6b6d06214f4b75c77443aec2bb68c4ca97618c3f0189edfa732eb6b80870","observation_id":"c0df93c6-3af7-4ce3-ad93-beb0d070b678","resolution":{"observed_at":"2026-08-06T21:02:38.864617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.10625","last_updated":"2023-04-16T22:08:08Z","snapshot_observed_at":"2026-08-06T09:00:42.886249Z","submitted_at":"2022-05-21T15:34:53Z","title":"Least-to-Most Prompting Enables Complex Reasoning in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.10625","snapshot_observed_at":"2026-08-06T21:02:38.868488Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-09T00:46:58.233525Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:38.868488Z"},"links":{"cited_paper":"/paper/2205.10625","citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:a6b7be2846500f11adadbee2c27019ec041eda7c4c00cfb674be34c5496f75ec","observation_id":"6c168912-83aa-46d6-94cc-af00a997d0dd","resolution":{"observed_at":"2026-08-06T21:02:38.868488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:02:38.873273Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-09T00:46:58.233525Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:38.873273Z"},"links":{"citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:8703cfd8dcc868dd96c4c3d144d57ba72b3ab14864fac27a4840d7b3e6d51197","observation_id":"c0586836-fa80-412a-920f-13e07fa9f098","resolution":{"observed_at":"2026-08-06T21:02:38.873273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:02:39.937945Z","title":null,"venue":null,"work_id":"5043bb5d-e271-42a5-b5b2-962eda425875","year":2021},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-09T00:46:58.233525Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:38.877329Z"},"links":{"citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:e453413cc64538ef7b9d958cb2d9beb78c967d0a275418b26b2811bb4437de0e","observation_id":"656c26ef-ca14-4248-8233-0421db02e172","resolution":{"observed_at":"2026-08-06T21:02:39.942268Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:02:38.881524Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-09T00:46:58.233525Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:38.881524Z"},"links":{"citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:e587920895560b7a1e30b499ab33656953b1b1a5374331d3ef7f8d5fc94d1649","observation_id":"1d90440a-2dd7-43ce-8ece-082d594f8f6d","resolution":{"observed_at":"2026-08-06T21:02:38.881524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:02:38.886258Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-09T00:46:58.233525Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:38.886258Z"},"links":{"citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:0d50b07a6b04da054ad1d46002cb04cb6f747bb275500170b62b46abba0c1f39","observation_id":"16f3e57d-a978-4b96-9d35-2180688f1449","resolution":{"observed_at":"2026-08-06T21:02:38.886258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T00:46:58.233525Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy"},"reference_resolution":{"displayed":63,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":60,"verified_exact":3,"verified_fuzzy":0},"total_outbound_references":63},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 63 of 63 outbound references and 0 inbound Pith citation observations for arXiv:2507.01327."}