{"as_of":"2026-08-09T15:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ff51168a40c1d61ed9f07334696f10f8e0b1c86203321dce466179c4104cc974","coverage":[{"denominator":19,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":19,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T07:43:26.153787Z","state":"measured"},{"denominator":21,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":21,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T15:12:55.978703Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-02T03:26:29.328767Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2510.24636","last_updated":"2026-07-01T11:59:43Z","snapshot_observed_at":"2026-08-07T23:16:25.258712Z","submitted_at":"2025-10-28T17:02:46Z","title":"OpenReward: Learning to Reward Long-form Agentic Tasks via Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2510.24636","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.24636","snapshot_observed_at":"2026-07-02T03:26:29.328767Z","title":"OpenReward: Learning to Reward Long-form Agentic Tasks via Reinforcement Learning","venue":"cs.CL","work_id":"cd2b8a5f-5d71-4806-b44e-e889c42f37f7","year":2025},"citing_paper":{"arxiv_id":"2606.03963","last_updated":"2026-06-09T15:09:32Z","snapshot_observed_at":"2026-08-05T23:50:00.007370Z","submitted_at":"2026-06-02T17:50:15Z","title":"AgenticRL: Self-Refining Agentic Reinforcement Learning for Vision-Conditioned UAV Navigation","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-28T10:03:54.185019Z"},"links":{"cited_paper":"/paper/2510.24636","citing_paper":"/paper/2606.03963"},"observation_digest":"sha256:33be5c1c2e25338b1defde4361b3d5162c962cf821fc2032cccaa3d769709131","observation_id":"2fa5c8cd-2e1d-4666-a6ab-e196f6207750","resolution":{"observed_at":"2026-07-02T03:26:29.330841Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.24636","last_updated":"2026-07-01T11:59:43Z","snapshot_observed_at":"2026-08-07T23:16:25.258712Z","submitted_at":"2025-10-28T17:02:46Z","title":"OpenReward: Learning to Reward Long-form Agentic Tasks via Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.24636","snapshot_observed_at":"2026-08-04T15:12:55.978703Z","title":"2025 , archivePrefix =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02097","last_updated":"2026-08-03T11:58:21Z","snapshot_observed_at":"2026-08-09T08:55:51.965628Z","submitted_at":"2026-08-03T11:58:21Z","title":"Fetch-then-Explore: Decoupling Selection from Extraction over a Persistent Workspace for Search Agents","version":1},"reference_index":174,"source":"arxiv_source","source_observed_at":"2026-08-04T15:12:55.978703Z"},"links":{"cited_paper":"/paper/2510.24636","citing_paper":"/paper/2608.02097"},"observation_digest":"sha256:7701205be84c4a48874531b412cb842fa7d4204b4cb632c669e2228f0becf259","observation_id":"f31f01ec-4405-47ac-808b-e0a1c6ec45da","resolution":{"observed_at":"2026-08-04T15:12:55.978703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2510.24636/citation-record","integrity":"/paper/2510.24636/integrity","json":"/paper/2510.24636/citation-record.json","paper":"/paper/2510.24636"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2407.18940","last_updated":"2024-10-16T18:37:15Z","snapshot_observed_at":"2026-08-05T11:52:00.055185Z","submitted_at":"2024-07-10T18:00:03Z","title":"LitSearch: A Retrieval Benchmark for Scientific Literature Search","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.18940","snapshot_observed_at":"2026-08-04T07:43:23.166612Z","title":"Lit- search: A retrieval benchmark for scientific literature search.arXiv preprint arXiv:2407.18940,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.24636","last_updated":"2026-07-01T11:59:43Z","snapshot_observed_at":"2026-08-07T23:16:25.258712Z","submitted_at":"2025-10-28T17:02:46Z","title":"OpenReward: Learning to Reward Long-form Agentic Tasks via Reinforcement Learning","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T07:43:23.166612Z"},"links":{"cited_paper":"/paper/2407.18940","citing_paper":"/paper/2510.24636"},"observation_digest":"sha256:c9fba17317cd026cc87120131edb1bc68c81cba374f9465011fe14ee5d53c391","observation_id":"4017fda2-d60e-4662-ab92-ced0d4c72468","resolution":{"observed_at":"2026-08-04T07:43:23.166612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01377","last_updated":"2024-07-16T03:24:39Z","snapshot_observed_at":"2026-08-02T07:46:40.319683Z","submitted_at":"2023-10-02T17:40:01Z","title":"UltraFeedback: Boosting Language Models with Scaled AI Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01377","snapshot_observed_at":"2026-08-04T07:43:23.842667Z","title":"Ultrafeedback: Boosting language models with scaled ai feedback.arXiv preprint arXiv:2310.01377,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.24636","last_updated":"2026-07-01T11:59:43Z","snapshot_observed_at":"2026-08-07T23:16:25.258712Z","submitted_at":"2025-10-28T17:02:46Z","title":"OpenReward: Learning to Reward Long-form Agentic Tasks via Reinforcement Learning","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T07:43:23.842667Z"},"links":{"cited_paper":"/paper/2310.01377","citing_paper":"/paper/2510.24636"},"observation_digest":"sha256:9156fba1d6e858bca6a6bb2f27071aca81f086f460c2668b54049d2374396143","observation_id":"a669659d-eb68-4d3f-b5f3-51fdfb80fb1c","resolution":{"observed_at":"2026-08-04T07:43:23.842667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15594","last_updated":"2025-10-19T10:32:43Z","snapshot_observed_at":"2026-08-02T10:23:50.881300Z","submitted_at":"2024-11-23T16:03:35Z","title":"A Survey on LLM-as-a-Judge","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15594","snapshot_observed_at":"2026-08-04T07:43:23.975882Z","title":"A survey on llm-as-a-judge.arXiv preprint arXiv:2411.15594,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.24636","last_updated":"2026-07-01T11:59:43Z","snapshot_observed_at":"2026-08-07T23:16:25.258712Z","submitted_at":"2025-10-28T17:02:46Z","title":"OpenReward: Learning to Reward Long-form Agentic Tasks via Reinforcement Learning","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T07:43:23.975882Z"},"links":{"cited_paper":"/paper/2411.15594","citing_paper":"/paper/2510.24636"},"observation_digest":"sha256:76c611fe157a7fb3bfcc24641267032e2f64a3ba269a4322bc3975b876d1862c","observation_id":"0d203271-3140-4f3f-baaa-ff3b3defe4d4","resolution":{"observed_at":"2026-08-04T07:43:23.975882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-07T23:14:31.982740Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14674","snapshot_observed_at":"2026-08-04T07:43:24.151892Z","title":"Reward reasoning model.arXiv preprint arXiv:2505.14674,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.24636","last_updated":"2026-07-01T11:59:43Z","snapshot_observed_at":"2026-08-07T23:16:25.258712Z","submitted_at":"2025-10-28T17:02:46Z","title":"OpenReward: Learning to Reward Long-form Agentic Tasks via Reinforcement Learning","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T07:43:24.151892Z"},"links":{"cited_paper":"/paper/2505.14674","citing_paper":"/paper/2510.24636"},"observation_digest":"sha256:fbc7c2f6839fa86893b6bc5cf5cfc15dd34448c42cf721637f00dd016f830c1e","observation_id":"c37af3d7-af75-4336-af67-24164bd603c7","resolution":{"observed_at":"2026-08-04T07:43:24.151892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-04T07:43:24.321802Z","title":"Gpt-4o system card.arXiv preprint arXiv:2410.21276,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.24636","last_updated":"2026-07-01T11:59:43Z","snapshot_observed_at":"2026-08-07T23:16:25.258712Z","submitted_at":"2025-10-28T17:02:46Z","title":"OpenReward: Learning to Reward Long-form Agentic Tasks via Reinforcement Learning","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T07:43:24.321802Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2510.24636"},"observation_digest":"sha256:d5777b536d7d8a177215500e651a7f249f964bfc7ba27d42de4fc98b221f3bd0","observation_id":"4536026d-9fbc-432f-ab63-f788f4e274dd","resolution":{"observed_at":"2026-08-04T07:43:24.321802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09516","last_updated":"2025-08-05T19:08:38Z","snapshot_observed_at":"2026-07-06T20:51:28.022519Z","submitted_at":"2025-03-12T16:26:39Z","title":"Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09516","snapshot_observed_at":"2026-08-04T07:43:24.471106Z","title":"Search-r1: Training llms to reason and leverage search engines with reinforcement learning.arXiv preprint arXiv:2503.09516,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.24636","last_updated":"2026-07-01T11:59:43Z","snapshot_observed_at":"2026-08-07T23:16:25.258712Z","submitted_at":"2025-10-28T17:02:46Z","title":"OpenReward: Learning to Reward Long-form Agentic Tasks via Reinforcement Learning","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T07:43:24.471106Z"},"links":{"cited_paper":"/paper/2503.09516","citing_paper":"/paper/2510.24636"},"observation_digest":"sha256:26cdf2cc2b3d7a7140f1e01d7e8097f91de2bebc5fdd1ca4547f5726de1b1bea","observation_id":"9c9888e2-16e0-4a62-a3a7-75b701758423","resolution":{"observed_at":"2026-08-04T07:43:24.471106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13787","last_updated":"2024-06-08T16:40:12Z","snapshot_observed_at":"2026-08-02T18:11:57.036767Z","submitted_at":"2024-03-20T17:49:54Z","title":"RewardBench: Evaluating Reward Models for Language Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13787","snapshot_observed_at":"2026-08-04T07:43:24.665067Z","title":"Rewardbench: Evaluating reward models for language modeling.arXiv preprint arXiv:2403.13787,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.24636","last_updated":"2026-07-01T11:59:43Z","snapshot_observed_at":"2026-08-07T23:16:25.258712Z","submitted_at":"2025-10-28T17:02:46Z","title":"OpenReward: Learning to Reward Long-form Agentic Tasks via Reinforcement Learning","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T07:43:24.665067Z"},"links":{"cited_paper":"/paper/2403.13787","citing_paper":"/paper/2510.24636"},"observation_digest":"sha256:9611b8dc0463d0a383cbff2a1d88b46b7ce45669ca6459016480f8d0130bac5f","observation_id":"bb48b874-e55b-4f2c-8572-c3f6a9ed6cb4","resolution":{"observed_at":"2026-08-04T07:43:24.665067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05579","last_updated":"2024-12-10T05:49:12Z","snapshot_observed_at":"2026-07-31T01:42:39.468673Z","submitted_at":"2024-12-07T08:07:24Z","title":"LLMs-as-Judges: A Comprehensive Survey on LLM-based Evaluation Methods","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05579","snapshot_observed_at":"2026-08-04T07:43:24.808467Z","title":"Llms-as-judges: a comprehensive survey on llm-based evaluation methods.arXiv preprint arXiv:2412.05579, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.24636","last_updated":"2026-07-01T11:59:43Z","snapshot_observed_at":"2026-08-07T23:16:25.258712Z","submitted_at":"2025-10-28T17:02:46Z","title":"OpenReward: Learning to Reward Long-form Agentic Tasks via Reinforcement Learning","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T07:43:24.808467Z"},"links":{"cited_paper":"/paper/2412.05579","citing_paper":"/paper/2510.24636"},"observation_digest":"sha256:3819872dd8dcc23e60b2c273057e787b4a744ab628b5f6d0cd112e74598e76e0","observation_id":"2ec46496-2ed5-4882-87c3-f8db1312b954","resolution":{"observed_at":"2026-08-04T07:43:24.808467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-04T07:43:24.944019Z","title":"Deepseek-v3 technical report.arXiv preprint arXiv:2412.19437, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.24636","last_updated":"2026-07-01T11:59:43Z","snapshot_observed_at":"2026-08-07T23:16:25.258712Z","submitted_at":"2025-10-28T17:02:46Z","title":"OpenReward: Learning to Reward Long-form Agentic Tasks via Reinforcement Learning","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T07:43:24.944019Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2510.24636"},"observation_digest":"sha256:bef3ea963e503865ebeccdf3c8c7d176f90b597d255f904dfeb1bd73f633905d","observation_id":"76c6d061-bfe2-4bd6-bed9-7a813641a7a9","resolution":{"observed_at":"2026-08-04T07:43:24.944019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.01488","last_updated":"2022-07-10T17:28:51Z","snapshot_observed_at":"2026-08-04T03:36:33.710054Z","submitted_at":"2021-12-02T18:38:50Z","title":"ColBERTv2: Effective and Efficient Retrieval via Lightweight Late Interaction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.01488","snapshot_observed_at":"2026-08-04T07:43:25.107788Z","title":"Colbertv2: Effective and efficient retrieval via lightweight late interaction.arXiv preprint arXiv:2112.01488,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.24636","last_updated":"2026-07-01T11:59:43Z","snapshot_observed_at":"2026-08-07T23:16:25.258712Z","submitted_at":"2025-10-28T17:02:46Z","title":"OpenReward: Learning to Reward Long-form Agentic Tasks via Reinforcement Learning","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T07:43:25.107788Z"},"links":{"cited_paper":"/paper/2112.01488","citing_paper":"/paper/2510.24636"},"observation_digest":"sha256:527d76161e2d8fe9866f323abdb5c4f45387744eef320a93ebb018ecd31c438c","observation_id":"0825a5ca-74e1-48e8-97be-1945e1419bf0","resolution":{"observed_at":"2026-08-04T07:43:25.107788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:43:25.470188Z","title":"Lianmin Zheng, Wei-Lin Chiang, Ying Sheng, Siyuan Zhuang, Zhanghao Wu, Yonghao Zhuang, Zi Lin, Zhuohan Li, Dacheng Li, Eric Xing, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.24636","last_updated":"2026-07-01T11:59:43Z","snapshot_observed_at":"2026-08-07T23:16:25.258712Z","submitted_at":"2025-10-28T17:02:46Z","title":"OpenReward: Learning to Reward Long-form Agentic Tasks via Reinforcement Learning","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T07:43:25.470188Z"},"links":{"citing_paper":"/paper/2510.24636"},"observation_digest":"sha256:0e8b35c7d4cac6d769ede779cc7733966a42f9ea73b6787a43d9875f3f4abdf1","observation_id":"df821748-0ef0-4ed6-a211-7d8dc675b0d9","resolution":{"observed_at":"2026-08-04T07:43:25.470188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.03160","last_updated":"2025-04-17T04:46:08Z","snapshot_observed_at":"2026-07-06T21:04:06.413573Z","submitted_at":"2025-04-04T04:41:28Z","title":"DeepResearcher: Scaling Deep Research via Reinforcement Learning in Real-world Environments","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.03160","snapshot_observed_at":"2026-08-04T07:43:25.595789Z","title":"Deepresearcher: Scaling deep research via reinforcement learning in real-world environ- ments.arXiv preprint arXiv:2504.03160,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.24636","last_updated":"2026-07-01T11:59:43Z","snapshot_observed_at":"2026-08-07T23:16:25.258712Z","submitted_at":"2025-10-28T17:02:46Z","title":"OpenReward: Learning to Reward Long-form Agentic Tasks via Reinforcement Learning","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T07:43:25.595789Z"},"links":{"cited_paper":"/paper/2504.03160","citing_paper":"/paper/2510.24636"},"observation_digest":"sha256:35b71cdc725e82dd8e8c57608dfad98616d3f3ff3a87f4f6e17a92efb513914a","observation_id":"620c362c-7cd2-42bc-ab82-327944e133cc","resolution":{"observed_at":"2026-08-04T07:43:25.595789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.08569","last_updated":"2025-03-11T15:59:43Z","snapshot_observed_at":"2026-08-07T17:12:32.675735Z","submitted_at":"2025-03-11T15:59:43Z","title":"DeepReview: Improving LLM-based Paper Review with Human-like Deep Thinking Process","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.08569","snapshot_observed_at":"2026-08-04T07:43:25.717056Z","title":"Deepreview: Improving llm-based paper review with human-like deep thinking process.arXiv preprint arXiv:2503.08569,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.24636","last_updated":"2026-07-01T11:59:43Z","snapshot_observed_at":"2026-08-07T23:16:25.258712Z","submitted_at":"2025-10-28T17:02:46Z","title":"OpenReward: Learning to Reward Long-form Agentic Tasks via Reinforcement Learning","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T07:43:25.717056Z"},"links":{"cited_paper":"/paper/2503.08569","citing_paper":"/paper/2510.24636"},"observation_digest":"sha256:5b5f3421b86ebd4c49245bc7a4d7bb718a4d35cf25ccc1dfaca70a2ed9dc8616","observation_id":"5494b6d3-cc63-4ce5-aa65-7cff8bc3b62f","resolution":{"observed_at":"2026-08-04T07:43:25.717056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16084","last_updated":"2025-06-30T15:59:26Z","snapshot_observed_at":"2026-07-06T21:13:13.686703Z","submitted_at":"2025-04-22T17:59:56Z","title":"TTRL: Test-Time Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16084","snapshot_observed_at":"2026-08-04T07:43:25.904052Z","title":"Ttrl: Test-time reinforcement learning.arXiv preprint arXiv:2504.16084,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.24636","last_updated":"2026-07-01T11:59:43Z","snapshot_observed_at":"2026-08-07T23:16:25.258712Z","submitted_at":"2025-10-28T17:02:46Z","title":"OpenReward: Learning to Reward Long-form Agentic Tasks via Reinforcement Learning","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T07:43:25.904052Z"},"links":{"cited_paper":"/paper/2504.16084","citing_paper":"/paper/2510.24636"},"observation_digest":"sha256:507b43c5615070f3938f17dded649fd6d25947b9daa139e6930eb0de12ae28ea","observation_id":"9154d8a7-6529-4d91-a2b9-cbb063127e87","resolution":{"observed_at":"2026-08-04T07:43:25.904052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:43:26.153787Z","title":"<search>","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.24636","last_updated":"2026-07-01T11:59:43Z","snapshot_observed_at":"2026-08-07T23:16:25.258712Z","submitted_at":"2025-10-28T17:02:46Z","title":"OpenReward: Learning to Reward Long-form Agentic Tasks via Reinforcement Learning","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T07:43:26.153787Z"},"links":{"citing_paper":"/paper/2510.24636"},"observation_digest":"sha256:3bd76112931b9473c1d6b306e56201789e1c89c13bec967b26d36c552b9500a2","observation_id":"d1803f90-09a4-43e3-9cd1-ab8b8054d950","resolution":{"observed_at":"2026-08-04T07:43:26.153787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-04T07:43:25.323549Z","title":"Deepseekmath: Pushing the limits of mathemati- cal reasoning in open language models.arXiv preprint arXiv:2402.03300,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.24636","last_updated":"2026-07-01T11:59:43Z","snapshot_observed_at":"2026-08-07T23:16:25.258712Z","submitted_at":"2025-10-28T17:02:46Z","title":"OpenReward: Learning to Reward Long-form Agentic Tasks via Reinforcement Learning","version":3},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-04T07:43:25.323549Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2510.24636"},"observation_digest":"sha256:6b25cd4e92375e843f894d1029557868cc9ba31d309b2b81f836564eb4e0576f","observation_id":"0e72a6e3-9c4c-430a-b864-1cc7972b1e72","resolution":{"observed_at":"2026-08-04T07:43:25.323549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-08-04T07:43:23.625509Z","title":"Gemini 2.5: Pushing the frontier with advanced reasoning, multimodality, long context, and next generation agentic capa- bilities.arXiv preprint arXiv:2507.06261,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.24636","last_updated":"2026-07-01T11:59:43Z","snapshot_observed_at":"2026-08-07T23:16:25.258712Z","submitted_at":"2025-10-28T17:02:46Z","title":"OpenReward: Learning to Reward Long-form Agentic Tasks via Reinforcement Learning","version":3},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-04T07:43:23.625509Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2510.24636"},"observation_digest":"sha256:1c664413e9fd62e7ca2b3308e1752d944487f0099c7ef2f5d1be2a967624eaa3","observation_id":"fe62aaab-6e99-4cff-a2d1-4f62d6b61ad2","resolution":{"observed_at":"2026-08-04T07:43:23.625509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:43:23.483080Z","title":"Judgelrm: Large reasoning models as a judge.arXiv preprint arXiv:2504.00050, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.24636","last_updated":"2026-07-01T11:59:43Z","snapshot_observed_at":"2026-08-07T23:16:25.258712Z","submitted_at":"2025-10-28T17:02:46Z","title":"OpenReward: Learning to Reward Long-form Agentic Tasks via Reinforcement Learning","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-04T07:43:23.483080Z"},"links":{"citing_paper":"/paper/2510.24636"},"observation_digest":"sha256:c8d23fe48e1065d8b4e4f21092ece3c8d441df3d56ffee130a32aacd38c44018","observation_id":"277f7038-62bf-4de2-9117-c86f581cb9d5","resolution":{"observed_at":"2026-08-04T07:43:23.483080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.08069","last_updated":"2024-09-12T14:24:45Z","snapshot_observed_at":"2026-07-06T19:14:21.092302Z","submitted_at":"2024-09-12T14:24:45Z","title":"TravelAgent: An AI Assistant for Personalized Travel Planning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.08069","snapshot_observed_at":"2026-08-04T07:43:23.344859Z","title":"Travelagent: An ai assistant for personalized travel planning.arXiv preprint arXiv:2409.08069,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.24636","last_updated":"2026-07-01T11:59:43Z","snapshot_observed_at":"2026-08-07T23:16:25.258712Z","submitted_at":"2025-10-28T17:02:46Z","title":"OpenReward: Learning to Reward Long-form Agentic Tasks via Reinforcement Learning","version":3},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-04T07:43:23.344859Z"},"links":{"cited_paper":"/paper/2409.08069","citing_paper":"/paper/2510.24636"},"observation_digest":"sha256:c1ec5c87e8f84c838eb40a56b251dbdc7886a3b88603f922fec2846060598a7e","observation_id":"6210a4bb-f318-477e-b054-a9acfed1291d","resolution":{"observed_at":"2026-08-04T07:43:23.344859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2510.24636","last_updated":"2026-07-01T11:59:43Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T23:16:25.258712Z","submitted_at":"2025-10-28T17:02:46Z","title":"OpenReward: Learning to Reward Long-form Agentic Tasks via Reinforcement Learning"},"reference_resolution":{"displayed":19,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":19,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":19},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 19 of 19 outbound references and 2 inbound Pith citation observations for arXiv:2510.24636."}