{"as_of":"2026-08-17T18:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:97e492bcd9fb900caea4a260a29bb964e048930eab6b00a2c49d1f71090ab6c6","coverage":[{"denominator":14,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":14,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:22:07.387448Z","state":"measured"},{"denominator":17,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":17,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T05:05:24.654803Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-08T05:05:25.028535Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.08379","last_updated":"2025-06-10T02:43:47Z","snapshot_observed_at":"2026-08-15T18:41:58.261543Z","submitted_at":"2025-06-10T02:43:47Z","title":"Reinforce LLM Reasoning through Multi-Agent Reflection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.08379","snapshot_observed_at":"2026-08-04T06:40:27.178080Z","title":"Reinforce llm reasoning through multi-agent reflection.ArXiv, abs/2506.08379, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.10739","last_updated":"2026-08-03T08:17:50Z","snapshot_observed_at":"2026-08-16T02:54:35.299466Z","submitted_at":"2025-12-11T15:26:28Z","title":"Intern-S1-MO: Long-horizon Reasoning Agent for Olympiad?Level Mathematical Problem Solving","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-04T06:40:27.178080Z"},"links":{"cited_paper":"/paper/2506.08379","citing_paper":"/paper/2512.10739"},"observation_digest":"sha256:ba03e7d7f8443a7214804b325648360230c997543fa6e7f3609584bc3709795b","observation_id":"955d0567-4898-445d-a39e-c52286bacebd","resolution":{"observed_at":"2026-08-04T06:40:27.178080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08379","last_updated":"2025-06-10T02:43:47Z","snapshot_observed_at":"2026-08-15T18:41:58.261543Z","submitted_at":"2025-06-10T02:43:47Z","title":"Reinforce LLM Reasoning through Multi-Agent Reflection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.08379","snapshot_observed_at":"2026-08-01T23:34:09.797820Z","title":"Reinforce LLM reasoning through multi-agent reflection.arXiv preprint arXiv:2506.08379, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15388","last_updated":"2026-07-16T18:38:10Z","snapshot_observed_at":"2026-08-07T11:47:55.675443Z","submitted_at":"2026-07-16T18:38:10Z","title":"Precise but Uncoupled: Reviewer Precision Does Not Guarantee Critique Uptake in Multi-Agent Math Reasoning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-01T23:34:09.797820Z"},"links":{"cited_paper":"/paper/2506.08379","citing_paper":"/paper/2607.15388"},"observation_digest":"sha256:f32b3edbd74a61d2201e766d99a7722d245de48ed9ac44c3e830153e47907b29","observation_id":"7dbf8087-3485-4e26-9fd2-531ae83c4e6d","resolution":{"observed_at":"2026-08-01T23:34:09.797820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08379","last_updated":"2025-06-10T02:43:47Z","snapshot_observed_at":"2026-08-15T18:41:58.261543Z","submitted_at":"2025-06-10T02:43:47Z","title":"Reinforce LLM Reasoning through Multi-Agent Reflection","version":1},"cited_work":{"arxiv_id":"2506.08379","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.08379","snapshot_observed_at":"2026-08-08T05:05:25.028535Z","title":"Reinforce LLM Reasoning through Multi-Agent Reflection","venue":"cs.LG","work_id":"4db7948b-875f-4ad3-9df0-cb0e0c49c5d8","year":2025},"citing_paper":{"arxiv_id":"2608.05643","last_updated":"2026-08-06T06:38:37Z","snapshot_observed_at":"2026-08-15T13:27:03.557074Z","submitted_at":"2026-08-06T06:38:37Z","title":"Refining Over Resampling: Test-Time Self-Correction for LLM Reasoning","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-08T05:05:24.654803Z"},"links":{"cited_paper":"/paper/2506.08379","citing_paper":"/paper/2608.05643"},"observation_digest":"sha256:56ad00ee69a8b8b2bb492935ae459616caa6cc997d3136b86c12d8c16feeea4b","observation_id":"6c346b48-8005-4431-adde-304cc1ceb99b","resolution":{"observed_at":"2026-08-08T05:05:25.034076Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.08379/citation-record","integrity":"/paper/2506.08379/integrity","json":"/paper/2506.08379/citation-record.json","paper":"/paper/2506.08379"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:07.633065Z","title":"Therefore,A bπ h(sh, ah) = eAbπ h(sh, ah)","venue":null,"work_id":"1e7af195-d1b8-4a2e-8c2f-5987c1309231","year":null},"citing_paper":{"arxiv_id":"2506.08379","last_updated":"2025-06-10T02:43:47Z","snapshot_observed_at":"2026-08-15T18:41:58.261543Z","submitted_at":"2025-06-10T02:43:47Z","title":"Reinforce LLM Reasoning through Multi-Agent Reflection","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T05:22:07.370780Z"},"links":{"citing_paper":"/paper/2506.08379"},"observation_digest":"sha256:7925cc1cb7135d8068caa3a86b4be6dad481373393a9d65d6d90e16f7fb9d889","observation_id":"0efa096b-d473-4a1e-87af-bf49807045c3","resolution":{"observed_at":"2026-08-07T05:22:07.636610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:07.622104Z","title":"We define the approximation error: ∆ =E sh∼dπ⋆ h ,ah∼π⋆(·|sh)[Aˆπ h(sh, ah)− eAˆπ h(sh, ah)]","venue":null,"work_id":"e1644707-c439-4ce8-806a-d736164a20f4","year":null},"citing_paper":{"arxiv_id":"2506.08379","last_updated":"2025-06-10T02:43:47Z","snapshot_observed_at":"2026-08-15T18:41:58.261543Z","submitted_at":"2025-06-10T02:43:47Z","title":"Reinforce LLM Reasoning through Multi-Agent Reflection","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T05:22:07.375406Z"},"links":{"citing_paper":"/paper/2506.08379"},"observation_digest":"sha256:7ba01c8823a839e3eea79fcc25551b89e4375a174987c185025a9969c204a1bd","observation_id":"96680339-25da-4c3e-8ee3-c0be6630f002","resolution":{"observed_at":"2026-08-07T05:22:07.626156Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01306","last_updated":"2024-11-19T18:12:45Z","snapshot_observed_at":"2026-08-17T15:29:47.883677Z","submitted_at":"2024-02-02T10:53:36Z","title":"KTO: Model Alignment as Prospect Theoretic Optimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01306","snapshot_observed_at":"2026-08-07T05:22:07.342330Z","title":"Kawin Ethayarajh, Winnie Xu, Niklas Muennighoff, Dan Jurafsky, and Douwe Kiela","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08379","last_updated":"2025-06-10T02:43:47Z","snapshot_observed_at":"2026-08-15T18:41:58.261543Z","submitted_at":"2025-06-10T02:43:47Z","title":"Reinforce LLM Reasoning through Multi-Agent Reflection","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T05:22:07.342330Z"},"links":{"cited_paper":"/paper/2402.01306","citing_paper":"/paper/2506.08379"},"observation_digest":"sha256:92891378a6d8aa27924373513540f3547e7dbbcad340d20f4931fb80b8e0de22","observation_id":"29f7abc9-e6cb-45a5-b0d2-b9f06bb93792","resolution":{"observed_at":"2026-08-07T05:22:07.342330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.07411","last_updated":"2023-08-14T18:58:00Z","snapshot_observed_at":"2026-08-16T15:08:32.520430Z","submitted_at":"2023-08-14T18:58:00Z","title":"Exploring the Intersection of Large Language Models and Agent-Based Modeling via Prompt Engineering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.07411","snapshot_observed_at":"2026-08-07T05:22:07.351003Z","title":"Edward Junprung","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08379","last_updated":"2025-06-10T02:43:47Z","snapshot_observed_at":"2026-08-15T18:41:58.261543Z","submitted_at":"2025-06-10T02:43:47Z","title":"Reinforce LLM Reasoning through Multi-Agent Reflection","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T05:22:07.351003Z"},"links":{"cited_paper":"/paper/2308.07411","citing_paper":"/paper/2506.08379"},"observation_digest":"sha256:4fd4c83727d96a4697d0b6136634e87bf303729549bcb5ef859502e917365165","observation_id":"de8cb2d5-ef93-44b2-81b2-f1841bd337c0","resolution":{"observed_at":"2026-08-07T05:22:07.351003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14830","last_updated":"2024-02-16T23:44:38Z","snapshot_observed_at":"2026-08-16T14:17:49.494789Z","submitted_at":"2024-02-16T23:44:38Z","title":"Orca-Math: Unlocking the potential of SLMs in Grade School Math","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14830","snapshot_observed_at":"2026-08-07T05:22:07.355124Z","title":"Arindam Mitra, Hamed Khanpour, Corby Rosset, and Ahmed Awadallah","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08379","last_updated":"2025-06-10T02:43:47Z","snapshot_observed_at":"2026-08-15T18:41:58.261543Z","submitted_at":"2025-06-10T02:43:47Z","title":"Reinforce LLM Reasoning through Multi-Agent Reflection","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T05:22:07.355124Z"},"links":{"cited_paper":"/paper/2402.14830","citing_paper":"/paper/2506.08379"},"observation_digest":"sha256:68f8f7c23d7903eae4a9f070b75d58e79cbc07c5651fbe0e2005898891aa5cba","observation_id":"128492c0-5a34-4de2-9ffd-649a728ba6c9","resolution":{"observed_at":"2026-08-07T05:22:07.355124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.naacl-long.327","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"doi: 10.18653/v1/2024.naacl-long.327","venue":null,"work_id":"39f8402e-efc1-4cb8-95bc-fd14e6e5ccf8","year":2024},"citing_paper":{"arxiv_id":"2506.08379","last_updated":"2025-06-10T02:43:47Z","snapshot_observed_at":"2026-08-15T18:41:58.261543Z","submitted_at":"2025-06-10T02:43:47Z","title":"Reinforce LLM Reasoning through Multi-Agent Reflection","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T05:22:07.359532Z"},"links":{"citing_paper":"/paper/2506.08379"},"observation_digest":"sha256:06bac643592a418daf53b4cc1db7f769ad98642fde8c3ceb484b0004e124a2b7","observation_id":"c17167c2-90f9-431c-b86b-656d2be58f56","resolution":{"observed_at":"2026-08-07T05:22:07.418364Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15240","last_updated":"2025-02-22T10:21:46Z","snapshot_observed_at":"2026-08-17T07:45:48.419891Z","submitted_at":"2024-08-27T17:57:45Z","title":"Generative Verifiers: Reward Modeling as Next-Token Prediction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15240","snapshot_observed_at":"2026-08-07T05:22:07.366793Z","title":"Qbπ h(sh, ah)−βlog bπ(ah |s h) πref (ah |s h) +c(s h) 2# From Assumption 1, we have Esh∼dπ⋆ h ,ah∼π⋆(·|sh)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08379","last_updated":"2025-06-10T02:43:47Z","snapshot_observed_at":"2026-08-15T18:41:58.261543Z","submitted_at":"2025-06-10T02:43:47Z","title":"Reinforce LLM Reasoning through Multi-Agent Reflection","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T05:22:07.366793Z"},"links":{"cited_paper":"/paper/2408.15240","citing_paper":"/paper/2506.08379"},"observation_digest":"sha256:2c83288eb66f336118af14173d526b39ad416e29e01671c1c95398ee8b7f2a7c","observation_id":"04895f0d-918d-435f-bbd9-98701affebb3","resolution":{"observed_at":"2026-08-07T05:22:07.366793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:07.611399Z","title":"Therefore, Eah∼π⋆(·|sh)[Aˆπ h(sh, ah)]≈E ah∼π⋆(·|sh)[Aπ⋆ h (sh, ah)] = 0, where the last equality follows from the definition ofA π h","venue":null,"work_id":"bd9adb4c-62b2-4065-befb-24a96aa0889d","year":2023},"citing_paper":{"arxiv_id":"2506.08379","last_updated":"2025-06-10T02:43:47Z","snapshot_observed_at":"2026-08-15T18:41:58.261543Z","submitted_at":"2025-06-10T02:43:47Z","title":"Reinforce LLM Reasoning through Multi-Agent Reflection","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T05:22:07.379886Z"},"links":{"citing_paper":"/paper/2506.08379"},"observation_digest":"sha256:1030d027c6a24b4b20f37a6722a6d5ca0b2887f7e5259b1fd74c6e6dfbd187d6","observation_id":"3b29a631-cbcb-498a-b6c3-87ff39f65aaf","resolution":{"observed_at":"2026-08-07T05:22:07.615127Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:07.599253Z","title":"We then conduct DPO training on the critic, producing a refined critic modelbπc","venue":null,"work_id":"cb9b9895-a05c-4c01-a45b-307f2cd101cd","year":null},"citing_paper":{"arxiv_id":"2506.08379","last_updated":"2025-06-10T02:43:47Z","snapshot_observed_at":"2026-08-15T18:41:58.261543Z","submitted_at":"2025-06-10T02:43:47Z","title":"Reinforce LLM Reasoning through Multi-Agent Reflection","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T05:22:07.383889Z"},"links":{"citing_paper":"/paper/2506.08379"},"observation_digest":"sha256:bfc773c370b94c7dff5f86708ee856908ebf5ffe0660ca9c80911435d576e0d3","observation_id":"24cc874b-469e-4ca7-a8c1-920f6ffd2753","resolution":{"observed_at":"2026-08-07T05:22:07.603927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:07.588581Z","title":null,"venue":null,"work_id":"459dafaa-9575-42a4-a55b-02e03827d7b0","year":null},"citing_paper":{"arxiv_id":"2506.08379","last_updated":"2025-06-10T02:43:47Z","snapshot_observed_at":"2026-08-15T18:41:58.261543Z","submitted_at":"2025-06-10T02:43:47Z","title":"Reinforce LLM Reasoning through Multi-Agent Reflection","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T05:22:07.387448Z"},"links":{"citing_paper":"/paper/2506.08379"},"observation_digest":"sha256:d42177e4818f5dc15c36b922e8fe107ead57e46e76948bce925ade59de5ef9da","observation_id":"030ab3c0-e20e-45e7-acd2-6ac2a409e09c","resolution":{"observed_at":"2026-08-07T05:22:07.592010Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:07.338683Z","title":"Justin Chih-Yao Chen, Archiki Prasad, Swarnadeep Saha, Elias Stengel-Eskin, and Mohit Bansal","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08379","last_updated":"2025-06-10T02:43:47Z","snapshot_observed_at":"2026-08-15T18:41:58.261543Z","submitted_at":"2025-06-10T02:43:47Z","title":"Reinforce LLM Reasoning through Multi-Agent Reflection","version":1},"reference_index":862,"source":"pdf_text","source_observed_at":"2026-08-07T05:22:07.338683Z"},"links":{"citing_paper":"/paper/2506.08379"},"observation_digest":"sha256:d0a80ab4b1277a87ec1520620ce61befea17090efcbfc508528061501b89352e","observation_id":"7ace3744-985c-44d5-9248-4b73b41540d4","resolution":{"observed_at":"2026-08-07T05:22:07.338683Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12036","last_updated":"2023-11-22T00:02:49Z","snapshot_observed_at":"2026-08-16T14:51:01.638500Z","submitted_at":"2023-10-18T15:21:28Z","title":"A General Theoretical Paradigm to Understand Learning from Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12036","snapshot_observed_at":"2026-08-07T05:22:07.333606Z","title":"Mohammad Gheshlaghi Azar, Mark Rowland, Bilal Piot, Daniel Guo, Daniele Calandriello, Michal Valko, and R´emi Munos","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08379","last_updated":"2025-06-10T02:43:47Z","snapshot_observed_at":"2026-08-15T18:41:58.261543Z","submitted_at":"2025-06-10T02:43:47Z","title":"Reinforce LLM Reasoning through Multi-Agent Reflection","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T05:22:07.333606Z"},"links":{"cited_paper":"/paper/2310.12036","citing_paper":"/paper/2506.08379"},"observation_digest":"sha256:7f0cdad190b7ac963345c24bd08874caf577c860036a695b7f9630d20108b6b0","observation_id":"38a7ec8d-1f7a-4786-babf-f21180eb9c63","resolution":{"observed_at":"2026-08-07T05:22:07.333606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07691","last_updated":"2024-03-14T07:47:08Z","snapshot_observed_at":"2026-08-16T14:56:35.674907Z","submitted_at":"2024-03-12T14:34:08Z","title":"ORPO: Monolithic Preference Optimization without Reference Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07691","snapshot_observed_at":"2026-08-07T05:22:07.346376Z","title":"Chaoqun He, Renjie Luo, Yuzhuo Bai, Shengding Hu, Zhen Leng Thai, Junhao Shen, Jinyi Hu, Xu Han, Yu- jie Huang, Yuxiang Zhang, Jie Liu, Lei Qi, Zhiyuan Liu, and Maosong Sun","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08379","last_updated":"2025-06-10T02:43:47Z","snapshot_observed_at":"2026-08-15T18:41:58.261543Z","submitted_at":"2025-06-10T02:43:47Z","title":"Reinforce LLM Reasoning through Multi-Agent Reflection","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T05:22:07.346376Z"},"links":{"cited_paper":"/paper/2403.07691","citing_paper":"/paper/2506.08379"},"observation_digest":"sha256:d5ac8118d0f2a52910a12e2a3cf3f27a207e9e26e7b62996e61ff8b168fd24fc","observation_id":"19fe975d-edb7-42b7-bf65-921f342a7812","resolution":{"observed_at":"2026-08-07T05:22:07.346376Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02172","last_updated":"2024-09-24T20:40:43Z","snapshot_observed_at":"2026-08-16T14:21:51.881597Z","submitted_at":"2024-02-03T14:43:14Z","title":"CodeAgent: Autonomous Communicative Agents for Code Review","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02172","snapshot_observed_at":"2026-08-07T05:22:07.362906Z","title":"URLhttps: //proceedings.neurips.cc/paper_files /paper/2020/file/1f89885d556929e98d3 ef9b86448f951-Paper.pdf","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.08379","last_updated":"2025-06-10T02:43:47Z","snapshot_observed_at":"2026-08-15T18:41:58.261543Z","submitted_at":"2025-06-10T02:43:47Z","title":"Reinforce LLM Reasoning through Multi-Agent Reflection","version":1},"reference_index":3021,"source":"pdf_text","source_observed_at":"2026-08-07T05:22:07.362906Z"},"links":{"cited_paper":"/paper/2402.02172","citing_paper":"/paper/2506.08379"},"observation_digest":"sha256:bc4a8caf8a3c70f8ef9df38582fb6614c184e40ec3cc3bbc958f1ea247f73d96","observation_id":"ac843756-05ec-483a-b8e2-b6f5c403f49c","resolution":{"observed_at":"2026-08-07T05:22:07.362906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.08379","last_updated":"2025-06-10T02:43:47Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-15T18:41:58.261543Z","submitted_at":"2025-06-10T02:43:47Z","title":"Reinforce LLM Reasoning through Multi-Agent Reflection"},"reference_resolution":{"displayed":14,"state_counts":{"malformed_identifier":2,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":7,"verified_exact":1,"verified_fuzzy":4},"total_outbound_references":14},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 14 of 14 outbound references and 3 inbound Pith citation observations for arXiv:2506.08379."}