{"as_of":"2026-08-23T12:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d6cbf8c85ce8002e2d2f8b2b6d4e0888974b5e5529a244460f2dcb600c138234","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T12:35:53.841154Z","state":"measured"},{"denominator":35,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":35,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.03021/citation-record","integrity":"/paper/2606.03021/integrity","json":"/paper/2606.03021/citation-record.json","paper":"/paper/2606.03021"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:35:52.052898Z","title":"It should only elaborate on the high-level strategies and concepts, without going into specific calculations","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03021","last_updated":"2026-07-24T07:13:48Z","snapshot_observed_at":"2026-08-02T12:35:49.759808Z","submitted_at":"2026-06-02T01:55:54Z","title":"Hint-Guided Diversified Policy Optimization for LLM Reasoning","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T12:35:52.052898Z"},"links":{"citing_paper":"/paper/2606.03021"},"observation_digest":"sha256:3a3e96dfc94622c1f55eaa3b1a5c034925e66e0b8c955d848bc3798369f55601","observation_id":"9cd82d61-b56b-4d8f-9f13-34bd64e80f03","resolution":{"observed_at":"2026-08-02T12:35:52.052898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:35:52.105117Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03021","last_updated":"2026-07-24T07:13:48Z","snapshot_observed_at":"2026-08-02T12:35:49.759808Z","submitted_at":"2026-06-02T01:55:54Z","title":"Hint-Guided Diversified Policy Optimization for LLM Reasoning","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T12:35:52.105117Z"},"links":{"citing_paper":"/paper/2606.03021"},"observation_digest":"sha256:fca1baf6e98f6a843b85a4b46a912458994748ff4d99522ba7b571eae6e95cd9","observation_id":"385afc16-3699-4125-8320-8e9d49d717e7","resolution":{"observed_at":"2026-08-02T12:35:52.105117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:35:52.185053Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03021","last_updated":"2026-07-24T07:13:48Z","snapshot_observed_at":"2026-08-02T12:35:49.759808Z","submitted_at":"2026-06-02T01:55:54Z","title":"Hint-Guided Diversified Policy Optimization for LLM Reasoning","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T12:35:52.185053Z"},"links":{"citing_paper":"/paper/2606.03021"},"observation_digest":"sha256:0cb447380ceb1459343972e874cc975db8a8390bf8761c144bc1f904fa685882","observation_id":"899a701b-d902-4f49-be45-ba8587e7d2b1","resolution":{"observed_at":"2026-08-02T12:35:52.185053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-02T12:35:51.310647Z","title":"An Yang, Beichen Zhang, Binyuan Hui, Bofei Gao, Bowen Yu, Chengpeng Li, Dayiheng Liu, Jianhong Tu, Jingren Zhou, Junyang Lin, and 1 others","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.03021","last_updated":"2026-07-24T07:13:48Z","snapshot_observed_at":"2026-08-02T12:35:49.759808Z","submitted_at":"2026-06-02T01:55:54Z","title":"Hint-Guided Diversified Policy Optimization for LLM Reasoning","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T12:35:51.310647Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2606.03021"},"observation_digest":"sha256:c68becc70597d8263dd88a319615b5dea6bb2a7234f6f75f577301ca97cf9043","observation_id":"979abb64-bdab-4e0d-b2b6-67b019b00cd8","resolution":{"observed_at":"2026-08-02T12:35:51.310647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:35:52.835670Z","title":"propose-select-think","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03021","last_updated":"2026-07-24T07:13:48Z","snapshot_observed_at":"2026-08-02T12:35:49.759808Z","submitted_at":"2026-06-02T01:55:54Z","title":"Hint-Guided Diversified Policy Optimization for LLM Reasoning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T12:35:52.835670Z"},"links":{"citing_paper":"/paper/2606.03021"},"observation_digest":"sha256:b13cbb9613e62acc040ea239d90030b156340351b85b11b721a0e47a14b49262","observation_id":"b7129faf-0e80-44ad-910e-eebc887b4ae0","resolution":{"observed_at":"2026-08-02T12:35:52.835670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:35:51.700318Z","title":"Yes” as a measure of the similarity between the two candi- date solutions. As shown by “HDPO (LLM-Div)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.03021","last_updated":"2026-07-24T07:13:48Z","snapshot_observed_at":"2026-08-02T12:35:49.759808Z","submitted_at":"2026-06-02T01:55:54Z","title":"Hint-Guided Diversified Policy Optimization for LLM Reasoning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T12:35:51.700318Z"},"links":{"citing_paper":"/paper/2606.03021"},"observation_digest":"sha256:d5d352312d4578efa5d78c73dfa4a67b7a38f998651c25056f83dd841bac34ff","observation_id":"76bdf2ed-787b-4446-a334-e03c072b8e29","resolution":{"observed_at":"2026-08-02T12:35:51.700318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:35:51.845328Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.03021","last_updated":"2026-07-24T07:13:48Z","snapshot_observed_at":"2026-08-02T12:35:49.759808Z","submitted_at":"2026-06-02T01:55:54Z","title":"Hint-Guided Diversified Policy Optimization for LLM Reasoning","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T12:35:51.845328Z"},"links":{"citing_paper":"/paper/2606.03021"},"observation_digest":"sha256:b6f82ef481d2e1bf826145563acb61107f55bdd8eb33f66939585ed054c23c3f","observation_id":"39731c6f-2d28-4915-b94e-3bc739c303af","resolution":{"observed_at":"2026-08-02T12:35:51.845328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:35:51.995434Z","title":"ex- plore–evaluate–select","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.03021","last_updated":"2026-07-24T07:13:48Z","snapshot_observed_at":"2026-08-02T12:35:49.759808Z","submitted_at":"2026-06-02T01:55:54Z","title":"Hint-Guided Diversified Policy Optimization for LLM Reasoning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T12:35:51.995434Z"},"links":{"citing_paper":"/paper/2606.03021"},"observation_digest":"sha256:78d325c3c0dfd09016a9dc92135b3b059b1e477e7ea76107b85655383c13cd7e","observation_id":"dd16bfac-7cb3-42c3-ad1b-fe3cd3f88465","resolution":{"observed_at":"2026-08-02T12:35:51.995434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:35:52.245160Z","title":"[1]”, “[2]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03021","last_updated":"2026-07-24T07:13:48Z","snapshot_observed_at":"2026-08-02T12:35:49.759808Z","submitted_at":"2026-06-02T01:55:54Z","title":"Hint-Guided Diversified Policy Optimization for LLM Reasoning","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T12:35:52.245160Z"},"links":{"citing_paper":"/paper/2606.03021"},"observation_digest":"sha256:71c851c376b8846aa50033abf6550899ce6139d8c109c0d1aff73ef8861c6505","observation_id":"5e99ce3d-65a6-453e-933c-ba1c6eb4c932","resolution":{"observed_at":"2026-08-02T12:35:52.245160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:35:52.311408Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03021","last_updated":"2026-07-24T07:13:48Z","snapshot_observed_at":"2026-08-02T12:35:49.759808Z","submitted_at":"2026-06-02T01:55:54Z","title":"Hint-Guided Diversified Policy Optimization for LLM Reasoning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T12:35:52.311408Z"},"links":{"citing_paper":"/paper/2606.03021"},"observation_digest":"sha256:1d9530fa220a49c9c40ad4332043f36501ccc01da0e9dfb5cd5058fc3eb621ca","observation_id":"6d28b855-43b2-407a-a798-1051481b37e7","resolution":{"observed_at":"2026-08-02T12:35:52.311408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:35:52.362940Z","title":"Yes\", otherwise output","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03021","last_updated":"2026-07-24T07:13:48Z","snapshot_observed_at":"2026-08-02T12:35:49.759808Z","submitted_at":"2026-06-02T01:55:54Z","title":"Hint-Guided Diversified Policy Optimization for LLM Reasoning","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T12:35:52.362940Z"},"links":{"citing_paper":"/paper/2606.03021"},"observation_digest":"sha256:ecf4c04c646de7c64a7b43a17de7155aa459cd17c6444b30fc33b241f6f803bf","observation_id":"ef730c80-1d06-4cc6-9e13-5492557f0045","resolution":{"observed_at":"2026-08-02T12:35:52.362940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:35:52.414340Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03021","last_updated":"2026-07-24T07:13:48Z","snapshot_observed_at":"2026-08-02T12:35:49.759808Z","submitted_at":"2026-06-02T01:55:54Z","title":"Hint-Guided Diversified Policy Optimization for LLM Reasoning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T12:35:52.414340Z"},"links":{"citing_paper":"/paper/2606.03021"},"observation_digest":"sha256:7ed9aea3dc6492caefb8992031831a2e22c20fd1e89f112df9646bc7f506e113","observation_id":"c9fa484b-de64-4e03-9d2c-d9ef92b202b8","resolution":{"observed_at":"2026-08-02T12:35:52.414340Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:35:52.465863Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03021","last_updated":"2026-07-24T07:13:48Z","snapshot_observed_at":"2026-08-02T12:35:49.759808Z","submitted_at":"2026-06-02T01:55:54Z","title":"Hint-Guided Diversified Policy Optimization for LLM Reasoning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T12:35:52.465863Z"},"links":{"citing_paper":"/paper/2606.03021"},"observation_digest":"sha256:29baeb8b57e2bf45ebce7b19da26d2af155080bfb72a44a02ae3105415c4b149","observation_id":"2a052d0c-7bf0-476b-92d9-46860eae661c","resolution":{"observed_at":"2026-08-02T12:35:52.465863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:35:52.513747Z","title":"We need to find the values ofa,b, andcthat maximize|a|+|b|+|c|while satisfying these constraints","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03021","last_updated":"2026-07-24T07:13:48Z","snapshot_observed_at":"2026-08-02T12:35:49.759808Z","submitted_at":"2026-06-02T01:55:54Z","title":"Hint-Guided Diversified Policy Optimization for LLM Reasoning","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T12:35:52.513747Z"},"links":{"citing_paper":"/paper/2606.03021"},"observation_digest":"sha256:c1cd8ffcbe28db59b8b1f9d77597f78d5fae773831410df5e83f559832005115","observation_id":"d53f7e89-9203-4e0a-8659-4df956b38678","resolution":{"observed_at":"2026-08-02T12:35:52.513747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:35:52.591365Z","title":"Then express a, b, c in terms of these values and use linear programming or symmetry arguments to maximize |a| + |b| + |c|","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03021","last_updated":"2026-07-24T07:13:48Z","snapshot_observed_at":"2026-08-02T12:35:49.759808Z","submitted_at":"2026-06-02T01:55:54Z","title":"Hint-Guided Diversified Policy Optimization for LLM Reasoning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T12:35:52.591365Z"},"links":{"citing_paper":"/paper/2606.03021"},"observation_digest":"sha256:9a4c361e3d6151552c3be1d662409b6c64ea85aa6f952af097c4263233df0d9d","observation_id":"9c57d91c-3805-4377-ba7f-785502f9e381","resolution":{"observed_at":"2026-08-02T12:35:52.591365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:35:52.653407Z","title":"Apply the method of Lagrange multipliers to maximize the linear functional |a| + |b| + |c| subject to the quadratic constraint","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03021","last_updated":"2026-07-24T07:13:48Z","snapshot_observed_at":"2026-08-02T12:35:49.759808Z","submitted_at":"2026-06-02T01:55:54Z","title":"Hint-Guided Diversified Policy Optimization for LLM Reasoning","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T12:35:52.653407Z"},"links":{"citing_paper":"/paper/2606.03021"},"observation_digest":"sha256:f717b68cc25e5fc0068fcfc6efd07bf1be8b8f553a8559fc7663abd7baddc9f3","observation_id":"9beee6ca-e8d8-48be-b696-a85acde1f562","resolution":{"observed_at":"2026-08-02T12:35:52.653407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:35:52.702950Z","title":"However, this may miss the global maximum if the optimal polynomial is not symmetric or has non-zero a and b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03021","last_updated":"2026-07-24T07:13:48Z","snapshot_observed_at":"2026-08-02T12:35:49.759808Z","submitted_at":"2026-06-02T01:55:54Z","title":"Hint-Guided Diversified Policy Optimization for LLM Reasoning","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T12:35:52.702950Z"},"links":{"citing_paper":"/paper/2606.03021"},"observation_digest":"sha256:41232bf22d1ba3974898b5ce0169480f5ef51d391b2d89f8dbc2586f11c46c54","observation_id":"1248710d-c51b-4cf2-8ab1-450984e3ebb0","resolution":{"observed_at":"2026-08-02T12:35:52.702950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:35:52.756629Z","title":"Scale and shift the Chebyshev polynomial to satisfy the bound|P(x)| ≤1and compute the coefficients to find the maximum of |a| + |b| + |c|","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03021","last_updated":"2026-07-24T07:13:48Z","snapshot_observed_at":"2026-08-02T12:35:49.759808Z","submitted_at":"2026-06-02T01:55:54Z","title":"Hint-Guided Diversified Policy Optimization for LLM Reasoning","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T12:35:52.756629Z"},"links":{"citing_paper":"/paper/2606.03021"},"observation_digest":"sha256:3f2b282445d5a09bdba907396e99942d6fffeeccc9abc9b000e4d65b91e15faf","observation_id":"3428ce2f-5445-452a-b208-d0731abe43b4","resolution":{"observed_at":"2026-08-02T12:35:52.756629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:35:52.893352Z","title":"- PointPis 4 units away from the circle, so the distance fromPto the centerOis6 + 4 = 10","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03021","last_updated":"2026-07-24T07:13:48Z","snapshot_observed_at":"2026-08-02T12:35:49.759808Z","submitted_at":"2026-06-02T01:55:54Z","title":"Hint-Guided Diversified Policy Optimization for LLM Reasoning","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T12:35:52.893352Z"},"links":{"citing_paper":"/paper/2606.03021"},"observation_digest":"sha256:0e596950d65ec76f9b7ff5eff4ed0e54a0a52b31d4b79f650430fea7110836b7","observation_id":"d4a4c7f8-5cfd-49b1-88d5-6bc9f4879966","resolution":{"observed_at":"2026-08-02T12:35:52.893352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:35:52.981079Z","title":"But sincePis 4 units away from the circle and AB is parallel to ← →OP, the perpendicular distance fromOto ABmust be 4 (as 8 would place AB outside the circle)","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03021","last_updated":"2026-07-24T07:13:48Z","snapshot_observed_at":"2026-08-02T12:35:49.759808Z","submitted_at":"2026-06-02T01:55:54Z","title":"Hint-Guided Diversified Policy Optimization for LLM Reasoning","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T12:35:52.981079Z"},"links":{"citing_paper":"/paper/2606.03021"},"observation_digest":"sha256:46aad6a89f1f28999dd97d3a9eb3b6aa977421db64995af52871a6467fe7af1c","observation_id":"24ba2916-f45f-4821-9ce0-eadac1e024ca","resolution":{"observed_at":"2026-08-02T12:35:52.981079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:35:53.047009Z","title":"- The chord ABis parallel to the x-axis and 2 units below the x-axis (since the distance from Oto ABis 4)","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03021","last_updated":"2026-07-24T07:13:48Z","snapshot_observed_at":"2026-08-02T12:35:49.759808Z","submitted_at":"2026-06-02T01:55:54Z","title":"Hint-Guided Diversified Policy Optimization for LLM Reasoning","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T12:35:53.047009Z"},"links":{"citing_paper":"/paper/2606.03021"},"observation_digest":"sha256:2756d533ec7018fec570192987dbae06d65af38d372fe6c0129489ec8ab45f22","observation_id":"b2be02ac-7311-420d-92d5-4a9a777144d8","resolution":{"observed_at":"2026-08-02T12:35:53.047009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:35:53.106699Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03021","last_updated":"2026-07-24T07:13:48Z","snapshot_observed_at":"2026-08-02T12:35:49.759808Z","submitted_at":"2026-06-02T01:55:54Z","title":"Hint-Guided Diversified Policy Optimization for LLM Reasoning","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T12:35:53.106699Z"},"links":{"citing_paper":"/paper/2606.03021"},"observation_digest":"sha256:bd8d0c756ef760fda1c20e67b4b730f84783b913e9003f37f816270232733b61","observation_id":"5a7f3fdb-33e5-41a6-acbe-b62e5ad9d97d","resolution":{"observed_at":"2026-08-02T12:35:53.106699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:35:53.291528Z","title":"19 Case 2 (Generation Model: Qwen2.5-Math-7B-HDPO) Question: CircleOhas radius 6","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03021","last_updated":"2026-07-24T07:13:48Z","snapshot_observed_at":"2026-08-02T12:35:49.759808Z","submitted_at":"2026-06-02T01:55:54Z","title":"Hint-Guided Diversified Policy Optimization for LLM Reasoning","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T12:35:53.291528Z"},"links":{"citing_paper":"/paper/2606.03021"},"observation_digest":"sha256:1214f0ae71347877b7e6862d22cc87c5b76ecea563fd157e91bd7aea917ec761","observation_id":"0dcc36f0-25ae-4a07-bf5c-4094777d030c","resolution":{"observed_at":"2026-08-02T12:35:53.291528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:35:53.450558Z","title":"SinceABis parallel toOP and the distance between them is 2, the perpendicular distance fromOtoABis either4 + 2 = 6 or4−2 = 2","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03021","last_updated":"2026-07-24T07:13:48Z","snapshot_observed_at":"2026-08-02T12:35:49.759808Z","submitted_at":"2026-06-02T01:55:54Z","title":"Hint-Guided Diversified Policy Optimization for LLM Reasoning","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T12:35:53.450558Z"},"links":{"citing_paper":"/paper/2606.03021"},"observation_digest":"sha256:ac141d627fc46e952f7f88c4003c3b6942864caaadc2b0f5c50707ffd88f57ed","observation_id":"a930312e-37f1-4013-9a76-38a24a41f4a8","resolution":{"observed_at":"2026-08-02T12:35:53.450558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:35:53.506946Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03021","last_updated":"2026-07-24T07:13:48Z","snapshot_observed_at":"2026-08-02T12:35:49.759808Z","submitted_at":"2026-06-02T01:55:54Z","title":"Hint-Guided Diversified Policy Optimization for LLM Reasoning","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T12:35:53.506946Z"},"links":{"citing_paper":"/paper/2606.03021"},"observation_digest":"sha256:709fe0e3013ba4ccedc4038be9e4108b46831a0e12e528c91cb863715258654f","observation_id":"a760fd0a-70d2-482e-9e34-cfe6b241c814","resolution":{"observed_at":"2026-08-02T12:35:53.506946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:35:53.617668Z","title":"Since chordABis parallel to ← →OP, it is horizontal, and the distance betweenAB and ← →OPis 2, soABis either aty= 2ory=−2","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03021","last_updated":"2026-07-24T07:13:48Z","snapshot_observed_at":"2026-08-02T12:35:49.759808Z","submitted_at":"2026-06-02T01:55:54Z","title":"Hint-Guided Diversified Policy Optimization for LLM Reasoning","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T12:35:53.617668Z"},"links":{"citing_paper":"/paper/2606.03021"},"observation_digest":"sha256:94ce8f1660ba31cd4403c5841482f45f3fc618c7c3d62b51ccad3db82c22fbb7","observation_id":"4d786531-c111-4ad6-bd7c-a381c23304cc","resolution":{"observed_at":"2026-08-02T12:35:53.617668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:35:53.677733Z","title":"propose-select-think","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03021","last_updated":"2026-07-24T07:13:48Z","snapshot_observed_at":"2026-08-02T12:35:49.759808Z","submitted_at":"2026-06-02T01:55:54Z","title":"Hint-Guided Diversified Policy Optimization for LLM Reasoning","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T12:35:53.677733Z"},"links":{"citing_paper":"/paper/2606.03021"},"observation_digest":"sha256:29b7431f26943c6ce11248ce5b8e8326e740c3bb136103f7acad18aef3adca3f","observation_id":"cdb55b2d-a1c6-44a6-b6c4-f3d6fbd63325","resolution":{"observed_at":"2026-08-02T12:35:53.677733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:35:53.745864Z","title":"Then apply the sum of cosine series formula for angles in arithmetic sequence, simplifying the resulting expression using symmetry and periodicity of the cosine function","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03021","last_updated":"2026-07-24T07:13:48Z","snapshot_observed_at":"2026-08-02T12:35:49.759808Z","submitted_at":"2026-06-02T01:55:54Z","title":"Hint-Guided Diversified Policy Optimization for LLM Reasoning","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T12:35:53.745864Z"},"links":{"citing_paper":"/paper/2606.03021"},"observation_digest":"sha256:6bf64e120e2a89fd1b0b31283b12a930de313860bdb5c22077c58e397c56cbbe","observation_id":"1545a31a-f893-4671-aacc-0b9ec204f355","resolution":{"observed_at":"2026-08-02T12:35:53.745864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:35:53.793195Z","title":"However, this approach lacks precision and relies on approximation, making it unsuitable for exact computation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03021","last_updated":"2026-07-24T07:13:48Z","snapshot_observed_at":"2026-08-02T12:35:49.759808Z","submitted_at":"2026-06-02T01:55:54Z","title":"Hint-Guided Diversified Policy Optimization for LLM Reasoning","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T12:35:53.793195Z"},"links":{"citing_paper":"/paper/2606.03021"},"observation_digest":"sha256:9bab7fac407930f8930683a8a695858dc2005f27ad37e8421c0581b4af4697e1","observation_id":"69b98ad9-4d0a-47e5-9252-bb491351ac34","resolution":{"observed_at":"2026-08-02T12:35:53.793195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:35:53.820126Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03021","last_updated":"2026-07-24T07:13:48Z","snapshot_observed_at":"2026-08-02T12:35:49.759808Z","submitted_at":"2026-06-02T01:55:54Z","title":"Hint-Guided Diversified Policy Optimization for LLM Reasoning","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T12:35:53.820126Z"},"links":{"citing_paper":"/paper/2606.03021"},"observation_digest":"sha256:79496796723eba735ac903e0e9a37d8441c5b8cce2d9b082c33a4a2dcbd6b4f3","observation_id":"d77077b0-1efc-4674-897d-4c46714e7023","resolution":{"observed_at":"2026-08-02T12:35:53.820126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:35:53.841154Z","title":"</Candidate Solutions> <selected>[1]</selected> <thinking> We are given the sum: sin2 4◦ + sin2 8◦ + sin2 12◦ +· · ·+ sin2 176◦ This is a sum ofsin 2 θforθ= 4k ◦ wherek= 1,2,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03021","last_updated":"2026-07-24T07:13:48Z","snapshot_observed_at":"2026-08-02T12:35:49.759808Z","submitted_at":"2026-06-02T01:55:54Z","title":"Hint-Guided Diversified Policy Optimization for LLM Reasoning","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T12:35:53.841154Z"},"links":{"citing_paper":"/paper/2606.03021"},"observation_digest":"sha256:4b59343ae632253772391cceabf4651b5c45d555489ac9e93d628195cef38e41","observation_id":"83cc1e74-017d-4047-a9aa-072a95d4cd11","resolution":{"observed_at":"2026-08-02T12:35:53.841154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12022","last_updated":"2023-11-20T18:57:34Z","snapshot_observed_at":"2026-08-21T17:04:32.090035Z","submitted_at":"2023-11-20T18:57:34Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12022","snapshot_observed_at":"2026-08-02T12:35:50.958736Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.03021","last_updated":"2026-07-24T07:13:48Z","snapshot_observed_at":"2026-08-02T12:35:49.759808Z","submitted_at":"2026-06-02T01:55:54Z","title":"Hint-Guided Diversified Policy Optimization for LLM Reasoning","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-02T12:35:50.958736Z"},"links":{"cited_paper":"/paper/2311.12022","citing_paper":"/paper/2606.03021"},"observation_digest":"sha256:05c848f1e8d8c11454817aa762ceac9f96c1ceeb734939e9ac37019a449cf797","observation_id":"86cde73d-8e00-4f3c-9df8-f0a67f849b41","resolution":{"observed_at":"2026-08-02T12:35:50.958736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-18T05:01:20.543826Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-02T12:35:51.506873Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.03021","last_updated":"2026-07-24T07:13:48Z","snapshot_observed_at":"2026-08-02T12:35:49.759808Z","submitted_at":"2026-06-02T01:55:54Z","title":"Hint-Guided Diversified Policy Optimization for LLM Reasoning","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-02T12:35:51.506873Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2606.03021"},"observation_digest":"sha256:9211d0f65f7cab803c7ee1f1a7048299c7dcbe1b8184af7239f294558f1dc719","observation_id":"8a118376-6d2a-4c97-be81-c204f113c223","resolution":{"observed_at":"2026-08-02T12:35:51.506873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14945","last_updated":"2025-06-22T00:18:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-21T08:09:13Z","title":"Learning to Reason under Off-Policy Guidance","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.14945","snapshot_observed_at":"2026-08-02T12:35:51.091898Z","title":"InThe Twelfth 10 International Conference on Learning Representa- tions, ICLR 2024, Vienna, Austria, May 7-11, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.03021","last_updated":"2026-07-24T07:13:48Z","snapshot_observed_at":"2026-08-02T12:35:49.759808Z","submitted_at":"2026-06-02T01:55:54Z","title":"Hint-Guided Diversified Policy Optimization for LLM Reasoning","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-02T12:35:51.091898Z"},"links":{"cited_paper":"/paper/2504.14945","citing_paper":"/paper/2606.03021"},"observation_digest":"sha256:a5109a1827c48f9a6b96d6ad44755677e2688561817b0ff2aba9f2633230ed61","observation_id":"5f2bc28b-a410-497d-b18d-f30fbda8d347","resolution":{"observed_at":"2026-08-02T12:35:51.091898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-08-15T22:38:53.825110Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-02T12:35:51.048915Z","title":"5: Scaling reinforcement learning with llms.arXiv preprint arXiv:2501.12599","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.03021","last_updated":"2026-07-24T07:13:48Z","snapshot_observed_at":"2026-08-02T12:35:49.759808Z","submitted_at":"2026-06-02T01:55:54Z","title":"Hint-Guided Diversified Policy Optimization for LLM Reasoning","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-02T12:35:51.048915Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2606.03021"},"observation_digest":"sha256:b4bdf54bbde15771b3886e711f44cfbdaca3950ceaa2e8365be4aa9ab1fbc970","observation_id":"1db52df6-2413-495b-b2a4-73745f4af1a5","resolution":{"observed_at":"2026-08-02T12:35:51.048915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.03021","last_updated":"2026-07-24T07:13:48Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-02T12:35:49.759808Z","submitted_at":"2026-06-02T01:55:54Z","title":"Hint-Guided Diversified Policy Optimization for LLM Reasoning"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":34,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 0 inbound Pith citation observations for arXiv:2606.03021."}