{"as_of":"2026-08-23T18:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:584c0ee9cc8977c9004cc5d1745bab06663612c45397793ef1acb7b9a87cf4ed","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":47,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":47,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T17:24:08.397621Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-05T17:41:17.457873Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2209.14610","last_updated":"2023-03-02T07:41:55Z","snapshot_observed_at":"2026-08-18T00:48:14.021998Z","submitted_at":"2022-09-29T08:01:04Z","title":"Dynamic Prompt Learning via Policy Gradient for Semi-structured Mathematical Reasoning","version":3},"cited_work":{"arxiv_id":"2209.14610","doi":null,"metadata_source":"pith","pith_arxiv_id":"2209.14610","snapshot_observed_at":"2026-07-05T17:41:17.457873Z","title":"arXiv preprint arXiv:2209.14610 , year =","venue":"cs.LG","work_id":"b02aa44e-3fa1-4e2f-a1d4-adc73c214fdc","year":2022},"citing_paper":{"arxiv_id":"2211.12588","last_updated":"2023-10-23T01:27:38Z","snapshot_observed_at":"2026-08-02T13:06:11.850456Z","submitted_at":"2022-11-22T21:06:00Z","title":"Program of Thoughts Prompting: Disentangling Computation from Reasoning for Numerical Reasoning Tasks","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-12T16:48:27.918334Z"},"links":{"cited_paper":"/paper/2209.14610","citing_paper":"/paper/2211.12588"},"observation_digest":"sha256:675a305d865a02a36a0de2fb942cae196ae56c2f6198e91dc3ebbe689a3f5081","observation_id":"ed20a350-dee8-46d9-af3b-1970e308611a","resolution":{"observed_at":"2026-05-12T16:48:28.089252Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14610","last_updated":"2023-03-02T07:41:55Z","snapshot_observed_at":"2026-08-18T00:48:14.021998Z","submitted_at":"2022-09-29T08:01:04Z","title":"Dynamic Prompt Learning via Policy Gradient for Semi-structured Mathematical Reasoning","version":3},"cited_work":{"arxiv_id":"2209.14610","doi":null,"metadata_source":"pith","pith_arxiv_id":"2209.14610","snapshot_observed_at":"2026-07-05T17:41:17.457873Z","title":"arXiv preprint arXiv:2209.14610 , year =","venue":"cs.LG","work_id":"b02aa44e-3fa1-4e2f-a1d4-adc73c214fdc","year":2022},"citing_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-08-21T19:00:44.723890Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-12T18:12:27.396607Z"},"links":{"cited_paper":"/paper/2209.14610","citing_paper":"/paper/2302.00923"},"observation_digest":"sha256:a23f698d2adf367e81283f000b818caeda321d87c641946b231e9b48b45692d5","observation_id":"78cad326-9ff8-4673-99e7-855a21908352","resolution":{"observed_at":"2026-05-12T18:12:27.523797Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14610","last_updated":"2023-03-02T07:41:55Z","snapshot_observed_at":"2026-08-18T00:48:14.021998Z","submitted_at":"2022-09-29T08:01:04Z","title":"Dynamic Prompt Learning via Policy Gradient for Semi-structured Mathematical Reasoning","version":3},"cited_work":{"arxiv_id":"2209.14610","doi":null,"metadata_source":"pith","pith_arxiv_id":"2209.14610","snapshot_observed_at":"2026-07-05T17:41:17.457873Z","title":"arXiv preprint arXiv:2209.14610 , year =","venue":"cs.LG","work_id":"b02aa44e-3fa1-4e2f-a1d4-adc73c214fdc","year":2022},"citing_paper":{"arxiv_id":"2309.17421","last_updated":"2023-10-11T05:07:37Z","snapshot_observed_at":"2026-08-17T12:24:00.878640Z","submitted_at":"2023-09-29T17:34:51Z","title":"The Dawn of LMMs: Preliminary Explorations with GPT-4V(ision)","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-05-15T23:26:06.183574Z"},"links":{"cited_paper":"/paper/2209.14610","citing_paper":"/paper/2309.17421"},"observation_digest":"sha256:ba6180d6c94caa6d106cc6f52e3449ccdcc664ab5cfc23fd0eff3b3baaf62185","observation_id":"1030b891-771b-4678-b98c-b8c96b3c4b84","resolution":{"observed_at":"2026-05-15T23:26:06.336163Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14610","last_updated":"2023-03-02T07:41:55Z","snapshot_observed_at":"2026-08-18T00:48:14.021998Z","submitted_at":"2022-09-29T08:01:04Z","title":"Dynamic Prompt Learning via Policy Gradient for Semi-structured Mathematical Reasoning","version":3},"cited_work":{"arxiv_id":"2209.14610","doi":null,"metadata_source":"pith","pith_arxiv_id":"2209.14610","snapshot_observed_at":"2026-07-05T17:41:17.457873Z","title":"arXiv preprint arXiv:2209.14610 , year =","venue":"cs.LG","work_id":"b02aa44e-3fa1-4e2f-a1d4-adc73c214fdc","year":2022},"citing_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-08-17T14:16:52.244007Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-12T20:58:58.849040Z"},"links":{"cited_paper":"/paper/2209.14610","citing_paper":"/paper/2404.16821"},"observation_digest":"sha256:99fee3e298224ee8b8f5d781cf26f7d43f9f98ab5888c26803db800b8c668e88","observation_id":"91e0f16f-d3b7-4386-98bc-8395f3a1f7f8","resolution":{"observed_at":"2026-05-12T20:58:59.136825Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14610","last_updated":"2023-03-02T07:41:55Z","snapshot_observed_at":"2026-08-18T00:48:14.021998Z","submitted_at":"2022-09-29T08:01:04Z","title":"Dynamic Prompt Learning via Policy Gradient for Semi-structured Mathematical Reasoning","version":3},"cited_work":{"arxiv_id":"2209.14610","doi":null,"metadata_source":"pith","pith_arxiv_id":"2209.14610","snapshot_observed_at":"2026-07-05T17:41:17.457873Z","title":"arXiv preprint arXiv:2209.14610 , year =","venue":"cs.LG","work_id":"b02aa44e-3fa1-4e2f-a1d4-adc73c214fdc","year":2022},"citing_paper":{"arxiv_id":"2407.03320","last_updated":"2024-07-03T17:59:21Z","snapshot_observed_at":"2026-08-14T16:53:05.474750Z","submitted_at":"2024-07-03T17:59:21Z","title":"InternLM-XComposer-2.5: A Versatile Large Vision Language Model Supporting Long-Contextual Input and Output","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-05-17T10:46:28.447347Z"},"links":{"cited_paper":"/paper/2209.14610","citing_paper":"/paper/2407.03320"},"observation_digest":"sha256:540b053e2d2af9e4338b997023e585f03b1b6ca52b638f834961e519c4521442","observation_id":"728c5717-d3d1-43d0-b4dd-8ebdd0893478","resolution":{"observed_at":"2026-05-17T10:46:28.848496Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14610","last_updated":"2023-03-02T07:41:55Z","snapshot_observed_at":"2026-08-18T00:48:14.021998Z","submitted_at":"2022-09-29T08:01:04Z","title":"Dynamic Prompt Learning via Policy Gradient for Semi-structured Mathematical Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14610","snapshot_observed_at":"2026-08-12T17:45:06.323743Z","title":"Preprint at https://arxiv.org/abs/2209.14610","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.13599","last_updated":"2025-01-16T03:17:25Z","snapshot_observed_at":"2026-08-18T17:55:57.379689Z","submitted_at":"2024-11-19T07:45:58Z","title":"Can ChatGPT Overcome Behavioral Biases in the Financial Sector? Classify-and-Rethink: Multi-Step Zero-Shot Reasoning in the Gold Investment","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T17:45:06.323743Z"},"links":{"cited_paper":"/paper/2209.14610","citing_paper":"/paper/2411.13599"},"observation_digest":"sha256:5a98d02a33e46ac432754ac9dc5b4761a0203f40c9b1c20ca9646d09255dec32","observation_id":"19f63a1e-4256-4725-8fb2-444834dd1666","resolution":{"observed_at":"2026-08-12T17:45:06.323743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14610","last_updated":"2023-03-02T07:41:55Z","snapshot_observed_at":"2026-08-18T00:48:14.021998Z","submitted_at":"2022-09-29T08:01:04Z","title":"Dynamic Prompt Learning via Policy Gradient for Semi-structured Mathematical Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14610","snapshot_observed_at":"2026-08-12T19:24:49.855253Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.14460","last_updated":"2025-02-09T17:13:10Z","snapshot_observed_at":"2026-08-19T23:08:09.009592Z","submitted_at":"2024-11-16T12:27:14Z","title":"LLaSA: Large Language and Structured Data Assistant","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-12T19:24:49.855253Z"},"links":{"cited_paper":"/paper/2209.14610","citing_paper":"/paper/2411.14460"},"observation_digest":"sha256:fd1b55a2c5d36ff0c1b6ddf32149318148f56fe22f21adb04e5e75a27ce8d4b5","observation_id":"1967235b-fc79-49f4-bb7a-73e95f8b9a92","resolution":{"observed_at":"2026-08-12T19:24:49.855253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14610","last_updated":"2023-03-02T07:41:55Z","snapshot_observed_at":"2026-08-18T00:48:14.021998Z","submitted_at":"2022-09-29T08:01:04Z","title":"Dynamic Prompt Learning via Policy Gradient for Semi-structured Mathematical Reasoning","version":3},"cited_work":{"arxiv_id":"2209.14610","doi":null,"metadata_source":"pith","pith_arxiv_id":"2209.14610","snapshot_observed_at":"2026-07-05T17:41:17.457873Z","title":"arXiv preprint arXiv:2209.14610 , year =","venue":"cs.LG","work_id":"b02aa44e-3fa1-4e2f-a1d4-adc73c214fdc","year":2022},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":166,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"cited_paper":"/paper/2209.14610","citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:3dcf8fd82a2f789793df6b48dbd6ce1eb485267e2e69726e9335d0699346c838","observation_id":"e228ef7e-5dc0-4e3c-b8d8-009d12d57122","resolution":{"observed_at":"2026-05-10T13:23:57.777515Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14610","last_updated":"2023-03-02T07:41:55Z","snapshot_observed_at":"2026-08-18T00:48:14.021998Z","submitted_at":"2022-09-29T08:01:04Z","title":"Dynamic Prompt Learning via Policy Gradient for Semi-structured Mathematical Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14610","snapshot_observed_at":"2026-08-11T16:56:42.538842Z","title":"Dynamic prompt learning via policy gradient for 16 semi-structured mathematical reasoning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.09613","last_updated":"2024-12-12T18:59:40Z","snapshot_observed_at":"2026-08-15T13:28:02.644563Z","submitted_at":"2024-12-12T18:59:40Z","title":"PVC: Progressive Visual Token Compression for Unified Image and Video Processing in Large Vision-Language Models","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-11T16:56:42.538842Z"},"links":{"cited_paper":"/paper/2209.14610","citing_paper":"/paper/2412.09613"},"observation_digest":"sha256:da1d0343c13cb1f2c448b9236c292e9a428b0078585a36d0e97374e79fa3d887","observation_id":"7eaa812c-b129-4d95-9dda-f3f94b1b37af","resolution":{"observed_at":"2026-08-11T16:56:42.538842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14610","last_updated":"2023-03-02T07:41:55Z","snapshot_observed_at":"2026-08-18T00:48:14.021998Z","submitted_at":"2022-09-29T08:01:04Z","title":"Dynamic Prompt Learning via Policy Gradient for Semi-structured Mathematical Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14610","snapshot_observed_at":"2026-08-11T10:49:08.214747Z","title":"Dynamic prompt learning via policy gradient for semi-structured mathematical reasoning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.16158","last_updated":"2025-02-09T05:35:18Z","snapshot_observed_at":"2026-08-15T07:37:36.527948Z","submitted_at":"2024-12-20T18:59:59Z","title":"HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:08.214747Z"},"links":{"cited_paper":"/paper/2209.14610","citing_paper":"/paper/2412.16158"},"observation_digest":"sha256:e9f501d10dd2a380aa9a50fe7b3f9a11c7f62da9a8c3a8b10bf7bb631126f134","observation_id":"f716cc29-6023-4004-ac70-5c53ffd6d5bd","resolution":{"observed_at":"2026-08-11T10:49:08.214747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14610","last_updated":"2023-03-02T07:41:55Z","snapshot_observed_at":"2026-08-18T00:48:14.021998Z","submitted_at":"2022-09-29T08:01:04Z","title":"Dynamic Prompt Learning via Policy Gradient for Semi-structured Mathematical Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14610","snapshot_observed_at":"2026-08-10T21:10:19.071219Z","title":"Dynamic prompt learning via policy gradient for semi-structured mathematical reasoning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.05901","last_updated":"2025-01-13T02:34:19Z","snapshot_observed_at":"2026-08-14T04:25:59.263298Z","submitted_at":"2025-01-10T11:53:46Z","title":"Valley2: Exploring Multimodal Models with Scalable Vision-Language Design","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:19.071219Z"},"links":{"cited_paper":"/paper/2209.14610","citing_paper":"/paper/2501.05901"},"observation_digest":"sha256:b6f14f11b5eeb8d050864bba400b011aa375fba4277b52e636b4d3b29e68374d","observation_id":"602a996e-fd75-43f3-ae7e-7f3003a15456","resolution":{"observed_at":"2026-08-10T21:10:19.071219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14610","last_updated":"2023-03-02T07:41:55Z","snapshot_observed_at":"2026-08-18T00:48:14.021998Z","submitted_at":"2022-09-29T08:01:04Z","title":"Dynamic Prompt Learning via Policy Gradient for Semi-structured Mathematical Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14610","snapshot_observed_at":"2026-08-10T17:27:43.099255Z","title":"arXiv preprint arXiv:2209.14610","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.12226","last_updated":"2025-01-21T15:51:07Z","snapshot_observed_at":"2026-08-18T08:00:52.745622Z","submitted_at":"2025-01-21T15:51:07Z","title":"CDW-CoT: Clustered Distance-Weighted Chain-of-Thoughts Reasoning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:43.099255Z"},"links":{"cited_paper":"/paper/2209.14610","citing_paper":"/paper/2501.12226"},"observation_digest":"sha256:6f64f6d64b65a578055dbff716add7d018a2840e482caeb90a33029db950f6b7","observation_id":"b0a9aab9-bf2a-4992-bba8-1c11427c7e97","resolution":{"observed_at":"2026-08-10T17:27:43.099255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14610","last_updated":"2023-03-02T07:41:55Z","snapshot_observed_at":"2026-08-18T00:48:14.021998Z","submitted_at":"2022-09-29T08:01:04Z","title":"Dynamic Prompt Learning via Policy Gradient for Semi-structured Mathematical Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14610","snapshot_observed_at":"2026-08-10T17:18:40.590732Z","title":"Dynamic prompt learning via policy gradient for semi-structured mathematical reasoning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-17T21:21:26.500724Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-10T17:18:40.590732Z"},"links":{"cited_paper":"/paper/2209.14610","citing_paper":"/paper/2501.12368"},"observation_digest":"sha256:89a33b51b2660bfa43956030da3ed5ab478b22efb82fbe25abb4221ae9c99f1e","observation_id":"219b968c-698f-47ae-aa01-efe93dbd34e2","resolution":{"observed_at":"2026-08-10T17:18:40.590732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14610","last_updated":"2023-03-02T07:41:55Z","snapshot_observed_at":"2026-08-18T00:48:14.021998Z","submitted_at":"2022-09-29T08:01:04Z","title":"Dynamic Prompt Learning via Policy Gradient for Semi-structured Mathematical Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14610","snapshot_observed_at":"2026-08-10T14:56:30.878124Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.14717","last_updated":"2026-06-09T14:39:39Z","snapshot_observed_at":"2026-08-16T12:21:06.830663Z","submitted_at":"2025-01-24T18:50:26Z","title":"What Really Matters for Table LLMs? A Meta-Evaluation of Model and Data Effects","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-10T14:56:30.878124Z"},"links":{"cited_paper":"/paper/2209.14610","citing_paper":"/paper/2501.14717"},"observation_digest":"sha256:74f7467f5d11cf70a6d7f06be911a50ce7ff97786767777c97cd5aa1cf49de14","observation_id":"691127aa-01a8-4bd5-975d-89fc8eb190a5","resolution":{"observed_at":"2026-08-10T14:56:30.878124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14610","last_updated":"2023-03-02T07:41:55Z","snapshot_observed_at":"2026-08-18T00:48:14.021998Z","submitted_at":"2022-09-29T08:01:04Z","title":"Dynamic Prompt Learning via Policy Gradient for Semi-structured Mathematical Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14610","snapshot_observed_at":"2026-08-10T18:04:34.155023Z","title":"Dynamic prompt learning via pol- icy gradient for semi-structured mathematical reasoning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.14818","last_updated":"2025-01-20T18:40:47Z","snapshot_observed_at":"2026-08-11T01:59:38.596539Z","submitted_at":"2025-01-20T18:40:47Z","title":"Eagle 2: Building Post-Training Data Strategies from Scratch for Frontier Vision-Language Models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-10T18:04:34.155023Z"},"links":{"cited_paper":"/paper/2209.14610","citing_paper":"/paper/2501.14818"},"observation_digest":"sha256:8bd59d886190ccb83d390feab61b84df017270a04eaa637c495b5782071a4a08","observation_id":"261cf6af-5fae-4493-a957-9e769eec7bf1","resolution":{"observed_at":"2026-08-10T18:04:34.155023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14610","last_updated":"2023-03-02T07:41:55Z","snapshot_observed_at":"2026-08-18T00:48:14.021998Z","submitted_at":"2022-09-29T08:01:04Z","title":"Dynamic Prompt Learning via Policy Gradient for Semi-structured Mathematical Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14610","snapshot_observed_at":"2026-08-07T20:06:36.638524Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09925","last_updated":"2025-02-14T05:32:46Z","snapshot_observed_at":"2026-08-18T11:58:33.706977Z","submitted_at":"2025-02-14T05:32:46Z","title":"TaskGalaxy: Scaling Multi-modal Instruction Fine-tuning with Tens of Thousands Vision Task Types","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T20:06:36.638524Z"},"links":{"cited_paper":"/paper/2209.14610","citing_paper":"/paper/2502.09925"},"observation_digest":"sha256:435bbb406de998f19ff5ed7a702668c206b3ea1f572a82b57ad95257852713ef","observation_id":"a1d1e027-957c-42bf-94e0-f94604204e11","resolution":{"observed_at":"2026-08-07T20:06:36.638524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14610","last_updated":"2023-03-02T07:41:55Z","snapshot_observed_at":"2026-08-18T00:48:14.021998Z","submitted_at":"2022-09-29T08:01:04Z","title":"Dynamic Prompt Learning via Policy Gradient for Semi-structured Mathematical Reasoning","version":3},"cited_work":{"arxiv_id":"2209.14610","doi":null,"metadata_source":"pith","pith_arxiv_id":"2209.14610","snapshot_observed_at":"2026-07-05T17:41:17.457873Z","title":"arXiv preprint arXiv:2209.14610 , year =","venue":"cs.LG","work_id":"b02aa44e-3fa1-4e2f-a1d4-adc73c214fdc","year":2022},"citing_paper":{"arxiv_id":"2503.07536","last_updated":"2025-03-11T03:32:59Z","snapshot_observed_at":"2026-08-18T16:51:32.000170Z","submitted_at":"2025-03-10T17:04:14Z","title":"LMM-R1: Empowering 3B LMMs with Strong Reasoning Abilities Through Two-Stage Rule-Based RL","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-16T15:15:46.255296Z"},"links":{"cited_paper":"/paper/2209.14610","citing_paper":"/paper/2503.07536"},"observation_digest":"sha256:3ee75f4cc98c966a4c54fd01ea3f22d005f59c7037668c00ae7bb2c85f90909e","observation_id":"c46353c7-91bd-440e-9d6e-04019cfad104","resolution":{"observed_at":"2026-05-16T15:15:46.298494Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14610","last_updated":"2023-03-02T07:41:55Z","snapshot_observed_at":"2026-08-18T00:48:14.021998Z","submitted_at":"2022-09-29T08:01:04Z","title":"Dynamic Prompt Learning via Policy Gradient for Semi-structured Mathematical Reasoning","version":3},"cited_work":{"arxiv_id":"2209.14610","doi":null,"metadata_source":"pith","pith_arxiv_id":"2209.14610","snapshot_observed_at":"2026-07-05T17:41:17.457873Z","title":"arXiv preprint arXiv:2209.14610 , year =","venue":"cs.LG","work_id":"b02aa44e-3fa1-4e2f-a1d4-adc73c214fdc","year":2022},"citing_paper":{"arxiv_id":"2504.09925","last_updated":"2026-04-29T06:12:36Z","snapshot_observed_at":"2026-08-16T10:58:08.667292Z","submitted_at":"2025-04-14T06:33:29Z","title":"FLARE: Fully Integration of Vision-Language Representations for Deep Cross-Modal Understanding","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-22T19:49:00.961388Z"},"links":{"cited_paper":"/paper/2209.14610","citing_paper":"/paper/2504.09925"},"observation_digest":"sha256:7aa5611cf6036638845fc41d6a7f215dba8f42cc38c515ad5643a9870a8629ea","observation_id":"f6784cd3-7111-4c36-9b89-9954220371a4","resolution":{"observed_at":"2026-05-22T19:52:01.892384Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14610","last_updated":"2023-03-02T07:41:55Z","snapshot_observed_at":"2026-08-18T00:48:14.021998Z","submitted_at":"2022-09-29T08:01:04Z","title":"Dynamic Prompt Learning via Policy Gradient for Semi-structured Mathematical Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14610","snapshot_observed_at":"2026-08-07T15:42:25.067596Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.14131","last_updated":"2025-05-20T09:36:17Z","snapshot_observed_at":"2026-08-16T21:24:33.706330Z","submitted_at":"2025-05-20T09:36:17Z","title":"Texts or Images? A Fine-grained Analysis on the Effectiveness of Input Representations and Models for Table Question Answering","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:25.067596Z"},"links":{"cited_paper":"/paper/2209.14610","citing_paper":"/paper/2505.14131"},"observation_digest":"sha256:1c6ac9ee838156cdd4390bc5d80ed6b28375b1c552ca63f1a58d867ef34553c7","observation_id":"e44e2bb2-2481-4e40-a0b9-7802a9de8efe","resolution":{"observed_at":"2026-08-07T15:42:25.067596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14610","last_updated":"2023-03-02T07:41:55Z","snapshot_observed_at":"2026-08-18T00:48:14.021998Z","submitted_at":"2022-09-29T08:01:04Z","title":"Dynamic Prompt Learning via Policy Gradient for Semi-structured Mathematical Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14610","snapshot_observed_at":"2026-08-07T14:12:04.652599Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19702","last_updated":"2025-05-26T08:54:14Z","snapshot_observed_at":"2026-08-18T21:41:28.663341Z","submitted_at":"2025-05-26T08:54:14Z","title":"Point-RFT: Improving Multimodal Reasoning with Visually Grounded Reinforcement Finetuning","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:04.652599Z"},"links":{"cited_paper":"/paper/2209.14610","citing_paper":"/paper/2505.19702"},"observation_digest":"sha256:efbbb45d0280c312a5670aa4562285ebad3c0e8a714c0f48881c7e24805835c3","observation_id":"563f274e-f6b0-4a07-967c-6cc9a724897b","resolution":{"observed_at":"2026-08-07T14:12:04.652599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14610","last_updated":"2023-03-02T07:41:55Z","snapshot_observed_at":"2026-08-18T00:48:14.021998Z","submitted_at":"2022-09-29T08:01:04Z","title":"Dynamic Prompt Learning via Policy Gradient for Semi-structured Mathematical Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14610","snapshot_observed_at":"2026-08-07T13:30:19.359442Z","title":"Dynamic prompt learning via policy gradient for semi-structured mathematical reasoning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.21771","last_updated":"2026-05-23T17:30:43Z","snapshot_observed_at":"2026-08-20T02:00:21.519496Z","submitted_at":"2025-05-27T21:09:11Z","title":"MMTABREAL: Real-World Benchmark for Multimodal Table Understanding","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:19.359442Z"},"links":{"cited_paper":"/paper/2209.14610","citing_paper":"/paper/2505.21771"},"observation_digest":"sha256:eff15165fdcb7651649970ab10773e49ebaaaa799bffe2eefd397f3f0be437c2","observation_id":"779f9fba-6b85-4f38-a0b7-12883815d016","resolution":{"observed_at":"2026-08-07T13:30:19.359442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14610","last_updated":"2023-03-02T07:41:55Z","snapshot_observed_at":"2026-08-18T00:48:14.021998Z","submitted_at":"2022-09-29T08:01:04Z","title":"Dynamic Prompt Learning via Policy Gradient for Semi-structured Mathematical Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14610","snapshot_observed_at":"2026-08-07T13:12:54.957538Z","title":"Dynamic prompt learning via policy gradient for semi-structured mathematical reasoning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22334","last_updated":"2025-07-23T07:37:08Z","snapshot_observed_at":"2026-08-18T08:49:01.935048Z","submitted_at":"2025-05-28T13:21:38Z","title":"Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:54.957538Z"},"links":{"cited_paper":"/paper/2209.14610","citing_paper":"/paper/2505.22334"},"observation_digest":"sha256:d7ec21735bdb9b7783d6e406ba97dc51ac32140805ee5c11090d22af124fcd6d","observation_id":"c06c8f85-6815-4e2f-a344-637fcd7bc9a1","resolution":{"observed_at":"2026-08-07T13:12:54.957538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14610","last_updated":"2023-03-02T07:41:55Z","snapshot_observed_at":"2026-08-18T00:48:14.021998Z","submitted_at":"2022-09-29T08:01:04Z","title":"Dynamic Prompt Learning via Policy Gradient for Semi-structured Mathematical Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14610","snapshot_observed_at":"2026-08-07T10:54:00.575535Z","title":"Dynamic prompt learning via policy gradient for semi-structured mathematical reasoning.arXiv preprint arXiv:2209.14610, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.04088","last_updated":"2025-06-04T15:46:30Z","snapshot_observed_at":"2026-08-20T05:07:54.994402Z","submitted_at":"2025-06-04T15:46:30Z","title":"Multimodal Tabular Reasoning with Privileged Structured Information","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T10:54:00.575535Z"},"links":{"cited_paper":"/paper/2209.14610","citing_paper":"/paper/2506.04088"},"observation_digest":"sha256:797694282c46194f6f76af5e8de5ad3ebe0f7d0038e150bb8fa3011f74c2bc2f","observation_id":"3f10de56-a0b1-4c17-ae11-78cfbcbc2cd5","resolution":{"observed_at":"2026-08-07T10:54:00.575535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14610","last_updated":"2023-03-02T07:41:55Z","snapshot_observed_at":"2026-08-18T00:48:14.021998Z","submitted_at":"2022-09-29T08:01:04Z","title":"Dynamic Prompt Learning via Policy Gradient for Semi-structured Mathematical Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14610","snapshot_observed_at":"2026-08-07T06:02:30.357233Z","title":"N., Zhu, S.-C., Rajpurohit, T., Clark, P., and Kalyan, A","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-15T00:15:02.626802Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.357233Z"},"links":{"cited_paper":"/paper/2209.14610","citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:4b6b63d95b8e063926b4549427df9460c005af7ecf4295e02b4b471e8b970413","observation_id":"4f30c604-bac2-41b0-9774-f0e2832b62cd","resolution":{"observed_at":"2026-08-07T06:02:30.357233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14610","last_updated":"2023-03-02T07:41:55Z","snapshot_observed_at":"2026-08-18T00:48:14.021998Z","submitted_at":"2022-09-29T08:01:04Z","title":"Dynamic Prompt Learning via Policy Gradient for Semi-structured Mathematical Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14610","snapshot_observed_at":"2026-08-07T05:59:12.917956Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06699","last_updated":"2025-06-07T07:50:01Z","snapshot_observed_at":"2026-08-17T06:16:40.618822Z","submitted_at":"2025-06-07T07:50:01Z","title":"MarginSel : Max-Margin Demonstration Selection for LLMs","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T05:59:12.917956Z"},"links":{"cited_paper":"/paper/2209.14610","citing_paper":"/paper/2506.06699"},"observation_digest":"sha256:b28971f8fff2b9b0db7d70313aa5126e0b7135ba70e2c9e55336d16983cb3043","observation_id":"d29d96b1-1b6e-4443-a13f-25d9904f8dcb","resolution":{"observed_at":"2026-08-07T05:59:12.917956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14610","last_updated":"2023-03-02T07:41:55Z","snapshot_observed_at":"2026-08-18T00:48:14.021998Z","submitted_at":"2022-09-29T08:01:04Z","title":"Dynamic Prompt Learning via Policy Gradient for Semi-structured Mathematical Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14610","snapshot_observed_at":"2026-08-07T00:40:45.415945Z","title":"Qiu, K.-W","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.13066","last_updated":"2025-06-16T03:19:31Z","snapshot_observed_at":"2026-08-18T17:43:59.030170Z","submitted_at":"2025-06-16T03:19:31Z","title":"FinLMM-R1: Enhancing Financial Reasoning in LMM through Scalable Data and Reward Design","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:45.415945Z"},"links":{"cited_paper":"/paper/2209.14610","citing_paper":"/paper/2506.13066"},"observation_digest":"sha256:407999739c9914660e62b9fb4238dda46dd5e64f2a0206a6b11be7f407661dd9","observation_id":"1c1c7cfb-783d-4f56-a472-3b1a2373e1b6","resolution":{"observed_at":"2026-08-07T00:40:45.415945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14610","last_updated":"2023-03-02T07:41:55Z","snapshot_observed_at":"2026-08-18T00:48:14.021998Z","submitted_at":"2022-09-29T08:01:04Z","title":"Dynamic Prompt Learning via Policy Gradient for Semi-structured Mathematical Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14610","snapshot_observed_at":"2026-08-06T17:52:36.733960Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.10085","last_updated":"2025-07-14T09:11:33Z","snapshot_observed_at":"2026-08-13T14:13:10.992544Z","submitted_at":"2025-07-14T09:11:33Z","title":"Enhancing Chain-of-Thought Reasoning with Critical Representation Fine-tuning","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T17:52:36.733960Z"},"links":{"cited_paper":"/paper/2209.14610","citing_paper":"/paper/2507.10085"},"observation_digest":"sha256:3f2bb14481acab62e7e700d6037d46b09b90fd76d36aa8a2cded3f850f1b2fd5","observation_id":"1ca9bdcc-28dc-4284-918d-cdca4ea567c6","resolution":{"observed_at":"2026-08-06T17:52:36.733960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14610","last_updated":"2023-03-02T07:41:55Z","snapshot_observed_at":"2026-08-18T00:48:14.021998Z","submitted_at":"2022-09-29T08:01:04Z","title":"Dynamic Prompt Learning via Policy Gradient for Semi-structured Mathematical Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14610","snapshot_observed_at":"2026-08-06T16:50:03.783517Z","title":"Dynamic prompt learning via policy gradient for semi- structured mathematical reasoning,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-16T04:56:37.330824Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:03.783517Z"},"links":{"cited_paper":"/paper/2209.14610","citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:73471252d4a150c6c76bec408fcef5425dbad211baaa1778a031c50260698223","observation_id":"f8b413f7-7d5a-45e3-8655-2a7e0c828785","resolution":{"observed_at":"2026-08-06T16:50:03.783517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14610","last_updated":"2023-03-02T07:41:55Z","snapshot_observed_at":"2026-08-18T00:48:14.021998Z","submitted_at":"2022-09-29T08:01:04Z","title":"Dynamic Prompt Learning via Policy Gradient for Semi-structured Mathematical Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14610","snapshot_observed_at":"2026-08-06T12:18:36.719126Z","title":"Dynamic prompt learning via policy gradient for semi-structured mathematical reasoning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-15T10:04:01.608984Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:36.719126Z"},"links":{"cited_paper":"/paper/2209.14610","citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:c549126adf6a72fbef4abfba3d41e6e6e00abdd8082e481909cc28e37576c0c8","observation_id":"319aec87-0af3-4f86-bfe8-be9ab2818488","resolution":{"observed_at":"2026-08-06T12:18:36.719126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14610","last_updated":"2023-03-02T07:41:55Z","snapshot_observed_at":"2026-08-18T00:48:14.021998Z","submitted_at":"2022-09-29T08:01:04Z","title":"Dynamic Prompt Learning via Policy Gradient for Semi-structured Mathematical Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14610","snapshot_observed_at":"2026-08-06T17:05:19.206563Z","title":"N., Zhu, S.-C., Rajpurohit, T., Clark, P., and Kalyan, A","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.22069","last_updated":"2025-07-31T07:33:11Z","snapshot_observed_at":"2026-08-20T22:29:00.043540Z","submitted_at":"2025-07-16T03:11:43Z","title":"A Compute-Matched Re-Evaluation of TroVE on MATH","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T17:05:19.206563Z"},"links":{"cited_paper":"/paper/2209.14610","citing_paper":"/paper/2507.22069"},"observation_digest":"sha256:cae3354a2a43e47f85f69ec194e1e1208fc87b82fca8b2424a2cfec652b9d0e7","observation_id":"6ae840bb-6856-43d5-b93b-3e4b89998ffd","resolution":{"observed_at":"2026-08-06T17:05:19.206563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14610","last_updated":"2023-03-02T07:41:55Z","snapshot_observed_at":"2026-08-18T00:48:14.021998Z","submitted_at":"2022-09-29T08:01:04Z","title":"Dynamic Prompt Learning via Policy Gradient for Semi-structured Mathematical Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14610","snapshot_observed_at":"2026-08-15T17:24:08.397621Z","title":"Dynamic prompt learning via policy gradient for semi-structured mathematical reasoning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-18T01:37:24.516846Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.397621Z"},"links":{"cited_paper":"/paper/2209.14610","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:4e7ef94d13c8341a36c9158d1107489a29c3c042c5e3ffd4013d3bbc793a81f2","observation_id":"96109899-f9ff-431b-b58f-a0ed11b218ed","resolution":{"observed_at":"2026-08-15T17:24:08.397621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14610","last_updated":"2023-03-02T07:41:55Z","snapshot_observed_at":"2026-08-18T00:48:14.021998Z","submitted_at":"2022-09-29T08:01:04Z","title":"Dynamic Prompt Learning via Policy Gradient for Semi-structured Mathematical Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14610","snapshot_observed_at":"2026-08-04T23:56:52.574532Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.06278","last_updated":"2026-07-26T14:15:22Z","snapshot_observed_at":"2026-08-14T20:19:09.298002Z","submitted_at":"2025-09-08T02:00:31Z","title":"TableMind: An Autonomous Programmatic Agent for Tool-Augmented Table Reasoning","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T23:56:52.574532Z"},"links":{"cited_paper":"/paper/2209.14610","citing_paper":"/paper/2509.06278"},"observation_digest":"sha256:b2a7fc5481aa45b93c83f51230564304e9042bd9e24874ff4e0f786510bc8ecb","observation_id":"d6f8beef-a452-4e5f-8a3f-d6c6b9153366","resolution":{"observed_at":"2026-08-04T23:56:52.574532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14610","last_updated":"2023-03-02T07:41:55Z","snapshot_observed_at":"2026-08-18T00:48:14.021998Z","submitted_at":"2022-09-29T08:01:04Z","title":"Dynamic Prompt Learning via Policy Gradient for Semi-structured Mathematical Reasoning","version":3},"cited_work":{"arxiv_id":"2209.14610","doi":null,"metadata_source":"pith","pith_arxiv_id":"2209.14610","snapshot_observed_at":"2026-07-05T17:41:17.457873Z","title":"arXiv preprint arXiv:2209.14610 , year =","venue":"cs.LG","work_id":"b02aa44e-3fa1-4e2f-a1d4-adc73c214fdc","year":2022},"citing_paper":{"arxiv_id":"2510.09671","last_updated":"2026-04-18T09:34:28Z","snapshot_observed_at":"2026-08-13T09:51:48.892652Z","submitted_at":"2025-10-08T14:56:03Z","title":"Table Question Answering in the Era of Large Language Models: A Comprehensive Survey of Tasks, Methods, and Evaluation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-18T09:17:00.389716Z"},"links":{"cited_paper":"/paper/2209.14610","citing_paper":"/paper/2510.09671"},"observation_digest":"sha256:503d8305dda460cb9d8ec1a6f0371b6f49bc42914194b1014bd1f0cf9f482f30","observation_id":"13894834-534b-453e-8427-7c16af940138","resolution":{"observed_at":"2026-05-18T09:21:10.687359Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14610","last_updated":"2023-03-02T07:41:55Z","snapshot_observed_at":"2026-08-18T00:48:14.021998Z","submitted_at":"2022-09-29T08:01:04Z","title":"Dynamic Prompt Learning via Policy Gradient for Semi-structured Mathematical Reasoning","version":3},"cited_work":{"arxiv_id":"2209.14610","doi":null,"metadata_source":"pith","pith_arxiv_id":"2209.14610","snapshot_observed_at":"2026-07-05T17:41:17.457873Z","title":"arXiv preprint arXiv:2209.14610 , year =","venue":"cs.LG","work_id":"b02aa44e-3fa1-4e2f-a1d4-adc73c214fdc","year":2022},"citing_paper":{"arxiv_id":"2601.03682","last_updated":"2026-04-18T04:38:32Z","snapshot_observed_at":"2026-08-10T22:17:30.389591Z","submitted_at":"2026-01-07T08:15:01Z","title":"From Implicit to Explicit: Token-Efficient Logical Supervision for Mathematical Reasoning in LLMs","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-16T17:09:58.963561Z"},"links":{"cited_paper":"/paper/2209.14610","citing_paper":"/paper/2601.03682"},"observation_digest":"sha256:5f2d27c2326db1e9c65f51eeb2217cd2759faa71fcb16955d394c7c54c8b105d","observation_id":"5e68657e-cbf9-4d1b-8731-2699fe041a04","resolution":{"observed_at":"2026-05-16T17:11:08.204801Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14610","last_updated":"2023-03-02T07:41:55Z","snapshot_observed_at":"2026-08-18T00:48:14.021998Z","submitted_at":"2022-09-29T08:01:04Z","title":"Dynamic Prompt Learning via Policy Gradient for Semi-structured Mathematical Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14610","snapshot_observed_at":"2026-08-03T06:52:53.945286Z","title":"N., Zhu, S.-C., Rajpurohit, T., Clark, P., and Kalyan, A","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2601.21909","last_updated":"2026-05-28T16:50:42Z","snapshot_observed_at":"2026-08-13T16:19:01.554758Z","submitted_at":"2026-01-29T16:00:48Z","title":"From Meta-Thought to Execution: Cognitively Aligned Post-Training for Generalizable and Reliable LLM Reasoning","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-03T06:52:53.945286Z"},"links":{"cited_paper":"/paper/2209.14610","citing_paper":"/paper/2601.21909"},"observation_digest":"sha256:96c15d1ed3fafeb43c0cb8d37a6a30ed83dfb1413e9ee7ebf0899690a7cf6aa7","observation_id":"0f778b08-1513-4b56-9814-1927e1be69d3","resolution":{"observed_at":"2026-08-03T06:52:53.945286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14610","last_updated":"2023-03-02T07:41:55Z","snapshot_observed_at":"2026-08-18T00:48:14.021998Z","submitted_at":"2022-09-29T08:01:04Z","title":"Dynamic Prompt Learning via Policy Gradient for Semi-structured Mathematical Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14610","snapshot_observed_at":"2026-08-02T19:57:32.329557Z","title":"Dynamic prompt learning via policy gradient for semi-structured mathematical reasoning.arXiv preprint arXiv:2209.14610, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.06652","last_updated":"2026-06-11T03:22:36Z","snapshot_observed_at":"2026-08-14T07:03:59.496846Z","submitted_at":"2026-02-28T04:33:11Z","title":"PaLMR: Towards Faithful Visual Reasoning via Multimodal Process Alignment","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T19:57:32.329557Z"},"links":{"cited_paper":"/paper/2209.14610","citing_paper":"/paper/2603.06652"},"observation_digest":"sha256:dfb2cc87be84ddc3ead0eb779d3cc339ae31951390ab3c680af33a2682d9a640","observation_id":"0fbc24ed-2b5b-41c0-9fa1-275302ea34a7","resolution":{"observed_at":"2026-08-02T19:57:32.329557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14610","last_updated":"2023-03-02T07:41:55Z","snapshot_observed_at":"2026-08-18T00:48:14.021998Z","submitted_at":"2022-09-29T08:01:04Z","title":"Dynamic Prompt Learning via Policy Gradient for Semi-structured Mathematical Reasoning","version":3},"cited_work":{"arxiv_id":"2209.14610","doi":null,"metadata_source":"pith","pith_arxiv_id":"2209.14610","snapshot_observed_at":"2026-07-05T17:41:17.457873Z","title":"arXiv preprint arXiv:2209.14610 , year =","venue":"cs.LG","work_id":"b02aa44e-3fa1-4e2f-a1d4-adc73c214fdc","year":2022},"citing_paper":{"arxiv_id":"2604.17433","last_updated":"2026-06-04T22:58:20Z","snapshot_observed_at":"2026-08-15T16:37:46.861894Z","submitted_at":"2026-04-19T13:26:04Z","title":"Self-Consistency from Only Two Samples: CoT-PoT Ensembling for Efficient LLM Reasoning","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-05T17:40:18.030591Z"},"links":{"cited_paper":"/paper/2209.14610","citing_paper":"/paper/2604.17433"},"observation_digest":"sha256:5771be256352950b45059d8a398ef88b8cbc227db2d5232b88aa3281a7b5285d","observation_id":"9fd8fad2-2019-49a6-9e9d-17cf251d7597","resolution":{"observed_at":"2026-07-05T17:41:17.460571Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14610","last_updated":"2023-03-02T07:41:55Z","snapshot_observed_at":"2026-08-18T00:48:14.021998Z","submitted_at":"2022-09-29T08:01:04Z","title":"Dynamic Prompt Learning via Policy Gradient for Semi-structured Mathematical Reasoning","version":3},"cited_work":{"arxiv_id":"2209.14610","doi":null,"metadata_source":"pith","pith_arxiv_id":"2209.14610","snapshot_observed_at":"2026-07-05T17:41:17.457873Z","title":"arXiv preprint arXiv:2209.14610 , year =","venue":"cs.LG","work_id":"b02aa44e-3fa1-4e2f-a1d4-adc73c214fdc","year":2022},"citing_paper":{"arxiv_id":"2604.20755","last_updated":"2026-04-22T16:44:33Z","snapshot_observed_at":"2026-08-12T17:11:51.959264Z","submitted_at":"2026-04-22T16:44:33Z","title":"V-tableR1: Process-Supervised Multimodal Table Reasoning with Critic-Guided Policy Optimization","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-09T23:48:32.613988Z"},"links":{"cited_paper":"/paper/2209.14610","citing_paper":"/paper/2604.20755"},"observation_digest":"sha256:3e72dd946988862e75e7f5e9c33fafb9096bdba50a780e33316d72f3497e1c12","observation_id":"e873eadc-c41f-4092-8528-5a7a74e87e95","resolution":{"observed_at":"2026-05-11T14:01:04.237102Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14610","last_updated":"2023-03-02T07:41:55Z","snapshot_observed_at":"2026-08-18T00:48:14.021998Z","submitted_at":"2022-09-29T08:01:04Z","title":"Dynamic Prompt Learning via Policy Gradient for Semi-structured Mathematical Reasoning","version":3},"cited_work":{"arxiv_id":"2209.14610","doi":null,"metadata_source":"pith","pith_arxiv_id":"2209.14610","snapshot_observed_at":"2026-07-05T17:41:17.457873Z","title":"arXiv preprint arXiv:2209.14610 , year =","venue":"cs.LG","work_id":"b02aa44e-3fa1-4e2f-a1d4-adc73c214fdc","year":2022},"citing_paper":{"arxiv_id":"2605.01018","last_updated":"2026-05-21T18:54:13Z","snapshot_observed_at":"2026-08-16T00:23:11.194779Z","submitted_at":"2026-05-01T18:28:49Z","title":"WildTableBench: Benchmarking Multimodal Foundation Models on Table Understanding In the Wild","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-05-09T19:28:54.531339Z"},"links":{"cited_paper":"/paper/2209.14610","citing_paper":"/paper/2605.01018"},"observation_digest":"sha256:e7db1364a020b46d2538644f1c75008e1f16d4f348d00b99c25d0ae1cbdb2dbe","observation_id":"4cb5e9e7-0f80-4054-90b7-8b11f5b14ca7","resolution":{"observed_at":"2026-05-11T15:41:24.776125Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14610","last_updated":"2023-03-02T07:41:55Z","snapshot_observed_at":"2026-08-18T00:48:14.021998Z","submitted_at":"2022-09-29T08:01:04Z","title":"Dynamic Prompt Learning via Policy Gradient for Semi-structured Mathematical Reasoning","version":3},"cited_work":{"arxiv_id":"2209.14610","doi":null,"metadata_source":"pith","pith_arxiv_id":"2209.14610","snapshot_observed_at":"2026-07-05T17:41:17.457873Z","title":"arXiv preprint arXiv:2209.14610 , year =","venue":"cs.LG","work_id":"b02aa44e-3fa1-4e2f-a1d4-adc73c214fdc","year":2022},"citing_paper":{"arxiv_id":"2605.01018","last_updated":"2026-05-21T18:54:13Z","snapshot_observed_at":"2026-08-16T00:23:11.194779Z","submitted_at":"2026-05-01T18:28:49Z","title":"WildTableBench: Benchmarking Multimodal Foundation Models on Table Understanding In the Wild","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-05-25T06:07:28.392100Z"},"links":{"cited_paper":"/paper/2209.14610","citing_paper":"/paper/2605.01018"},"observation_digest":"sha256:f956351848636c9de2b168aaff3e343f63cfadf4c4f754cc1b66c037c67764ff","observation_id":"60c70ffd-6c9f-4b66-9502-b67ca9d6ef01","resolution":{"observed_at":"2026-05-25T06:10:24.092184Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14610","last_updated":"2023-03-02T07:41:55Z","snapshot_observed_at":"2026-08-18T00:48:14.021998Z","submitted_at":"2022-09-29T08:01:04Z","title":"Dynamic Prompt Learning via Policy Gradient for Semi-structured Mathematical Reasoning","version":3},"cited_work":{"arxiv_id":"2209.14610","doi":null,"metadata_source":"pith","pith_arxiv_id":"2209.14610","snapshot_observed_at":"2026-07-05T17:41:17.457873Z","title":"arXiv preprint arXiv:2209.14610 , year =","venue":"cs.LG","work_id":"b02aa44e-3fa1-4e2f-a1d4-adc73c214fdc","year":2022},"citing_paper":{"arxiv_id":"2605.08560","last_updated":"2026-05-08T23:41:13Z","snapshot_observed_at":"2026-08-15T12:35:11.807336Z","submitted_at":"2026-05-08T23:41:13Z","title":"ZAYA1-VL-8B Technical Report","version":1},"reference_index":163,"source":"pdf_text","source_observed_at":"2026-05-12T01:15:16.607346Z"},"links":{"cited_paper":"/paper/2209.14610","citing_paper":"/paper/2605.08560"},"observation_digest":"sha256:c8b5bf92ec0269ec5da38a2436fdda9dad69fb3a67b072285df9eea5fe861cc2","observation_id":"b26d3fdd-c3ec-4262-a7b3-20a15995e983","resolution":{"observed_at":"2026-05-12T08:21:23.486623Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14610","last_updated":"2023-03-02T07:41:55Z","snapshot_observed_at":"2026-08-18T00:48:14.021998Z","submitted_at":"2022-09-29T08:01:04Z","title":"Dynamic Prompt Learning via Policy Gradient for Semi-structured Mathematical Reasoning","version":3},"cited_work":{"arxiv_id":"2209.14610","doi":null,"metadata_source":"pith","pith_arxiv_id":"2209.14610","snapshot_observed_at":"2026-07-05T17:41:17.457873Z","title":"arXiv preprint arXiv:2209.14610 , year =","venue":"cs.LG","work_id":"b02aa44e-3fa1-4e2f-a1d4-adc73c214fdc","year":2022},"citing_paper":{"arxiv_id":"2606.00390","last_updated":"2026-05-29T22:12:40Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T22:12:40Z","title":"Zamba2-VL Technical Report","version":1},"reference_index":123,"source":"pdf_text","source_observed_at":"2026-06-28T22:34:20.970856Z"},"links":{"cited_paper":"/paper/2209.14610","citing_paper":"/paper/2606.00390"},"observation_digest":"sha256:863cf54edfdeae53f8e56ddab7fc46731b46133cf3658c1836f984019f5d9e92","observation_id":"9d902a10-81d4-448a-89b2-3ffd33bc34d9","resolution":{"observed_at":"2026-07-01T19:26:00.662647Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14610","last_updated":"2023-03-02T07:41:55Z","snapshot_observed_at":"2026-08-18T00:48:14.021998Z","submitted_at":"2022-09-29T08:01:04Z","title":"Dynamic Prompt Learning via Policy Gradient for Semi-structured Mathematical Reasoning","version":3},"cited_work":{"arxiv_id":"2209.14610","doi":null,"metadata_source":"pith","pith_arxiv_id":"2209.14610","snapshot_observed_at":"2026-07-05T17:41:17.457873Z","title":"arXiv preprint arXiv:2209.14610 , year =","venue":"cs.LG","work_id":"b02aa44e-3fa1-4e2f-a1d4-adc73c214fdc","year":2022},"citing_paper":{"arxiv_id":"2606.01075","last_updated":"2026-06-02T05:50:15Z","snapshot_observed_at":"2026-08-08T11:14:54.052517Z","submitted_at":"2026-05-31T07:43:19Z","title":"On the Generalization Gap in Self-Evolving Language Model Reasoning","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-28T17:18:37.671369Z"},"links":{"cited_paper":"/paper/2209.14610","citing_paper":"/paper/2606.01075"},"observation_digest":"sha256:dab067633c7d0ad42d3940c19ce31c84a5dbd6f6c445f1ba29f349c554e3032c","observation_id":"03258f5a-a419-4f52-962e-1e01d6164398","resolution":{"observed_at":"2026-06-28T17:22:24.934086Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14610","last_updated":"2023-03-02T07:41:55Z","snapshot_observed_at":"2026-08-18T00:48:14.021998Z","submitted_at":"2022-09-29T08:01:04Z","title":"Dynamic Prompt Learning via Policy Gradient for Semi-structured Mathematical Reasoning","version":3},"cited_work":{"arxiv_id":"2209.14610","doi":null,"metadata_source":"pith","pith_arxiv_id":"2209.14610","snapshot_observed_at":"2026-07-05T17:41:17.457873Z","title":"arXiv preprint arXiv:2209.14610 , year =","venue":"cs.LG","work_id":"b02aa44e-3fa1-4e2f-a1d4-adc73c214fdc","year":2022},"citing_paper":{"arxiv_id":"2606.03606","last_updated":"2026-06-03T12:40:36Z","snapshot_observed_at":"2026-08-05T13:58:58.657681Z","submitted_at":"2026-06-02T13:09:44Z","title":"Testing LLM Arithmetic Reasoning Generalization with Automatic Numeric-Remapping Attacks","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-28T09:27:30.923556Z"},"links":{"cited_paper":"/paper/2209.14610","citing_paper":"/paper/2606.03606"},"observation_digest":"sha256:b76a9122e4542d02ae0246077d22de8b1b9de1eb9a3871be242e724b93fb11b2","observation_id":"383af810-4417-49a0-baf6-34ad11371b6c","resolution":{"observed_at":"2026-07-02T04:06:35.186296Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14610","last_updated":"2023-03-02T07:41:55Z","snapshot_observed_at":"2026-08-18T00:48:14.021998Z","submitted_at":"2022-09-29T08:01:04Z","title":"Dynamic Prompt Learning via Policy Gradient for Semi-structured Mathematical Reasoning","version":3},"cited_work":{"arxiv_id":"2209.14610","doi":null,"metadata_source":"pith","pith_arxiv_id":"2209.14610","snapshot_observed_at":"2026-07-05T17:41:17.457873Z","title":"arXiv preprint arXiv:2209.14610 , year =","venue":"cs.LG","work_id":"b02aa44e-3fa1-4e2f-a1d4-adc73c214fdc","year":2022},"citing_paper":{"arxiv_id":"2606.10298","last_updated":"2026-06-09T01:34:13Z","snapshot_observed_at":"2026-08-07T09:29:25.981670Z","submitted_at":"2026-06-09T01:34:13Z","title":"From Context-Aware to Conflict-Aware: Generalizing Contrastive Decoding for Knowledge Conflict in LLMs","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-27T13:38:31.421486Z"},"links":{"cited_paper":"/paper/2209.14610","citing_paper":"/paper/2606.10298"},"observation_digest":"sha256:116a56fed223c24c3dce5339c133c84343a6bce7b5c7cdc0e8bbd29cac55c2bd","observation_id":"2d89b93a-b6d1-4900-a27c-3c96111fac85","resolution":{"observed_at":"2026-07-03T04:47:38.341911Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14610","last_updated":"2023-03-02T07:41:55Z","snapshot_observed_at":"2026-08-18T00:48:14.021998Z","submitted_at":"2022-09-29T08:01:04Z","title":"Dynamic Prompt Learning via Policy Gradient for Semi-structured Mathematical Reasoning","version":3},"cited_work":{"arxiv_id":"2209.14610","doi":null,"metadata_source":"pith","pith_arxiv_id":"2209.14610","snapshot_observed_at":"2026-07-05T17:41:17.457873Z","title":"arXiv preprint arXiv:2209.14610 , year =","venue":"cs.LG","work_id":"b02aa44e-3fa1-4e2f-a1d4-adc73c214fdc","year":2022},"citing_paper":{"arxiv_id":"2606.11537","last_updated":"2026-06-17T21:27:59Z","snapshot_observed_at":"2026-08-13T19:05:34.141200Z","submitted_at":"2026-06-10T00:45:39Z","title":"MoCA-Agent: A Market-of-Claims Code Agent for Financial and Numerical Reasoning","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-06-27T10:17:42.831128Z"},"links":{"cited_paper":"/paper/2209.14610","citing_paper":"/paper/2606.11537"},"observation_digest":"sha256:8b14ad6bf6004c30b7e6a3737e44f90eb02239d502c1894aef7cb0312d67fa61","observation_id":"9cff557a-1171-4ee2-80d1-1f1ba5084f87","resolution":{"observed_at":"2026-07-03T09:57:56.203277Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14610","last_updated":"2023-03-02T07:41:55Z","snapshot_observed_at":"2026-08-18T00:48:14.021998Z","submitted_at":"2022-09-29T08:01:04Z","title":"Dynamic Prompt Learning via Policy Gradient for Semi-structured Mathematical Reasoning","version":3},"cited_work":{"arxiv_id":"2209.14610","doi":null,"metadata_source":"pith","pith_arxiv_id":"2209.14610","snapshot_observed_at":"2026-07-05T17:41:17.457873Z","title":"arXiv preprint arXiv:2209.14610 , year =","venue":"cs.LG","work_id":"b02aa44e-3fa1-4e2f-a1d4-adc73c214fdc","year":2022},"citing_paper":{"arxiv_id":"2606.31958","last_updated":"2026-06-30T17:00:33Z","snapshot_observed_at":"2026-07-07T00:05:37.068846Z","submitted_at":"2026-06-30T17:00:33Z","title":"Adapting Generalist Robot Policies with Semantic Reinforcement Learning","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-07-01T05:09:29.625066Z"},"links":{"cited_paper":"/paper/2209.14610","citing_paper":"/paper/2606.31958"},"observation_digest":"sha256:11cd6361c053a51fbe60543449291cb545e625151359f02c9fab375bb78011f2","observation_id":"bf856bad-8392-4af0-9dc4-fc151234e38d","resolution":{"observed_at":"2026-07-01T10:45:42.737459Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2209.14610/citation-record","integrity":"/paper/2209.14610/integrity","json":"/paper/2209.14610/citation-record.json","paper":"/paper/2209.14610"},"outbound":[],"paper":{"arxiv_id":"2209.14610","last_updated":"2023-03-02T07:41:55Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-18T00:48:14.021998Z","submitted_at":"2022-09-29T08:01:04Z","title":"Dynamic Prompt Learning via Policy Gradient for Semi-structured Mathematical Reasoning"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 47 inbound Pith citation observations for arXiv:2209.14610."}