{"as_of":"2026-08-15T05:31:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d0975b15a7c54bd66b1ff4f1e816a0fdad7b9bc6a61a2db0ea377c18de8ee048","coverage":[{"denominator":133,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:13:10.322843Z","state":"measured"},{"denominator":101,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":101,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T15:31:25.047058Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T15:31:26.249343Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-14T19:11:50.543978Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"cited_work":{"arxiv_id":"2505.19815","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.19815","snapshot_observed_at":"2026-08-06T15:31:26.249343Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","venue":"cs.CL","work_id":"8bf2ae0c-0c88-4892-88b4-dd16428d2701","year":2025},"citing_paper":{"arxiv_id":"2507.16003","last_updated":"2026-06-02T08:52:07Z","snapshot_observed_at":"2026-08-11T08:23:39.695085Z","submitted_at":"2025-07-21T18:44:35Z","title":"Learning without training: The implicit dynamics of in-context learning","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T15:31:25.047058Z"},"links":{"cited_paper":"/paper/2505.19815","citing_paper":"/paper/2507.16003"},"observation_digest":"sha256:ff5495ad145b4f7de98682c95781b382896dd0f6b4f23768d734ea12e1cd9c36","observation_id":"36db4986-8f7d-4b3a-bcd8-080ad3e7dd9e","resolution":{"observed_at":"2026-08-06T15:31:26.311146Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.19815/citation-record","integrity":"/paper/2505.19815/integrity","json":"/paper/2505.19815/citation-record.json","paper":"/paper/2505.19815"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:03.846154Z","title":"On sensitivity of meta-learning to support data","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-14T19:11:50.543978Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:03.846154Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:2aa53febd72c826cff65a1f15950c394ec7d880c992bf4e3df67f5ee123f769f","observation_id":"cd7960cf-27bb-447b-9b92-a329d3c9a498","resolution":{"observed_at":"2026-08-07T14:13:03.846154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:03.889689Z","title":"Back to basics: Revisiting reinforce-style optimization for learning from human feedback in llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-14T19:11:50.543978Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:03.889689Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:bed9e62f2b35f57aabdf230ec1d5c2cf7268cb34d0719e774a1a89cb6d5a9a09","observation_id":"9062d4bc-6448-4df5-88c6-5edc78f9f64c","resolution":{"observed_at":"2026-08-07T14:13:03.889689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:03.954359Z","title":"What learning algorithm is in-context learning? investigations with linear models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-14T19:11:50.543978Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:03.954359Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:d11e2e909f5bebac530801ff7e49763705c6ffc4051d8d61557135c111868cf5","observation_id":"41bcb0e9-8fef-4824-a591-e2b94b7ae97d","resolution":{"observed_at":"2026-08-07T14:13:03.954359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:04.007965Z","title":"Hoffman, David Pfau, Tom Schaul, and Nando de Freitas","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-14T19:11:50.543978Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:04.007965Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:a81ca56aea3af35f9c99763f7affca2f6b2ffa432577ab94f468b0230d89743b","observation_id":"37cd0d8e-c446-4c34-9e67-58bc0e03c546","resolution":{"observed_at":"2026-08-07T14:13:04.007965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:04.021073Z","title":"Transformers as statisticians: Provable in-context learning with in-context algorithm selection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-14T19:11:50.543978Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:04.021073Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:2cf7f8f7648df2e6d0b9bbee136e7d699ba7047e41d75e1207e9829e53b86ef3","observation_id":"4d3070e3-e1cf-401e-9067-fef6d050f215","resolution":{"observed_at":"2026-08-07T14:13:04.021073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:04.089527Z","title":"Numinamath 72b cot.https://huggingface.co/ AI-MO/NuminaMath-72B-CoT, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-14T19:11:50.543978Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:04.089527Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:9d728fc117d40d0e23f24edaf604a73f9ba568bdf51d0ce0adedab0a68fac640","observation_id":"640cc635-1292-4979-a2e8-f575c7d052ef","resolution":{"observed_at":"2026-08-07T14:13:04.089527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:04.153587Z","title":"On the optimization of a synaptic learning rule","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-14T19:11:50.543978Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:04.153587Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:019c99e2d2826c64c940ac3e841f784ec19d6915bda8b1b267bc2770bd27813d","observation_id":"6cbcf43e-f241-4849-8d4d-3a83eb7b4a52","resolution":{"observed_at":"2026-08-07T14:13:04.153587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:04.185963Z","title":"Llama-Nemotron: Efficient reasoning models.CoRR, abs/2505.00949, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-14T19:11:50.543978Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:04.185963Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:de1f035a2fbc8d035aec3d43aaf9205a08825da48b4927d2c05356061256194b","observation_id":"95fbf38b-d253-4a4d-9a88-36061aad59d2","resolution":{"observed_at":"2026-08-07T14:13:04.185963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00200","last_updated":"2025-03-03T19:53:28Z","snapshot_observed_at":"2026-08-15T05:29:28.605488Z","submitted_at":"2024-04-30T21:06:52Z","title":"In-Context Learning with Long-Context Models: An In-Depth Exploration","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00200","snapshot_observed_at":"2026-08-07T14:13:04.222611Z","title":"Gormley, and Graham Neubig","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-14T19:11:50.543978Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:04.222611Z"},"links":{"cited_paper":"/paper/2405.00200","citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:6c0636941936642a3e23c7e36a72dac27872278c0eda65640fbc3a381de1eafe","observation_id":"63ffba2c-47ae-4b84-b451-cb57d72f734b","resolution":{"observed_at":"2026-08-07T14:13:04.222611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:04.276040Z","title":"Graph of thoughts: Solving elaborate problems with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-14T19:11:50.543978Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:04.276040Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:93ec9e96f068838803b12ff6e6531e36c6ecfd90a5301a7f34fed12854f83323","observation_id":"492d5d87-8e50-42d7-801b-64ae44e07137","resolution":{"observed_at":"2026-08-07T14:13:04.276040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:04.332975Z","title":"On the ability and limitations of transformers to recognize formal languages","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-14T19:11:50.543978Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:04.332975Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:70897087d2ccf450a70a057446fee896a93066ba53a54d5eb570056be133e611","observation_id":"22663e17-7e8c-4082-b7e7-5f4b984cf4e6","resolution":{"observed_at":"2026-08-07T14:13:04.332975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:04.393726Z","title":"Application of calculus of matrices to method of least squares: with special reference to geodetic calculations.Trans","venue":null,"work_id":null,"year":1951},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-14T19:11:50.543978Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:04.393726Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:ba5189971ef4eb8aaef59ef3109baa5cead12c6b8b5cc5232b53acdd90dc7577","observation_id":"cbcbcbea-674a-4073-9ce1-ae6ee9130e25","resolution":{"observed_at":"2026-08-07T14:13:04.393726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:04.463619Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-14T19:11:50.543978Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:04.463619Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:6ebefb05fb249e10181d274b9453a1e542dd934d9c64f82541ea6d93e883f386","observation_id":"0c356d39-3593-4cb4-96da-5e231a942a6d","resolution":{"observed_at":"2026-08-07T14:13:04.463619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11468","last_updated":"2025-04-10T16:54:05Z","snapshot_observed_at":"2026-08-05T02:57:13.928237Z","submitted_at":"2025-04-10T16:54:05Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11468","snapshot_observed_at":"2026-08-07T14:13:04.572965Z","title":"Sft or rl? an early investigation into training r1-like reasoning large vision-language models.CoRR, abs/2504.11468, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-14T19:11:50.543978Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:04.572965Z"},"links":{"cited_paper":"/paper/2504.11468","citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:11811c91e87608b7f02a5131cba4249aea00e2bf18e0484725655a13ba426849","observation_id":"111a5e79-786e-45ab-b28e-e508b1c541de","resolution":{"observed_at":"2026-08-07T14:13:04.572965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:04.650151Z","title":"A closer look at the training strategy for modern meta-learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-14T19:11:50.543978Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:04.650151Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:0d1d93057be30b7e67d90450d5aee42ba066069654611cd5159606843776bbd6","observation_id":"1d5550d9-631f-4a81-8b12-9f17cb116a5c","resolution":{"observed_at":"2026-08-07T14:13:04.650151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:04.777215Z","title":"Variational metric scaling for metric-based meta-learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-14T19:11:50.543978Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:04.777215Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:07ab15fe2f05254d71d1b6a21190f94b5cbbf584640b1ebdae18cb64b601846c","observation_id":"ee5eaa55-4e10-49fc-b2d9-a4a2f9773045","resolution":{"observed_at":"2026-08-07T14:13:04.777215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-07T14:13:04.861032Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-14T19:11:50.543978Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:04.861032Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:5ba8538e8dec4dc3ae556a07afda3fb87b57ba2e02c584ae2abaaebc897850de","observation_id":"bd803e36-d4ad-4d2e-908b-1d81c32c6da5","resolution":{"observed_at":"2026-08-07T14:13:04.861032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09567","last_updated":"2025-07-18T15:57:54Z","snapshot_observed_at":"2026-08-08T22:33:20.124926Z","submitted_at":"2025-03-12T17:35:03Z","title":"Towards Reasoning Era: A Survey of Long Chain-of-Thought for Reasoning Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09567","snapshot_observed_at":"2026-08-07T14:13:04.956661Z","title":"Towards reasoning era: A survey of long chain-of-thought for reasoning large language models.CoRR, abs/2503.09567, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-14T19:11:50.543978Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:04.956661Z"},"links":{"cited_paper":"/paper/2503.09567","citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:19df3fd8bab73183bd13a1543e55f40e191e5f27c44da02bd28ae0f1e25ea80c","observation_id":"518ca357-322d-446b-80b2-59141bdd4cc3","resolution":{"observed_at":"2026-08-07T14:13:04.956661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:05.037177Z","title":"Tighter bounds on the expressivity of transformer encoders","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-14T19:11:50.543978Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:05.037177Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:1d274efe64fe2191f0a8f7eb6055b31cb7c666757e5a3dc6533251d2152d42d1","observation_id":"e55d93cd-53dc-4e59-90ce-8d4dac890a6f","resolution":{"observed_at":"2026-08-07T14:13:05.037177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17161","last_updated":"2025-05-26T17:16:45Z","snapshot_observed_at":"2026-08-09T18:26:12.869738Z","submitted_at":"2025-01-28T18:59:44Z","title":"SFT Memorizes, RL Generalizes: A Comparative Study of Foundation Model Post-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17161","snapshot_observed_at":"2026-08-07T14:13:05.097364Z","title":"Le, Sergey Levine, and Yi Ma","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-14T19:11:50.543978Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:05.097364Z"},"links":{"cited_paper":"/paper/2501.17161","citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:43749a56280b8bc23345429f9605aed5cf190c0344941ce224f25a6ae71b2cc3","observation_id":"13f9710f-010f-4439-b2c3-3413663f1975","resolution":{"observed_at":"2026-08-07T14:13:05.097364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:05.185556Z","title":"Gpg: A simple and strong reinforcement learning baseline for model reasoning.CoRR, abs/2504.02546, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-14T19:11:50.543978Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:05.185556Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:46cf704834f6ef49974aba83a6951be86458491f4431141398518c98668b45af","observation_id":"f2bb6e67-9f19-457a-a385-9c22bdff631d","resolution":{"observed_at":"2026-08-07T14:13:05.185556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:05.251388Z","title":"Task-robust model-agnostic meta-learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-14T19:11:50.543978Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:05.251388Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:79eaaa696f07c62bf171b75eadfc01b680e7d7d0bf2692810e61ccfbfc1baa7a","observation_id":"873e7d08-0884-446a-af88-6381fd5c39d4","resolution":{"observed_at":"2026-08-07T14:13:05.251388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:05.313549Z","title":"How does the task landscape affect MAML performance? InCoLLAs, volume 199 ofProceedings of Machine Learning Research, pages 23–59","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-14T19:11:50.543978Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:05.313549Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:de2c7a4e02a2d2453f0ab7581494e657ef869e669e8a902e60eaad830e0f61cb","observation_id":"546d6461-e0ef-43e0-a34f-77188d01d39f","resolution":{"observed_at":"2026-08-07T14:13:05.313549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:05.373031Z","title":"Approximations by superpositions of a sigmoidal function.MCSS, 2:183–192, 1989","venue":null,"work_id":null,"year":1989},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-14T19:11:50.543978Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:05.373031Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:bb6aebbd72729ba06417bf8d83a816c013f1022e552675ac662ce7bd60a65ca5","observation_id":"5d538284-4aa0-4d77-b52a-a7c81927e3b0","resolution":{"observed_at":"2026-08-07T14:13:05.373031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:05.423564Z","title":"Why can gpt learn in-context? language models secretly perform gradient descent as meta-optimizers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-14T19:11:50.543978Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:05.423564Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:30d4620159ee228cbb9cc34c715f625cb9bb721c3f3c1fd49e82ed1e1f641308","observation_id":"b3cd39d0-bcdb-480f-9e5d-544dbf71c5a5","resolution":{"observed_at":"2026-08-07T14:13:05.423564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:05.535773Z","title":"Gemini 2.5: Our most intelligent ai model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-14T19:11:50.543978Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:05.535773Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:e03a4cf8533dd1def2de74bb4ada3103f0215d0a7dac6d6dc81ac1d06a575c6d","observation_id":"4061d508-f39e-446a-a831-e4e9dd5c0317","resolution":{"observed_at":"2026-08-07T14:13:05.535773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-13T15:58:13.809876Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T14:13:05.581094Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-14T19:11:50.543978Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:05.581094Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:f701989f0b78131412225ff245e9465f56854fceedf186845cc720efe09066c2","observation_id":"d825fd48-c173-4c7c-ba2c-9bc5abf04bed","resolution":{"observed_at":"2026-08-07T14:13:05.581094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-11T01:48:59.557045Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-07T14:13:05.623446Z","title":"Zhang, Han Bao, Hanwei Xu, Haocheng Wang, Haowei Zhang, Honghui Ding, Huajian Xin, Huazuo Gao, Hui Li, Hui Qu, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-14T19:11:50.543978Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:05.623446Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:dc3f7301f07e8fbc1994971d5d6d1f8b0fea08532b07f23729045d1e2280e06e","observation_id":"68cacb91-93c5-4dff-b88e-87ab20cc52c2","resolution":{"observed_at":"2026-08-07T14:13:05.623446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:05.680234Z","title":"Universal transformers","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-14T19:11:50.543978Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:05.680234Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:7fb5071e098f8fe1f05e7bea9a30f552a047530c86371756cff4a8c2927d7a03","observation_id":"8a67dbd7-0b59-4cbd-841b-f33895d00586","resolution":{"observed_at":"2026-08-07T14:13:05.680234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:05.778916Z","title":"BERT: pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-14T19:11:50.543978Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:05.778916Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:27f9ab7bb9fdefe112504059d00999ed9588138f0135119c5c90b1326870d9ce","observation_id":"5b31e925-f738-47dd-817e-06d3ab34c297","resolution":{"observed_at":"2026-08-07T14:13:05.778916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:05.847209Z","title":"A survey on in-context learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-14T19:11:50.543978Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:05.847209Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:9913d0a9e034d78d320c6f95526ad24f09a58fdb07a6a71de7c6ad80fcccfb96","observation_id":"0785688b-7ca1-42f5-b648-87b70ce5f28c","resolution":{"observed_at":"2026-08-07T14:13:05.847209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T14:13:05.932438Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-14T19:11:50.543978Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:05.932438Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:481b156a8e4184b0617f326a3743160c5c4bda72dfca19b1cc364b4ba0c8df35","observation_id":"221e7f49-d486-4dde-8594-c117654f1f23","resolution":{"observed_at":"2026-08-07T14:13:05.932438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:05.991035Z","title":"Towards revealing the mystery behind chain of thought: A theoretical perspective","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-14T19:11:50.543978Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:05.991035Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:b3a1389b649ce8ef614ef2f906f6ebb7df9285bb2692bfc18c59912f46b3d26f","observation_id":"a0b5cb80-3051-48de-847f-972378cc0d86","resolution":{"observed_at":"2026-08-07T14:13:05.991035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:06.102481Z","title":"Model-agnostic meta-learning for fast adaptation of deep networks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-14T19:11:50.543978Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:06.102481Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:9afef7dc2233f058621524652e6d6249795c4dea1c0c3bc85c84f16709598ad1","observation_id":"08087437-dede-417f-ac4c-65901acb7763","resolution":{"observed_at":"2026-08-07T14:13:06.102481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:06.154765Z","title":"Transformers learn to achieve second-order convergence rates for in-context linear regression","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-14T19:11:50.543978Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:06.154765Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:7ca9fa7c5659d41c52ec829be556247c279302ce8dd610cebd0f6f6f84ee944c","observation_id":"f3180c5d-5d3c-4818-b70f-c94029497cde","resolution":{"observed_at":"2026-08-07T14:13:06.154765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:06.196331Z","title":"Reddi, Stefanie Jegelka, and Sanjiv Kumar","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-14T19:11:50.543978Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:06.196331Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:f4b57a13b7e04614d527459f57be4e6b276160985c4cfda97796802f2d2e87cd","observation_id":"9eff5f2d-8af6-41d4-bebd-65c8686419a8","resolution":{"observed_at":"2026-08-07T14:13:06.196331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:06.230812Z","title":"Lee, and Dimitris Papail- iopoulos","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-14T19:11:50.543978Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:06.230812Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:02554f3786075ff3c35f217b7ded40dd91d72b6bc095fc14d7f8dcf62bba888d","observation_id":"624d798b-e489-4310-b1d5-dc2edf934cd9","resolution":{"observed_at":"2026-08-07T14:13:06.230812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14196","last_updated":"2024-01-26T09:23:11Z","snapshot_observed_at":"2026-08-06T22:40:28.707813Z","submitted_at":"2024-01-25T14:17:53Z","title":"DeepSeek-Coder: When the Large Language Model Meets Programming -- The Rise of Code Intelligence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14196","snapshot_observed_at":"2026-08-07T14:13:06.287596Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-14T19:11:50.543978Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:06.287596Z"},"links":{"cited_paper":"/paper/2401.14196","citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:c348757329725f1b57cf558dfd84baa4f47ff5a2e8ef267da2ddff6553f18b1d","observation_id":"4448d8e4-a2ab-484b-89d3-7a10ae08bff6","resolution":{"observed_at":"2026-08-07T14:13:06.287596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:06.392230Z","title":"Measuring mathematical problem solving with the MATH dataset","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-14T19:11:50.543978Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:06.392230Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:d899636af81fc4fc7d782228144b32cc2a9d38032bf4316c3bf2e3410e2ae9ea","observation_id":"ffc3e076-c28e-4cfc-9980-2f1346756a49","resolution":{"observed_at":"2026-08-07T14:13:06.392230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:06.430607Z","title":null,"venue":null,"work_id":null,"year":1978},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-14T19:11:50.543978Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:06.430607Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:0f26a45b7bbae56775a9145c4ae125630654b8a0297e579c1b63761c02aef592","observation_id":"bd24f75d-82fa-4466-b347-72ef1b765fe2","resolution":{"observed_at":"2026-08-07T14:13:06.430607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:06.473455Z","title":"Approximation capabilities of multilayer feedforward networks.Neural Networks, 4(2):251– 257, 1991","venue":null,"work_id":null,"year":1991},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-14T19:11:50.543978Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:06.473455Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:15d012a16b059a8e935b75600e5b7967c5af2d7966e26b182993ed5f63029423","observation_id":"f21210e3-b3ed-4504-8e04-fc6881df648b","resolution":{"observed_at":"2026-08-07T14:13:06.473455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:06.538821Z","title":"Hospedales, Antreas Antoniou, Paul Micaelli, and Amos J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-14T19:11:50.543978Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:06.538821Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:4ad57ffb91e989a03abde6727995266be8a78e1ade7b5a6b8a5577a1c5bffc79","observation_id":"15de22bd-2ef9-4a81-90c9-01be65b74530","resolution":{"observed_at":"2026-08-07T14:13:06.538821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:06.609290Z","title":"Universal language model fine-tuning for text classification","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-14T19:11:50.543978Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:06.609290Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:e88d97bd7abec0412a0f836a7dd9ee4f6ce3aab0e32af7df24dc0f6fded056b6","observation_id":"68ed48f3-f99e-45db-a421-0b288074d9c9","resolution":{"observed_at":"2026-08-07T14:13:06.609290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.24290","last_updated":"2025-07-05T09:01:04Z","snapshot_observed_at":"2026-08-12T18:49:18.486177Z","submitted_at":"2025-03-31T16:36:05Z","title":"Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.24290","snapshot_observed_at":"2026-08-07T14:13:06.674033Z","title":"Open- reasoner-zero: An open source approach to scaling up reinforcement learning on the base model.CoRR, abs/2503.24290, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-14T19:11:50.543978Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:06.674033Z"},"links":{"cited_paper":"/paper/2503.24290","citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:671a14fd10dd2ea64faa28d07cb21fe5caad5c36da6346c4d169fc6beece20ef","observation_id":"49759538-da87-46cd-b2f8-683f3257d031","resolution":{"observed_at":"2026-08-07T14:13:06.674033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.21212","last_updated":"2025-02-28T16:40:38Z","snapshot_observed_at":"2026-08-14T19:54:11.817466Z","submitted_at":"2025-02-28T16:40:38Z","title":"Transformers Learn to Implement Multi-step Gradient Descent with Chain of Thought","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.21212","snapshot_observed_at":"2026-08-07T14:13:06.748375Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-14T19:11:50.543978Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:06.748375Z"},"links":{"cited_paper":"/paper/2502.21212","citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:ff18c612ffc75f029820a150a587dcf0f7fbc5b079bba133f7094f47107d905a","observation_id":"04a28cdf-1d77-4bec-8a79-869984e94306","resolution":{"observed_at":"2026-08-07T14:13:06.748375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12186","last_updated":"2024-11-12T13:24:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-18T17:57:57Z","title":"Qwen2.5-Coder Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12186","snapshot_observed_at":"2026-08-07T14:13:06.798749Z","title":"Qwen2.5-coder technical report.CoRR, abs/2409.12186, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-14T19:11:50.543978Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:06.798749Z"},"links":{"cited_paper":"/paper/2409.12186","citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:a04d8a7f739d81e9870e381e9c2ef35c7e553715fca34bc8973675833ed9b0a2","observation_id":"2517825d-c34d-423a-abe8-5ff36dab6d15","resolution":{"observed_at":"2026-08-07T14:13:06.798749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07974","last_updated":"2024-06-06T17:41:21Z","snapshot_observed_at":"2026-08-13T09:04:30.125777Z","submitted_at":"2024-03-12T17:58:04Z","title":"LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07974","snapshot_observed_at":"2026-08-07T14:13:06.850119Z","title":"Livecodebench: Holistic and contamination free evaluation of large language models for code.CoRR, abs/2403.07974, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-14T19:11:50.543978Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:06.850119Z"},"links":{"cited_paper":"/paper/2403.07974","citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:d7a5948fb5a9ddeb370c76555ac1911250b0b34e3d46a283952e0dac49292330","observation_id":"02f2b3f1-399c-4b62-ad26-f141f0219f78","resolution":{"observed_at":"2026-08-07T14:13:06.850119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:06.927332Z","title":"Xu, Jun Araki, and Graham Neubig","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-14T19:11:50.543978Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:06.927332Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:f593e15b9f437c215ac9f68facf160f63293c4e56dc26b0255998c1878f0a5e4","observation_id":"90e9767b-ae4a-4976-bae1-1253314a8f9e","resolution":{"observed_at":"2026-08-07T14:13:06.927332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:06.987382Z","title":"Efficient memory management for large language model serving with pagedattention","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-14T19:11:50.543978Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:06.987382Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:081b6d567bd46b76290717405547b086bb9970a22201fefa014640d3e1a7384a","observation_id":"9a023e01-3435-474c-ba5a-78295caafe5d","resolution":{"observed_at":"2026-08-07T14:13:06.987382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:07.041699Z","title":"Bespoke-stratos: The unreasonable effectiveness of reasoning distillation, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-14T19:11:50.543978Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:07.041699Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:553ed53e11b8d2d856ca839fe9c380ba7d466a94e2f0312055639dd284bfdce6","observation_id":"1e7ae17b-a6b3-48a8-a2fd-d54b5352348e","resolution":{"observed_at":"2026-08-07T14:13:07.041699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:07.097294Z","title":"Rupam Mahmood, Shuicheng Yan, and Zhongwen Xu","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-14T19:11:50.543978Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:07.097294Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:eeb7d30055206ea7aeb1558ffda75737e5bb2448d67c0054f1c066d290542650","observation_id":"89db988a-f9ec-4f09-871f-95a0574a4636","resolution":{"observed_at":"2026-08-07T14:13:07.097294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:07.176651Z","title":"Meta-learning with differentiable convex optimization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-14T19:11:50.543978Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:07.176651Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:944885fa5613d421473ae2cdee14b4abc1fe8738854990ff1ec0efcb5a629971","observation_id":"b726312e-9fc3-4c7f-beda-8d93305874fe","resolution":{"observed_at":"2026-08-07T14:13:07.176651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:07.242294Z","title":"Visualizing the loss landscape of neural nets","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-14T19:11:50.543978Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:07.242294Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:501e709e146e0b7426d2faded1ae262be34db422054e7c3b28416bf16dd2989d","observation_id":"06ecbfd4-822e-4de7-869c-928c16e769ea","resolution":{"observed_at":"2026-08-07T14:13:07.242294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:07.318755Z","title":"Learning to optimize","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-14T19:11:50.543978Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:07.318755Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:8fec67d174b96d76937ef3bc62dd882c9c80d2b4347ea69727a798fe6eba49e6","observation_id":"76f61f26-2816-44e5-bd00-473c7774b1a9","resolution":{"observed_at":"2026-08-07T14:13:07.318755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1703.00441","last_updated":"2017-11-30T18:59:01Z","snapshot_observed_at":"2026-08-14T21:14:03.193111Z","submitted_at":"2017-03-01T18:52:23Z","title":"Learning to Optimize Neural Nets","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1703.00441","snapshot_observed_at":"2026-08-07T14:13:07.379623Z","title":"Learning to optimize neural nets.CoRR, abs/1703.00441, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-14T19:11:50.543978Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:07.379623Z"},"links":{"cited_paper":"/paper/1703.00441","citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:7aeaf44d9ac166658baa145b29a0616d102d3eeec1a3ce1c03c53b4beeda1995","observation_id":"f998e8fe-af3c-4a9c-9893-69e6a9366d7d","resolution":{"observed_at":"2026-08-07T14:13:07.379623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.10069","last_updated":"2025-04-27T08:55:07Z","snapshot_observed_at":"2026-08-13T02:10:59.760183Z","submitted_at":"2025-01-17T09:42:48Z","title":"A Survey on LLM Test-Time Compute via Search: Tasks, LLM Profiling, Search Algorithms, and Relevant Frameworks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.10069","snapshot_observed_at":"2026-08-07T14:13:07.442289Z","title":"A survey on LLM test-time compute via search: Tasks, LLM profiling, search algorithms, and relevant frameworks.CoRR, abs/2501.10069, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-14T19:11:50.543978Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:07.442289Z"},"links":{"cited_paper":"/paper/2501.10069","citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:38afca85267885bfbff47c931a7021b77c08678c65489e99c7ffee8de1dfbd84","observation_id":"27e8b020-eb5b-4619-9341-d453c3383f62","resolution":{"observed_at":"2026-08-07T14:13:07.442289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:07.493931Z","title":"Let’s verify step by step","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-14T19:11:50.543978Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:07.493931Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:dafeda9f9eb925ffeb4ea721304c7dd302770f9686d3f2a427ad2c54326c779e","observation_id":"6931b8cd-e0db-4d64-a1c0-2f141e2dfed9","resolution":{"observed_at":"2026-08-07T14:13:07.493931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:07.561262Z","title":"Ash, Surbhi Goel, Akshay Krishnamurthy, and Cyril Zhang","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-14T19:11:50.543978Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:07.561262Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:ea46fa731195f79cc8ed3f65bd4e35c79c3c3d72cc6419356e872de51e661b6b","observation_id":"d629610e-a7cc-49a7-a1b6-d5468648bd1f","resolution":{"observed_at":"2026-08-07T14:13:07.561262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:07.624447Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-14T19:11:50.543978Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:07.624447Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:5ed3654be7f7379c5576b735d1a0b3921f02c9bb43cc0e35c086a885f2c766d3","observation_id":"78b9157b-413b-488f-b7d7-5aea2ac871d9","resolution":{"observed_at":"2026-08-07T14:13:07.624447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13147","last_updated":"2025-08-08T15:28:01Z","snapshot_observed_at":"2026-08-14T15:26:52.922323Z","submitted_at":"2024-12-17T18:12:47Z","title":"Are Your LLMs Capable of Stable Reasoning?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13147","snapshot_observed_at":"2026-08-07T14:13:07.676651Z","title":"Are your llms capable of stable reasoning?CoRR, abs/2412.13147, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-14T19:11:50.543978Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:07.676651Z"},"links":{"cited_paper":"/paper/2412.13147","citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:085344c37e4e690c28f2a484d9670457d15cf99a3fe594ca25291827978cd4d9","observation_id":"011da701-fbe3-44ef-af4e-b2ac622f280f","resolution":{"observed_at":"2026-08-07T14:13:07.676651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.09858","last_updated":"2025-04-14T04:08:16Z","snapshot_observed_at":"2026-08-08T01:06:59.135762Z","submitted_at":"2025-04-14T04:08:16Z","title":"Reasoning Models Can Be Effective Without Thinking","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.09858","snapshot_observed_at":"2026-08-07T14:13:07.755282Z","title":"Reasoning models can be effective without thinking.CoRR, abs/2504.09858, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-14T19:11:50.543978Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:07.755282Z"},"links":{"cited_paper":"/paper/2504.09858","citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:e2a06b22784c2ad3a8a6cf492d05a1af93891d6f4643facd79f9932a2e2777c7","observation_id":"fd37c512-1417-436e-851c-aa6767c0faa7","resolution":{"observed_at":"2026-08-07T14:13:07.755282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:07.821020Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-14T19:11:50.543978Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:07.821020Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:38977b214dd1af31f69384a87993f2262190e2440e4fc38df7152742eeb73d56","observation_id":"ee90d448-51da-4cb6-9e8a-5adcc25a3fb0","resolution":{"observed_at":"2026-08-07T14:13:07.821020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:07.888575Z","title":"Academy, 1877","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-14T19:11:50.543978Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:07.888575Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:99e9cab2705fcae9b7cb446ca87fa3f132816a43af60da525e95627d2e90c319","observation_id":"e53b52d6-0857-47c1-9c75-47ac5611c292","resolution":{"observed_at":"2026-08-07T14:13:07.888575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:07.949373Z","title":"Metaicl: Learning to learn in context","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-14T19:11:50.543978Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:07.949373Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:c3eccafa8cf55436925616444a1e7f3163bdcd5296f6cc07eec568fa95aab6ab","observation_id":"7fb5527f-58c4-4ac9-b746-3f9b15ecad3a","resolution":{"observed_at":"2026-08-07T14:13:07.949373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:08.015925Z","title":"Rethinking the role of demonstrations: What makes in-context learning work? InEMNLP, pages 11048–11064","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-14T19:11:50.543978Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:08.015925Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:010364f1a4d09187fadf81d17e485cc4dbaa751ce6da8a305e862b769af385ec","observation_id":"fa2536c2-34e6-46df-8164-eb0c6387edc8","resolution":{"observed_at":"2026-08-07T14:13:08.015925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09413","last_updated":"2024-12-22T10:44:13Z","snapshot_observed_at":"2026-08-14T19:09:59.262526Z","submitted_at":"2024-12-12T16:20:36Z","title":"Imitate, Explore, and Self-Improve: A Reproduction Report on Slow-thinking Reasoning Systems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09413","snapshot_observed_at":"2026-08-07T14:13:08.100248Z","title":"Imitate, explore, and self-improve: A reproduction report on slow-thinking reasoning systems.CoRR, abs/2412.09413, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-14T19:11:50.543978Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:08.100248Z"},"links":{"cited_paper":"/paper/2412.09413","citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:3fe0d2106abf1a19565a1119571de92b147d393dc6c8ac3c59c23e3160807339","observation_id":"550dffcd-cfeb-4f98-970f-5d2d4c3956f4","resolution":{"observed_at":"2026-08-07T14:13:08.100248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.5602","last_updated":"2013-12-19T16:00:08Z","snapshot_observed_at":"2026-08-14T03:19:40.736445Z","submitted_at":"2013-12-19T16:00:08Z","title":"Playing Atari with Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.5602","snapshot_observed_at":"2026-08-07T14:13:08.198094Z","title":"Riedmiller","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-14T19:11:50.543978Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:08.198094Z"},"links":{"cited_paper":"/paper/1312.5602","citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:05f29f0d772d469dde9eeb13628490dd53f02cc6bd869422c2059454032845c4","observation_id":"22b59dbf-ee13-4759-ad72-fd323d8caa7f","resolution":{"observed_at":"2026-08-07T14:13:08.198094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:08.267336Z","title":"On the reciprocal of the general algebraic matrix.Bull","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-14T19:11:50.543978Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:08.267336Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:e239057a4798cc2a76277c93749f60c3e96ec48205818009e2a556ddeb610483","observation_id":"bf72671a-9350-459f-bc18-2878a716ae4a","resolution":{"observed_at":"2026-08-07T14:13:08.267336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19393","last_updated":"2025-03-01T06:07:39Z","snapshot_observed_at":"2026-08-14T11:38:51.383664Z","submitted_at":"2025-01-31T18:48:08Z","title":"s1: Simple test-time scaling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19393","snapshot_observed_at":"2026-08-07T14:13:08.379653Z","title":"Candès, and Tatsunori Hashimoto","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-14T19:11:50.543978Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:08.379653Z"},"links":{"cited_paper":"/paper/2501.19393","citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:6a3a810f10cb98b718d0009bab4f941624385a4b23bc96bb14a028574205e1d8","observation_id":"64fec554-2a0e-4197-b806-4203055af3a3","resolution":{"observed_at":"2026-08-07T14:13:08.379653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.11895","last_updated":"2022-09-24T00:43:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-09-24T00:43:19Z","title":"In-context Learning and Induction Heads","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.11895","snapshot_observed_at":"2026-08-07T14:13:08.434201Z","title":"In-context learning and induction heads.CoRR, abs/2209.11895, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-14T19:11:50.543978Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:08.434201Z"},"links":{"cited_paper":"/paper/2209.11895","citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:d974c2ac81c9376246a511e325fe6470888581e9001dc6d0bafcfc10f5eee1fa","observation_id":"0f35de02-d51b-41f4-88f5-a971b38fd0e8","resolution":{"observed_at":"2026-08-07T14:13:08.434201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T14:13:08.513001Z","title":"GPT-4 technical report.CoRR, abs/2303.08774, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-14T19:11:50.543978Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:08.513001Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:25d8ac7d6d432893ef9514a4f5fa68f3f24ea7f57660246aa69e35e20c8b2892","observation_id":"9ee7c885-1c6d-4409-845d-bea84e13b2ae","resolution":{"observed_at":"2026-08-07T14:13:08.513001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:08.575853Z","title":"Learning to reason with llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-14T19:11:50.543978Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:08.575853Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:a5ecbab3d64ff95548aa3d65478041abc492e74e05c815b61e2ae04d158f7a21","observation_id":"683dd9a5-4a8a-40ff-af3c-4ffd1827649e","resolution":{"observed_at":"2026-08-07T14:13:08.575853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:08.641941Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-14T19:11:50.543978Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:08.641941Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:7bf60c3bf8fa963945c3b911fe81556ac0c1fe3c00bdfd6ffbba27b0603e74cd","observation_id":"9d3b5eb4-c868-4973-9009-be573e8d2175","resolution":{"observed_at":"2026-08-07T14:13:08.641941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:08.705867Z","title":"Yang, Zachary DeVito, Martin Raison, Alykhan Tejani, Sasank Chilamkurthy, Benoit Steiner, Lu Fang, Junjie Bai, and Soumith Chintala","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-14T19:11:50.543978Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:08.705867Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:5fbfca1e98b0579932d67f2369e82c96764d39bc3fd5c109844c765951a52688","observation_id":"f219487c-ed62-43de-98a5-51cc592c890f","resolution":{"observed_at":"2026-08-07T14:13:08.705867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:08.774117Z","title":"A generalized inverse for matrices","venue":null,"work_id":null,"year":1955},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-14T19:11:50.543978Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:08.774117Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:dd4093cfcd083cc56124c547224663b5577a67e2303b9677aba1d8bb1b5b6124","observation_id":"7e03045f-d25d-4ae7-bc7e-351a68c5b162","resolution":{"observed_at":"2026-08-07T14:13:08.774117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:21.621085Z","title":"A simple guard for learned optimizers","venue":null,"work_id":"90ffe3f5-5c34-43c0-a7ed-dc7c33e809e7","year":2022},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-14T19:11:50.543978Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:08.870312Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:aa803c3e578f1cd8b7c645097f27fbe31a16c2c1abd186e9edf45d0ef407aa2d","observation_id":"b5119c13-0e97-4ebe-83c0-3850e6a154b5","resolution":{"observed_at":"2026-08-07T14:13:21.684679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18982","last_updated":"2024-10-08T15:13:01Z","snapshot_observed_at":"2026-08-14T11:57:04.446597Z","submitted_at":"2024-10-08T15:13:01Z","title":"O1 Replication Journey: A Strategic Progress Report -- Part 1","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18982","snapshot_observed_at":"2026-08-07T14:13:08.930615Z","title":"O1 replication journey: A strategic progress report - part 1.CoRR, abs/2410.18982, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-14T19:11:50.543978Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:08.930615Z"},"links":{"cited_paper":"/paper/2410.18982","citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:9bef5b4ec615ded41508ab9f935c12171eed4600339f8d054b5a6a2609db5a0b","observation_id":"c47a79b1-30cf-4b43-a5c0-f515f443b4e2","resolution":{"observed_at":"2026-08-07T14:13:08.930615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:08.992883Z","title":"A survey of efficient reasoning for large reasoning models: Language, multimodality, and beyond.CoRR, abs/2503.21614, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-14T19:11:50.543978Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:08.992883Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:be792515deae28dc39314bdb87509146b1cef341f73f3e16d353d3f5de23a42a","observation_id":"c1011af8-99ce-4177-8156-c40f5efe5df3","resolution":{"observed_at":"2026-08-07T14:13:08.992883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:21.430326Z","title":"Improving language understand- ing by generative pre-training.OpenAI, 2018","venue":null,"work_id":"1d4fc761-195a-4fbf-9600-d1bb16d73eef","year":2018},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-14T19:11:50.543978Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:09.058562Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:22bd44b13a353d907d0491adfd2319b38281085cd10afc3569216bd1fe3b8732","observation_id":"2c8d8de0-ee38-49d5-8af1-33a0e84922af","resolution":{"observed_at":"2026-08-07T14:13:21.531829Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:21.205656Z","title":"Manning, Stefano Ermon, and Chelsea Finn","venue":null,"work_id":"4ebf8c35-4342-49f2-be80-6f9d2782a71b","year":null},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-14T19:11:50.543978Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:09.133936Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:7ad92930104e224230c8d1872d826489af45f959deb243f47806860510575245","observation_id":"e51bd8b2-4182-498d-96cc-3b7833cdff6d","resolution":{"observed_at":"2026-08-07T14:13:21.300794Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:21.030010Z","title":"Kakade, and Sergey Levine","venue":null,"work_id":"c1d5c09b-ea34-4a98-af55-42839dcfcd96","year":2019},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-14T19:11:50.543978Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:09.195493Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:61aa9e4e0527c7c9533e9291e684427feb9c82a435590af1d16762088ea10761","observation_id":"a034b155-5f00-40d9-9edd-e50bca4beed3","resolution":{"observed_at":"2026-08-07T14:13:21.122628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:20.861725Z","title":"Optimization as a model for few-shot learning","venue":null,"work_id":"118d08de-75ec-4694-b5e5-229085d7f0b7","year":2017},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-14T19:11:50.543978Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:09.270372Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:00693e584e27ebd769a6b07f69422fd32474050d8bb52c3f2c6ee6333f0752e5","observation_id":"a8b5061b-8020-4e77-8b7f-93b94df87b7f","resolution":{"observed_at":"2026-08-07T14:13:20.922435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12022","last_updated":"2023-11-20T18:57:34Z","snapshot_observed_at":"2026-08-10T12:02:35.919497Z","submitted_at":"2023-11-20T18:57:34Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12022","snapshot_observed_at":"2026-08-07T14:13:09.318060Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-14T19:11:50.543978Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:09.318060Z"},"links":{"cited_paper":"/paper/2311.12022","citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:5a79a9ff9660ffc2c10f17ead7556fd0a263b6559abc64e1d717b8bae19dcfa6","observation_id":"a65b5a9c-ba39-4bdf-aa26-e2de63b7b95d","resolution":{"observed_at":"2026-08-07T14:13:09.318060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:20.645910Z","title":"Learning to retrieve prompts for in-context learning","venue":null,"work_id":"b7519dc9-aed7-419b-a5b6-253679e8d146","year":2022},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-14T19:11:50.543978Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:09.365657Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:ec9ee063d73f902d3d3ae3c43eb76770ba11a7d3648727e0b1ffecfa2dd9781e","observation_id":"5330e67a-6131-43f2-85f1-333ad8ba8a99","resolution":{"observed_at":"2026-08-07T14:13:20.774803Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1605.06065","last_updated":"2016-05-19T17:44:51Z","snapshot_observed_at":"2026-08-14T21:56:38.050895Z","submitted_at":"2016-05-19T17:44:51Z","title":"One-shot Learning with Memory-Augmented Neural Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1605.06065","snapshot_observed_at":"2026-08-07T14:13:09.429316Z","title":"Botvinick, Daan Wierstra, and Timothy P","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-14T19:11:50.543978Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:09.429316Z"},"links":{"cited_paper":"/paper/1605.06065","citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:608078c8cfdd8edd216c3ac30d11ad601feb433051ef6229ad1c057a56fe5ef9","observation_id":"93d8f48c-b70b-4b15-8978-319febdeeaaa","resolution":{"observed_at":"2026-08-07T14:13:09.429316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:20.459632Z","title":"Evolutionary principles in self-referential learning, or on learning how to learn: The meta-meta-","venue":null,"work_id":"c449e28e-2f76-4b27-85c6-c21a13bbcf50","year":1987},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-14T19:11:50.543978Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:09.524137Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:fc0e79fa10361dbe42bceb7cae481d1b8993349aade67e0c2ef23b001f06e4e5","observation_id":"4fe45818-2782-473c-abbb-d63ea510437a","resolution":{"observed_at":"2026-08-07T14:13:20.546970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T14:13:09.625547Z","title":"Proximal policy optimization algorithms.CoRR, abs/1707.06347, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-14T19:11:50.543978Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:09.625547Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:7b241d3dc9f9550330d279af265d756b622614b43020ce6af75b6f92b65a3be2","observation_id":"93df2217-f2c0-45f0-ab75-75ad274dafc7","resolution":{"observed_at":"2026-08-07T14:13:09.625547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.04022","last_updated":"2025-04-05T02:24:07Z","snapshot_observed_at":"2026-08-15T03:38:30.678510Z","submitted_at":"2025-04-05T02:24:07Z","title":"Rethinking Reflection in Pre-Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.04022","snapshot_observed_at":"2026-08-07T14:13:09.701448Z","title":"Rethinking reflection in pre-training.CoRR, abs/2504.04022, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-14T19:11:50.543978Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:09.701448Z"},"links":{"cited_paper":"/paper/2504.04022","citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:a5923ea6ec3b7cd7df108b9f4d4a6da37176d7861a45e20787a5f8f682f22dc6","observation_id":"add5ac14-23fd-414a-84bc-edfcea2c2eae","resolution":{"observed_at":"2026-08-07T14:13:09.701448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T14:13:09.795838Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-14T19:11:50.543978Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:09.795838Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:e719e962d89ae1a1ae52ca43c66d8045e57dee7ff274ff10bf8deb68b545b0aa","observation_id":"c3388108-bb18-4d55-a6ac-eb23367b7892","resolution":{"observed_at":"2026-08-07T14:13:09.795838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:20.242649Z","title":"Hybridflow: A flexible and efficient RLHF framework","venue":null,"work_id":"ad170c9a-d53e-44c9-bb75-3693772f69ab","year":2025},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-14T19:11:50.543978Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:09.853973Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:0dfd37d60675e0b1f54035bf50020c0712fde17fecfde6b28ac1bbba5edaca4d","observation_id":"52505d35-b8b5-4057-8449-f549907560a3","resolution":{"observed_at":"2026-08-07T14:13:20.357532Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.08200","last_updated":"2025-05-23T03:46:43Z","snapshot_observed_at":"2026-08-14T12:06:53.681103Z","submitted_at":"2025-03-11T09:08:07Z","title":"Route Sparse Autoencoder to Interpret Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.08200","snapshot_observed_at":"2026-08-07T14:13:09.892396Z","title":"Route sparse autoencoder to interpret large language models.CoRR, abs/2503.08200, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-14T19:11:50.543978Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:09.892396Z"},"links":{"cited_paper":"/paper/2503.08200","citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:26a9c5498da7b95b4167650462ad63fd4c8c69c2f012d4f4625fd7e0fcf2917e","observation_id":"9ade0988-831f-482c-85dc-b309ea41f64b","resolution":{"observed_at":"2026-08-07T14:13:09.892396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:20.050728Z","title":"Co-Reyes, Rishabh Agarwal, Ankesh Anand, Piyush Patil, Xavier Garcia, Peter J","venue":null,"work_id":"c285f893-2a2e-409f-867a-43592f713514","year":2024},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-14T19:11:50.543978Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:09.944823Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:7dfe74c33aaf39e5bf288e5d2e0aadd31945fa8bd9e34a7ac653f22853c6ef88","observation_id":"6c376dd7-ff2d-409c-8abe-555878c0ed4d","resolution":{"observed_at":"2026-08-07T14:13:20.145364Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:19.850753Z","title":null,"venue":null,"work_id":"ce5d8101-0989-48e7-b8dc-4305eda08807","year":2017},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-14T19:11:50.543978Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:10.004740Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:f77c8cef9ead31756ecae6b79898a74380604f1f71cce0d89aad4a01493a51f7","observation_id":"e8ad6c2e-f46e-4cf0-8cef-7ad7ff522a18","resolution":{"observed_at":"2026-08-07T14:13:19.926428Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:19.672832Z","title":"End-to-end memory networks","venue":null,"work_id":"2edf8337-d2fd-4e84-b60f-c3a19b5c92bd","year":2015},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-14T19:11:50.543978Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:10.050171Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:8b06afb9cf19e844534eeda1d85530ed4b0285f7c26175b0c610a239be5278d9","observation_id":"798131f2-a93a-48e7-9826-3de2136420aa","resolution":{"observed_at":"2026-08-07T14:13:19.761948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:10.096820Z","title":"Andrew Bagnell","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-14T19:11:50.543978Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:10.096820Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:cf77504d06be220c15d3b5234aa988e36f9315c60bfbbe31f8b9b5a25ba48a47","observation_id":"a9dd52e9-1da2-455e-b46e-8e90b913ea8c","resolution":{"observed_at":"2026-08-07T14:13:10.096820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:19.512440Z","title":"Blockmix: Meta regularization and self-calibrated inference for metric-based meta-learning","venue":null,"work_id":"66e22f00-ff20-4860-aff6-e0f0ea24329b","year":2020},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-14T19:11:50.543978Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:10.141251Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:47542265e3bdcd942ea23bb098f6479407279b8ba0ac6cd8d21c1b175c636f6c","observation_id":"1a7e9674-6b59-4031-8e4e-44638681b15f","resolution":{"observed_at":"2026-08-07T14:13:19.584497Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-08-11T01:31:26.242281Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-07T14:13:10.188547Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-14T19:11:50.543978Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:10.188547Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:107da0b68a04e2c0f6e86060472b054c2db863cdffbb396fbfec88833f6dbe03","observation_id":"0dc475fb-517a-4ba8-9778-89e2b58fd9fe","resolution":{"observed_at":"2026-08-07T14:13:10.188547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:19.304974Z","title":"Sky-t1: Train your own o1 preview model within $450.https://novasky-ai","venue":null,"work_id":"18edb71e-2e4d-4c25-b489-9acf4359517c","year":2025},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-14T19:11:50.543978Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:10.233784Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:38d8e4fdf7cee0835b306194fa40e7840f8a2716631baf25aded01b6c5592045","observation_id":"0b24141c-efa8-4b5f-a8bf-a283380141c8","resolution":{"observed_at":"2026-08-07T14:13:19.414611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:19.047074Z","title":"Open Thoughts.https://open-thoughts.ai, 2025","venue":null,"work_id":"9e65f7fc-8af3-40f7-bcb2-641f79d51688","year":2025},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-14T19:11:50.543978Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:10.278438Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:883e7deb409d2397008da5559a185768cf31c822e674b45de8a252b54ee96bc3","observation_id":"8d544828-9521-49e4-87a2-9fd7f3cb77b3","resolution":{"observed_at":"2026-08-07T14:13:19.181089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:18.810573Z","title":"Qwen3: Think deeper, act faster.https://qwenlm.github.io/blog/qwen3/, April","venue":null,"work_id":"b0bf3b97-52e8-49d1-bf68-2b0091a4219b","year":null},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-14T19:11:50.543978Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:10.322843Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:e14144b63c4f2c870856baced09bc1d8d47d481993d40a8c3370edb8196c51f9","observation_id":"1a42a299-166e-4879-9e37-ed8dfed4d730","resolution":{"observed_at":"2026-08-07T14:13:18.893561Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-14T19:11:50.543978Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":86,"verified_exact":0,"verified_fuzzy":14},"total_outbound_references":133},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 100 of 133 outbound references and 1 inbound Pith citation observation for arXiv:2505.19815."}