{"as_of":"2026-08-10T07:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:49847ee14aa292aad754a2ac38b2aef284ec9b30bdf9d49b50a9ed1e6b761bd3","coverage":[{"denominator":91,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":91,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T00:51:25.097330Z","state":"measured"},{"denominator":91,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":91,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.03573/citation-record","integrity":"/paper/2608.03573/integrity","json":"/paper/2608.03573/citation-record.json","paper":"/paper/2608.03573"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-08T00:51:24.838386Z","title":"arXiv preprint arXiv:2501.12948 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-09T23:10:07.427475Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:24.838386Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:1f5d4a461dff18ac48c86ef2f8159bc0a21e269e3b16b6aadcff584735863a00","observation_id":"68c54f4a-d5d9-41dc-9fc1-ea37fa6c5f7f","resolution":{"observed_at":"2026-08-08T00:51:24.838386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:24.842437Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-09T23:10:07.427475Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:24.842437Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:c3bca06d2cec9afc2ca3369928baed46d4515d14310a49eb2e46f3d1c9f43b4e","observation_id":"e540975b-3755-44ed-adb4-eee6f0b51777","resolution":{"observed_at":"2026-08-08T00:51:24.842437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:24.845618Z","title":"Notion Blog , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-09T23:10:07.427475Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:24.845618Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:149b05ba16142cb4467b2e661f540ef739e54c9dc60bc0a90e3a45c083a1adaa","observation_id":"9172b590-a96a-47f1-b0b3-e0985bd86175","resolution":{"observed_at":"2026-08-08T00:51:24.845618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:24.848882Z","title":"Notion Blog , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-09T23:10:07.427475Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:24.848882Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:2d96a83861505cead538dfce141feb3b9ccb60e6101e333fd1890cfc0da3f7c3","observation_id":"009d592c-9a2c-474c-8709-cd8e53b922cf","resolution":{"observed_at":"2026-08-08T00:51:24.848882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14768","last_updated":"2025-02-20T17:49:26Z","snapshot_observed_at":"2026-08-04T12:32:53.090165Z","submitted_at":"2025-02-20T17:49:26Z","title":"Logic-RL: Unleashing LLM Reasoning with Rule-Based Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14768","snapshot_observed_at":"2026-08-08T00:51:24.851939Z","title":"arXiv preprint arXiv:2502.14768 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-09T23:10:07.427475Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:24.851939Z"},"links":{"cited_paper":"/paper/2502.14768","citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:e6cd276cb451ca5525843bd213ed027ec17cb9009e9ff7a8caf904f7eb21bc06","observation_id":"68f17af8-7ccf-4e48-938b-cbb778f2c6c8","resolution":{"observed_at":"2026-08-08T00:51:24.851939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.06471","last_updated":"2025-08-08T17:21:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-08T17:21:06Z","title":"GLM-4.5: Agentic, Reasoning, and Coding (ARC) Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.06471","snapshot_observed_at":"2026-08-08T00:51:24.855511Z","title":"arXiv preprint arXiv:2508.06471 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-09T23:10:07.427475Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:24.855511Z"},"links":{"cited_paper":"/paper/2508.06471","citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:c0d4954496e5dff8d7586085944df12aa14f1b7506761cc51dc0772f4afde4e6","observation_id":"7da74fc9-5c31-4edd-9266-4f6cc37f89a6","resolution":{"observed_at":"2026-08-08T00:51:24.855511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:24.859031Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-09T23:10:07.427475Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:24.859031Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:6d6e4ba3a9d4695385c0a346f96be1b08c1853635984d519aa040aeed9d8e08d","observation_id":"9d050213-bfa5-414b-887d-78aa2ef677e4","resolution":{"observed_at":"2026-08-08T00:51:24.859031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17161","last_updated":"2025-05-26T17:16:45Z","snapshot_observed_at":"2026-08-09T18:26:12.869738Z","submitted_at":"2025-01-28T18:59:44Z","title":"SFT Memorizes, RL Generalizes: A Comparative Study of Foundation Model Post-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17161","snapshot_observed_at":"2026-08-08T00:51:24.862030Z","title":"arXiv preprint arXiv:2501.17161 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-09T23:10:07.427475Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:24.862030Z"},"links":{"cited_paper":"/paper/2501.17161","citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:5abf269f0b66bc8877aa58ed6480af584e53b4013cec1d75c096cf55674b8adc","observation_id":"270372db-3e7e-49ea-83bc-6355322e8c5a","resolution":{"observed_at":"2026-08-08T00:51:24.862030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.21128","last_updated":"2026-05-27T07:06:43Z","snapshot_observed_at":"2026-08-04T15:01:28.565478Z","submitted_at":"2025-09-25T13:18:57Z","title":"RL Squeezes, SFT Expands: A Comparative Study of Reasoning LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.21128","snapshot_observed_at":"2026-08-08T00:51:24.865455Z","title":"arXiv preprint arXiv:2509.21128 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-09T23:10:07.427475Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:24.865455Z"},"links":{"cited_paper":"/paper/2509.21128","citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:8d97db16067f54f1397b0badb1b81392766527507d3fc092fecde3d8f1e409a1","observation_id":"bb7986a9-0f38-4aed-8526-47d14e2458cb","resolution":{"observed_at":"2026-08-08T00:51:24.865455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05492","last_updated":"2024-06-07T15:51:08Z","snapshot_observed_at":"2026-07-06T16:29:39.982733Z","submitted_at":"2023-10-09T07:56:16Z","title":"How Abilities in Large Language Models are Affected by Supervised Fine-tuning Data Composition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05492","snapshot_observed_at":"2026-08-08T00:51:24.868703Z","title":"arXiv preprint arXiv:2310.05492 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-09T23:10:07.427475Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:24.868703Z"},"links":{"cited_paper":"/paper/2310.05492","citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:552a17cc630dc2680a2b273d9b91be1fc30c8e18f7e14d937a3f86005d2808dd","observation_id":"475e09fa-8e71-49f3-842f-6c38be11a240","resolution":{"observed_at":"2026-08-08T00:51:24.868703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:24.871996Z","title":"2025 , school=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-09T23:10:07.427475Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:24.871996Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:23cb2645604c5df1cd1b908b55d6ccc8e488730e3eefa449d6eb0750abd17a4c","observation_id":"a3b5cc92-d26b-49ef-b432-57eb6e5f6e2f","resolution":{"observed_at":"2026-08-08T00:51:24.871996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:24.874964Z","title":"Journal of Machine Learning Research , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-09T23:10:07.427475Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:24.874964Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:55614fa5d8aa0dd80d591e582778eaa624482f821be7f39f7af103991f786936","observation_id":"96fabbca-42e0-4c5a-9bf6-ebb1ae74bcb1","resolution":{"observed_at":"2026-08-08T00:51:24.874964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:24.877955Z","title":"Forty-first International Conference on Machine Learning , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-09T23:10:07.427475Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:24.877955Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:dea9f8f3aa08f40729e8192cd452c26000453deeef54c2d5c53d50ada35cdca2","observation_id":"b0a38f5c-106b-452c-8fb9-329dc3164034","resolution":{"observed_at":"2026-08-08T00:51:24.877955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:24.880970Z","title":"2024 , journal =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-09T23:10:07.427475Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:24.880970Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:583dcc4c2e85ce1524a687b1af6fcf79fcbfc8a83999ad4a77ef132b5dd86a1a","observation_id":"711a6dea-54c6-46d2-8ce5-15955619d8de","resolution":{"observed_at":"2026-08-08T00:51:24.880970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13372","last_updated":"2024-06-27T22:44:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-20T08:08:54Z","title":"LlamaFactory: Unified Efficient Fine-Tuning of 100+ Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13372","snapshot_observed_at":"2026-08-08T00:51:24.883937Z","title":"arXiv preprint arXiv:2403.13372 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-09T23:10:07.427475Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:24.883937Z"},"links":{"cited_paper":"/paper/2403.13372","citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:ce03c5d48a2e2878a3a2dd9529b58806658e5ae413bd08709a57774146535481","observation_id":"b468e741-8353-48b7-be51-fbe16876cb46","resolution":{"observed_at":"2026-08-08T00:51:24.883937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:24.887173Z","title":"arXiv preprint arXiv:2505.11711 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-09T23:10:07.427475Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:24.887173Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:00afd663e9c6de54f93dcccbba5bfa53503a43cc67e1ab00f7de7cfb32ae2cd9","observation_id":"f7ac2037-c10d-42e2-a7b3-704cf0f240a7","resolution":{"observed_at":"2026-08-08T00:51:24.887173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-08T00:51:24.889992Z","title":"arXiv preprint arXiv:2412.16720 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-09T23:10:07.427475Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:24.889992Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:efe5dd57c5dff7a8d9927891f7cd1fbc73cb9bf4b0fa66dd7b6db454c25ba58b","observation_id":"f534c9f5-c07d-4188-a3af-c49375af7665","resolution":{"observed_at":"2026-08-08T00:51:24.889992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:24.893127Z","title":"arXiv preprint arXiv:2510.00553 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-09T23:10:07.427475Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:24.893127Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:49abd48a99124d0630308c693f430eee83f08699814406ec0be9a85076520d1c","observation_id":"45ef809b-2384-4458-82f2-a4e384dee59d","resolution":{"observed_at":"2026-08-08T00:51:24.893127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:24.896219Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-09T23:10:07.427475Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:24.896219Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:93b720242f2bf2b4c3ea9c846703b8a99253b8948f174e78f55d400c6914e93c","observation_id":"234113de-6718-4f5b-9b69-bb659ea26ca7","resolution":{"observed_at":"2026-08-08T00:51:24.896219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.04259","last_updated":"2025-09-04T14:38:08Z","snapshot_observed_at":"2026-08-07T12:32:15.780660Z","submitted_at":"2025-09-04T14:38:08Z","title":"RL's Razor: Why Online Reinforcement Learning Forgets Less","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.04259","snapshot_observed_at":"2026-08-08T00:51:24.899233Z","title":"arXiv preprint arXiv:2509.04259 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-09T23:10:07.427475Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:24.899233Z"},"links":{"cited_paper":"/paper/2509.04259","citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:a131073a88d604f49d85a46dddc21615be144daeb9d388f61253bf2ea156984f","observation_id":"11c81482-b16b-42cc-b5cf-e67d9efc2be1","resolution":{"observed_at":"2026-08-08T00:51:24.899233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:24.902409Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-09T23:10:07.427475Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:24.902409Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:f4d99ff9870bc763608a3b5457fb89d707a5a8cda7761385aa3084ae70ea120d","observation_id":"71923b72-fb19-4cd1-aa22-2eb690f3c77a","resolution":{"observed_at":"2026-08-08T00:51:24.902409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:24.905310Z","title":"2013 , eprint=","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-09T23:10:07.427475Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:24.905310Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:d9a2c3fcba9bcccbbbf20bb9cc90b49357177da06b8ff339bd0b6d781e04d6d8","observation_id":"f2c23186-5130-4f8c-af90-2984a31afaf1","resolution":{"observed_at":"2026-08-08T00:51:24.905310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:25.957091Z","title":"2025 , eprint=","venue":null,"work_id":"e2e18b62-5668-4689-a6bb-94e4c6b8255f","year":2025},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-09T23:10:07.427475Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:24.908993Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:599f2cf69b5147ae98401d566947eb7bd16c1264fb2ce49ab8f871b7e09f1151","observation_id":"71140767-a30f-4303-83f9-ea0281e40b19","resolution":{"observed_at":"2026-08-08T00:51:25.960024Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:24.911800Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-09T23:10:07.427475Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:24.911800Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:7d66d4f0875a45bdbe23ada81cb249c38b7120e5110a48cf13bb3a0be6ce1d96","observation_id":"e8335b22-ae85-4996-9a33-057bfcda0d32","resolution":{"observed_at":"2026-08-08T00:51:24.911800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.07349","last_updated":"2022-11-14T13:43:46Z","snapshot_observed_at":"2026-07-06T14:17:58.992600Z","submitted_at":"2022-11-14T13:43:46Z","title":"Finding Skill Neurons in Pre-trained Transformer-based Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.07349","snapshot_observed_at":"2026-08-08T00:51:24.914427Z","title":"arXiv preprint arXiv:2211.07349 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-09T23:10:07.427475Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:24.914427Z"},"links":{"cited_paper":"/paper/2211.07349","citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:d8eda76eab469180c8db7ea5cfd1ada4d8b919e98721164093eaf7dc54da650d","observation_id":"19efbbe8-f5ee-48fc-945b-4efdc4e3cc93","resolution":{"observed_at":"2026-08-08T00:51:24.914427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.11284","last_updated":"2025-01-20T05:44:01Z","snapshot_observed_at":"2026-08-06T13:30:45.600197Z","submitted_at":"2025-01-20T05:44:01Z","title":"RedStar: Does Scaling Long-CoT Data Unlock Better Slow-Reasoning Systems?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.11284","snapshot_observed_at":"2026-08-08T00:51:24.917563Z","title":"arXiv preprint arXiv:2501.11284 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-09T23:10:07.427475Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:24.917563Z"},"links":{"cited_paper":"/paper/2501.11284","citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:d11acf91054efa89e43f381139bdab78807b9d660f242b697f58cfcf3a9ae8a3","observation_id":"feda317e-f4f1-4c84-b724-c765eae22b4d","resolution":{"observed_at":"2026-08-08T00:51:24.917563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:24.920696Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-09T23:10:07.427475Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:24.920696Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:688363cb1799ed9b63f5c0369cd07ea92a17c59b9c5056ccb1f8e0eb6b9eaa0f","observation_id":"70b8ca03-76d2-45bd-b9b4-a146edd8dffa","resolution":{"observed_at":"2026-08-08T00:51:24.920696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.18071","last_updated":"2025-07-28T11:11:33Z","snapshot_observed_at":"2026-08-06T04:31:03.113409Z","submitted_at":"2025-07-24T03:50:32Z","title":"Group Sequence Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.18071","snapshot_observed_at":"2026-08-08T00:51:24.923464Z","title":"arXiv preprint arXiv:2507.18071 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-09T23:10:07.427475Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:24.923464Z"},"links":{"cited_paper":"/paper/2507.18071","citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:6fc596a51a1787a2c06341bc242e7ca5ca104ba7171082aefa0e13c13ec225d6","observation_id":"1b4f520d-f52f-43b1-bb3c-9ce02f0269af","resolution":{"observed_at":"2026-08-08T00:51:24.923464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:24.926486Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-09T23:10:07.427475Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:24.926486Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:cc9fb8ee37e390f9c6349ec54474c22e66f1387d0794423f2108a4ad5a2e2b9a","observation_id":"16f87fda-c97a-430d-b473-60434b3e0f85","resolution":{"observed_at":"2026-08-08T00:51:24.926486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.16546","last_updated":"2025-08-22T17:10:37Z","snapshot_observed_at":"2026-08-09T01:56:02.075811Z","submitted_at":"2025-08-22T17:10:37Z","title":"RL Is Neither a Panacea Nor a Mirage: Understanding Supervised vs. Reinforcement Learning Fine-Tuning for LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.16546","snapshot_observed_at":"2026-08-08T00:51:24.929359Z","title":"reinforcement learning fine-tuning for llms , author=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-09T23:10:07.427475Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:24.929359Z"},"links":{"cited_paper":"/paper/2508.16546","citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:f740bf4ed052d35851a940e064a4342759c0c7fd12245bbef7b4ff15f7a8a0b9","observation_id":"b7ae546c-595f-4e1e-a732-6e2679834658","resolution":{"observed_at":"2026-08-08T00:51:24.929359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:25.938005Z","title":null,"venue":null,"work_id":"2db81c52-3687-4561-a94e-251a7ec1ccf8","year":null},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-09T23:10:07.427475Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:24.932337Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:5b4ef415d068a7922b03ecd273b4018c30514a451087f0608d5f8f121fe12f84","observation_id":"6ee3b23d-47c9-4d05-9d9a-702c441e85fe","resolution":{"observed_at":"2026-08-08T00:51:25.941163Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:24.934982Z","title":"arXiv preprint arXiv:2508.11408 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-09T23:10:07.427475Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:24.934982Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:0211c435868a772e5e01403e0a03d38694f0f0b69ee80e4e051012fa213dcf97","observation_id":"da7ea94d-8785-4431-b5ad-f5af98effe21","resolution":{"observed_at":"2026-08-08T00:51:24.934982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19767","last_updated":"2025-06-24T16:31:37Z","snapshot_observed_at":"2026-08-06T23:00:22.849455Z","submitted_at":"2025-06-24T16:31:37Z","title":"SRFT: A Single-Stage Method with Supervised and Reinforcement Fine-Tuning for Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.19767","snapshot_observed_at":"2026-08-08T00:51:24.937566Z","title":"arXiv preprint arXiv:2506.19767 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-09T23:10:07.427475Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:24.937566Z"},"links":{"cited_paper":"/paper/2506.19767","citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:ff957443a0e07941a167f72a2d8e40736ec2b004d29adfb523c78c6ab021ab80","observation_id":"66463944-db0e-4f81-8a74-1a8135b269ac","resolution":{"observed_at":"2026-08-08T00:51:24.937566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:24.940643Z","title":"arXiv preprint arXiv:2507.14783 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-09T23:10:07.427475Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:24.940643Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:05e304e2965643179e24358df2b1721400bbfba6adb66c6374dfc6622341ccd3","observation_id":"764de3c9-cf85-4936-97b8-d44c84de81e5","resolution":{"observed_at":"2026-08-08T00:51:24.940643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:25.930524Z","title":null,"venue":null,"work_id":"56364636-e181-4cde-ad32-8be1eefe7d0c","year":null},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-09T23:10:07.427475Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:24.943161Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:46e9647dacd38c4bafa6ba64aa1a9e4d4f34c73a8794c767352b3f6b611fa3b3","observation_id":"5880889f-ada6-4589-9536-bf1cd6f24903","resolution":{"observed_at":"2026-08-08T00:51:25.933261Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04142","last_updated":"2025-06-04T16:33:44Z","snapshot_observed_at":"2026-08-07T21:43:19.257599Z","submitted_at":"2025-06-04T16:33:44Z","title":"Establishing Trustworthy LLM Evaluation via Shortcut Neuron Analysis","version":1},"cited_work":{"arxiv_id":"2506.04142","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.04142","snapshot_observed_at":"2026-08-08T00:51:25.414858Z","title":"Establishing Trustworthy LLM Evaluation via Shortcut Neuron Analysis","venue":"cs.CL","work_id":"2a5749bc-bc1e-46a5-962c-0612f4573c7f","year":2025},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-09T23:10:07.427475Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:24.945853Z"},"links":{"cited_paper":"/paper/2506.04142","citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:96809b8b8f1e27b99d928138fc4b2c46261eb4f2529150cf930794bff44616b0","observation_id":"f249f6e5-1491-4e43-a410-13aca663e1a2","resolution":{"observed_at":"2026-08-08T00:51:25.419952Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:24.948610Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-09T23:10:07.427475Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:24.948610Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:41d96e6755efe715ef5c2e82cb54a9566c4a4032c356c6d331c03b126b20bf14","observation_id":"4d23f51b-9412-441b-8f52-eee04f5eb2d9","resolution":{"observed_at":"2026-08-08T00:51:24.948610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:24.951367Z","title":"arXiv e-prints , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-09T23:10:07.427475Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:24.951367Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:8d0f7cfafacee49058db2937da278d03647b3f8906b0d1cd59140b2a53fbcbaf","observation_id":"745e9d7f-2acd-4bb7-806e-e4293d9babc8","resolution":{"observed_at":"2026-08-08T00:51:24.951367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:24.954073Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-09T23:10:07.427475Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:24.954073Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:3a0d9b0cd1a0445fddf1ea35e63b1ec6af32119abceaf3bb588a45e29570cc44","observation_id":"24e4dbc1-7e97-4fd0-bd8f-3b58a041cdb2","resolution":{"observed_at":"2026-08-08T00:51:24.954073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.11423","last_updated":"2025-09-02T02:55:17Z","snapshot_observed_at":"2026-08-09T06:00:41.769405Z","submitted_at":"2025-05-16T16:36:00Z","title":"When Thinking Fails: The Pitfalls of Reasoning for Instruction-Following in LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.11423","snapshot_observed_at":"2026-08-08T00:51:24.956984Z","title":"arXiv preprint arXiv:2505.11423 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-09T23:10:07.427475Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:24.956984Z"},"links":{"cited_paper":"/paper/2505.11423","citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:9c1c55bd3b904d8f3d61404ccce509349d59fe75d3d1cc6d9f195a56699e623a","observation_id":"e190c4f2-4725-41c1-a6ff-9c092fa92250","resolution":{"observed_at":"2026-08-08T00:51:24.956984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:24.959992Z","title":"International Conference on Machine Learning , pages=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-09T23:10:07.427475Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:24.959992Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:0bb4c80159dc991d1bec92704f0a09c2335500be126d442b7901eea4a88f7f7a","observation_id":"7f05ed9c-ec62-4b30-9b7f-37ca7a45157a","resolution":{"observed_at":"2026-08-08T00:51:24.959992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08593","last_updated":"2020-01-08T23:02:36Z","snapshot_observed_at":"2026-08-08T07:44:49.921146Z","submitted_at":"2019-09-18T17:33:39Z","title":"Fine-Tuning Language Models from Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08593","snapshot_observed_at":"2026-08-08T00:51:24.962646Z","title":"arXiv preprint arXiv:1909.08593 , year=","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-09T23:10:07.427475Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:24.962646Z"},"links":{"cited_paper":"/paper/1909.08593","citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:28fdfb6e77df3eb593f0b16ea10c05df64463a60e795679c536a357389903630","observation_id":"a093eb83-067c-4172-a1a6-286c9091e8d5","resolution":{"observed_at":"2026-08-08T00:51:24.962646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:24.965740Z","title":"arXiv preprint arXiv:2510.23451 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-09T23:10:07.427475Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:24.965740Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:3d735f657b7a7dd06c05add9faa3f28fa3a68ab4ea898edcf5bd7474d91c174b","observation_id":"ea9057cc-3348-44d9-ba0d-a8fb64914c59","resolution":{"observed_at":"2026-08-08T00:51:24.965740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-08T00:51:24.968486Z","title":"arXiv preprint arXiv:2503.14476 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-09T23:10:07.427475Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:24.968486Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:409378b49b0128aecbb3771fd1a6f781ac4a4f0cef7ddcd0573986a8e7f0ae13","observation_id":"7f808ad9-c7ac-4b19-b4f4-ff9731543c33","resolution":{"observed_at":"2026-08-08T00:51:24.968486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.20534","last_updated":"2026-02-03T04:57:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-28T05:35:43Z","title":"Kimi K2: Open Agentic Intelligence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.20534","snapshot_observed_at":"2026-08-08T00:51:24.971347Z","title":"arXiv preprint arXiv:2507.20534 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-09T23:10:07.427475Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:24.971347Z"},"links":{"cited_paper":"/paper/2507.20534","citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:bc5d3c81ec22dde2123c3794776ab1e8f5a7ced135eb919cf861e85e93184bb5","observation_id":"13da6049-b004-45c3-8c9a-93018bb1f1c4","resolution":{"observed_at":"2026-08-08T00:51:24.971347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.01652","last_updated":"2022-02-08T20:26:45Z","snapshot_observed_at":"2026-08-10T07:52:08.606999Z","submitted_at":"2021-09-03T17:55:52Z","title":"Finetuned Language Models Are Zero-Shot Learners","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.01652","snapshot_observed_at":"2026-08-08T00:51:24.974293Z","title":"arXiv preprint arXiv:2109.01652 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-09T23:10:07.427475Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:24.974293Z"},"links":{"cited_paper":"/paper/2109.01652","citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:e30c2faf0451941375311926afa3a461de9872f609b7a5f0e9ac71a219432036","observation_id":"274a4626-4b3f-42e1-81e8-c4211dc99651","resolution":{"observed_at":"2026-08-08T00:51:24.974293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.00432","last_updated":"2025-10-20T14:27:09Z","snapshot_observed_at":"2026-08-09T08:43:45.790818Z","submitted_at":"2025-07-01T05:23:05Z","title":"Does Math Reasoning Improve General LLM Capabilities? Understanding Transferability of LLM Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.00432","snapshot_observed_at":"2026-08-08T00:51:24.977379Z","title":"arXiv preprint arXiv:2507.00432 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-09T23:10:07.427475Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:24.977379Z"},"links":{"cited_paper":"/paper/2507.00432","citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:6c34e9ef72f551425c51a2ab2632df092b44f88c9a010acf97a4c2fae7f992a9","observation_id":"64744e12-324e-44ba-9f40-65a2bb6ec4be","resolution":{"observed_at":"2026-08-08T00:51:24.977379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:24.980199Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-09T23:10:07.427475Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:24.980199Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:9e5aebbe79a84a31911eb818857346b0a971e72a2f42fba409975f44881a123a","observation_id":"cfa8e593-2751-444f-86c4-dd747e1b95de","resolution":{"observed_at":"2026-08-08T00:51:24.980199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:24.983165Z","title":"arXiv preprint arXiv:2510.19178 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-09T23:10:07.427475Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:24.983165Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:332e42cc9b115d6face78dddd6abe89030257225eb1d4528792f58ace4afadd5","observation_id":"9c809825-2207-4248-b986-1e64ec13d22c","resolution":{"observed_at":"2026-08-08T00:51:24.983165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.02556","last_updated":"2025-12-02T09:25:14Z","snapshot_observed_at":"2026-07-31T23:49:25.878472Z","submitted_at":"2025-12-02T09:25:14Z","title":"DeepSeek-V3.2: Pushing the Frontier of Open Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.02556","snapshot_observed_at":"2026-08-08T00:51:24.985898Z","title":"2: Pushing the frontier of open large language models , author=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-09T23:10:07.427475Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:24.985898Z"},"links":{"cited_paper":"/paper/2512.02556","citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:a786d8bba2a907eb611a807afe9b95d9392e5ab280fc13dd3a280840a086916d","observation_id":"a2022819-1246-49c2-a20d-d370e0f34043","resolution":{"observed_at":"2026-08-08T00:51:24.985898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.07317","last_updated":"2026-06-06T19:45:56Z","snapshot_observed_at":"2026-08-03T23:08:02.092548Z","submitted_at":"2025-11-10T17:18:35Z","title":"RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.07317","snapshot_observed_at":"2026-08-08T00:51:24.989053Z","title":"arXiv preprint arXiv:2511.07317 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-09T23:10:07.427475Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:24.989053Z"},"links":{"cited_paper":"/paper/2511.07317","citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:66df38b52b3dc6b88796aac0eb5eb974ec8a6f5f1498c830b4bc9fc4fcd09cac","observation_id":"71867253-54ed-464c-97bb-90248c9e3e5a","resolution":{"observed_at":"2026-08-08T00:51:24.989053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:24.991738Z","title":"2025 , url =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-09T23:10:07.427475Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:24.991738Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:f9452bb944782c151a9aef5fb24afdeb106953eadf4b48e8263ede313a2e9bb9","observation_id":"a246913d-eed8-4d9d-95b8-df2f8c98ef22","resolution":{"observed_at":"2026-08-08T00:51:24.991738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:25.900484Z","title":"2025 , url =","venue":null,"work_id":"e7adf566-8c9f-4107-bfd0-bd802075111b","year":2025},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-09T23:10:07.427475Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:24.994352Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:455ce2c4f33b38946b1db8c51812a25b011a4fbaa16d6817522d372e17b89411","observation_id":"6296a290-b359-4605-b99c-cf693850f86e","resolution":{"observed_at":"2026-08-08T00:51:25.903509Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-08T00:51:24.997044Z","title":"arXiv preprint arXiv:2505.09388 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-09T23:10:07.427475Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:24.997044Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:cfbea9edd66473b700887791b62a5259c10a214cd7d6efda788a26c39259a47b","observation_id":"6420f249-30c8-4e0e-ac34-9ca34ea51e94","resolution":{"observed_at":"2026-08-08T00:51:24.997044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.17565","last_updated":"2025-05-13T07:43:57Z","snapshot_observed_at":"2026-08-07T15:59:30.215146Z","submitted_at":"2025-04-24T13:57:53Z","title":"DeepDistill: Enhancing LLM Reasoning Capabilities via Large-Scale Difficulty-Graded Data Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.17565","snapshot_observed_at":"2026-08-08T00:51:24.999803Z","title":"arXiv preprint arXiv:2504.17565 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-09T23:10:07.427475Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:24.999803Z"},"links":{"cited_paper":"/paper/2504.17565","citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:a63b05e5ba17ffc76e0c36601a84097328093d5e0b3af107405214e060a7f75c","observation_id":"76f66b0a-8911-4d14-9334-55a992341558","resolution":{"observed_at":"2026-08-08T00:51:24.999803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:25.002728Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-09T23:10:07.427475Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:25.002728Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:a97ebad00746d6113cc1fdc1ca6057644c0212e6815c75aed36b3c9eb1fba8b5","observation_id":"df3ba475-cc66-4b8a-9ffb-891e6bf26385","resolution":{"observed_at":"2026-08-08T00:51:25.002728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:25.888938Z","title":"2023 38th IEEE/ACM International Conference on Automated Software Engineering (ASE) , pages=","venue":null,"work_id":"72be01bd-1f97-49f0-8b35-60a508324d4c","year":2023},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-09T23:10:07.427475Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:25.005420Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:200691ed015c8f8a4eebf8e8286a5d0f5c3e3c37c92627b0701f0bef839cbbdd","observation_id":"8c329527-5d4b-4c46-a22d-af845ac75ecb","resolution":{"observed_at":"2026-08-08T00:51:25.892013Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.20050","last_updated":"2023-05-31T17:24:00Z","snapshot_observed_at":"2026-08-05T13:11:04.104454Z","submitted_at":"2023-05-31T17:24:00Z","title":"Let's Verify Step by Step","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.20050","snapshot_observed_at":"2026-08-08T00:51:25.008147Z","title":"arXiv preprint arXiv:2305.20050 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-09T23:10:07.427475Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:25.008147Z"},"links":{"cited_paper":"/paper/2305.20050","citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:3c46f87b12cef834c103c8da75e5799385a89b08a4721ad6eeae7ca748e43344","observation_id":"9361a7d4-2b63-4187-9363-1051be6d3c82","resolution":{"observed_at":"2026-08-08T00:51:25.008147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:25.011091Z","title":"2021 , eprint=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-09T23:10:07.427475Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:25.011091Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:326a43443b315616a8464465c51f3ae5f28c763e35d7d9023dcee089776ab8cf","observation_id":"9a48c120-3fd5-4099-a059-871c5e3a22a5","resolution":{"observed_at":"2026-08-08T00:51:25.011091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:25.014006Z","title":"2023 , eprint=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-09T23:10:07.427475Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:25.014006Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:72bfa4eaadad8642340534d7ef49e4121b5872bc119ebd48820433d688fee12a","observation_id":"efdddd95-982f-4daf-9c61-14879811b92e","resolution":{"observed_at":"2026-08-08T00:51:25.014006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:25.017043Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-09T23:10:07.427475Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:25.017043Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:4ef93e214b717377d078c8ea22d4e4ac46d62cded1d07622564622991c6d2185","observation_id":"daab03e9-76d4-4b8a-a62f-0f4be1d86bee","resolution":{"observed_at":"2026-08-08T00:51:25.017043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:25.019902Z","title":"2021 , eprint=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-09T23:10:07.427475Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:25.019902Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:2822278b4e81740b8a1633e964b8500d36eb8ad5e20344c99e8cade6afd5e092","observation_id":"5b6c23ea-e248-4b6e-bd5c-d74225384034","resolution":{"observed_at":"2026-08-08T00:51:25.019902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:25.866699Z","title":"2023 , version =","venue":null,"work_id":"683e4b0f-195b-4982-81cc-76612a68ccd6","year":2023},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-09T23:10:07.427475Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:25.022641Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:1866fc1bc257c2979b2d7c57150126277f98c3208bc1de44e9fbe3daae66f580","observation_id":"d1c45c70-a3fa-41a4-b4bc-aa80d8848f8f","resolution":{"observed_at":"2026-08-08T00:51:25.869420Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-08T00:51:25.025149Z","title":"arXiv preprint arXiv:1707.06347 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-09T23:10:07.427475Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:25.025149Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:bbb1af6eee649a67ea4cf03cf961898fee39b768a4114fed103892bd9b0bc11e","observation_id":"f778c1ea-d242-4c17-a6bb-f44267396d80","resolution":{"observed_at":"2026-08-08T00:51:25.025149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19641","last_updated":"2025-06-04T05:08:08Z","snapshot_observed_at":"2026-08-07T14:07:26.838295Z","submitted_at":"2025-05-26T07:59:36Z","title":"SynLogic: Synthesizing Verifiable Reasoning Data at Scale for Learning Logical Reasoning and Beyond","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19641","snapshot_observed_at":"2026-08-08T00:51:25.027810Z","title":"arXiv preprint arXiv:2505.19641 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-09T23:10:07.427475Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:25.027810Z"},"links":{"cited_paper":"/paper/2505.19641","citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:1aba298f5a82e5c924759b64c2a51b2b4dde14d3fd97233a89607699f9ee733c","observation_id":"2f8860d8-de94-47b4-ac83-0f576c4dc1db","resolution":{"observed_at":"2026-08-08T00:51:25.027810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:25.030741Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-09T23:10:07.427475Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:25.030741Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:ff4f01f882c24a41424665754c71c426ddbe9266e3dc1e7b54820d16d85e1f39","observation_id":"5c7924ec-49e9-472d-8b0d-ef809e3e2859","resolution":{"observed_at":"2026-08-08T00:51:25.030741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:25.033447Z","title":"2021 , eprint=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-09T23:10:07.427475Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:25.033447Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:2f0d4dd116de9ad592432019f78956e4beaff720f1c65385eddc807ed15a8db2","observation_id":"d846356e-fef5-4e2c-bb81-dcab8bd5d115","resolution":{"observed_at":"2026-08-08T00:51:25.033447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:25.036133Z","title":"2018 , publisher=","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-09T23:10:07.427475Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:25.036133Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:4a7928f81b8602363d8babffa50d7f0bab7dacfa7f31017660c1f68e124757f7","observation_id":"95efbe3e-738e-4301-8e88-cf35352831ed","resolution":{"observed_at":"2026-08-08T00:51:25.036133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:25.038958Z","title":"arXiv preprint arXiv:2511.08567 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-09T23:10:07.427475Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:25.038958Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:d73dffbab89dc0533917257740e37e563157607ed21192e4ed353aa0afdcf88b","observation_id":"a82567e2-1149-4f66-9bd1-8d6940c54fab","resolution":{"observed_at":"2026-08-08T00:51:25.038958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:25.041478Z","title":"2023 , eprint=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-09T23:10:07.427475Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:25.041478Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:5cc3014b6ca9f773bc150d7235204d4f859cfa7159e04f4dc2ea21a208d5befd","observation_id":"992b03f0-173e-4f22-af7c-5828a9d78df8","resolution":{"observed_at":"2026-08-08T00:51:25.041478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-09T23:40:29.433863Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.17512","snapshot_observed_at":"2026-08-08T00:51:25.044392Z","title":"arXiv preprint arXiv:2507.17512 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-09T23:10:07.427475Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:25.044392Z"},"links":{"cited_paper":"/paper/2507.17512","citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:ffd49c693bd69809336cb6fb9b9b198dd7d893d7c613aec105043a37c15b3f1f","observation_id":"c2ae80be-b48c-4a30-8693-dbf3e39bd428","resolution":{"observed_at":"2026-08-08T00:51:25.044392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14965","last_updated":"2025-06-17T20:24:00Z","snapshot_observed_at":"2026-08-07T00:07:18.793298Z","submitted_at":"2025-06-17T20:24:00Z","title":"Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.14965","snapshot_observed_at":"2026-08-08T00:51:25.047158Z","title":"arXiv preprint arXiv:2506.14965 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-09T23:10:07.427475Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:25.047158Z"},"links":{"cited_paper":"/paper/2506.14965","citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:85ef985be7b9a0272bee2750c17b701ed2dc9485ca8bd47cceaabbd82ed42d57","observation_id":"6ff86dea-41c1-47b1-9ea2-89aaca1fd3c3","resolution":{"observed_at":"2026-08-08T00:51:25.047158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:25.842661Z","title":"The Fourteenth International Conference on Learning Representations , year=","venue":null,"work_id":"c8c3695e-b531-4fcc-947c-402efa2deec6","year":null},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-09T23:10:07.427475Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:25.050015Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:cfd66a6febcc0c6193686e18d69d354ef14f706ea7a50de5408c2e68da4deced","observation_id":"e66d5eb6-190b-4889-a7df-0d3c10249ede","resolution":{"observed_at":"2026-08-08T00:51:25.845486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:25.834763Z","title":"Proceedings of the 2024 Conference on Empirical Methods in Natural Language Processing , pages=","venue":null,"work_id":"38a978d2-fb26-4f72-97a9-ecf1f9e3c52d","year":2024},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-09T23:10:07.427475Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:25.052625Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:00793d34b347cac40cf647363d2797d0aefd611b1263816248dd813c4c760277","observation_id":"89566f01-e99a-4fe2-aa09-d5807c6082a6","resolution":{"observed_at":"2026-08-08T00:51:25.837858Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:25.826924Z","title":"Forty-second International Conference on Machine Learning , year=","venue":null,"work_id":"b949ead3-36a8-4dc6-a828-ac3ed2935d9a","year":null},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-09T23:10:07.427475Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:25.055253Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:98c2340775fec22e76d930a221365e3ee177eefc6df5ead5f15c71e5fc0de208","observation_id":"975416e0-961b-4e25-9587-d5bfc019080c","resolution":{"observed_at":"2026-08-08T00:51:25.829860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:25.058003Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-09T23:10:07.427475Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:25.058003Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:3fd0d84441806babfd4c6442172dbe4d2dd5c42bfcc5f481ace5d248b584a60b","observation_id":"47e5bb23-9f6d-4127-b083-cd1a1cf26d76","resolution":{"observed_at":"2026-08-08T00:51:25.058003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04089","last_updated":"2023-03-31T15:27:01Z","snapshot_observed_at":"2026-08-03T22:12:27.993418Z","submitted_at":"2022-12-08T05:50:53Z","title":"Editing Models with Task Arithmetic","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04089","snapshot_observed_at":"2026-08-08T00:51:25.060648Z","title":"arXiv preprint arXiv:2212.04089 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-09T23:10:07.427475Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:25.060648Z"},"links":{"cited_paper":"/paper/2212.04089","citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:3b4db064c815426e6579d0ee0389e1658fcf2f1c91429f441438b9949202fdbc","observation_id":"556712b3-94f1-45aa-b5fb-6909f09cefe5","resolution":{"observed_at":"2026-08-08T00:51:25.060648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:25.063688Z","title":"Forty-first International Conference on Machine Learning , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-09T23:10:07.427475Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:25.063688Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:56b777dee6e86fa151582b7f624e10e50da100a1b7f32c4c5684ef39718eb87b","observation_id":"f8209ebf-a8f4-45fe-9f2e-50e7deaccfbf","resolution":{"observed_at":"2026-08-08T00:51:25.063688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:25.066306Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-09T23:10:07.427475Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:25.066306Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:c488c9bf3ef276ab6ea6409619d96166ffb444acf7c350a3ff13c09ae0dc2376","observation_id":"9ffd96e5-6234-4689-84bd-408099ee5923","resolution":{"observed_at":"2026-08-08T00:51:25.066306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09849","last_updated":"2025-05-21T23:53:00Z","snapshot_observed_at":"2026-08-07T00:34:34.195906Z","submitted_at":"2022-12-19T20:46:43Z","title":"Dataless Knowledge Fusion by Merging Weights of Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09849","snapshot_observed_at":"2026-08-08T00:51:25.068937Z","title":"arXiv preprint arXiv:2212.09849 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-09T23:10:07.427475Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:25.068937Z"},"links":{"cited_paper":"/paper/2212.09849","citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:512ee04163ef0dc2b16eb1dc3df67d47ac1e22442258b078869f150021bd1028","observation_id":"1912973d-21a4-4e46-8168-a210dc0e8dfc","resolution":{"observed_at":"2026-08-08T00:51:25.068937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:25.807452Z","title":"2026 , eprint=","venue":null,"work_id":"cbd2de4b-5074-4924-90cc-96571ae9c047","year":2026},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-09T23:10:07.427475Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:25.071815Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:816da99b4000031c554afd5d322e4f5c5e7874c5a6dc9082f140e9faa9742864","observation_id":"caf44552-0cef-4061-bad3-19aaea3ae23a","resolution":{"observed_at":"2026-08-08T00:51:25.810348Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:25.799793Z","title":"2026 , eprint=","venue":null,"work_id":"1a5adede-79fb-488b-843a-a6ca77810433","year":2026},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-09T23:10:07.427475Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:25.074482Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:6497a8675a32f2d6652e22bfdedf48599734a5ef61b9a7b1ec9332478d48db53","observation_id":"ddd4fee7-4ce1-4dc2-a313-a8d2c9ee7221","resolution":{"observed_at":"2026-08-08T00:51:25.802733Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:25.791986Z","title":"2026 , eprint=","venue":null,"work_id":"57de0a50-5b33-403f-8a7b-6fe6437c6594","year":2026},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-09T23:10:07.427475Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:25.077067Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:b8939d8201c5a9449295d67e60d8420dc9336fd453a69db545b63ae4122213db","observation_id":"39cc38b0-c77e-4038-accc-df121c4630b7","resolution":{"observed_at":"2026-08-08T00:51:25.794796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:25.784065Z","title":"2026 , eprint=","venue":null,"work_id":"70e9ca65-20c2-4b17-b035-584e5ee2442a","year":2026},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-09T23:10:07.427475Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:25.079487Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:08b01688a970658f7d328ea267d255594033f95d96ad636cb276139825634507","observation_id":"6b056ef3-3e89-4599-a46b-8c5d3df82a23","resolution":{"observed_at":"2026-08-08T00:51:25.786970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:25.776138Z","title":"2026 , eprint=","venue":null,"work_id":"fcaf0635-6fee-4982-947f-af991806ed0b","year":2026},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-09T23:10:07.427475Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:25.082053Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:891c28a7030f064347ffaf9488dfc313f95c721d1199106065997ffe8bb17646","observation_id":"82ccedf0-eeb8-4730-a59e-b833c30585a2","resolution":{"observed_at":"2026-08-08T00:51:25.778971Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:25.768079Z","title":"2026 , eprint=","venue":null,"work_id":"0d83bbe6-9151-482e-acd2-3b28ca38dbdb","year":2026},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-09T23:10:07.427475Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:25.084604Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:0c68d9ba0d9d68d496672cd660e1d87f29be84a4ab2a77d397a8b8c8969ad88b","observation_id":"678625fb-776c-4013-88ad-7afa773708d4","resolution":{"observed_at":"2026-08-08T00:51:25.770980Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:25.760152Z","title":"2026 , eprint=","venue":null,"work_id":"44452995-0bae-433a-9ada-e5e12a6bd470","year":2026},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-09T23:10:07.427475Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:25.087330Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:a05cbbd729f02f97c1e2da14ee24415b81c5e619b20fa5df1a304178fcf7692e","observation_id":"abf48d9c-71d8-4055-b9e7-41899d946b6f","resolution":{"observed_at":"2026-08-08T00:51:25.762900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:25.751964Z","title":"2026 , eprint=","venue":null,"work_id":"219382e8-a649-4ec4-bae3-af913f133b8a","year":2026},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-09T23:10:07.427475Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:25.089778Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:2d7cc4dfa73dfb2f926f53adf190569e42e06ff879a0981d072236f8b9f55b8e","observation_id":"10ddd987-57c6-4940-a2b7-328d30167c99","resolution":{"observed_at":"2026-08-08T00:51:25.754873Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:25.744350Z","title":"2026 , eprint=","venue":null,"work_id":"9e9701e7-c65b-456e-9c86-a830830de9df","year":2026},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-09T23:10:07.427475Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:25.092301Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:e1a87ea2fe2bf3d672db939acd0c6978c7a2af02654c59f7445a1165b0c85748","observation_id":"22fc5538-5170-4c1d-b216-5e3ca146df99","resolution":{"observed_at":"2026-08-08T00:51:25.747135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:25.735274Z","title":"2025 , eprint=","venue":null,"work_id":"177c031c-9c99-4fb1-b1ed-bdf668258136","year":2025},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-09T23:10:07.427475Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:25.094778Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:8b267cbb8e06faf6dfdcdf88dec5e394602724f43e9fc7dd26ccb9b602cc47f8","observation_id":"7478ca43-fb12-4840-ba87-a003ba3c8dff","resolution":{"observed_at":"2026-08-08T00:51:25.739308Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:51:25.727188Z","title":"2026 , eprint=","venue":null,"work_id":"1b9c4c4b-f1e7-414a-99d6-44ddc8488246","year":2026},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-09T23:10:07.427475Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:25.097330Z"},"links":{"citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:e50cfc77b23ef2ba83d8c101be31a6f8fce1a026a55b8202d96435e0dae03b8b","observation_id":"f4b5e2d6-d10d-4199-969d-945f04036517","resolution":{"observed_at":"2026-08-08T00:51:25.730046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-09T23:10:07.427475Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs"},"reference_resolution":{"displayed":91,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":72,"verified_exact":0,"verified_fuzzy":18},"total_outbound_references":91},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 91 of 91 outbound references and 0 inbound Pith citation observations for arXiv:2608.03573."}