{"as_of":"2026-08-21T03:29:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8ca7fba1c321c9fecfbbc64e88ce6b163c7acc5f3597cdf3b6cc84175efe9b93","coverage":[{"denominator":58,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":58,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-14T10:33:54.851493Z","state":"measured"},{"denominator":60,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":60,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T09:44:31.301557Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-04T12:16:13.904932Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2607.10601","last_updated":"2026-07-12T06:38:55Z","snapshot_observed_at":"2026-08-20T04:28:43.904286Z","submitted_at":"2026-07-12T06:38:55Z","title":"Agentic-DPO: From Imitation to Agentic Policy Optimization on Expert Trajectories","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.10601","snapshot_observed_at":"2026-08-04T09:44:31.189084Z","title":"Agentic-DPO: From imitation to agentic policy optimization on expert trajectories.arXiv preprint arXiv:2607.10601,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02302","last_updated":"2026-08-03T14:27:58Z","snapshot_observed_at":"2026-08-14T10:12:18.886139Z","submitted_at":"2026-08-03T14:27:58Z","title":"Trajectories That Segment Themselves: Agent-Declared Boundaries as a Training Unit","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T09:44:31.189084Z"},"links":{"cited_paper":"/paper/2607.10601","citing_paper":"/paper/2608.02302"},"observation_digest":"sha256:4c9abc967c9f10166942e36e96100c3c9e43e5415c650049bacb60744713b1e0","observation_id":"875642c6-38ee-4344-9c6f-05ebcba0861e","resolution":{"observed_at":"2026-08-04T09:44:31.189084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.10601","last_updated":"2026-07-12T06:38:55Z","snapshot_observed_at":"2026-08-20T04:28:43.904286Z","submitted_at":"2026-07-12T06:38:55Z","title":"Agentic-DPO: From Imitation to Agentic Policy Optimization on Expert Trajectories","version":1},"cited_work":{"arxiv_id":"2607.10601","doi":"10.48550/arxiv.2607.10601","metadata_source":"pith","pith_arxiv_id":"2607.10601","snapshot_observed_at":"2026-08-04T12:16:13.904932Z","title":"Agentic-DPO: From Imitation to Agentic Policy Optimization on Expert Trajectories","venue":"cs.AI","work_id":"469a3c31-48c3-4220-9850-d64389c6fc89","year":2026},"citing_paper":{"arxiv_id":"2608.02302","last_updated":"2026-08-03T14:27:58Z","snapshot_observed_at":"2026-08-14T10:12:18.886139Z","submitted_at":"2026-08-03T14:27:58Z","title":"Trajectories That Segment Themselves: Agent-Declared Boundaries as a Training Unit","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-04T09:44:31.301557Z"},"links":{"cited_paper":"/paper/2607.10601","citing_paper":"/paper/2608.02302"},"observation_digest":"sha256:9c9776842a0d6dd379f19ea6c6203ac140d3f372047585020879313457593713","observation_id":"c2f3f8ba-9fab-439d-9502-a0dcb14cd4ea","resolution":{"observed_at":"2026-08-04T09:49:29.305770Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2607.10601/citation-record","integrity":"/paper/2607.10601/integrity","json":"/paper/2607.10601/citation-record.json","paper":"/paper/2607.10601"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T10:33:54.851493Z","title":"On-policy distillation of language models: Learning from self-generated mistakes","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10601","last_updated":"2026-07-12T06:38:55Z","snapshot_observed_at":"2026-08-20T04:28:43.904286Z","submitted_at":"2026-07-12T06:38:55Z","title":"Agentic-DPO: From Imitation to Agentic Policy Optimization on Expert Trajectories","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-14T10:33:54.851493Z"},"links":{"citing_paper":"/paper/2607.10601"},"observation_digest":"sha256:9ee804e550e0ed82a35fbbd11e57651e0c30fe597357ee742f58386255189448","observation_id":"4bd8000a-17c5-497e-991b-75af1d98781d","resolution":{"observed_at":"2026-07-14T10:33:54.851493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T10:33:54.851493Z","title":"A general theoretical paradigm to understand learning from human preferences","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10601","last_updated":"2026-07-12T06:38:55Z","snapshot_observed_at":"2026-08-20T04:28:43.904286Z","submitted_at":"2026-07-12T06:38:55Z","title":"Agentic-DPO: From Imitation to Agentic Policy Optimization on Expert Trajectories","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-14T10:33:54.851493Z"},"links":{"citing_paper":"/paper/2607.10601"},"observation_digest":"sha256:7e1117ba26ea140d7ca61319b5464a459321fb9cd74794e9b3e694df0b5a3cd8","observation_id":"7bed126f-49a0-4b34-8771-8c9097274e48","resolution":{"observed_at":"2026-07-14T10:33:54.851493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T10:33:54.851493Z","title":"Digirl: Training in-the-wild device-control agents with autonomous reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10601","last_updated":"2026-07-12T06:38:55Z","snapshot_observed_at":"2026-08-20T04:28:43.904286Z","submitted_at":"2026-07-12T06:38:55Z","title":"Agentic-DPO: From Imitation to Agentic Policy Optimization on Expert Trajectories","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-14T10:33:54.851493Z"},"links":{"citing_paper":"/paper/2607.10601"},"observation_digest":"sha256:c7f764a2860261459d43cdb88bd3f45e713253f4ae3bc227d0172cb45fc61faa","observation_id":"2a742f75-8987-4797-96ca-d4981f57b7da","resolution":{"observed_at":"2026-07-14T10:33:54.851493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05915","last_updated":"2023-10-09T17:58:38Z","snapshot_observed_at":"2026-08-16T14:53:43.494263Z","submitted_at":"2023-10-09T17:58:38Z","title":"FireAct: Toward Language Agent Fine-tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05915","snapshot_observed_at":"2026-07-14T10:33:54.851493Z","title":"Fireact: Toward language agent fine-tuning.arXiv preprint arXiv:2310.05915, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.10601","last_updated":"2026-07-12T06:38:55Z","snapshot_observed_at":"2026-08-20T04:28:43.904286Z","submitted_at":"2026-07-12T06:38:55Z","title":"Agentic-DPO: From Imitation to Agentic Policy Optimization on Expert Trajectories","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-14T10:33:54.851493Z"},"links":{"cited_paper":"/paper/2310.05915","citing_paper":"/paper/2607.10601"},"observation_digest":"sha256:44687cc8aee5de44675bf64224583ef97315f949534af7e77aa757f190a52c05","observation_id":"fadb3a24-6dea-449d-8890-a67f0292a037","resolution":{"observed_at":"2026-07-14T10:33:54.851493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12881","last_updated":"2024-03-19T16:26:10Z","snapshot_observed_at":"2026-08-16T14:08:19.460947Z","submitted_at":"2024-03-19T16:26:10Z","title":"Agent-FLAN: Designing Data and Methods of Effective Agent Tuning for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12881","snapshot_observed_at":"2026-07-14T10:33:54.851493Z","title":"Agent-FLAN: Designing data and methods of effective agent tuning for large language models.arXiv preprint arXiv:2403.12881, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10601","last_updated":"2026-07-12T06:38:55Z","snapshot_observed_at":"2026-08-20T04:28:43.904286Z","submitted_at":"2026-07-12T06:38:55Z","title":"Agentic-DPO: From Imitation to Agentic Policy Optimization on Expert Trajectories","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-14T10:33:54.851493Z"},"links":{"cited_paper":"/paper/2403.12881","citing_paper":"/paper/2607.10601"},"observation_digest":"sha256:85607a5998b4573b58268f2ff507bb0188ce01016595097f1c5a618c68fb4f16","observation_id":"aa1023e0-2103-4140-8bcf-38a7d6edef7f","resolution":{"observed_at":"2026-07-14T10:33:54.851493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.02197","last_updated":"2025-06-05T01:42:08Z","snapshot_observed_at":"2026-08-16T12:53:22.712391Z","submitted_at":"2025-03-04T02:14:55Z","title":"ATLaS: Agent Tuning via Learning Critical Steps","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.02197","snapshot_observed_at":"2026-07-14T10:33:54.851493Z","title":"ATLaS: Agent tuning via learning critical steps.arXiv preprint arXiv:2503.02197, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10601","last_updated":"2026-07-12T06:38:55Z","snapshot_observed_at":"2026-08-20T04:28:43.904286Z","submitted_at":"2026-07-12T06:38:55Z","title":"Agentic-DPO: From Imitation to Agentic Policy Optimization on Expert Trajectories","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-14T10:33:54.851493Z"},"links":{"cited_paper":"/paper/2503.02197","citing_paper":"/paper/2607.10601"},"observation_digest":"sha256:2dc4585f2b0f26f7b81a3a8249cfefb31c5234ac7dd50f0c8f259801ae8b02e6","observation_id":"a2032254-9900-4d09-a479-56845208ee84","resolution":{"observed_at":"2026-07-14T10:33:54.851493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T10:33:54.851493Z","title":"Self-play fine-tuning converts weak language models to strong language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10601","last_updated":"2026-07-12T06:38:55Z","snapshot_observed_at":"2026-08-20T04:28:43.904286Z","submitted_at":"2026-07-12T06:38:55Z","title":"Agentic-DPO: From Imitation to Agentic Policy Optimization on Expert Trajectories","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-14T10:33:54.851493Z"},"links":{"citing_paper":"/paper/2607.10601"},"observation_digest":"sha256:61d307faa378e2b224e2122745a5b6b810f9604be30be7c419bfc17af5572874","observation_id":"073b40c5-dbb9-486f-9b6b-5a46a17d6e3f","resolution":{"observed_at":"2026-07-14T10:33:54.851493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.12725","last_updated":"2025-06-15T05:32:07Z","snapshot_observed_at":"2026-08-16T10:44:54.797916Z","submitted_at":"2025-06-15T05:32:07Z","title":"Rethinking DPO: The Role of Rejected Responses in Preference Misalignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.12725","snapshot_observed_at":"2026-07-14T10:33:54.851493Z","title":"Rethinking DPO: The role of rejected responses in preference misalignment.arXiv preprint arXiv:2506.12725, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10601","last_updated":"2026-07-12T06:38:55Z","snapshot_observed_at":"2026-08-20T04:28:43.904286Z","submitted_at":"2026-07-12T06:38:55Z","title":"Agentic-DPO: From Imitation to Agentic Policy Optimization on Expert Trajectories","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-14T10:33:54.851493Z"},"links":{"cited_paper":"/paper/2506.12725","citing_paper":"/paper/2607.10601"},"observation_digest":"sha256:2584f949e35396c3c8c552113f3783a2f98e76c3fdfeae26543a14fb2df5807c","observation_id":"1b629639-8ed1-4636-8dfb-7d7e727e1127","resolution":{"observed_at":"2026-07-14T10:33:54.851493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.11425","last_updated":"2025-06-20T23:32:06Z","snapshot_observed_at":"2026-08-15T01:54:01.275744Z","submitted_at":"2025-06-13T02:46:53Z","title":"Agent-RLVR: Training Software Engineering Agents via Guidance and Environment Rewards","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.11425","snapshot_observed_at":"2026-07-14T10:33:54.851493Z","title":"Agent-rlvr: Training software engineering agents via guidance and environment rewards.arXiv preprint arXiv:2506.11425, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10601","last_updated":"2026-07-12T06:38:55Z","snapshot_observed_at":"2026-08-20T04:28:43.904286Z","submitted_at":"2026-07-12T06:38:55Z","title":"Agentic-DPO: From Imitation to Agentic Policy Optimization on Expert Trajectories","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-14T10:33:54.851493Z"},"links":{"cited_paper":"/paper/2506.11425","citing_paper":"/paper/2607.10601"},"observation_digest":"sha256:7a7c7ecae5d1ad99fe4c9179d7329b75414f0a42f5ae7135f6fd1dbaa367b413","observation_id":"daced041-f2dc-4f63-8d6b-cc3dd8ae344b","resolution":{"observed_at":"2026-07-14T10:33:54.851493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T10:33:54.851493Z","title":"Mind2Web: Towards a generalist agent for the web","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.10601","last_updated":"2026-07-12T06:38:55Z","snapshot_observed_at":"2026-08-20T04:28:43.904286Z","submitted_at":"2026-07-12T06:38:55Z","title":"Agentic-DPO: From Imitation to Agentic Policy Optimization on Expert Trajectories","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-14T10:33:54.851493Z"},"links":{"citing_paper":"/paper/2607.10601"},"observation_digest":"sha256:b4f3979cf6a23f390dc2f0e59c98692df1590a5fb01a812586d10a69ebb951f0","observation_id":"0aabe613-5e49-464b-bcd6-d37bf6f05257","resolution":{"observed_at":"2026-07-14T10:33:54.851493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01306","last_updated":"2024-11-19T18:12:45Z","snapshot_observed_at":"2026-08-17T15:29:47.883677Z","submitted_at":"2024-02-02T10:53:36Z","title":"KTO: Model Alignment as Prospect Theoretic Optimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01306","snapshot_observed_at":"2026-07-14T10:33:54.851493Z","title":"KTO: Model alignment as prospect theoretic optimization.International Conference on Machine Learning (ICML), 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10601","last_updated":"2026-07-12T06:38:55Z","snapshot_observed_at":"2026-08-20T04:28:43.904286Z","submitted_at":"2026-07-12T06:38:55Z","title":"Agentic-DPO: From Imitation to Agentic Policy Optimization on Expert Trajectories","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-14T10:33:54.851493Z"},"links":{"cited_paper":"/paper/2402.01306","citing_paper":"/paper/2607.10601"},"observation_digest":"sha256:06684b9517e8ace2ad5edbfd04c492b122cbdc5d52991a782eaf7a3297872468","observation_id":"eea484d1-9b2d-40cf-947d-18c3272a465f","resolution":{"observed_at":"2026-07-14T10:33:54.851493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01702","last_updated":"2025-02-24T12:42:14Z","snapshot_observed_at":"2026-08-10T22:27:45.352221Z","submitted_at":"2025-01-03T08:55:19Z","title":"AgentRefine: Enhancing Agent Generalization through Refinement Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01702","snapshot_observed_at":"2026-07-14T10:33:54.851493Z","title":"AgentRefine: Enhancing agent generalization through refinement tuning.arXiv preprint arXiv:2501.01702, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10601","last_updated":"2026-07-12T06:38:55Z","snapshot_observed_at":"2026-08-20T04:28:43.904286Z","submitted_at":"2026-07-12T06:38:55Z","title":"Agentic-DPO: From Imitation to Agentic Policy Optimization on Expert Trajectories","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-14T10:33:54.851493Z"},"links":{"cited_paper":"/paper/2501.01702","citing_paper":"/paper/2607.10601"},"observation_digest":"sha256:9648b4bd6bbf506979f77796636730755db522d2c93b3b9f772523fc14135243","observation_id":"ddddbc5f-1585-4c36-8a98-841c2807c6af","resolution":{"observed_at":"2026-07-14T10:33:54.851493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T10:33:54.851493Z","title":"Solving the granularity mismatch: Hierarchical preference learning for long-horizon llm agents","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10601","last_updated":"2026-07-12T06:38:55Z","snapshot_observed_at":"2026-08-20T04:28:43.904286Z","submitted_at":"2026-07-12T06:38:55Z","title":"Agentic-DPO: From Imitation to Agentic Policy Optimization on Expert Trajectories","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-14T10:33:54.851493Z"},"links":{"citing_paper":"/paper/2607.10601"},"observation_digest":"sha256:5070b43defddb7b7ea66567dcb5e7f1088c65d3c3f78812cb9049306e48946a6","observation_id":"ea5c0a9f-0bad-41e1-848d-3d75d73784c8","resolution":{"observed_at":"2026-07-14T10:33:54.851493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19786","last_updated":"2025-03-25T15:52:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T15:52:34Z","title":"Gemma 3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19786","snapshot_observed_at":"2026-07-14T10:33:54.851493Z","title":"Gemma 3 technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10601","last_updated":"2026-07-12T06:38:55Z","snapshot_observed_at":"2026-08-20T04:28:43.904286Z","submitted_at":"2026-07-12T06:38:55Z","title":"Agentic-DPO: From Imitation to Agentic Policy Optimization on Expert Trajectories","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-14T10:33:54.851493Z"},"links":{"cited_paper":"/paper/2503.19786","citing_paper":"/paper/2607.10601"},"observation_digest":"sha256:4c440069d5c4cf19042ddd039786793d34d6d64405dd60a3f36a88c11d8ab3f6","observation_id":"ecceda03-3c18-4ebb-bdfb-f024a19b2c26","resolution":{"observed_at":"2026-07-14T10:33:54.851493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07714","last_updated":"2025-03-05T07:39:03Z","snapshot_observed_at":"2026-08-19T14:24:16.776673Z","submitted_at":"2024-03-12T14:57:40Z","title":"StableToolBench: Towards Stable Large-Scale Benchmarking on Tool Learning of Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07714","snapshot_observed_at":"2026-07-14T10:33:54.851493Z","title":"StableToolBench: Towards stable large-scale benchmarking on tool learning of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10601","last_updated":"2026-07-12T06:38:55Z","snapshot_observed_at":"2026-08-20T04:28:43.904286Z","submitted_at":"2026-07-12T06:38:55Z","title":"Agentic-DPO: From Imitation to Agentic Policy Optimization on Expert Trajectories","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-14T10:33:54.851493Z"},"links":{"cited_paper":"/paper/2403.07714","citing_paper":"/paper/2607.10601"},"observation_digest":"sha256:d65ab645bd60b2d2ab401b11c56649affb95dfefa7749a8d8865b97e906e2ade","observation_id":"13b04911-4930-4a14-b996-e942cbefe43b","resolution":{"observed_at":"2026-07-14T10:33:54.851493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06770","last_updated":"2024-11-11T23:05:04Z","snapshot_observed_at":"2026-08-18T08:11:45.716032Z","submitted_at":"2023-10-10T16:47:29Z","title":"SWE-bench: Can Language Models Resolve Real-World GitHub Issues?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06770","snapshot_observed_at":"2026-07-14T10:33:54.851493Z","title":"Jimenez, John Yang, Alexander Wettig, Shunyu Yao, Kexin Pei, Ofir Press, and Karthik Narasimhan","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10601","last_updated":"2026-07-12T06:38:55Z","snapshot_observed_at":"2026-08-20T04:28:43.904286Z","submitted_at":"2026-07-12T06:38:55Z","title":"Agentic-DPO: From Imitation to Agentic Policy Optimization on Expert Trajectories","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-14T10:33:54.851493Z"},"links":{"cited_paper":"/paper/2310.06770","citing_paper":"/paper/2607.10601"},"observation_digest":"sha256:29b3deccf461758372b2fcf3e9bd6f5e22b53a2ab162f778b31bef1258dc72c5","observation_id":"1323640d-a83f-4a73-99fe-49b9b9ef3352","resolution":{"observed_at":"2026-07-14T10:33:54.851493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02882","last_updated":"2025-07-14T09:56:47Z","snapshot_observed_at":"2026-08-19T04:52:45.265808Z","submitted_at":"2025-04-02T05:47:28Z","title":"DiaTool-DPO: Multi-Turn Direct Preference Optimization for Tool-Augmented Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.02882","snapshot_observed_at":"2026-07-14T10:33:54.851493Z","title":"DiaTool-DPO: Multi-turn direct preference optimization for tool-augmented large language models.Annual Meeting of the Association for Computational Linguistics (ACL), 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10601","last_updated":"2026-07-12T06:38:55Z","snapshot_observed_at":"2026-08-20T04:28:43.904286Z","submitted_at":"2026-07-12T06:38:55Z","title":"Agentic-DPO: From Imitation to Agentic Policy Optimization on Expert Trajectories","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-14T10:33:54.851493Z"},"links":{"cited_paper":"/paper/2504.02882","citing_paper":"/paper/2607.10601"},"observation_digest":"sha256:f5140e76ab9c5d51b69bb098e0cb1d52cf1b5a7e628f40715e8ae504132be6df","observation_id":"95c6e5d8-ecde-4168-a827-3ea7abf5ff01","resolution":{"observed_at":"2026-07-14T10:33:54.851493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18629","snapshot_observed_at":"2026-07-14T10:33:54.851493Z","title":"Step- dpo: Step-wise preference optimization for long-chain reasoning of llms.arXiv preprint arXiv:2406.18629, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10601","last_updated":"2026-07-12T06:38:55Z","snapshot_observed_at":"2026-08-20T04:28:43.904286Z","submitted_at":"2026-07-12T06:38:55Z","title":"Agentic-DPO: From Imitation to Agentic Policy Optimization on Expert Trajectories","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-14T10:33:54.851493Z"},"links":{"cited_paper":"/paper/2406.18629","citing_paper":"/paper/2607.10601"},"observation_digest":"sha256:8e2c88e1041fc735e4d560dccde9af602958ff0db2a670b28b6685276bbefaa1","observation_id":"87b2b2cf-224f-4ae4-9ad6-dde87fe12866","resolution":{"observed_at":"2026-07-14T10:33:54.851493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00267","last_updated":"2024-09-03T14:01:54Z","snapshot_observed_at":"2026-08-15T10:07:24.540946Z","submitted_at":"2023-09-01T05:53:33Z","title":"RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00267","snapshot_observed_at":"2026-07-14T10:33:54.851493Z","title":"RLAIF vs","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10601","last_updated":"2026-07-12T06:38:55Z","snapshot_observed_at":"2026-08-20T04:28:43.904286Z","submitted_at":"2026-07-12T06:38:55Z","title":"Agentic-DPO: From Imitation to Agentic Policy Optimization on Expert Trajectories","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-14T10:33:54.851493Z"},"links":{"cited_paper":"/paper/2309.00267","citing_paper":"/paper/2607.10601"},"observation_digest":"sha256:a16ff1304414ae59ba6b862d35a768881bbb09b1b0fe2f16a6300fc0652e4eeb","observation_id":"39980b5c-efff-4ecf-817c-a9bd5c061323","resolution":{"observed_at":"2026-07-14T10:33:54.851493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T10:33:54.851493Z","title":"Hammer: Robust function- calling for on-device language models via function masking.arXiv preprint arXiv:2410.04587, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10601","last_updated":"2026-07-12T06:38:55Z","snapshot_observed_at":"2026-08-20T04:28:43.904286Z","submitted_at":"2026-07-12T06:38:55Z","title":"Agentic-DPO: From Imitation to Agentic Policy Optimization on Expert Trajectories","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-14T10:33:54.851493Z"},"links":{"citing_paper":"/paper/2607.10601"},"observation_digest":"sha256:8a41db9b481fbf03f5e31ce4990b2ff5fdd1f5d16eb1d9f10f77eef8c9879278","observation_id":"7f9fcd0f-ff5f-4d3d-905f-9611cafbb6d2","resolution":{"observed_at":"2026-07-14T10:33:54.851493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00920","last_updated":"2025-07-25T08:26:54Z","snapshot_observed_at":"2026-08-16T13:22:13.710309Z","submitted_at":"2024-09-02T03:19:56Z","title":"ToolACE: Winning the Points of LLM Function Calling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00920","snapshot_observed_at":"2026-07-14T10:33:54.851493Z","title":"ToolACE: Winning the points of LLM function calling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10601","last_updated":"2026-07-12T06:38:55Z","snapshot_observed_at":"2026-08-20T04:28:43.904286Z","submitted_at":"2026-07-12T06:38:55Z","title":"Agentic-DPO: From Imitation to Agentic Policy Optimization on Expert Trajectories","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-14T10:33:54.851493Z"},"links":{"cited_paper":"/paper/2409.00920","citing_paper":"/paper/2607.10601"},"observation_digest":"sha256:af8211d7a0c36013546201b77cdb84dff0ba9d0f42f45b307cf2da22ddabd69e","observation_id":"5cd85973-f39f-4e1c-88f6-0945f4952fda","resolution":{"observed_at":"2026-07-14T10:33:54.851493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T10:33:54.851493Z","title":"Simpo: Simple preference optimization with a reference-free reward.Advances in Neural Information Processing Systems, 37:124198–124235, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10601","last_updated":"2026-07-12T06:38:55Z","snapshot_observed_at":"2026-08-20T04:28:43.904286Z","submitted_at":"2026-07-12T06:38:55Z","title":"Agentic-DPO: From Imitation to Agentic Policy Optimization on Expert Trajectories","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-14T10:33:54.851493Z"},"links":{"citing_paper":"/paper/2607.10601"},"observation_digest":"sha256:49257392423768cb2921bc6a384ba577aa6136a6d4d41237bc6305e89a589292","observation_id":"5eea86bb-7289-4a91-95de-a03bb0a7515f","resolution":{"observed_at":"2026-07-14T10:33:54.851493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T10:33:54.851493Z","title":"Gui agents: A survey","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10601","last_updated":"2026-07-12T06:38:55Z","snapshot_observed_at":"2026-08-20T04:28:43.904286Z","submitted_at":"2026-07-12T06:38:55Z","title":"Agentic-DPO: From Imitation to Agentic Policy Optimization on Expert Trajectories","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-14T10:33:54.851493Z"},"links":{"citing_paper":"/paper/2607.10601"},"observation_digest":"sha256:b245be18d6eb69747f72573b352cdcbae91fdb394371ba1d4358285259fc4613","observation_id":"79571b25-a819-4894-a3e3-928ce0f60229","resolution":{"observed_at":"2026-07-14T10:33:54.851493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.02155","last_updated":"2022-03-04T07:04:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-04T07:04:42Z","title":"Training language models to follow instructions with human feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.02155","snapshot_observed_at":"2026-07-14T10:33:54.851493Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.10601","last_updated":"2026-07-12T06:38:55Z","snapshot_observed_at":"2026-08-20T04:28:43.904286Z","submitted_at":"2026-07-12T06:38:55Z","title":"Agentic-DPO: From Imitation to Agentic Policy Optimization on Expert Trajectories","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-14T10:33:54.851493Z"},"links":{"cited_paper":"/paper/2203.02155","citing_paper":"/paper/2607.10601"},"observation_digest":"sha256:b296dd39a0a235f00e2dabc1282a182bd26fbe5d05a86dce2c114150e5c55815","observation_id":"ce7beb51-7129-4ea0-883d-91ca30119bf8","resolution":{"observed_at":"2026-07-14T10:33:54.851493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13228","last_updated":"2024-07-03T13:46:33Z","snapshot_observed_at":"2026-08-14T02:18:02.339361Z","submitted_at":"2024-02-20T18:42:34Z","title":"Smaug: Fixing Failure Modes of Preference Optimisation with DPO-Positive","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13228","snapshot_observed_at":"2026-07-14T10:33:54.851493Z","title":"Smaug: Fixing failure modes of preference optimisation with DPO-positive.arXiv preprint arXiv:2402.13228, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10601","last_updated":"2026-07-12T06:38:55Z","snapshot_observed_at":"2026-08-20T04:28:43.904286Z","submitted_at":"2026-07-12T06:38:55Z","title":"Agentic-DPO: From Imitation to Agentic Policy Optimization on Expert Trajectories","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-14T10:33:54.851493Z"},"links":{"cited_paper":"/paper/2402.13228","citing_paper":"/paper/2607.10601"},"observation_digest":"sha256:d428789599403190c239b413bb63f6deb903ba7e846f4bf7098b9cffe757eb6d","observation_id":"2e5ed80b-ce8e-440d-ac78-7c1869bd53f5","resolution":{"observed_at":"2026-07-14T10:33:54.851493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T10:33:54.851493Z","title":"Patil, Huanzhi Mao, Fanjia Yan, Charlie Cheng-Jie Ji, Vishnu Suresh, Ion Stoica, and Joseph E","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10601","last_updated":"2026-07-12T06:38:55Z","snapshot_observed_at":"2026-08-20T04:28:43.904286Z","submitted_at":"2026-07-12T06:38:55Z","title":"Agentic-DPO: From Imitation to Agentic Policy Optimization on Expert Trajectories","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-14T10:33:54.851493Z"},"links":{"citing_paper":"/paper/2607.10601"},"observation_digest":"sha256:00b188540ca6b72ff7b7a6f0e89bd3a53e4e5206f843c312af2e8c5ff3ea4e99","observation_id":"bfb841ce-f1d5-482e-a2b8-b447e2059dbb","resolution":{"observed_at":"2026-07-14T10:33:54.851493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02337","last_updated":"2025-01-27T11:56:15Z","snapshot_observed_at":"2026-08-18T10:06:51.290180Z","submitted_at":"2024-11-04T17:59:58Z","title":"WebRL: Training LLM Web Agents via Self-Evolving Online Curriculum Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02337","snapshot_observed_at":"2026-07-14T10:33:54.851493Z","title":"WebRL: Training LLM web agents via self-evolving online curriculum reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10601","last_updated":"2026-07-12T06:38:55Z","snapshot_observed_at":"2026-08-20T04:28:43.904286Z","submitted_at":"2026-07-12T06:38:55Z","title":"Agentic-DPO: From Imitation to Agentic Policy Optimization on Expert Trajectories","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-14T10:33:54.851493Z"},"links":{"cited_paper":"/paper/2411.02337","citing_paper":"/paper/2607.10601"},"observation_digest":"sha256:09817f4623715b1127635e9d73247e13fc37be7ec3e93a7b1e4e89069018dc6f","observation_id":"18440b04-b9a5-4dea-b32d-f6f4e07bcc55","resolution":{"observed_at":"2026-07-14T10:33:54.851493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16789","last_updated":"2023-10-03T14:45:48Z","snapshot_observed_at":"2026-08-16T04:18:30.717622Z","submitted_at":"2023-07-31T15:56:53Z","title":"ToolLLM: Facilitating Large Language Models to Master 16000+ Real-world APIs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16789","snapshot_observed_at":"2026-07-14T10:33:54.851493Z","title":"ToolLLM: Facilitating large language models to master 16000+ real-world APIs","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10601","last_updated":"2026-07-12T06:38:55Z","snapshot_observed_at":"2026-08-20T04:28:43.904286Z","submitted_at":"2026-07-12T06:38:55Z","title":"Agentic-DPO: From Imitation to Agentic Policy Optimization on Expert Trajectories","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-14T10:33:54.851493Z"},"links":{"cited_paper":"/paper/2307.16789","citing_paper":"/paper/2607.10601"},"observation_digest":"sha256:926ec7e3b6c055afcd3f29c3ddff4f60b24296d49e04ee531ee249dfaea95296","observation_id":"cac12049-04b6-44bc-9e63-d089bc29f8c2","resolution":{"observed_at":"2026-07-14T10:33:54.851493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T10:33:54.851493Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.10601","last_updated":"2026-07-12T06:38:55Z","snapshot_observed_at":"2026-08-20T04:28:43.904286Z","submitted_at":"2026-07-12T06:38:55Z","title":"Agentic-DPO: From Imitation to Agentic Policy Optimization on Expert Trajectories","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-14T10:33:54.851493Z"},"links":{"citing_paper":"/paper/2607.10601"},"observation_digest":"sha256:e2b12404f1668c9eac8a7f4bed098ca000ab9688bda64556e04bdc5470af8260","observation_id":"8a548b2e-ffed-4753-9dc6-204b79192997","resolution":{"observed_at":"2026-07-14T10:33:54.851493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-20T07:04:06.309989Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-07-14T10:33:54.851493Z","title":"Proximal policy optimization algorithms.arXiv preprint arXiv:1707.06347, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.10601","last_updated":"2026-07-12T06:38:55Z","snapshot_observed_at":"2026-08-20T04:28:43.904286Z","submitted_at":"2026-07-12T06:38:55Z","title":"Agentic-DPO: From Imitation to Agentic Policy Optimization on Expert Trajectories","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-14T10:33:54.851493Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2607.10601"},"observation_digest":"sha256:bbb9bb3a4f115736a35e3c71976e159c6407ca1971f45a8115d2ad6e9727ec9f","observation_id":"0c8dbf53-6548-4bfb-970e-1b80295858fd","resolution":{"observed_at":"2026-07-14T10:33:54.851493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-07-14T10:33:54.851493Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10601","last_updated":"2026-07-12T06:38:55Z","snapshot_observed_at":"2026-08-20T04:28:43.904286Z","submitted_at":"2026-07-12T06:38:55Z","title":"Agentic-DPO: From Imitation to Agentic Policy Optimization on Expert Trajectories","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-14T10:33:54.851493Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2607.10601"},"observation_digest":"sha256:761df847957162841c99f12be83ecd2aaac2471b6be7b9f85b3e2b2b0e80dd3b","observation_id":"7144fbd5-b679-453c-8af3-4f5464f345c6","resolution":{"observed_at":"2026-07-14T10:33:54.851493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15004","last_updated":"2024-12-05T02:00:07Z","snapshot_observed_at":"2026-08-20T22:03:43.474413Z","submitted_at":"2024-11-22T15:26:23Z","title":"ScribeAgent: Towards Specialized Web Agents Using Production-Scale Workflow Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15004","snapshot_observed_at":"2026-07-14T10:33:54.851493Z","title":"ScribeAgent: Towards specialized web agents using production-scale workflow data.arXiv preprint arXiv:2411.15004, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10601","last_updated":"2026-07-12T06:38:55Z","snapshot_observed_at":"2026-08-20T04:28:43.904286Z","submitted_at":"2026-07-12T06:38:55Z","title":"Agentic-DPO: From Imitation to Agentic Policy Optimization on Expert Trajectories","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-14T10:33:54.851493Z"},"links":{"cited_paper":"/paper/2411.15004","citing_paper":"/paper/2607.10601"},"observation_digest":"sha256:858ed6fed469899abc97c938befa15f8f15f3be1817761ed87977d0bdc85f664","observation_id":"61d49fa2-1d15-422e-80b3-39416bc77069","resolution":{"observed_at":"2026-07-14T10:33:54.851493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14868","last_updated":"2025-02-23T20:00:36Z","snapshot_observed_at":"2026-08-20T09:12:43.911019Z","submitted_at":"2024-06-21T05:13:20Z","title":"Direct Multi-Turn Preference Optimization for Language Agents","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.14868","snapshot_observed_at":"2026-07-14T10:33:54.851493Z","title":"Direct multi-turn preference optimization for language agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10601","last_updated":"2026-07-12T06:38:55Z","snapshot_observed_at":"2026-08-20T04:28:43.904286Z","submitted_at":"2026-07-12T06:38:55Z","title":"Agentic-DPO: From Imitation to Agentic Policy Optimization on Expert Trajectories","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-14T10:33:54.851493Z"},"links":{"cited_paper":"/paper/2406.14868","citing_paper":"/paper/2607.10601"},"observation_digest":"sha256:81fddfa1bc04d54a984fdabbc6e3bd2ec7db4d119af37383a7302cc32ec1fdf7","observation_id":"2dbc19d7-538f-4172-8aea-d9e62cf42b6d","resolution":{"observed_at":"2026-07-14T10:33:54.851493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T10:33:54.851493Z","title":"Reflexion: Language agents with verbal reinforcement learning.Advances in neural information processing systems, 36:8634–8652, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.10601","last_updated":"2026-07-12T06:38:55Z","snapshot_observed_at":"2026-08-20T04:28:43.904286Z","submitted_at":"2026-07-12T06:38:55Z","title":"Agentic-DPO: From Imitation to Agentic Policy Optimization on Expert Trajectories","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-14T10:33:54.851493Z"},"links":{"citing_paper":"/paper/2607.10601"},"observation_digest":"sha256:a7013e3ed0914364ac64f856d37710d02918c1d780134fabe4356078ce9a3c4c","observation_id":"a648e3d0-d204-426e-9c40-b3c0df0fe317","resolution":{"observed_at":"2026-07-14T10:33:54.851493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.03768","last_updated":"2021-03-14T22:44:38Z","snapshot_observed_at":"2026-08-19T18:51:42.906395Z","submitted_at":"2020-10-08T05:13:36Z","title":"ALFWorld: Aligning Text and Embodied Environments for Interactive Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.03768","snapshot_observed_at":"2026-07-14T10:33:54.851493Z","title":"ALFWorld: Aligning text and embodied environments for inter- active learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.10601","last_updated":"2026-07-12T06:38:55Z","snapshot_observed_at":"2026-08-20T04:28:43.904286Z","submitted_at":"2026-07-12T06:38:55Z","title":"Agentic-DPO: From Imitation to Agentic Policy Optimization on Expert Trajectories","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-14T10:33:54.851493Z"},"links":{"cited_paper":"/paper/2010.03768","citing_paper":"/paper/2607.10601"},"observation_digest":"sha256:59054f72ac7a7f31ab2f30b6c5e236d651d5b7f74845793f0904f669e1acdd75","observation_id":"7fd8d7a3-0a9a-4b3a-8383-414f080a6a23","resolution":{"observed_at":"2026-07-14T10:33:54.851493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.02502","last_updated":"2024-07-10T17:36:25Z","snapshot_observed_at":"2026-08-16T14:12:52.561838Z","submitted_at":"2024-03-04T21:50:29Z","title":"Trial and Error: Exploration-Based Trajectory Optimization for LLM Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.02502","snapshot_observed_at":"2026-07-14T10:33:54.851493Z","title":"Trial and error: Exploration-based trajectory optimization for LLM agents.arXiv preprint arXiv:2403.02502, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10601","last_updated":"2026-07-12T06:38:55Z","snapshot_observed_at":"2026-08-20T04:28:43.904286Z","submitted_at":"2026-07-12T06:38:55Z","title":"Agentic-DPO: From Imitation to Agentic Policy Optimization on Expert Trajectories","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-14T10:33:54.851493Z"},"links":{"cited_paper":"/paper/2403.02502","citing_paper":"/paper/2607.10601"},"observation_digest":"sha256:60b3e43729deee179f704df1ba7c1727f62368728d2245bcbbb37c37b6d46d43","observation_id":"9e11918f-c40e-4fcf-9e2c-4f56c9e8a377","resolution":{"observed_at":"2026-07-14T10:33:54.851493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T10:33:54.851493Z","title":"Swe-lego: Pushing the limits of supervised fine-tuning for software issue resolving.arXiv preprint arXiv:2601.01426, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.10601","last_updated":"2026-07-12T06:38:55Z","snapshot_observed_at":"2026-08-20T04:28:43.904286Z","submitted_at":"2026-07-12T06:38:55Z","title":"Agentic-DPO: From Imitation to Agentic Policy Optimization on Expert Trajectories","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-14T10:33:54.851493Z"},"links":{"citing_paper":"/paper/2607.10601"},"observation_digest":"sha256:e01a75914371abbbce437b95ecd6daa90dd069816262e3db248253719ab8cdfe","observation_id":"dc48e6f6-ed47-47ba-a876-ac2299bc4867","resolution":{"observed_at":"2026-07-14T10:33:54.851493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T10:33:54.851493Z","title":"Triplets better than pairs: Towards stable and effective self-play fine-tuning for LLMs","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10601","last_updated":"2026-07-12T06:38:55Z","snapshot_observed_at":"2026-08-20T04:28:43.904286Z","submitted_at":"2026-07-12T06:38:55Z","title":"Agentic-DPO: From Imitation to Agentic Policy Optimization on Expert Trajectories","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-14T10:33:54.851493Z"},"links":{"citing_paper":"/paper/2607.10601"},"observation_digest":"sha256:af27d7b322dd7ee6ed654fbf7b3f524b3b9ce0dfb50587729a464484bae027a7","observation_id":"eddeb439-8fc2-4d3c-bff0-b692f58a41f7","resolution":{"observed_at":"2026-07-14T10:33:54.851493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20073","last_updated":"2025-05-26T17:19:30Z","snapshot_observed_at":"2026-08-13T08:41:26.093022Z","submitted_at":"2025-04-24T17:57:08Z","title":"RAGEN: Understanding Self-Evolution in LLM Agents via Multi-Turn Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.20073","snapshot_observed_at":"2026-07-14T10:33:54.851493Z","title":"Ragen: Understanding self-evolution in llm agents via multi-turn reinforcement learning.arXiv preprint arXiv:2504.20073, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10601","last_updated":"2026-07-12T06:38:55Z","snapshot_observed_at":"2026-08-20T04:28:43.904286Z","submitted_at":"2026-07-12T06:38:55Z","title":"Agentic-DPO: From Imitation to Agentic Policy Optimization on Expert Trajectories","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-14T10:33:54.851493Z"},"links":{"cited_paper":"/paper/2504.20073","citing_paper":"/paper/2607.10601"},"observation_digest":"sha256:3bd2affd962eb8aae8fb7678c272d26fe01546deb4c589711ae1b59bdfcc21fd","observation_id":"072b71ac-60e3-40ac-b0ad-f30414dc02fe","resolution":{"observed_at":"2026-07-14T10:33:54.851493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T10:33:54.851493Z","title":"Webagent-r1: Training web agents via end-to-end multi-turn reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10601","last_updated":"2026-07-12T06:38:55Z","snapshot_observed_at":"2026-08-20T04:28:43.904286Z","submitted_at":"2026-07-12T06:38:55Z","title":"Agentic-DPO: From Imitation to Agentic Policy Optimization on Expert Trajectories","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-14T10:33:54.851493Z"},"links":{"citing_paper":"/paper/2607.10601"},"observation_digest":"sha256:edaafea425852ea3729757023ddbc2db7572ab3a4798d47d9ceb9bc79edd7550","observation_id":"d66964fa-2af2-4a5d-a84c-76b7f7c114ef","resolution":{"observed_at":"2026-07-14T10:33:54.851493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T10:33:54.851493Z","title":"On the generalization of SFT: A reinforcement learning perspective with reward rectification.arXiv preprint arXiv:2508.05629, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10601","last_updated":"2026-07-12T06:38:55Z","snapshot_observed_at":"2026-08-20T04:28:43.904286Z","submitted_at":"2026-07-12T06:38:55Z","title":"Agentic-DPO: From Imitation to Agentic Policy Optimization on Expert Trajectories","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-14T10:33:54.851493Z"},"links":{"citing_paper":"/paper/2607.10601"},"observation_digest":"sha256:8871f7d2feaad31a16d7e17fbea278586e6a64ce4eeb000565c75e78e101fd58","observation_id":"bbcf4ede-7dad-48e6-b29b-dd7363a87829","resolution":{"observed_at":"2026-07-14T10:33:54.851493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T10:33:54.851493Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10601","last_updated":"2026-07-12T06:38:55Z","snapshot_observed_at":"2026-08-20T04:28:43.904286Z","submitted_at":"2026-07-12T06:38:55Z","title":"Agentic-DPO: From Imitation to Agentic Policy Optimization on Expert Trajectories","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-14T10:33:54.851493Z"},"links":{"citing_paper":"/paper/2607.10601"},"observation_digest":"sha256:6a7768d5cde5b5b53a057416ed6835ba677fa2796c506282b3a20b054f58f8f7","observation_id":"e80a9c3c-7e51-4714-8bcb-d02e0649a8c2","resolution":{"observed_at":"2026-07-14T10:33:54.851493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.08755","last_updated":"2025-09-10T16:46:11Z","snapshot_observed_at":"2026-08-15T23:25:21.613036Z","submitted_at":"2025-09-10T16:46:11Z","title":"AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.08755","snapshot_observed_at":"2026-07-14T10:33:54.851493Z","title":"Agentgym-rl: Training llm agents for long-horizon decision making through multi-turn reinforcement learning.arXiv preprint arXiv:2509.08755, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10601","last_updated":"2026-07-12T06:38:55Z","snapshot_observed_at":"2026-08-20T04:28:43.904286Z","submitted_at":"2026-07-12T06:38:55Z","title":"Agentic-DPO: From Imitation to Agentic Policy Optimization on Expert Trajectories","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-14T10:33:54.851493Z"},"links":{"cited_paper":"/paper/2509.08755","citing_paper":"/paper/2607.10601"},"observation_digest":"sha256:5742a3eb4ae5fb8effd3e8362522956e2b10ef6896b859ab022e7eee1fc4a8a6","observation_id":"6b1e739c-bb86-4664-9402-992f048bad50","resolution":{"observed_at":"2026-07-14T10:33:54.851493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-14T10:33:54.851493Z","title":"Qwen3 technical report.arXiv preprint arXiv:2505.09388, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10601","last_updated":"2026-07-12T06:38:55Z","snapshot_observed_at":"2026-08-20T04:28:43.904286Z","submitted_at":"2026-07-12T06:38:55Z","title":"Agentic-DPO: From Imitation to Agentic Policy Optimization on Expert Trajectories","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-14T10:33:54.851493Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2607.10601"},"observation_digest":"sha256:dbbe05766b8d0ea97eb3abe7dfa99510310adff6d9bf789f4f6c41df1c359d58","observation_id":"f322476f-585f-4aa2-acac-e6eca0458269","resolution":{"observed_at":"2026-07-14T10:33:54.851493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.01206","last_updated":"2023-02-08T01:39:30Z","snapshot_observed_at":"2026-08-20T13:31:10.504015Z","submitted_at":"2022-07-04T05:30:22Z","title":"WebShop: Towards Scalable Real-World Web Interaction with Grounded Language Agents","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.01206","snapshot_observed_at":"2026-07-14T10:33:54.851493Z","title":"WebShop: Towards scalable real-world web interaction with grounded language agents","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.10601","last_updated":"2026-07-12T06:38:55Z","snapshot_observed_at":"2026-08-20T04:28:43.904286Z","submitted_at":"2026-07-12T06:38:55Z","title":"Agentic-DPO: From Imitation to Agentic Policy Optimization on Expert Trajectories","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-14T10:33:54.851493Z"},"links":{"cited_paper":"/paper/2207.01206","citing_paper":"/paper/2607.10601"},"observation_digest":"sha256:e8a9449847fe3b48cab33c43a490d61f6d8bae3c754e3814f4477c9c4b55b728","observation_id":"eae69f32-f3d9-40a1-b647-63633bc230ea","resolution":{"observed_at":"2026-07-14T10:33:54.851493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T10:33:54.851493Z","title":"React: Synergizing reasoning and acting in language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.10601","last_updated":"2026-07-12T06:38:55Z","snapshot_observed_at":"2026-08-20T04:28:43.904286Z","submitted_at":"2026-07-12T06:38:55Z","title":"Agentic-DPO: From Imitation to Agentic Policy Optimization on Expert Trajectories","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-14T10:33:54.851493Z"},"links":{"citing_paper":"/paper/2607.10601"},"observation_digest":"sha256:057e786f0f0aa684439c45b0bc7ac773610fc48d4af7ef51388dce30cadc40bc","observation_id":"938b0a07-ceca-4086-8f3c-6be037a98c7f","resolution":{"observed_at":"2026-07-14T10:33:54.851493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12045","last_updated":"2024-06-17T19:33:08Z","snapshot_observed_at":"2026-08-17T20:31:29.818313Z","submitted_at":"2024-06-17T19:33:08Z","title":"$\\tau$-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12045","snapshot_observed_at":"2026-07-14T10:33:54.851493Z","title":"τ-bench: A benchmark for tool-agent-user interaction in real-world domains.arXiv preprint arXiv:2406.12045, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10601","last_updated":"2026-07-12T06:38:55Z","snapshot_observed_at":"2026-08-20T04:28:43.904286Z","submitted_at":"2026-07-12T06:38:55Z","title":"Agentic-DPO: From Imitation to Agentic Policy Optimization on Expert Trajectories","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-14T10:33:54.851493Z"},"links":{"cited_paper":"/paper/2406.12045","citing_paper":"/paper/2607.10601"},"observation_digest":"sha256:98c7a8b91802353daadf3d8506bb83ee31248c5a81e26a5e7571e5711c22defd","observation_id":"ab2e065b-db38-425d-a90c-00716a677089","resolution":{"observed_at":"2026-07-14T10:33:54.851493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T10:33:54.851493Z","title":"Pivotrl: High accuracy agentic post-training at low compute cost.arXiv preprint arXiv:2603.21383, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.10601","last_updated":"2026-07-12T06:38:55Z","snapshot_observed_at":"2026-08-20T04:28:43.904286Z","submitted_at":"2026-07-12T06:38:55Z","title":"Agentic-DPO: From Imitation to Agentic Policy Optimization on Expert Trajectories","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-14T10:33:54.851493Z"},"links":{"citing_paper":"/paper/2607.10601"},"observation_digest":"sha256:759d5d93e07a8d124fc265dd7393fffbeaffafdb6fe5217282991c466511ea28","observation_id":"4763284b-6737-4384-8075-b7db468ec3b4","resolution":{"observed_at":"2026-07-14T10:33:54.851493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-08-15T01:20:08.134494Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-07-14T10:33:54.851493Z","title":"Self-rewarding language models.International Conference on Machine Learning (ICML), 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10601","last_updated":"2026-07-12T06:38:55Z","snapshot_observed_at":"2026-08-20T04:28:43.904286Z","submitted_at":"2026-07-12T06:38:55Z","title":"Agentic-DPO: From Imitation to Agentic Policy Optimization on Expert Trajectories","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-14T10:33:54.851493Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2607.10601"},"observation_digest":"sha256:edd413e31f509606995dc7ef99fbed2efcae341e3da75cc36ce56530329923a0","observation_id":"e7c1d6fa-76c3-40ae-a3d0-e44b3ee16705","resolution":{"observed_at":"2026-07-14T10:33:54.851493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T10:33:54.851493Z","title":"Agenttuning: Enabling generalized agent abilities for llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10601","last_updated":"2026-07-12T06:38:55Z","snapshot_observed_at":"2026-08-20T04:28:43.904286Z","submitted_at":"2026-07-12T06:38:55Z","title":"Agentic-DPO: From Imitation to Agentic Policy Optimization on Expert Trajectories","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-14T10:33:54.851493Z"},"links":{"citing_paper":"/paper/2607.10601"},"observation_digest":"sha256:d89a6a986dbca0ba7875d854270187b3b37bfa675f0c24cd1b998e99ab53554d","observation_id":"6cb0ce6a-0dd2-45e4-bfe3-044c7ba7c105","resolution":{"observed_at":"2026-07-14T10:33:54.851493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T10:33:54.851493Z","title":"ToolACE-R: Model-aware iterative training and adaptive refinement for tool learning.arXiv preprint arXiv:2504.01400, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10601","last_updated":"2026-07-12T06:38:55Z","snapshot_observed_at":"2026-08-20T04:28:43.904286Z","submitted_at":"2026-07-12T06:38:55Z","title":"Agentic-DPO: From Imitation to Agentic Policy Optimization on Expert Trajectories","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-14T10:33:54.851493Z"},"links":{"citing_paper":"/paper/2607.10601"},"observation_digest":"sha256:debc4dc1a09d91fa6c3e9f64014a3387610598f032897bc88719ea12bea3ac00","observation_id":"8fa68c9e-1438-475f-b7bf-7c4778a8b393","resolution":{"observed_at":"2026-07-14T10:33:54.851493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T10:33:54.851493Z","title":"first_name","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10601","last_updated":"2026-07-12T06:38:55Z","snapshot_observed_at":"2026-08-20T04:28:43.904286Z","submitted_at":"2026-07-12T06:38:55Z","title":"Agentic-DPO: From Imitation to Agentic Policy Optimization on Expert Trajectories","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-14T10:33:54.851493Z"},"links":{"citing_paper":"/paper/2607.10601"},"observation_digest":"sha256:4a7a7096dec4c56ff1e7f054e42f0679ac827d8154ecf35fb8c4ec37b213d766","observation_id":"39c67c93-b0a2-4325-b8c2-92037ed6bb82","resolution":{"observed_at":"2026-07-14T10:33:54.851493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T10:33:54.851493Z","title":"user_id\":","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10601","last_updated":"2026-07-12T06:38:55Z","snapshot_observed_at":"2026-08-20T04:28:43.904286Z","submitted_at":"2026-07-12T06:38:55Z","title":"Agentic-DPO: From Imitation to Agentic Policy Optimization on Expert Trajectories","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-14T10:33:54.851493Z"},"links":{"citing_paper":"/paper/2607.10601"},"observation_digest":"sha256:9e97907cff313413851f414565472467768e93cd8fdb2c3ec2cde38a3de3a391","observation_id":"a3388738-55db-44b5-bc57-f5edc284d166","resolution":{"observed_at":"2026-07-14T10:33:54.851493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T10:33:54.851493Z","title":"name\": \"Alice","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10601","last_updated":"2026-07-12T06:38:55Z","snapshot_observed_at":"2026-08-20T04:28:43.904286Z","submitted_at":"2026-07-12T06:38:55Z","title":"Agentic-DPO: From Imitation to Agentic Policy Optimization on Expert Trajectories","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-14T10:33:54.851493Z"},"links":{"citing_paper":"/paper/2607.10601"},"observation_digest":"sha256:5eeae3e29a08640fe93ce2b136d6ea210e7aebe16fab47849f53ab8c51ce1573","observation_id":"ec77e9ca-df12-4c1e-9d2e-954a088d3cab","resolution":{"observed_at":"2026-07-14T10:33:54.851493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T10:33:54.851493Z","title":"user_id\":","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10601","last_updated":"2026-07-12T06:38:55Z","snapshot_observed_at":"2026-08-20T04:28:43.904286Z","submitted_at":"2026-07-12T06:38:55Z","title":"Agentic-DPO: From Imitation to Agentic Policy Optimization on Expert Trajectories","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-07-14T10:33:54.851493Z"},"links":{"citing_paper":"/paper/2607.10601"},"observation_digest":"sha256:2e77a436e2a78dfe1772027c35eee5a7e1eeba96c78accb1deedb98219a4a7ad","observation_id":"12432ffd-2b1f-45ec-9999-c5d43c59e399","resolution":{"observed_at":"2026-07-14T10:33:54.851493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T10:33:54.851493Z","title":"user_id\":","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10601","last_updated":"2026-07-12T06:38:55Z","snapshot_observed_at":"2026-08-20T04:28:43.904286Z","submitted_at":"2026-07-12T06:38:55Z","title":"Agentic-DPO: From Imitation to Agentic Policy Optimization on Expert Trajectories","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-07-14T10:33:54.851493Z"},"links":{"citing_paper":"/paper/2607.10601"},"observation_digest":"sha256:c2e93f7e7eac1fbc476a7eafa029b5106fd81d42ecdc9e4556cac4abe4c02b77","observation_id":"e87c705e-95b9-402d-9331-7386dabd061e","resolution":{"observed_at":"2026-07-14T10:33:54.851493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T10:33:54.851493Z","title":"error\":","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10601","last_updated":"2026-07-12T06:38:55Z","snapshot_observed_at":"2026-08-20T04:28:43.904286Z","submitted_at":"2026-07-12T06:38:55Z","title":"Agentic-DPO: From Imitation to Agentic Policy Optimization on Expert Trajectories","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-07-14T10:33:54.851493Z"},"links":{"citing_paper":"/paper/2607.10601"},"observation_digest":"sha256:a925ef68ea75738e82c4bc6682ab3f8ec2a1bd91549e78428f2a4655a1771e1d","observation_id":"dfbbb2dd-43d8-461c-a4a0-dc1205f589a9","resolution":{"observed_at":"2026-07-14T10:33:54.851493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T10:33:54.851493Z","title":"user_id\":","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10601","last_updated":"2026-07-12T06:38:55Z","snapshot_observed_at":"2026-08-20T04:28:43.904286Z","submitted_at":"2026-07-12T06:38:55Z","title":"Agentic-DPO: From Imitation to Agentic Policy Optimization on Expert Trajectories","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-07-14T10:33:54.851493Z"},"links":{"citing_paper":"/paper/2607.10601"},"observation_digest":"sha256:5ba0ad0b380cad5e0eab0c22e6057bb5c35ba7e844b691ed585ecd84ee3a7a08","observation_id":"312805d7-2730-439b-a138-166929038dd1","resolution":{"observed_at":"2026-07-14T10:33:54.851493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.10601","last_updated":"2026-07-12T06:38:55Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-20T04:28:43.904286Z","submitted_at":"2026-07-12T06:38:55Z","title":"Agentic-DPO: From Imitation to Agentic Policy Optimization on Expert Trajectories"},"reference_resolution":{"displayed":58,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":58,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":58},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 58 of 58 outbound references and 2 inbound Pith citation observations for arXiv:2607.10601."}