{"as_of":"2026-08-09T19:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:03a26fba97820a8a846cd11b3ae6962ee76fb050fafb8ea3bba24e86ce4a23da","coverage":[{"denominator":27,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T15:47:41.955782Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":9,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":9,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T10:24:58.463499Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T04:17:36.880164Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.15073","last_updated":"2025-07-20T18:15:18Z","snapshot_observed_at":"2026-08-09T17:58:21.618872Z","submitted_at":"2025-07-20T18:15:18Z","title":"Reinforcement Learning for Flow-Matching Policies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.15073","snapshot_observed_at":"2026-08-04T10:24:58.463499Z","title":"Reinforcement Learning for Flow-Matching Policies,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.09976","last_updated":"2026-06-25T14:25:12Z","snapshot_observed_at":"2026-08-04T10:24:54.103532Z","submitted_at":"2025-10-11T03:11:18Z","title":"Reinforcement Fine-Tuning of Flow-Matching Policies for Vision-Language-Action Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-04T10:24:58.463499Z"},"links":{"cited_paper":"/paper/2507.15073","citing_paper":"/paper/2510.09976"},"observation_digest":"sha256:bb80ea95958e36336bd2d6665736f978ac5c36ae00fc9e80c1a0f7b200bcf419","observation_id":"bf0da5b4-75dc-40ec-8ee7-0448eedf1071","resolution":{"observed_at":"2026-08-04T10:24:58.463499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15073","last_updated":"2025-07-20T18:15:18Z","snapshot_observed_at":"2026-08-09T17:58:21.618872Z","submitted_at":"2025-07-20T18:15:18Z","title":"Reinforcement Learning for Flow-Matching Policies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.15073","snapshot_observed_at":"2026-07-14T23:46:32.301737Z","title":"Reinforce- ment learning for flow-matching policies.arXiv preprint arXiv:2507.15073,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.10263","last_updated":"2026-07-01T06:52:08Z","snapshot_observed_at":"2026-08-07T08:16:48.418429Z","submitted_at":"2026-03-10T22:49:46Z","title":"From Prior to Pro: Efficient Skill Mastery via Distribution Contractive RL Finetuning","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-14T23:46:32.301737Z"},"links":{"cited_paper":"/paper/2507.15073","citing_paper":"/paper/2603.10263"},"observation_digest":"sha256:ad856508c1e139ad9b9b8ea887aa04c6fcbbab6038ebe6315db7ea6eb18d0815","observation_id":"0c692d02-33ce-452c-b53d-ba76960fcef3","resolution":{"observed_at":"2026-07-14T23:46:32.301737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15073","last_updated":"2025-07-20T18:15:18Z","snapshot_observed_at":"2026-08-09T17:58:21.618872Z","submitted_at":"2025-07-20T18:15:18Z","title":"Reinforcement Learning for Flow-Matching Policies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.15073","snapshot_observed_at":"2026-08-04T05:51:28.959396Z","title":"Reinforcement learning for flow-matching policies,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.15257","last_updated":"2026-08-02T20:22:57Z","snapshot_observed_at":"2026-08-07T11:00:16.440130Z","submitted_at":"2026-03-16T13:24:58Z","title":"HapticVLA: Contact-Rich Manipulation via Vision-Language-Action Model without Inference-Time Tactile Sensing","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T05:51:28.959396Z"},"links":{"cited_paper":"/paper/2507.15073","citing_paper":"/paper/2603.15257"},"observation_digest":"sha256:3e69fd00cf5c01200e53efbb6d4d3e2e21c8be3448c7d03c1f4c1694ad262bbe","observation_id":"9761a3f3-fc2e-4afb-bc34-77176a4f413e","resolution":{"observed_at":"2026-08-04T05:51:28.959396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15073","last_updated":"2025-07-20T18:15:18Z","snapshot_observed_at":"2026-08-09T17:58:21.618872Z","submitted_at":"2025-07-20T18:15:18Z","title":"Reinforcement Learning for Flow-Matching Policies","version":1},"cited_work":{"arxiv_id":"2507.15073","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.15073","snapshot_observed_at":"2026-07-03T04:17:36.880164Z","title":"Reinforcement learning for flow- matching policies","venue":null,"work_id":"23f7dcd8-f328-4edc-a0cb-96493e341c79","year":2025},"citing_paper":{"arxiv_id":"2605.08879","last_updated":"2026-05-19T10:05:30Z","snapshot_observed_at":"2026-08-01T19:11:57.235558Z","submitted_at":"2026-05-09T10:59:03Z","title":"Preserving Foundational Capabilities in Flow-Matching VLAs through Conservative SFT","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-12T01:31:33.829939Z"},"links":{"cited_paper":"/paper/2507.15073","citing_paper":"/paper/2605.08879"},"observation_digest":"sha256:d921701f78bf0d46bb05e3ff6290677a247832fcecf83cb9488ec85ffd2460d6","observation_id":"4422a34a-b1f5-46b8-863f-d15820c07ad0","resolution":{"observed_at":"2026-05-12T07:56:27.226180Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15073","last_updated":"2025-07-20T18:15:18Z","snapshot_observed_at":"2026-08-09T17:58:21.618872Z","submitted_at":"2025-07-20T18:15:18Z","title":"Reinforcement Learning for Flow-Matching Policies","version":1},"cited_work":{"arxiv_id":"2507.15073","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.15073","snapshot_observed_at":"2026-07-03T04:17:36.880164Z","title":"Reinforcement learning for flow- matching policies","venue":null,"work_id":"23f7dcd8-f328-4edc-a0cb-96493e341c79","year":2025},"citing_paper":{"arxiv_id":"2605.08879","last_updated":"2026-05-19T10:05:30Z","snapshot_observed_at":"2026-08-01T19:11:57.235558Z","submitted_at":"2026-05-09T10:59:03Z","title":"Preserving Foundational Capabilities in Flow-Matching VLAs through Conservative SFT","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-20T23:08:30.205397Z"},"links":{"cited_paper":"/paper/2507.15073","citing_paper":"/paper/2605.08879"},"observation_digest":"sha256:9613a18769921b3fd7580aeef736e7a73ff4990ede06ddce2f795b15acec56cb","observation_id":"d6b7d634-4c3b-4b13-8d56-87f054558f5d","resolution":{"observed_at":"2026-05-20T23:09:12.156167Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15073","last_updated":"2025-07-20T18:15:18Z","snapshot_observed_at":"2026-08-09T17:58:21.618872Z","submitted_at":"2025-07-20T18:15:18Z","title":"Reinforcement Learning for Flow-Matching Policies","version":1},"cited_work":{"arxiv_id":"2507.15073","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.15073","snapshot_observed_at":"2026-07-03T04:17:36.880164Z","title":"Reinforcement learning for flow- matching policies","venue":null,"work_id":"23f7dcd8-f328-4edc-a0cb-96493e341c79","year":2025},"citing_paper":{"arxiv_id":"2605.17144","last_updated":"2026-05-16T20:28:21Z","snapshot_observed_at":"2026-08-01T21:39:10.155636Z","submitted_at":"2026-05-16T20:28:21Z","title":"Contrastive Conceptor Activation Steering (COAST): Unlocking Vision-Language-Action Models through Hidden States","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-05-20T14:30:20.697135Z"},"links":{"cited_paper":"/paper/2507.15073","citing_paper":"/paper/2605.17144"},"observation_digest":"sha256:cc4ebaf586c8975520d53950577b6a207d3c8962a13148d1b15b03d13592ccfc","observation_id":"63313854-9e4e-451b-9f58-7dda7d785a68","resolution":{"observed_at":"2026-05-20T14:33:21.515152Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15073","last_updated":"2025-07-20T18:15:18Z","snapshot_observed_at":"2026-08-09T17:58:21.618872Z","submitted_at":"2025-07-20T18:15:18Z","title":"Reinforcement Learning for Flow-Matching Policies","version":1},"cited_work":{"arxiv_id":"2507.15073","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.15073","snapshot_observed_at":"2026-07-03T04:17:36.880164Z","title":"Reinforcement learning for flow- matching policies","venue":null,"work_id":"23f7dcd8-f328-4edc-a0cb-96493e341c79","year":2025},"citing_paper":{"arxiv_id":"2606.08602","last_updated":"2026-06-07T12:28:51Z","snapshot_observed_at":"2026-07-06T23:48:07.065806Z","submitted_at":"2026-06-07T12:28:51Z","title":"Reinforcement Learning for Flow-Matching Policies with Density Transport","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-27T18:55:02.040180Z"},"links":{"cited_paper":"/paper/2507.15073","citing_paper":"/paper/2606.08602"},"observation_digest":"sha256:0d86830574137cdc5617863f7c44704982da81e11c10b1258e4ba1cf764ef20c","observation_id":"c33a8b6f-1a78-47fd-b24c-41837581b798","resolution":{"observed_at":"2026-07-02T22:27:25.847672Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15073","last_updated":"2025-07-20T18:15:18Z","snapshot_observed_at":"2026-08-09T17:58:21.618872Z","submitted_at":"2025-07-20T18:15:18Z","title":"Reinforcement Learning for Flow-Matching Policies","version":1},"cited_work":{"arxiv_id":"2507.15073","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.15073","snapshot_observed_at":"2026-07-03T04:17:36.880164Z","title":"Reinforcement learning for flow- matching policies","venue":null,"work_id":"23f7dcd8-f328-4edc-a0cb-96493e341c79","year":2025},"citing_paper":{"arxiv_id":"2606.11087","last_updated":"2026-06-09T16:45:57Z","snapshot_observed_at":"2026-08-02T20:45:09.177143Z","submitted_at":"2026-06-09T16:45:57Z","title":"Test-Time Gradient Guidance of Flow Policies in Reinforcement Learning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-27T14:05:01.073951Z"},"links":{"cited_paper":"/paper/2507.15073","citing_paper":"/paper/2606.11087"},"observation_digest":"sha256:4e5c11297d3185bc7eca686b5f3822481bf321c9d992599b0211b3141232d6e8","observation_id":"602dc178-c7b3-4ce7-9b56-03c9b4368b4f","resolution":{"observed_at":"2026-07-03T04:17:36.881701Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15073","last_updated":"2025-07-20T18:15:18Z","snapshot_observed_at":"2026-08-09T17:58:21.618872Z","submitted_at":"2025-07-20T18:15:18Z","title":"Reinforcement Learning for Flow-Matching Policies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.15073","snapshot_observed_at":"2026-08-01T15:26:40.805045Z","title":"arXiv:2507.15073","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26460","last_updated":"2026-07-29T04:22:46Z","snapshot_observed_at":"2026-08-08T02:49:42.406707Z","submitted_at":"2026-07-29T04:22:46Z","title":"RLMM-Flow: A Flow-based Mobile Manipulation Framework with Latent-Space Reinforcement Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T15:26:40.805045Z"},"links":{"cited_paper":"/paper/2507.15073","citing_paper":"/paper/2607.26460"},"observation_digest":"sha256:cd7d483be717153f57f1b9f5f9be93fcdcabd03407a664f7497917858f301dfc","observation_id":"d9c564af-c00c-4da3-b17d-5a062950cf59","resolution":{"observed_at":"2026-08-01T15:26:40.805045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.15073/citation-record","integrity":"/paper/2507.15073/integrity","json":"/paper/2507.15073/citation-record.json","paper":"/paper/2507.15073"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2305.13301","last_updated":"2024-01-04T19:11:25Z","snapshot_observed_at":"2026-08-09T16:20:23.732146Z","submitted_at":"2023-05-22T17:57:41Z","title":"Training Diffusion Models with Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13301","snapshot_observed_at":"2026-08-06T15:47:40.641859Z","title":"Training diffusion models with reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15073","last_updated":"2025-07-20T18:15:18Z","snapshot_observed_at":"2026-08-09T17:58:21.618872Z","submitted_at":"2025-07-20T18:15:18Z","title":"Reinforcement Learning for Flow-Matching Policies","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T15:47:40.641859Z"},"links":{"cited_paper":"/paper/2305.13301","citing_paper":"/paper/2507.15073"},"observation_digest":"sha256:4b0568e09bb69196a8ba20f4a76f5eb1eb68d928216a72ea4b7e8238df69ddda","observation_id":"7f832cbb-2e48-488e-b47e-e50bb117805e","resolution":{"observed_at":"2026-08-06T15:47:40.641859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-06T15:47:40.918955Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15073","last_updated":"2025-07-20T18:15:18Z","snapshot_observed_at":"2026-08-09T17:58:21.618872Z","submitted_at":"2025-07-20T18:15:18Z","title":"Reinforcement Learning for Flow-Matching Policies","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T15:47:40.918955Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2507.15073"},"observation_digest":"sha256:7f7229cc3eac86a02c568bfdb2efdfaf6e31fd11e97eb6a0e2e8c0265dbd09f4","observation_id":"efe58cf4-e773-4d57-a944-838414a31da3","resolution":{"observed_at":"2026-08-06T15:47:40.918955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.08861","last_updated":"2025-01-07T18:12:27Z","snapshot_observed_at":"2026-08-07T18:29:43.318422Z","submitted_at":"2024-09-13T14:22:14Z","title":"Adjoint Matching: Fine-tuning Flow and Diffusion Generative Models with Memoryless Stochastic Optimal Control","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.08861","snapshot_observed_at":"2026-08-06T15:47:41.260048Z","title":"Adjoint matching: Fine-tuning flow and diffusion generative models with memoryless stochastic optimal control","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15073","last_updated":"2025-07-20T18:15:18Z","snapshot_observed_at":"2026-08-09T17:58:21.618872Z","submitted_at":"2025-07-20T18:15:18Z","title":"Reinforcement Learning for Flow-Matching Policies","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T15:47:41.260048Z"},"links":{"cited_paper":"/paper/2409.08861","citing_paper":"/paper/2507.15073"},"observation_digest":"sha256:83e62190ebf543aeb8f120799608ecad05af54b05628464ddfb8a129d39cb78c","observation_id":"c84c4e0b-78e2-4fe5-a352-f92aaf9c9d54","resolution":{"observed_at":"2026-08-06T15:47:41.260048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06767","last_updated":"2023-12-01T14:28:06Z","snapshot_observed_at":"2026-08-07T04:02:54.504761Z","submitted_at":"2023-04-13T18:22:40Z","title":"RAFT: Reward rAnked FineTuning for Generative Foundation Model Alignment","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.06767","snapshot_observed_at":"2026-08-06T15:47:41.400153Z","title":"Raft: Reward ranked finetuning for generative foundation model alignment","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15073","last_updated":"2025-07-20T18:15:18Z","snapshot_observed_at":"2026-08-09T17:58:21.618872Z","submitted_at":"2025-07-20T18:15:18Z","title":"Reinforcement Learning for Flow-Matching Policies","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T15:47:41.400153Z"},"links":{"cited_paper":"/paper/2304.06767","citing_paper":"/paper/2507.15073"},"observation_digest":"sha256:ae1d920f31d7a7378cefe87eb81242c055ec3973671149a3e2bb05b71fb48d05","observation_id":"01624f29-4bef-4cc2-b6d5-324553a162f0","resolution":{"observed_at":"2026-08-06T15:47:41.400153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-08-08T22:04:13.117781Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-08-06T15:47:41.517438Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15073","last_updated":"2025-07-20T18:15:18Z","snapshot_observed_at":"2026-08-09T17:58:21.618872Z","submitted_at":"2025-07-20T18:15:18Z","title":"Reinforcement Learning for Flow-Matching Policies","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T15:47:41.517438Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2507.15073"},"observation_digest":"sha256:aa7a849afb9394759e4a63b823c2c452a98334be2629ca79a41acb38f9f2fc99","observation_id":"6c4e6d43-e587-4005-806b-3c8e424a3f01","resolution":{"observed_at":"2026-08-06T15:47:41.517438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-08-08T22:04:13.117781Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-08-06T15:47:41.632681Z","title":"Jiajun Fan, Shuaike Shen, Chaoran Cheng, Yuxin Chen, Chumeng Liang, and Ge Liu","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15073","last_updated":"2025-07-20T18:15:18Z","snapshot_observed_at":"2026-08-09T17:58:21.618872Z","submitted_at":"2025-07-20T18:15:18Z","title":"Reinforcement Learning for Flow-Matching Policies","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T15:47:41.632681Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2507.15073"},"observation_digest":"sha256:eb6085e13c3c7ca3b5bb9e47aa8da3fdb6f2557942680a8e1bdaced48eee81ad","observation_id":"9f0cfd26-cbb5-444f-8159-a30454f40814","resolution":{"observed_at":"2026-08-06T15:47:41.632681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12579","last_updated":"2025-06-07T04:16:28Z","snapshot_observed_at":"2026-08-07T18:10:05.360065Z","submitted_at":"2025-02-18T06:31:08Z","title":"CHATS: Combining Human-Aligned Optimization and Test-Time Sampling for Text-to-Image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12579","snapshot_observed_at":"2026-08-06T15:47:41.749121Z","title":"Chats: Combining human-aligned optimization and test-time sampling for text-to-image generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15073","last_updated":"2025-07-20T18:15:18Z","snapshot_observed_at":"2026-08-09T17:58:21.618872Z","submitted_at":"2025-07-20T18:15:18Z","title":"Reinforcement Learning for Flow-Matching Policies","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T15:47:41.749121Z"},"links":{"cited_paper":"/paper/2502.12579","citing_paper":"/paper/2507.15073"},"observation_digest":"sha256:d98102b996ec5fc3d4d449c35b250f76e72e9b3d5f90fef52ccf87bc19fd8c6a","observation_id":"acbc030e-251d-44f7-9aeb-f18fdd388352","resolution":{"observed_at":"2026-08-06T15:47:41.749121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.09991","last_updated":"2022-12-21T01:06:18Z","snapshot_observed_at":"2026-08-06T05:32:02.292779Z","submitted_at":"2022-05-20T07:02:03Z","title":"Planning with Diffusion for Flexible Behavior Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.09991","snapshot_observed_at":"2026-08-06T15:47:41.901307Z","title":"Planning with diffusion for flexible behavior synthesis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15073","last_updated":"2025-07-20T18:15:18Z","snapshot_observed_at":"2026-08-09T17:58:21.618872Z","submitted_at":"2025-07-20T18:15:18Z","title":"Reinforcement Learning for Flow-Matching Policies","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T15:47:41.901307Z"},"links":{"cited_paper":"/paper/2205.09991","citing_paper":"/paper/2507.15073"},"observation_digest":"sha256:e4f31d8fa0bddd35888920750e3b9e686499e908967bb3b2ed612e98ac36447a","observation_id":"db182ae3-bb80-4e1a-9a23-eac3251d5bc3","resolution":{"observed_at":"2026-08-06T15:47:41.901307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-06T15:47:41.908301Z","title":"Openvla: An open-source vision-language-action model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15073","last_updated":"2025-07-20T18:15:18Z","snapshot_observed_at":"2026-08-09T17:58:21.618872Z","submitted_at":"2025-07-20T18:15:18Z","title":"Reinforcement Learning for Flow-Matching Policies","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T15:47:41.908301Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2507.15073"},"observation_digest":"sha256:f01b59c6a5932bc1e9b393d89f127715eb67b41b6ddd67b8d0b7b95edaade07e","observation_id":"eb367f21-c9e2-43ae-8730-ddcaf01d5f89","resolution":{"observed_at":"2026-08-06T15:47:41.908301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17418","last_updated":"2025-03-19T03:55:48Z","snapshot_observed_at":"2026-07-06T18:20:44.070255Z","submitted_at":"2024-05-27T17:58:48Z","title":"A Self-Correcting Vision-Language-Action Model for Fast and Slow System Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17418","snapshot_observed_at":"2026-08-06T15:47:41.911320Z","title":"A self-correcting vision-language- action model for fast and slow system manipulation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15073","last_updated":"2025-07-20T18:15:18Z","snapshot_observed_at":"2026-08-09T17:58:21.618872Z","submitted_at":"2025-07-20T18:15:18Z","title":"Reinforcement Learning for Flow-Matching Policies","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T15:47:41.911320Z"},"links":{"cited_paper":"/paper/2405.17418","citing_paper":"/paper/2507.15073"},"observation_digest":"sha256:f9a53c782d190ba0be1121803f5f763be07e58ed2817b5403f5faa8bef46b4f1","observation_id":"5c472cac-20d5-4e4e-a927-03706a803155","resolution":{"observed_at":"2026-08-06T15:47:41.911320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-06T15:47:41.914645Z","title":"Flow matching for generative modeling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15073","last_updated":"2025-07-20T18:15:18Z","snapshot_observed_at":"2026-08-09T17:58:21.618872Z","submitted_at":"2025-07-20T18:15:18Z","title":"Reinforcement Learning for Flow-Matching Policies","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T15:47:41.914645Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2507.15073"},"observation_digest":"sha256:92b351461e3bf6509fc9a620edc92d3ffcd8e641b1a38b1640819c14184acbfb","observation_id":"79b4e05b-730d-46b6-a826-5e32e755241e","resolution":{"observed_at":"2026-08-06T15:47:41.914645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06264","last_updated":"2024-12-09T07:22:38Z","snapshot_observed_at":"2026-08-02T09:54:14.339169Z","submitted_at":"2024-12-09T07:22:38Z","title":"Flow Matching Guide and Code","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06264","snapshot_observed_at":"2026-08-06T15:47:41.918358Z","title":"Jie Liu, Gongye Liu, Jiajun Liang, Ziyang Yuan, Xiaokun Liu, Mingwu Zheng, Xiele Wu, Qiulin Wang, Wenyu Qin, Menghan Xia, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15073","last_updated":"2025-07-20T18:15:18Z","snapshot_observed_at":"2026-08-09T17:58:21.618872Z","submitted_at":"2025-07-20T18:15:18Z","title":"Reinforcement Learning for Flow-Matching Policies","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T15:47:41.918358Z"},"links":{"cited_paper":"/paper/2412.06264","citing_paper":"/paper/2507.15073"},"observation_digest":"sha256:3a512b39f32be496ea002d066ed8bf3e8081b9bc13de126e32efa36bf7bda354","observation_id":"1c40ee75-4e41-4c6f-9e8c-ad3e2558d1ec","resolution":{"observed_at":"2026-08-06T15:47:41.918358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05153","last_updated":"2025-05-05T16:26:30Z","snapshot_observed_at":"2026-08-07T17:22:58.699191Z","submitted_at":"2025-03-07T05:22:52Z","title":"Generative Trajectory Stitching through Diffusion Composition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.05153","snapshot_observed_at":"2026-08-06T15:47:41.921914Z","title":"Generative trajectory stitching through diffusion composition","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15073","last_updated":"2025-07-20T18:15:18Z","snapshot_observed_at":"2026-08-09T17:58:21.618872Z","submitted_at":"2025-07-20T18:15:18Z","title":"Reinforcement Learning for Flow-Matching Policies","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T15:47:41.921914Z"},"links":{"cited_paper":"/paper/2503.05153","citing_paper":"/paper/2507.15073"},"observation_digest":"sha256:37a9d7951371433f16f2dceeb040e5435cc1621e4c3462f2ce272505ee05bd72","observation_id":"17a60899-bc3c-4287-b812-d2c81ae6ff18","resolution":{"observed_at":"2026-08-06T15:47:41.921914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:47:41.925766Z","title":"Grounding multimodal llms to embodied agents that ask for help with reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15073","last_updated":"2025-07-20T18:15:18Z","snapshot_observed_at":"2026-08-09T17:58:21.618872Z","submitted_at":"2025-07-20T18:15:18Z","title":"Reinforcement Learning for Flow-Matching Policies","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T15:47:41.925766Z"},"links":{"citing_paper":"/paper/2507.15073"},"observation_digest":"sha256:2a107b53291cdec0960d787db46df0aec6021050b8430526f34f70d36a596b6a","observation_id":"4054e499-7d5e-443d-8403-71c41592b2c5","resolution":{"observed_at":"2026-08-06T15:47:41.925766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00588","snapshot_observed_at":"2026-08-06T15:47:41.929342Z","title":"Diffusion policy policy optimization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15073","last_updated":"2025-07-20T18:15:18Z","snapshot_observed_at":"2026-08-09T17:58:21.618872Z","submitted_at":"2025-07-20T18:15:18Z","title":"Reinforcement Learning for Flow-Matching Policies","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T15:47:41.929342Z"},"links":{"cited_paper":"/paper/2409.00588","citing_paper":"/paper/2507.15073"},"observation_digest":"sha256:1bd92839b3192760ec7f9d32062c9c7d6af579b88effed85e08004dc94ca9c87","observation_id":"70218636-21da-4b21-bfea-bff1a54fb854","resolution":{"observed_at":"2026-08-06T15:47:41.929342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-06T15:47:41.932555Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15073","last_updated":"2025-07-20T18:15:18Z","snapshot_observed_at":"2026-08-09T17:58:21.618872Z","submitted_at":"2025-07-20T18:15:18Z","title":"Reinforcement Learning for Flow-Matching Policies","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T15:47:41.932555Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2507.15073"},"observation_digest":"sha256:f10a38c8543db0184bda6ddd43dc646a0bdc467c84e75d385cdf5fb623636ee8","observation_id":"c3340881-7e64-42c4-993f-d772d72dc46e","resolution":{"observed_at":"2026-08-06T15:47:41.932555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01844","last_updated":"2025-06-02T16:30:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-02T16:30:19Z","title":"SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.01844","snapshot_observed_at":"2026-08-06T15:47:41.939393Z","title":"Smolvla: A vision- language-action model for affordable and efficient robotics","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15073","last_updated":"2025-07-20T18:15:18Z","snapshot_observed_at":"2026-08-09T17:58:21.618872Z","submitted_at":"2025-07-20T18:15:18Z","title":"Reinforcement Learning for Flow-Matching Policies","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T15:47:41.939393Z"},"links":{"cited_paper":"/paper/2506.01844","citing_paper":"/paper/2507.15073"},"observation_digest":"sha256:939e138fc543432c51d64723c394274daf18bf4fe5ad263c8d3ba9ffcd7442fd","observation_id":"9fdc379b-bbd8-44a5-aba5-95705e5f7cdb","resolution":{"observed_at":"2026-08-06T15:47:41.939393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08448","last_updated":"2024-05-14T09:12:30Z","snapshot_observed_at":"2026-08-05T00:57:12.421643Z","submitted_at":"2024-05-14T09:12:30Z","title":"Understanding the performance gap between online and offline alignment algorithms","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08448","snapshot_observed_at":"2026-08-06T15:47:41.942955Z","title":"Understanding the perfor- mance gap between online and offline alignment algorithms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15073","last_updated":"2025-07-20T18:15:18Z","snapshot_observed_at":"2026-08-09T17:58:21.618872Z","submitted_at":"2025-07-20T18:15:18Z","title":"Reinforcement Learning for Flow-Matching Policies","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T15:47:41.942955Z"},"links":{"cited_paper":"/paper/2405.08448","citing_paper":"/paper/2507.15073"},"observation_digest":"sha256:086100cc28b3894312488ad762c53b19b0996221dbe04492d47dd0aa41585716","observation_id":"4c22ff31-ea36-4d63-ada6-f96c2174257a","resolution":{"observed_at":"2026-08-06T15:47:41.942955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07818","last_updated":"2025-08-28T17:19:45Z","snapshot_observed_at":"2026-07-31T14:51:03.625964Z","submitted_at":"2025-05-12T17:59:34Z","title":"DanceGRPO: Unleashing GRPO on Visual Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07818","snapshot_observed_at":"2026-08-06T15:47:41.947500Z","title":"Dancegrpo: Unleashing grpo on visual generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15073","last_updated":"2025-07-20T18:15:18Z","snapshot_observed_at":"2026-08-09T17:58:21.618872Z","submitted_at":"2025-07-20T18:15:18Z","title":"Reinforcement Learning for Flow-Matching Policies","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T15:47:41.947500Z"},"links":{"cited_paper":"/paper/2505.07818","citing_paper":"/paper/2507.15073"},"observation_digest":"sha256:8186d4fd028b53d1b611e4e4e9f0902944fdf8c2e7f8dd645a1dfb5204b93cd0","observation_id":"af23b2b7-c6d2-49f7-971e-1fa979cc42cb","resolution":{"observed_at":"2026-08-06T15:47:41.947500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:47:42.385019Z","title":"We start by collecting 30, 000 demonstration trajectories from πD","venue":null,"work_id":"cb29a416-a429-4dd3-83c3-134f0c0eb8fa","year":2024},"citing_paper":{"arxiv_id":"2507.15073","last_updated":"2025-07-20T18:15:18Z","snapshot_observed_at":"2026-08-09T17:58:21.618872Z","submitted_at":"2025-07-20T18:15:18Z","title":"Reinforcement Learning for Flow-Matching Policies","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T15:47:41.951925Z"},"links":{"citing_paper":"/paper/2507.15073"},"observation_digest":"sha256:d2759e7b5d214689a3a5e4c8285a83d450b4a7f2827314d8a64878f365ea87c4","observation_id":"a5e5b0ef-f4a5-45b9-9a80-0e5e981565f9","resolution":{"observed_at":"2026-08-06T15:47:42.388467Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:47:42.371664Z","title":"To generate samples, we use Euler integration with 4 steps","venue":null,"work_id":"7b8a47e4-cd69-4010-b61e-6d7412956fb2","year":2023},"citing_paper":{"arxiv_id":"2507.15073","last_updated":"2025-07-20T18:15:18Z","snapshot_observed_at":"2026-08-09T17:58:21.618872Z","submitted_at":"2025-07-20T18:15:18Z","title":"Reinforcement Learning for Flow-Matching Policies","version":1},"reference_index":128,"source":"pdf_text","source_observed_at":"2026-08-06T15:47:41.955782Z"},"links":{"citing_paper":"/paper/2507.15073"},"observation_digest":"sha256:3dfaba3043947cf0ecbec9da0d65a742109d5a017a5f33d03615e95848b879dc","observation_id":"b9d8e59c-968e-445c-a9d5-e857999a8adf","resolution":{"observed_at":"2026-08-06T15:47:42.377747Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-06T15:47:41.936108Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15073","last_updated":"2025-07-20T18:15:18Z","snapshot_observed_at":"2026-08-09T17:58:21.618872Z","submitted_at":"2025-07-20T18:15:18Z","title":"Reinforcement Learning for Flow-Matching Policies","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-06T15:47:41.936108Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2507.15073"},"observation_digest":"sha256:88957aef3e2ece9b5f99280d3550a37cc952f3e0cc9a0c0e035eb738d84e2723","observation_id":"dec882b2-9fe1-4f14-86ff-b35940099ed7","resolution":{"observed_at":"2026-08-06T15:47:41.936108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20313","last_updated":"2024-12-11T15:42:13Z","snapshot_observed_at":"2026-08-04T08:56:57.976209Z","submitted_at":"2024-05-30T17:53:50Z","title":"Sequence-Augmented SE(3)-Flow Matching For Conditional Protein Backbone Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20313","snapshot_observed_at":"2026-08-06T15:47:41.896245Z","title":"Sequence-augmented se (3)-flow matching for conditional protein backbone generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15073","last_updated":"2025-07-20T18:15:18Z","snapshot_observed_at":"2026-08-09T17:58:21.618872Z","submitted_at":"2025-07-20T18:15:18Z","title":"Reinforcement Learning for Flow-Matching Policies","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-06T15:47:41.896245Z"},"links":{"cited_paper":"/paper/2405.20313","citing_paper":"/paper/2507.15073"},"observation_digest":"sha256:8482ac3ac61045e94d26d48bf7661dda1001686aafab7bbbfc9ba0b5b08edfed","observation_id":"26c3e4af-5f70-4080-ad3c-c67e36c79162","resolution":{"observed_at":"2026-08-06T15:47:41.896245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05833","last_updated":"2025-08-04T16:25:44Z","snapshot_observed_at":"2026-08-09T00:33:48.446154Z","submitted_at":"2025-03-06T12:52:11Z","title":"Refined Policy Distillation: From VLA Generalists to RL Experts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.05833","snapshot_observed_at":"2026-08-06T15:47:41.904894Z","title":"Refined policy distillation: From vla generalists to rl experts","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15073","last_updated":"2025-07-20T18:15:18Z","snapshot_observed_at":"2026-08-09T17:58:21.618872Z","submitted_at":"2025-07-20T18:15:18Z","title":"Reinforcement Learning for Flow-Matching Policies","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T15:47:41.904894Z"},"links":{"cited_paper":"/paper/2503.05833","citing_paper":"/paper/2507.15073"},"observation_digest":"sha256:382cb331f41f7e7478f18af905aef422d31692f2d7848690b33613a29547648a","observation_id":"abb0bb71-57f2-43ce-9940-7aa8cc843015","resolution":{"observed_at":"2026-08-06T15:47:41.904894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02644","last_updated":"2024-01-05T05:28:40Z","snapshot_observed_at":"2026-08-04T15:37:47.750655Z","submitted_at":"2024-01-05T05:28:40Z","title":"Simple Hierarchical Planning with Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02644","snapshot_observed_at":"2026-08-06T15:47:41.128597Z","title":"Diffusion forcing: Next-token prediction meets full-sequence diffusion","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15073","last_updated":"2025-07-20T18:15:18Z","snapshot_observed_at":"2026-08-09T17:58:21.618872Z","submitted_at":"2025-07-20T18:15:18Z","title":"Reinforcement Learning for Flow-Matching Policies","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T15:47:41.128597Z"},"links":{"cited_paper":"/paper/2401.02644","citing_paper":"/paper/2507.15073"},"observation_digest":"sha256:afeb7ca373ec35fcd10dfac91d47361ccb1c75ac70848283e87e9bd592f08632","observation_id":"d2fc7afe-b7ad-4a44-b7ec-7a1ceb508c48","resolution":{"observed_at":"2026-08-06T15:47:41.128597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-06T15:47:40.788104Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15073","last_updated":"2025-07-20T18:15:18Z","snapshot_observed_at":"2026-08-09T17:58:21.618872Z","submitted_at":"2025-07-20T18:15:18Z","title":"Reinforcement Learning for Flow-Matching Policies","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T15:47:40.788104Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2507.15073"},"observation_digest":"sha256:040e0379e9bf1183f9f65c163b8d11d7b00bcd18c824d482a4cbc86996eb928b","observation_id":"c0d62655-327a-46d1-aaca-c7d260a4f923","resolution":{"observed_at":"2026-08-06T15:47:40.788104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T15:47:41.831875Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15073","last_updated":"2025-07-20T18:15:18Z","snapshot_observed_at":"2026-08-09T17:58:21.618872Z","submitted_at":"2025-07-20T18:15:18Z","title":"Reinforcement Learning for Flow-Matching Policies","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T15:47:41.831875Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2507.15073"},"observation_digest":"sha256:d5d4c2530e749d0ee73ef3417edddfdeae803424a7c3251d10e927ee7017c259","observation_id":"ee54109a-fd62-43ca-b7d4-536076fd702d","resolution":{"observed_at":"2026-08-06T15:47:41.831875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.15073","last_updated":"2025-07-20T18:15:18Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T17:58:21.618872Z","submitted_at":"2025-07-20T18:15:18Z","title":"Reinforcement Learning for Flow-Matching Policies"},"reference_resolution":{"displayed":27,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":25,"verified_exact":0,"verified_fuzzy":2},"total_outbound_references":27},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 27 of 27 outbound references and 9 inbound Pith citation observations for arXiv:2507.15073."}