{"as_of":"2026-08-09T17:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:01d7b7e0065aa0be54b54c025828ba677e724d86c3f29e559d32bc71a7648f9b","coverage":[{"denominator":20,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":20,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T01:15:51.066275Z","state":"measured"},{"denominator":20,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":20,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.14739/citation-record","integrity":"/paper/2607.14739/integrity","json":"/paper/2607.14739/citation-record.json","paper":"/paper/2607.14739"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:15:50.391508Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14739","last_updated":"2026-07-16T09:04:50Z","snapshot_observed_at":"2026-08-09T04:05:39.379106Z","submitted_at":"2026-07-16T09:04:50Z","title":"FoMoVLA: Bridging Visual Foresight and Motion Guidance for Vision-Language-Action Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T01:15:50.391508Z"},"links":{"citing_paper":"/paper/2607.14739"},"observation_digest":"sha256:af3f08a45952483c94d6b5d13d3f7fe8b8b447c94e0b2bcb47ec75b0cbf77e3d","observation_id":"132e003a-25e7-4069-b575-e94390c2bef3","resolution":{"observed_at":"2026-08-02T01:15:50.391508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.13626","last_updated":"2025-12-26T12:19:56Z","snapshot_observed_at":"2026-07-06T22:32:42.381894Z","submitted_at":"2025-10-15T14:51:36Z","title":"LIBERO-Plus: In-depth Robustness Analysis of Vision-Language-Action Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.13626","snapshot_observed_at":"2026-08-02T01:15:50.666023Z","title":"arXiv:2510.13626","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14739","last_updated":"2026-07-16T09:04:50Z","snapshot_observed_at":"2026-08-09T04:05:39.379106Z","submitted_at":"2026-07-16T09:04:50Z","title":"FoMoVLA: Bridging Visual Foresight and Motion Guidance for Vision-Language-Action Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T01:15:50.666023Z"},"links":{"cited_paper":"/paper/2510.13626","citing_paper":"/paper/2607.14739"},"observation_digest":"sha256:5582fd2d3ee26679efdb56dd7bee7ab9d45d5cdac1ab107e71a17e5b816e22ff","observation_id":"5a498e8a-2f24-4fe6-bea1-ef450fa1ff8d","resolution":{"observed_at":"2026-08-02T01:15:50.666023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.23856","last_updated":"2026-05-22T17:08:37Z","snapshot_observed_at":"2026-07-06T23:33:59.210165Z","submitted_at":"2026-05-22T17:08:37Z","title":"Point Tracking Improves World Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.23856","snapshot_observed_at":"2026-08-02T01:15:50.737286Z","title":"arXiv:2605.23856","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14739","last_updated":"2026-07-16T09:04:50Z","snapshot_observed_at":"2026-08-09T04:05:39.379106Z","submitted_at":"2026-07-16T09:04:50Z","title":"FoMoVLA: Bridging Visual Foresight and Motion Guidance for Vision-Language-Action Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T01:15:50.737286Z"},"links":{"cited_paper":"/paper/2605.23856","citing_paper":"/paper/2607.14739"},"observation_digest":"sha256:ae216901965d728fb74af76c8224b807af286a76883117df67d4369ac94e1f13","observation_id":"616e8db5-5661-41ba-a695-54049e221387","resolution":{"observed_at":"2026-08-02T01:15:50.737286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:15:50.806929Z","title":"arXiv:2602.09849","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14739","last_updated":"2026-07-16T09:04:50Z","snapshot_observed_at":"2026-08-09T04:05:39.379106Z","submitted_at":"2026-07-16T09:04:50Z","title":"FoMoVLA: Bridging Visual Foresight and Motion Guidance for Vision-Language-Action Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T01:15:50.806929Z"},"links":{"citing_paper":"/paper/2607.14739"},"observation_digest":"sha256:52a836c6335b38453108e79174ef78a2934a0b3997cb6909ed65929f71bd7f4d","observation_id":"5cdf3b85-eb4a-44af-b3c6-91a7ee53a099","resolution":{"observed_at":"2026-08-02T01:15:50.806929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.16163","last_updated":"2026-01-22T18:09:30Z","snapshot_observed_at":"2026-08-06T02:05:52.408905Z","submitted_at":"2026-01-22T18:09:30Z","title":"Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control and Planning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.16163","snapshot_observed_at":"2026-08-02T01:15:50.909928Z","title":"arXiv:2601.16163","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14739","last_updated":"2026-07-16T09:04:50Z","snapshot_observed_at":"2026-08-09T04:05:39.379106Z","submitted_at":"2026-07-16T09:04:50Z","title":"FoMoVLA: Bridging Visual Foresight and Motion Guidance for Vision-Language-Action Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T01:15:50.909928Z"},"links":{"cited_paper":"/paper/2601.16163","citing_paper":"/paper/2607.14739"},"observation_digest":"sha256:20fbb3563d3c067f3e16800c0f29a1bb144f571ed6b8888f39d1ae6e197d75e0","observation_id":"76d049eb-b639-4378-89e3-6acf16dbbe5e","resolution":{"observed_at":"2026-08-02T01:15:50.909928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.21998","last_updated":"2026-03-22T15:37:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-29T17:07:43Z","title":"Causal World Modeling for Robot Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.21998","snapshot_observed_at":"2026-08-02T01:15:50.992652Z","title":"InConference on Robot Learning (CoRL), volume 270, 2679–2713","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14739","last_updated":"2026-07-16T09:04:50Z","snapshot_observed_at":"2026-08-09T04:05:39.379106Z","submitted_at":"2026-07-16T09:04:50Z","title":"FoMoVLA: Bridging Visual Foresight and Motion Guidance for Vision-Language-Action Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T01:15:50.992652Z"},"links":{"cited_paper":"/paper/2601.21998","citing_paper":"/paper/2607.14739"},"observation_digest":"sha256:079aeeecb9a853df5efc503d1df9e2e2f6993e0cd3d28809519594ccd95f07f4","observation_id":"537e55ff-7ed2-4d86-93a6-e21c567a26e2","resolution":{"observed_at":"2026-08-02T01:15:50.992652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19650","last_updated":"2024-11-29T12:06:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-29T12:06:03Z","title":"CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19650","snapshot_observed_at":"2026-08-02T01:15:51.034343Z","title":"arXiv:2411.19650","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14739","last_updated":"2026-07-16T09:04:50Z","snapshot_observed_at":"2026-08-09T04:05:39.379106Z","submitted_at":"2026-07-16T09:04:50Z","title":"FoMoVLA: Bridging Visual Foresight and Motion Guidance for Vision-Language-Action Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T01:15:51.034343Z"},"links":{"cited_paper":"/paper/2411.19650","citing_paper":"/paper/2607.14739"},"observation_digest":"sha256:fb2cf08a694b79d5b02b4a2ad89fec319c5cbeb213e9885fe47a3b63cba06b66","observation_id":"0d6220d7-d705-40b7-bcd1-c9ee34888c7f","resolution":{"observed_at":"2026-08-02T01:15:51.034343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.09928","last_updated":"2026-04-09T17:02:58Z","snapshot_observed_at":"2026-07-06T22:38:40.044448Z","submitted_at":"2025-12-10T18:59:32Z","title":"HiF-VLA: Hindsight, Insight and Foresight through Motion Representation for Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.09928","snapshot_observed_at":"2026-08-02T01:15:51.037508Z","title":"arXiv:2512.09928","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14739","last_updated":"2026-07-16T09:04:50Z","snapshot_observed_at":"2026-08-09T04:05:39.379106Z","submitted_at":"2026-07-16T09:04:50Z","title":"FoMoVLA: Bridging Visual Foresight and Motion Guidance for Vision-Language-Action Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T01:15:51.037508Z"},"links":{"cited_paper":"/paper/2512.09928","citing_paper":"/paper/2607.14739"},"observation_digest":"sha256:f29c57e204515df06c674d510608424a4102a4face634468206902ac73e00c5c","observation_id":"50d238a3-05e0-4284-b603-5ca86d95bed1","resolution":{"observed_at":"2026-08-02T01:15:51.037508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:15:51.040696Z","title":"arXiv:2511.19859","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14739","last_updated":"2026-07-16T09:04:50Z","snapshot_observed_at":"2026-08-09T04:05:39.379106Z","submitted_at":"2026-07-16T09:04:50Z","title":"FoMoVLA: Bridging Visual Foresight and Motion Guidance for Vision-Language-Action Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T01:15:51.040696Z"},"links":{"citing_paper":"/paper/2607.14739"},"observation_digest":"sha256:2cc6c11f90784d7a47d6ab65e1bfa34d5e55be3bb8b6c70987240239188718f0","observation_id":"abc843e6-083d-4b10-b2d2-5bbecf27ef98","resolution":{"observed_at":"2026-08-02T01:15:51.040696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.15483","last_updated":"2026-04-24T23:18:28Z","snapshot_observed_at":"2026-08-05T18:18:04.172934Z","submitted_at":"2026-04-16T19:18:07Z","title":"${\\pi}_{0.7}$: a Steerable Generalist Robotic Foundation Model with Emergent Capabilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.15483","snapshot_observed_at":"2026-08-02T01:15:51.043766Z","title":"InRobotics: Science and Systems (RSS)","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14739","last_updated":"2026-07-16T09:04:50Z","snapshot_observed_at":"2026-08-09T04:05:39.379106Z","submitted_at":"2026-07-16T09:04:50Z","title":"FoMoVLA: Bridging Visual Foresight and Motion Guidance for Vision-Language-Action Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T01:15:51.043766Z"},"links":{"cited_paper":"/paper/2604.15483","citing_paper":"/paper/2607.14739"},"observation_digest":"sha256:c3e9c4026621162fbae452830f614fe304ee1545db0efc85e812ea008731af88","observation_id":"9e49428c-fea9-4777-b44d-2bf49e7839a9","resolution":{"observed_at":"2026-08-02T01:15:51.043766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:15:51.047215Z","title":"arXiv:2602.22010","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14739","last_updated":"2026-07-16T09:04:50Z","snapshot_observed_at":"2026-08-09T04:05:39.379106Z","submitted_at":"2026-07-16T09:04:50Z","title":"FoMoVLA: Bridging Visual Foresight and Motion Guidance for Vision-Language-Action Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T01:15:51.047215Z"},"links":{"citing_paper":"/paper/2607.14739"},"observation_digest":"sha256:5c3eff16140cf2e46b31869e2af3db8d629bd99dafd2f16202a456da47d9cb23","observation_id":"b22597d3-32b6-4406-a776-296dcc84a852","resolution":{"observed_at":"2026-08-02T01:15:51.047215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:15:51.051011Z","title":"arXiv:2602.10098","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14739","last_updated":"2026-07-16T09:04:50Z","snapshot_observed_at":"2026-08-09T04:05:39.379106Z","submitted_at":"2026-07-16T09:04:50Z","title":"FoMoVLA: Bridging Visual Foresight and Motion Guidance for Vision-Language-Action Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T01:15:51.051011Z"},"links":{"citing_paper":"/paper/2607.14739"},"observation_digest":"sha256:c82c81769b0ac3604b394fbc01a6455db05b73746a9252ec1be81a2e1f754050","observation_id":"d3e75dcf-7d87-4411-b6ff-09419e0934f9","resolution":{"observed_at":"2026-08-02T01:15:51.051011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.11236","last_updated":"2026-04-14T10:01:08Z","snapshot_observed_at":"2026-07-06T22:45:29.609382Z","submitted_at":"2026-02-11T16:47:01Z","title":"ABot-M0: VLA Foundation Model for Robotic Manipulation with Action Manifold Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.11236","snapshot_observed_at":"2026-08-02T01:15:51.055527Z","title":"arXiv:2602.11236","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14739","last_updated":"2026-07-16T09:04:50Z","snapshot_observed_at":"2026-08-09T04:05:39.379106Z","submitted_at":"2026-07-16T09:04:50Z","title":"FoMoVLA: Bridging Visual Foresight and Motion Guidance for Vision-Language-Action Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T01:15:51.055527Z"},"links":{"cited_paper":"/paper/2602.11236","citing_paper":"/paper/2607.14739"},"observation_digest":"sha256:1d19d9cfa541740058b47e8444889b436f1f5b78ef3cd6f81d76667a5f5ee23a","observation_id":"bbd8565c-1912-4596-b50c-34c12e46b91a","resolution":{"observed_at":"2026-08-02T01:15:51.055527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.05014","last_updated":"2026-04-06T17:59:21Z","snapshot_observed_at":"2026-07-06T22:53:51.418227Z","submitted_at":"2026-04-06T17:59:21Z","title":"StarVLA: A Lego-like Codebase for Vision-Language-Action Model Developing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.05014","snapshot_observed_at":"2026-08-02T01:15:51.059693Z","title":"arXiv:2604.05014","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14739","last_updated":"2026-07-16T09:04:50Z","snapshot_observed_at":"2026-08-09T04:05:39.379106Z","submitted_at":"2026-07-16T09:04:50Z","title":"FoMoVLA: Bridging Visual Foresight and Motion Guidance for Vision-Language-Action Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T01:15:51.059693Z"},"links":{"cited_paper":"/paper/2604.05014","citing_paper":"/paper/2607.14739"},"observation_digest":"sha256:c44ef25004a90e2d68cfe313b4a79f517757b50cfc2a49df3460433a2e6e45fe","observation_id":"8f7472ba-a6b0-4525-81a8-148cd714ab7d","resolution":{"observed_at":"2026-08-02T01:15:51.059693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.04447","last_updated":"2025-08-26T08:23:50Z","snapshot_observed_at":"2026-08-05T16:56:52.400110Z","submitted_at":"2025-07-06T16:14:29Z","title":"DreamVLA: A Vision-Language-Action Model Dreamed with Comprehensive World Knowledge","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.04447","snapshot_observed_at":"2026-08-02T01:15:51.062743Z","title":"arXiv:2507.04447","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14739","last_updated":"2026-07-16T09:04:50Z","snapshot_observed_at":"2026-08-09T04:05:39.379106Z","submitted_at":"2026-07-16T09:04:50Z","title":"FoMoVLA: Bridging Visual Foresight and Motion Guidance for Vision-Language-Action Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T01:15:51.062743Z"},"links":{"cited_paper":"/paper/2507.04447","citing_paper":"/paper/2607.14739"},"observation_digest":"sha256:12abb9be1c5ccede10d08ad919926690ccce941a64136b7639e3b7b5502cc6ae","observation_id":"99a72d23-3379-48fb-bdb2-4f58a3fe219c","resolution":{"observed_at":"2026-08-02T01:15:51.062743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:15:51.066275Z","title":"arXiv:2508.18269","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14739","last_updated":"2026-07-16T09:04:50Z","snapshot_observed_at":"2026-08-09T04:05:39.379106Z","submitted_at":"2026-07-16T09:04:50Z","title":"FoMoVLA: Bridging Visual Foresight and Motion Guidance for Vision-Language-Action Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T01:15:51.066275Z"},"links":{"citing_paper":"/paper/2607.14739"},"observation_digest":"sha256:d900cea424c8cca113f6dea9296bf1f27c8077305a8f5c2f31c0d86f2a717933","observation_id":"e153b636-b722-4c4a-82b6-3398db214c54","resolution":{"observed_at":"2026-08-02T01:15:51.066275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:15:50.595450Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14739","last_updated":"2026-07-16T09:04:50Z","snapshot_observed_at":"2026-08-09T04:05:39.379106Z","submitted_at":"2026-07-16T09:04:50Z","title":"FoMoVLA: Bridging Visual Foresight and Motion Guidance for Vision-Language-Action Models","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-02T01:15:50.595450Z"},"links":{"citing_paper":"/paper/2607.14739"},"observation_digest":"sha256:949987a1dc4590098ab8e4e2babf29da0ee5d9f277e4ce0979e6026d9471f2ce","observation_id":"1384c583-f5c3-4d73-9227-21fc6fb3e954","resolution":{"observed_at":"2026-08-02T01:15:50.595450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.07635","last_updated":"2024-10-01T13:15:53Z","snapshot_observed_at":"2026-08-05T15:59:10.206778Z","submitted_at":"2023-07-14T21:13:04Z","title":"CoTracker: It is Better to Track Together","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.07635","snapshot_observed_at":"2026-08-02T01:15:50.868951Z","title":"arXiv:2307.07635","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14739","last_updated":"2026-07-16T09:04:50Z","snapshot_observed_at":"2026-08-09T04:05:39.379106Z","submitted_at":"2026-07-16T09:04:50Z","title":"FoMoVLA: Bridging Visual Foresight and Motion Guidance for Vision-Language-Action Models","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-02T01:15:50.868951Z"},"links":{"cited_paper":"/paper/2307.07635","citing_paper":"/paper/2607.14739"},"observation_digest":"sha256:05f094a927bfb4537bbf894891adabcc301bb63d9f80733a51ef1d5915bebd4a","observation_id":"0d5a7a9e-bb7e-4f93-93be-d4fe7e35c839","resolution":{"observed_at":"2026-08-02T01:15:50.868951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14734","last_updated":"2025-03-27T02:52:43Z","snapshot_observed_at":"2026-08-02T04:15:31.100670Z","submitted_at":"2025-03-18T21:06:21Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14734","snapshot_observed_at":"2026-08-02T01:15:50.469381Z","title":"arXiv:2503.14734","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14739","last_updated":"2026-07-16T09:04:50Z","snapshot_observed_at":"2026-08-09T04:05:39.379106Z","submitted_at":"2026-07-16T09:04:50Z","title":"FoMoVLA: Bridging Visual Foresight and Motion Guidance for Vision-Language-Action Models","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-02T01:15:50.469381Z"},"links":{"cited_paper":"/paper/2503.14734","citing_paper":"/paper/2607.14739"},"observation_digest":"sha256:fd5262da6302ee71c7844644dc73368f5951e47bea044fa453a23275ab261f75","observation_id":"08e1ce28-db67-4252-8660-5d0b55c5f279","resolution":{"observed_at":"2026-08-02T01:15:50.469381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:15:50.533339Z","title":"arXiv:2601.02456","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14739","last_updated":"2026-07-16T09:04:50Z","snapshot_observed_at":"2026-08-09T04:05:39.379106Z","submitted_at":"2026-07-16T09:04:50Z","title":"FoMoVLA: Bridging Visual Foresight and Motion Guidance for Vision-Language-Action Models","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-02T01:15:50.533339Z"},"links":{"citing_paper":"/paper/2607.14739"},"observation_digest":"sha256:9bfbe2863179b163e8eac1f4e70d70b156b121b5888e42fcac80755578075273","observation_id":"da1d927b-27dd-4fa1-b366-d0c334512116","resolution":{"observed_at":"2026-08-02T01:15:50.533339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.14739","last_updated":"2026-07-16T09:04:50Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T04:05:39.379106Z","submitted_at":"2026-07-16T09:04:50Z","title":"FoMoVLA: Bridging Visual Foresight and Motion Guidance for Vision-Language-Action Models"},"reference_resolution":{"displayed":20,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":20,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":20},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 20 of 20 outbound references and 0 inbound Pith citation observations for arXiv:2607.14739."}