{"as_of":"2026-08-10T04:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:505fd3e7e8f7f695cbcbbd957d8b7f6dd5a6130f8fbdb12136c2314e74fb0164","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":26,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":26,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":26,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":26,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:51:28.458480Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T13:09:50.161878Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2407.05996","last_updated":"2024-07-08T14:46:44Z","snapshot_observed_at":"2026-07-06T18:43:05.700263Z","submitted_at":"2024-07-08T14:46:44Z","title":"Multimodal Diffusion Transformer: Learning Versatile Behavior from Multimodal Goals","version":1},"cited_work":{"arxiv_id":"2407.05996","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.05996","snapshot_observed_at":"2026-07-04T13:09:50.161878Z","title":"Multimodal diffusion transformer: Learning versatile behavior from multimodal goals","venue":null,"work_id":"988b5d0d-a604-46c5-8d86-72a48f501f25","year":2024},"citing_paper":{"arxiv_id":"2405.14093","last_updated":"2026-05-01T01:50:44Z","snapshot_observed_at":"2026-08-04T06:47:25.827167Z","submitted_at":"2024-05-23T01:43:54Z","title":"A Survey on Vision-Language-Action Models for Embodied AI","version":8},"reference_index":114,"source":"pdf_text","source_observed_at":"2026-05-24T01:25:10.150459Z"},"links":{"cited_paper":"/paper/2407.05996","citing_paper":"/paper/2405.14093"},"observation_digest":"sha256:38d36180fb23587da39f228f17a37fc392e2706b9b9f25769ff112c18acf4a2b","observation_id":"8d349d7c-ca9e-4355-a268-b399094cd15d","resolution":{"observed_at":"2026-05-24T01:25:54.447400Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05996","last_updated":"2024-07-08T14:46:44Z","snapshot_observed_at":"2026-07-06T18:43:05.700263Z","submitted_at":"2024-07-08T14:46:44Z","title":"Multimodal Diffusion Transformer: Learning Versatile Behavior from Multimodal Goals","version":1},"cited_work":{"arxiv_id":"2407.05996","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.05996","snapshot_observed_at":"2026-07-04T13:09:50.161878Z","title":"Multimodal diffusion transformer: Learning versatile behavior from multimodal goals","venue":null,"work_id":"988b5d0d-a604-46c5-8d86-72a48f501f25","year":2024},"citing_paper":{"arxiv_id":"2412.14803","last_updated":"2025-05-04T04:28:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T12:48:40Z","title":"Video Prediction Policy: A Generalist Robot Policy with Predictive Visual Representations","version":2},"reference_index":121,"source":"arxiv_source","source_observed_at":"2026-05-12T18:38:11.110166Z"},"links":{"cited_paper":"/paper/2407.05996","citing_paper":"/paper/2412.14803"},"observation_digest":"sha256:951b5a533ae2ebe2e1ece39b450e54a9c6d3c89f94d36436c00f7a1310cbdf93","observation_id":"2ad859e1-dc7e-4e85-928d-49d597bcbacf","resolution":{"observed_at":"2026-05-12T18:38:11.308512Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05996","last_updated":"2024-07-08T14:46:44Z","snapshot_observed_at":"2026-07-06T18:43:05.700263Z","submitted_at":"2024-07-08T14:46:44Z","title":"Multimodal Diffusion Transformer: Learning Versatile Behavior from Multimodal Goals","version":1},"cited_work":{"arxiv_id":"2407.05996","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.05996","snapshot_observed_at":"2026-07-04T13:09:50.161878Z","title":"Multimodal diffusion transformer: Learning versatile behavior from multimodal goals","venue":null,"work_id":"988b5d0d-a604-46c5-8d86-72a48f501f25","year":2024},"citing_paper":{"arxiv_id":"2502.19645","last_updated":"2025-04-28T07:49:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-27T00:30:29Z","title":"Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-11T04:35:31.914360Z"},"links":{"cited_paper":"/paper/2407.05996","citing_paper":"/paper/2502.19645"},"observation_digest":"sha256:aba8ed3d21eb87af19d831d1e1acb9a571f25f1ac3d802147bff431f5cc2439d","observation_id":"f8e1ec0b-6798-440c-a082-68b7a88a3788","resolution":{"observed_at":"2026-05-11T04:35:32.782607Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05996","last_updated":"2024-07-08T14:46:44Z","snapshot_observed_at":"2026-07-06T18:43:05.700263Z","submitted_at":"2024-07-08T14:46:44Z","title":"Multimodal Diffusion Transformer: Learning Versatile Behavior from Multimodal Goals","version":1},"cited_work":{"arxiv_id":"2407.05996","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.05996","snapshot_observed_at":"2026-07-04T13:09:50.161878Z","title":"Multimodal diffusion transformer: Learning versatile behavior from multimodal goals","venue":null,"work_id":"988b5d0d-a604-46c5-8d86-72a48f501f25","year":2024},"citing_paper":{"arxiv_id":"2505.17016","last_updated":"2025-05-22T17:59:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:59:45Z","title":"Interactive Post-Training for Vision-Language-Action Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-21T14:25:47.178714Z"},"links":{"cited_paper":"/paper/2407.05996","citing_paper":"/paper/2505.17016"},"observation_digest":"sha256:83640f2264ab6dac886f075def510e18627066e54c13ad9fb9341aa0ad24596d","observation_id":"d5626ecc-b478-4453-9d54-eb8a36d32af6","resolution":{"observed_at":"2026-05-21T14:25:47.258877Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05996","last_updated":"2024-07-08T14:46:44Z","snapshot_observed_at":"2026-07-06T18:43:05.700263Z","submitted_at":"2024-07-08T14:46:44Z","title":"Multimodal Diffusion Transformer: Learning Versatile Behavior from Multimodal Goals","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05996","snapshot_observed_at":"2026-08-07T13:51:28.458480Z","title":"Reuss, ¨O","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20795","last_updated":"2026-05-29T12:22:36Z","snapshot_observed_at":"2026-08-08T23:33:37.619713Z","submitted_at":"2025-05-27T06:56:14Z","title":"Learning Generalizable Robot Policy with Human Demonstration Video as a Prompt","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:28.458480Z"},"links":{"cited_paper":"/paper/2407.05996","citing_paper":"/paper/2505.20795"},"observation_digest":"sha256:55dc5137e131186598a55bcbbe2f105ebafdc4023bcef90bdb8786d41b59b84d","observation_id":"20674eb8-9ca8-460f-8c2a-7d9c7a584ea1","resolution":{"observed_at":"2026-08-07T13:51:28.458480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05996","last_updated":"2024-07-08T14:46:44Z","snapshot_observed_at":"2026-07-06T18:43:05.700263Z","submitted_at":"2024-07-08T14:46:44Z","title":"Multimodal Diffusion Transformer: Learning Versatile Behavior from Multimodal Goals","version":1},"cited_work":{"arxiv_id":"2407.05996","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.05996","snapshot_observed_at":"2026-07-04T13:09:50.161878Z","title":"Multimodal diffusion transformer: Learning versatile behavior from multimodal goals","venue":null,"work_id":"988b5d0d-a604-46c5-8d86-72a48f501f25","year":2024},"citing_paper":{"arxiv_id":"2507.15493","last_updated":"2025-07-22T15:04:37Z","snapshot_observed_at":"2026-08-06T13:23:03.968769Z","submitted_at":"2025-07-21T10:54:13Z","title":"GR-3 Technical Report","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-17T08:04:12.433863Z"},"links":{"cited_paper":"/paper/2407.05996","citing_paper":"/paper/2507.15493"},"observation_digest":"sha256:ac31edecdabe58b06ce076b5b312763c583a625c46701ed1d295e1d60bb72a99","observation_id":"ca04556d-919d-4dd7-b074-3d4ea17824ee","resolution":{"observed_at":"2026-05-17T08:04:12.547881Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05996","last_updated":"2024-07-08T14:46:44Z","snapshot_observed_at":"2026-07-06T18:43:05.700263Z","submitted_at":"2024-07-08T14:46:44Z","title":"Multimodal Diffusion Transformer: Learning Versatile Behavior from Multimodal Goals","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05996","snapshot_observed_at":"2026-08-05T16:55:52.058916Z","title":"Multimodal diffusion transformer: Learning versatile behavior from multimodal goals,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.17449","last_updated":"2025-09-04T16:46:34Z","snapshot_observed_at":"2026-08-05T16:55:50.271610Z","submitted_at":"2025-08-24T17:01:15Z","title":"Robotic Manipulation via Imitation Learning: Taxonomy, Evolution, Benchmark, and Challenges","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T16:55:52.058916Z"},"links":{"cited_paper":"/paper/2407.05996","citing_paper":"/paper/2508.17449"},"observation_digest":"sha256:17073689c8450e24c24ef1ac6df31c8fa56991c3325d9c018c1479585578f5d1","observation_id":"76e7b3a8-92e5-4153-b977-6f651ae96d02","resolution":{"observed_at":"2026-08-05T16:55:52.058916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05996","last_updated":"2024-07-08T14:46:44Z","snapshot_observed_at":"2026-07-06T18:43:05.700263Z","submitted_at":"2024-07-08T14:46:44Z","title":"Multimodal Diffusion Transformer: Learning Versatile Behavior from Multimodal Goals","version":1},"cited_work":{"arxiv_id":"2407.05996","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.05996","snapshot_observed_at":"2026-07-04T13:09:50.161878Z","title":"Multimodal diffusion transformer: Learning versatile behavior from multimodal goals","venue":null,"work_id":"988b5d0d-a604-46c5-8d86-72a48f501f25","year":2024},"citing_paper":{"arxiv_id":"2508.19236","last_updated":"2026-01-30T13:36:22Z","snapshot_observed_at":"2026-07-06T22:19:00.152099Z","submitted_at":"2025-08-26T17:57:16Z","title":"MemoryVLA: Perceptual-Cognitive Memory in Vision-Language-Action Models for Robotic Manipulation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-15T20:43:24.417901Z"},"links":{"cited_paper":"/paper/2407.05996","citing_paper":"/paper/2508.19236"},"observation_digest":"sha256:d283e21f49f073df7602b5aa7fd408ffeb331804b53863b78f9a3b86a6ed580a","observation_id":"fd48f158-af31-4e1f-9d87-0fe1f2dc01fc","resolution":{"observed_at":"2026-05-15T20:43:24.525433Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05996","last_updated":"2024-07-08T14:46:44Z","snapshot_observed_at":"2026-07-06T18:43:05.700263Z","submitted_at":"2024-07-08T14:46:44Z","title":"Multimodal Diffusion Transformer: Learning Versatile Behavior from Multimodal Goals","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05996","snapshot_observed_at":"2026-08-05T10:30:23.635769Z","title":"E.; Wenzel, F.; and Lioutikov, R","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.04063","last_updated":"2025-09-04T09:48:43Z","snapshot_observed_at":"2026-08-10T04:02:44.332056Z","submitted_at":"2025-09-04T09:48:43Z","title":"Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-05T10:30:23.635769Z"},"links":{"cited_paper":"/paper/2407.05996","citing_paper":"/paper/2509.04063"},"observation_digest":"sha256:fd49da79ad2a831e0996b187343661e3ca64e0e5eaa80d5bab61f33fee3bd9d9","observation_id":"ffee3e7b-3f88-4282-9ee9-d2b050e62ed1","resolution":{"observed_at":"2026-08-05T10:30:23.635769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05996","last_updated":"2024-07-08T14:46:44Z","snapshot_observed_at":"2026-07-06T18:43:05.700263Z","submitted_at":"2024-07-08T14:46:44Z","title":"Multimodal Diffusion Transformer: Learning Versatile Behavior from Multimodal Goals","version":1},"cited_work":{"arxiv_id":"2407.05996","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.05996","snapshot_observed_at":"2026-07-04T13:09:50.161878Z","title":"Multimodal diffusion transformer: Learning versatile behavior from multimodal goals","venue":null,"work_id":"988b5d0d-a604-46c5-8d86-72a48f501f25","year":2024},"citing_paper":{"arxiv_id":"2510.12710","last_updated":"2026-04-09T08:55:45Z","snapshot_observed_at":"2026-07-06T22:32:37.311210Z","submitted_at":"2025-10-14T16:44:39Z","title":"Reflection-Based Task Adaptation for Self-Improving VLA","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-18T07:28:11.187479Z"},"links":{"cited_paper":"/paper/2407.05996","citing_paper":"/paper/2510.12710"},"observation_digest":"sha256:e4303c8eb2634e356e0be146d2dc6ece94d51eea3da262f58134933ee92835e7","observation_id":"7951d0f7-f695-444d-90ee-be9ed1e47dac","resolution":{"observed_at":"2026-05-18T07:31:02.986035Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05996","last_updated":"2024-07-08T14:46:44Z","snapshot_observed_at":"2026-07-06T18:43:05.700263Z","submitted_at":"2024-07-08T14:46:44Z","title":"Multimodal Diffusion Transformer: Learning Versatile Behavior from Multimodal Goals","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05996","snapshot_observed_at":"2026-08-03T20:59:52.285243Z","title":"Multimodal diffusion transformer: Learning versatile behavior from multimodal goals.arXiv preprint arXiv:2407.05996,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.17502","last_updated":"2026-05-30T03:49:39Z","snapshot_observed_at":"2026-08-03T20:59:48.866420Z","submitted_at":"2025-11-21T18:59:32Z","title":"RynnVLA-002: A Unified Vision-Language-Action and World Model","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T20:59:52.285243Z"},"links":{"cited_paper":"/paper/2407.05996","citing_paper":"/paper/2511.17502"},"observation_digest":"sha256:dde3e884f0d1a07b7a6532d700086ad951af985f3edfe3ede42a20ce537970d1","observation_id":"ee7f89a2-ab41-4a9a-b748-95bfdec19392","resolution":{"observed_at":"2026-08-03T20:59:52.285243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05996","last_updated":"2024-07-08T14:46:44Z","snapshot_observed_at":"2026-07-06T18:43:05.700263Z","submitted_at":"2024-07-08T14:46:44Z","title":"Multimodal Diffusion Transformer: Learning Versatile Behavior from Multimodal Goals","version":1},"cited_work":{"arxiv_id":"2407.05996","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.05996","snapshot_observed_at":"2026-07-04T13:09:50.161878Z","title":"Multimodal diffusion transformer: Learning versatile behavior from multimodal goals","venue":null,"work_id":"988b5d0d-a604-46c5-8d86-72a48f501f25","year":2024},"citing_paper":{"arxiv_id":"2601.07060","last_updated":"2026-04-04T05:08:38Z","snapshot_observed_at":"2026-08-08T17:47:58.330839Z","submitted_at":"2026-01-11T21:00:58Z","title":"PALM: Progress-Aware Policy Learning via Affordance Reasoning for Long-Horizon Robotic Manipulation","version":2},"reference_index":103,"source":"pdf_text","source_observed_at":"2026-05-16T15:05:21.907878Z"},"links":{"cited_paper":"/paper/2407.05996","citing_paper":"/paper/2601.07060"},"observation_digest":"sha256:fe01ead7bb55c0d06e964340c3108503c3923fb056894c230ad12743d012edd0","observation_id":"fc590509-8576-4970-bb43-2010eedc415b","resolution":{"observed_at":"2026-05-16T15:08:02.002359Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05996","last_updated":"2024-07-08T14:46:44Z","snapshot_observed_at":"2026-07-06T18:43:05.700263Z","submitted_at":"2024-07-08T14:46:44Z","title":"Multimodal Diffusion Transformer: Learning Versatile Behavior from Multimodal Goals","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05996","snapshot_observed_at":"2026-08-03T03:56:05.396182Z","title":"E., Wenzel, F., and Lioutikov, R","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.06575","last_updated":"2026-07-06T12:11:10Z","snapshot_observed_at":"2026-08-03T03:56:00.008362Z","submitted_at":"2026-02-06T10:16:22Z","title":"Think Proprioceptively: State-Grounded Visual Token Selection for VLA Policies","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-03T03:56:05.396182Z"},"links":{"cited_paper":"/paper/2407.05996","citing_paper":"/paper/2602.06575"},"observation_digest":"sha256:f6baf61ba8717b7a917779c99911a38f30689073148a6bb6ffea30a289df4be1","observation_id":"15fbe715-5e6c-4768-9716-468af86a2bc5","resolution":{"observed_at":"2026-08-03T03:56:05.396182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05996","last_updated":"2024-07-08T14:46:44Z","snapshot_observed_at":"2026-07-06T18:43:05.700263Z","submitted_at":"2024-07-08T14:46:44Z","title":"Multimodal Diffusion Transformer: Learning Versatile Behavior from Multimodal Goals","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05996","snapshot_observed_at":"2026-08-03T00:02:14.643503Z","title":"Multimodal diffusion transformer: Learning versatile behavior from multimodal goals.arXiv preprint arXiv:2407.05996, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.11934","last_updated":"2026-06-08T09:01:34Z","snapshot_observed_at":"2026-08-04T13:02:28.723589Z","submitted_at":"2026-02-12T13:30:24Z","title":"Robot-DIFT: Correspondence-Sensitive Diffusion Features for Contact-Rich Robot Manipulation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-03T00:02:14.643503Z"},"links":{"cited_paper":"/paper/2407.05996","citing_paper":"/paper/2602.11934"},"observation_digest":"sha256:96ca6d711977fef11b2e55c6816b37e073d09b7bed2e26a6a23a555f981b5e0c","observation_id":"54761429-a8f5-4208-9360-2821397c809c","resolution":{"observed_at":"2026-08-03T00:02:14.643503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05996","last_updated":"2024-07-08T14:46:44Z","snapshot_observed_at":"2026-07-06T18:43:05.700263Z","submitted_at":"2024-07-08T14:46:44Z","title":"Multimodal Diffusion Transformer: Learning Versatile Behavior from Multimodal Goals","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05996","snapshot_observed_at":"2026-08-02T18:49:51.103217Z","title":"Multimodal diffusion transformer: Learning versatile behavior from multimodal goals,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.04910","last_updated":"2026-07-23T05:22:39Z","snapshot_observed_at":"2026-08-08T21:05:20.374758Z","submitted_at":"2026-03-05T07:52:50Z","title":"VPWEM: Non-Markovian Visuomotor Policy with Working and Episodic Memory","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T18:49:51.103217Z"},"links":{"cited_paper":"/paper/2407.05996","citing_paper":"/paper/2603.04910"},"observation_digest":"sha256:d6a0b9166f7e373c0869bcc1675f9421bad711098cbcb262082cccb28f411a9c","observation_id":"3bbb0ec4-6d9c-496f-9a46-98a8775494e1","resolution":{"observed_at":"2026-08-02T18:49:51.103217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05996","last_updated":"2024-07-08T14:46:44Z","snapshot_observed_at":"2026-07-06T18:43:05.700263Z","submitted_at":"2024-07-08T14:46:44Z","title":"Multimodal Diffusion Transformer: Learning Versatile Behavior from Multimodal Goals","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05996","snapshot_observed_at":"2026-07-13T23:00:31.128534Z","title":"Multimodal diffusion transformer: Learning versatile behavior from multimodal goals,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.17720","last_updated":"2026-07-01T05:08:44Z","snapshot_observed_at":"2026-08-09T21:37:45.555205Z","submitted_at":"2026-03-18T13:40:24Z","title":"VolumeDP: Modeling Volumetric Representation for Manipulation Policy Learning","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-13T23:00:31.128534Z"},"links":{"cited_paper":"/paper/2407.05996","citing_paper":"/paper/2603.17720"},"observation_digest":"sha256:68a99738b01628c307ae323941e644f6872d462b75ec8172b368aa68cd2f2e5b","observation_id":"254afa48-c502-4b35-ae74-3827c9e0af7f","resolution":{"observed_at":"2026-07-13T23:00:31.128534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05996","last_updated":"2024-07-08T14:46:44Z","snapshot_observed_at":"2026-07-06T18:43:05.700263Z","submitted_at":"2024-07-08T14:46:44Z","title":"Multimodal Diffusion Transformer: Learning Versatile Behavior from Multimodal Goals","version":1},"cited_work":{"arxiv_id":"2407.05996","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.05996","snapshot_observed_at":"2026-07-04T13:09:50.161878Z","title":"Multimodal diffusion transformer: Learning versatile behavior from multimodal goals","venue":null,"work_id":"988b5d0d-a604-46c5-8d86-72a48f501f25","year":2024},"citing_paper":{"arxiv_id":"2603.25903","last_updated":"2026-04-16T00:09:18Z","snapshot_observed_at":"2026-07-06T22:50:41.736941Z","submitted_at":"2026-03-26T20:50:36Z","title":"Emergent Neural Automaton Policies: Learning Symbolic Structure from Visuomotor Trajectories","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-15T00:08:16.186576Z"},"links":{"cited_paper":"/paper/2407.05996","citing_paper":"/paper/2603.25903"},"observation_digest":"sha256:28c6f2f494c127d6092728b4fb18189bba9f3cd7270098f5d512d0af5d0c9c19","observation_id":"cdeb824a-dafd-4038-a29b-6688a7a3bf9c","resolution":{"observed_at":"2026-05-15T00:08:21.377605Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05996","last_updated":"2024-07-08T14:46:44Z","snapshot_observed_at":"2026-07-06T18:43:05.700263Z","submitted_at":"2024-07-08T14:46:44Z","title":"Multimodal Diffusion Transformer: Learning Versatile Behavior from Multimodal Goals","version":1},"cited_work":{"arxiv_id":"2407.05996","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.05996","snapshot_observed_at":"2026-07-04T13:09:50.161878Z","title":"Multimodal diffusion transformer: Learning versatile behavior from multimodal goals","venue":null,"work_id":"988b5d0d-a604-46c5-8d86-72a48f501f25","year":2024},"citing_paper":{"arxiv_id":"2604.05672","last_updated":"2026-04-15T03:34:03Z","snapshot_observed_at":"2026-07-06T22:54:21.571606Z","submitted_at":"2026-04-07T10:18:40Z","title":"A1: A Fully Transparent Open-Source, Adaptive and Efficient Truncated Vision-Language-Action Model","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-10T19:31:23.255452Z"},"links":{"cited_paper":"/paper/2407.05996","citing_paper":"/paper/2604.05672"},"observation_digest":"sha256:776b80d9a1369cc1d029c12527f97ff2062cc0cc26101433dedd9c2517a6060a","observation_id":"9508c971-13d5-46a9-ac4b-f393b047b750","resolution":{"observed_at":"2026-05-10T22:50:51.465622Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05996","last_updated":"2024-07-08T14:46:44Z","snapshot_observed_at":"2026-07-06T18:43:05.700263Z","submitted_at":"2024-07-08T14:46:44Z","title":"Multimodal Diffusion Transformer: Learning Versatile Behavior from Multimodal Goals","version":1},"cited_work":{"arxiv_id":"2407.05996","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.05996","snapshot_observed_at":"2026-07-04T13:09:50.161878Z","title":"Multimodal diffusion transformer: Learning versatile behavior from multimodal goals","venue":null,"work_id":"988b5d0d-a604-46c5-8d86-72a48f501f25","year":2024},"citing_paper":{"arxiv_id":"2604.24622","last_updated":"2026-04-28T15:05:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-27T15:51:40Z","title":"CF-VLA: Efficient Coarse-to-Fine Action Generation for Vision-Language-Action Policies","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-08T04:33:32.677434Z"},"links":{"cited_paper":"/paper/2407.05996","citing_paper":"/paper/2604.24622"},"observation_digest":"sha256:6d918d51e0af61b66335530cfcd94d7298d510cfe453813f44c5c24734ed8711","observation_id":"931e186a-74ee-431a-a788-864391bcccf0","resolution":{"observed_at":"2026-05-11T21:41:17.564383Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05996","last_updated":"2024-07-08T14:46:44Z","snapshot_observed_at":"2026-07-06T18:43:05.700263Z","submitted_at":"2024-07-08T14:46:44Z","title":"Multimodal Diffusion Transformer: Learning Versatile Behavior from Multimodal Goals","version":1},"cited_work":{"arxiv_id":"2407.05996","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.05996","snapshot_observed_at":"2026-07-04T13:09:50.161878Z","title":"Multimodal diffusion transformer: Learning versatile behavior from multimodal goals","venue":null,"work_id":"988b5d0d-a604-46c5-8d86-72a48f501f25","year":2024},"citing_paper":{"arxiv_id":"2605.17923","last_updated":"2026-05-18T06:30:31Z","snapshot_observed_at":"2026-08-03T06:19:48.849871Z","submitted_at":"2026-05-18T06:30:31Z","title":"AdaptiveLoad: Towards Efficient Video Diffusion Transformer Training","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-05-20T01:03:08.765350Z"},"links":{"cited_paper":"/paper/2407.05996","citing_paper":"/paper/2605.17923"},"observation_digest":"sha256:373355d16d7b23e117095ac5b24cab14f06db22c5dc1e3ad8a2e00c6c48c662a","observation_id":"9ea12bec-3613-4844-bf3b-0cae5d759fef","resolution":{"observed_at":"2026-05-20T01:03:18.366526Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05996","last_updated":"2024-07-08T14:46:44Z","snapshot_observed_at":"2026-07-06T18:43:05.700263Z","submitted_at":"2024-07-08T14:46:44Z","title":"Multimodal Diffusion Transformer: Learning Versatile Behavior from Multimodal Goals","version":1},"cited_work":{"arxiv_id":"2407.05996","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.05996","snapshot_observed_at":"2026-07-04T13:09:50.161878Z","title":"Multimodal diffusion transformer: Learning versatile behavior from multimodal goals","venue":null,"work_id":"988b5d0d-a604-46c5-8d86-72a48f501f25","year":2024},"citing_paper":{"arxiv_id":"2605.22816","last_updated":"2026-05-21T17:58:26Z","snapshot_observed_at":"2026-08-03T04:05:29.788502Z","submitted_at":"2026-05-21T17:58:26Z","title":"AwareVLN: Reasoning with Self-awareness for Vision-Language Navigation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-22T04:46:03.020800Z"},"links":{"cited_paper":"/paper/2407.05996","citing_paper":"/paper/2605.22816"},"observation_digest":"sha256:46fea206921d32cd68d7efe4f68a7f2f570916f61163f5db22cd0ca24e09eb0b","observation_id":"685b7205-5126-4cb6-b2cb-1f1abe86f475","resolution":{"observed_at":"2026-05-22T04:46:04.600695Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05996","last_updated":"2024-07-08T14:46:44Z","snapshot_observed_at":"2026-07-06T18:43:05.700263Z","submitted_at":"2024-07-08T14:46:44Z","title":"Multimodal Diffusion Transformer: Learning Versatile Behavior from Multimodal Goals","version":1},"cited_work":{"arxiv_id":"2407.05996","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.05996","snapshot_observed_at":"2026-07-04T13:09:50.161878Z","title":"Multimodal diffusion transformer: Learning versatile behavior from multimodal goals","venue":null,"work_id":"988b5d0d-a604-46c5-8d86-72a48f501f25","year":2024},"citing_paper":{"arxiv_id":"2606.04233","last_updated":"2026-06-02T21:33:28Z","snapshot_observed_at":"2026-08-05T14:25:49.046518Z","submitted_at":"2026-06-02T21:33:28Z","title":"What Are We Actually Benchmarking in Robot Manipulation?","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-06-28T09:31:39.345777Z"},"links":{"cited_paper":"/paper/2407.05996","citing_paper":"/paper/2606.04233"},"observation_digest":"sha256:fbdd2ec94d96c814611ff8554dea72afb901aafd2eb34e6dc5d6022eb6321dc8","observation_id":"ad7ffa25-6642-44fc-b6ec-fe6c10308560","resolution":{"observed_at":"2026-07-02T03:56:35.333611Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05996","last_updated":"2024-07-08T14:46:44Z","snapshot_observed_at":"2026-07-06T18:43:05.700263Z","submitted_at":"2024-07-08T14:46:44Z","title":"Multimodal Diffusion Transformer: Learning Versatile Behavior from Multimodal Goals","version":1},"cited_work":{"arxiv_id":"2407.05996","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.05996","snapshot_observed_at":"2026-07-04T13:09:50.161878Z","title":"Multimodal diffusion transformer: Learning versatile behavior from multimodal goals","venue":null,"work_id":"988b5d0d-a604-46c5-8d86-72a48f501f25","year":2024},"citing_paper":{"arxiv_id":"2606.21501","last_updated":"2026-06-19T14:53:40Z","snapshot_observed_at":"2026-07-30T13:23:20.103275Z","submitted_at":"2026-06-19T14:53:40Z","title":"UniviewVLA: A Unified Multiview Vision-Language-Action Model with World Modeling","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-26T14:27:40.585782Z"},"links":{"cited_paper":"/paper/2407.05996","citing_paper":"/paper/2606.21501"},"observation_digest":"sha256:7c87cff2f9ef31a36e515a28cea1980cb97a767ea9e1b4f23b10484849290291","observation_id":"558b8666-e791-44fd-980b-315c4bfa1be3","resolution":{"observed_at":"2026-07-04T06:29:37.506820Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05996","last_updated":"2024-07-08T14:46:44Z","snapshot_observed_at":"2026-07-06T18:43:05.700263Z","submitted_at":"2024-07-08T14:46:44Z","title":"Multimodal Diffusion Transformer: Learning Versatile Behavior from Multimodal Goals","version":1},"cited_work":{"arxiv_id":"2407.05996","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.05996","snapshot_observed_at":"2026-07-04T13:09:50.161878Z","title":"Multimodal diffusion transformer: Learning versatile behavior from multimodal goals","venue":null,"work_id":"988b5d0d-a604-46c5-8d86-72a48f501f25","year":2024},"citing_paper":{"arxiv_id":"2606.26588","last_updated":"2026-06-25T04:20:08Z","snapshot_observed_at":"2026-08-07T09:51:22.326073Z","submitted_at":"2026-06-25T04:20:08Z","title":"Inference-Time Robot Behavior Steering through Physically-Aware Reconfiguration of Task-Structure","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-26T05:32:52.472573Z"},"links":{"cited_paper":"/paper/2407.05996","citing_paper":"/paper/2606.26588"},"observation_digest":"sha256:52408f6e207d4df1345b85d12a8290e6104618443af01df3d872f553cb9cd7e8","observation_id":"d84f9e18-49a6-4d60-812c-133f99a2d089","resolution":{"observed_at":"2026-07-04T13:09:50.163333Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05996","last_updated":"2024-07-08T14:46:44Z","snapshot_observed_at":"2026-07-06T18:43:05.700263Z","submitted_at":"2024-07-08T14:46:44Z","title":"Multimodal Diffusion Transformer: Learning Versatile Behavior from Multimodal Goals","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05996","snapshot_observed_at":"2026-07-14T15:19:27.489381Z","title":"Multimodal diffusion transformer: Learning versatile behav- ior from multimodal goals,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09818","last_updated":"2026-07-10T07:06:02Z","snapshot_observed_at":"2026-07-16T23:18:02.667998Z","submitted_at":"2026-07-10T07:06:02Z","title":"TS-Mask VLA: 2D Temporal-Spatial Masking for Vision-Language-Action Model with Effective Bridging","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-14T15:19:27.489381Z"},"links":{"cited_paper":"/paper/2407.05996","citing_paper":"/paper/2607.09818"},"observation_digest":"sha256:2c0d4b9154009c234f341204b927e97453f452c458358dbc6b8fdb71cfc21d36","observation_id":"369bdd64-4844-48fb-95e8-985d5619ca7b","resolution":{"observed_at":"2026-07-14T15:19:27.489381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05996","last_updated":"2024-07-08T14:46:44Z","snapshot_observed_at":"2026-07-06T18:43:05.700263Z","submitted_at":"2024-07-08T14:46:44Z","title":"Multimodal Diffusion Transformer: Learning Versatile Behavior from Multimodal Goals","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05996","snapshot_observed_at":"2026-08-04T19:45:35.162534Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01851","last_updated":"2026-08-03T07:58:35Z","snapshot_observed_at":"2026-08-07T23:22:57.641630Z","submitted_at":"2026-08-03T07:58:35Z","title":"Weights or Skills? A Survey of Robot-Learning Techniques: from Action-Predicting Weights to Robots that Write their Own Skills","version":1},"reference_index":213,"source":"pdf_text","source_observed_at":"2026-08-04T19:45:35.162534Z"},"links":{"cited_paper":"/paper/2407.05996","citing_paper":"/paper/2608.01851"},"observation_digest":"sha256:2f8c3687825aa1c3f824637fff38599b33630c8c82d6c38d57bdd0caafac7a8a","observation_id":"1ae464e7-d62a-4c6c-83a4-c5bc459552ef","resolution":{"observed_at":"2026-08-04T19:45:35.162534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2407.05996/citation-record","integrity":"/paper/2407.05996/integrity","json":"/paper/2407.05996/citation-record.json","paper":"/paper/2407.05996"},"outbound":[],"paper":{"arxiv_id":"2407.05996","last_updated":"2024-07-08T14:46:44Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-07-06T18:43:05.700263Z","submitted_at":"2024-07-08T14:46:44Z","title":"Multimodal Diffusion Transformer: Learning Versatile Behavior from Multimodal Goals"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 26 inbound Pith citation observations for arXiv:2407.05996."}