{"as_of":"2026-08-16T22:23:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2d87f609bf93f010fbff2bb18eddf44198ef2a83485e86fbd9b1c22bf03dc130","coverage":[{"denominator":46,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":46,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:31:31.854787Z","state":"measured"},{"denominator":48,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":48,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T01:01:44.128884Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-08T01:01:44.731686Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.13679","last_updated":"2025-06-16T16:34:20Z","snapshot_observed_at":"2026-08-15T19:49:02.336488Z","submitted_at":"2025-06-16T16:34:20Z","title":"ROSA: Harnessing Robot States for Vision-Language and Action Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13679","snapshot_observed_at":"2026-08-04T06:10:35.151686Z","title":"Rosa: Harnessing robot states for vision-language and action alignment, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02497","last_updated":"2026-08-03T17:02:04Z","snapshot_observed_at":"2026-08-16T04:18:07.669857Z","submitted_at":"2026-08-03T17:02:04Z","title":"Grounded Semantic Re-Binding for Robust Instruction Generalization in Vision-Language-Action Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-04T06:10:35.151686Z"},"links":{"cited_paper":"/paper/2506.13679","citing_paper":"/paper/2608.02497"},"observation_digest":"sha256:13c27621e952cfcf73e8a50665bf97958cbbbb40b66f8a7073ac67648d5a382f","observation_id":"806cce81-a07d-4a0d-964b-55c4be1e767f","resolution":{"observed_at":"2026-08-04T06:10:35.151686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13679","last_updated":"2025-06-16T16:34:20Z","snapshot_observed_at":"2026-08-15T19:49:02.336488Z","submitted_at":"2025-06-16T16:34:20Z","title":"ROSA: Harnessing Robot States for Vision-Language and Action Alignment","version":1},"cited_work":{"arxiv_id":"2506.13679","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.13679","snapshot_observed_at":"2026-08-08T01:01:44.731686Z","title":"ROSA: Harnessing Robot States for Vision-Language and Action Alignment","venue":"cs.RO","work_id":"21caf7c2-7bc2-40f2-ae6d-3b8ce6cff6cf","year":2025},"citing_paper":{"arxiv_id":"2608.03052","last_updated":"2026-08-04T03:05:47Z","snapshot_observed_at":"2026-08-13T23:19:41.674781Z","submitted_at":"2026-08-04T03:05:47Z","title":"How Should Vision-Language-Action Models Use Proprioceptive State?","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-08T01:01:44.128884Z"},"links":{"cited_paper":"/paper/2506.13679","citing_paper":"/paper/2608.03052"},"observation_digest":"sha256:e0900c493085944da0ef9c2e03e0bb6e71a1f416c34eb39a1c18aad714615bd5","observation_id":"87fdd124-616f-4096-9bdc-3ba1d7801856","resolution":{"observed_at":"2026-08-08T01:01:44.735748Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.13679/citation-record","integrity":"/paper/2506.13679/integrity","json":"/paper/2506.13679/citation-record.json","paper":"/paper/2506.13679"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:31.706918Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13679","last_updated":"2025-06-16T16:34:20Z","snapshot_observed_at":"2026-08-15T19:49:02.336488Z","submitted_at":"2025-06-16T16:34:20Z","title":"ROSA: Harnessing Robot States for Vision-Language and Action Alignment","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:31.706918Z"},"links":{"citing_paper":"/paper/2506.13679"},"observation_digest":"sha256:c5e44f69c4037fcef457b72158d4313ee15dc61af00f69b3cab991bcefe627e8","observation_id":"c814ad01-a6d5-4cb3-92ba-6f0b2c45367a","resolution":{"observed_at":"2026-08-07T00:31:31.706918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:31.710794Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13679","last_updated":"2025-06-16T16:34:20Z","snapshot_observed_at":"2026-08-15T19:49:02.336488Z","submitted_at":"2025-06-16T16:34:20Z","title":"ROSA: Harnessing Robot States for Vision-Language and Action Alignment","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:31.710794Z"},"links":{"citing_paper":"/paper/2506.13679"},"observation_digest":"sha256:9ba931eea00b449b801d45f3838d7c795364ec00cf72ffb8e98db27f4c335be7","observation_id":"b09b29b0-0459-461f-96db-ea6356a82b61","resolution":{"observed_at":"2026-08-07T00:31:31.710794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-07T00:31:31.714299Z","title":"Llava-onevision: Easy visual task transfer.arXiv preprint arXiv:2408.03326, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13679","last_updated":"2025-06-16T16:34:20Z","snapshot_observed_at":"2026-08-15T19:49:02.336488Z","submitted_at":"2025-06-16T16:34:20Z","title":"ROSA: Harnessing Robot States for Vision-Language and Action Alignment","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:31.714299Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2506.13679"},"observation_digest":"sha256:45d735d1192c6d05dff1155b39919cb1eb80a8c664f77fcb006a0cbbaef00b84","observation_id":"2997546c-b778-430d-bf0c-43a9f82d0535","resolution":{"observed_at":"2026-08-07T00:31:31.714299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:31.718384Z","title":"Prismatic vlms: Investigating the design space of visually-conditioned language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13679","last_updated":"2025-06-16T16:34:20Z","snapshot_observed_at":"2026-08-15T19:49:02.336488Z","submitted_at":"2025-06-16T16:34:20Z","title":"ROSA: Harnessing Robot States for Vision-Language and Action Alignment","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:31.718384Z"},"links":{"citing_paper":"/paper/2506.13679"},"observation_digest":"sha256:544407db699e44ba23a8d818d19f4577007d6b441dfc7c8a11bb8370791563e1","observation_id":"904717a8-69be-4bdd-a694-e1085e59ddd0","resolution":{"observed_at":"2026-08-07T00:31:31.718384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:31.722611Z","title":"Flamingo: a visual language model for few-shot learning.Advances in neural information processing systems, 35:23716–23736, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.13679","last_updated":"2025-06-16T16:34:20Z","snapshot_observed_at":"2026-08-15T19:49:02.336488Z","submitted_at":"2025-06-16T16:34:20Z","title":"ROSA: Harnessing Robot States for Vision-Language and Action Alignment","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:31.722611Z"},"links":{"citing_paper":"/paper/2506.13679"},"observation_digest":"sha256:79c94a532ed917f2178beda982b0f329e5abb0f493f73f17ff475545d0d8a98d","observation_id":"c58b818e-dfaf-4cd2-a62e-d3fdd6d3fdc1","resolution":{"observed_at":"2026-08-07T00:31:31.722611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19650","last_updated":"2024-11-29T12:06:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-29T12:06:03Z","title":"CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19650","snapshot_observed_at":"2026-08-07T00:31:31.727134Z","title":"Cogact: A foundational vision-language-action model for synergizing cognition and action in robotic manipulation.arXiv preprint arXiv:2411.19650, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13679","last_updated":"2025-06-16T16:34:20Z","snapshot_observed_at":"2026-08-15T19:49:02.336488Z","submitted_at":"2025-06-16T16:34:20Z","title":"ROSA: Harnessing Robot States for Vision-Language and Action Alignment","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:31.727134Z"},"links":{"cited_paper":"/paper/2411.19650","citing_paper":"/paper/2506.13679"},"observation_digest":"sha256:0674137a298c94ce6271cb4b0eb385dd298ae45d586fcc385fe3785d3e6e21b4","observation_id":"bc828413-b729-4b96-b211-90854633e3c7","resolution":{"observed_at":"2026-08-07T00:31:31.727134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-08-16T21:53:14.144225Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-07T00:31:31.730726Z","title":"Openvla: An open-source vision-language-action model.arXiv preprint arXiv:2406.09246, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13679","last_updated":"2025-06-16T16:34:20Z","snapshot_observed_at":"2026-08-15T19:49:02.336488Z","submitted_at":"2025-06-16T16:34:20Z","title":"ROSA: Harnessing Robot States for Vision-Language and Action Alignment","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:31.730726Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2506.13679"},"observation_digest":"sha256:6f6de15aca556034bc57c2a890fcda5d23dac56682298bc337b772bdbb9a1ada","observation_id":"d8407032-91d5-48bb-a752-8ba9c45b3204","resolution":{"observed_at":"2026-08-07T00:31:31.730726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:32.184150Z","title":"Open x-embodiment: Robotic learning datasets and rt-x models","venue":null,"work_id":"0d1ce2be-d93a-4c11-bfd9-f816d5d44710","year":2023},"citing_paper":{"arxiv_id":"2506.13679","last_updated":"2025-06-16T16:34:20Z","snapshot_observed_at":"2026-08-15T19:49:02.336488Z","submitted_at":"2025-06-16T16:34:20Z","title":"ROSA: Harnessing Robot States for Vision-Language and Action Alignment","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:31.733936Z"},"links":{"citing_paper":"/paper/2506.13679"},"observation_digest":"sha256:c169048d7012ec63826a994d76e161614721cddca34e74d9a7538d28d42058ba","observation_id":"2fbb4476-14fa-406a-b8d6-a6499681c0fa","resolution":{"observed_at":"2026-08-07T00:31:32.187358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-08-16T17:53:54.636855Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-07T00:31:31.736995Z","title":"pi_0: A vision-language-action flow model for general robot control.arXiv preprint arXiv:2410.24164, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.13679","last_updated":"2025-06-16T16:34:20Z","snapshot_observed_at":"2026-08-15T19:49:02.336488Z","submitted_at":"2025-06-16T16:34:20Z","title":"ROSA: Harnessing Robot States for Vision-Language and Action Alignment","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:31.736995Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2506.13679"},"observation_digest":"sha256:90497e992a15f04099b4beb811be471b4f05fb949038c2a0ba34f7c34eb6a6a2","observation_id":"3c4898bc-9a6a-4a92-9291-2be204bd8d2f","resolution":{"observed_at":"2026-08-07T00:31:31.736995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-07T00:31:31.740812Z","title":"Rt-2: Vision-language- action models transfer web knowledge to robotic control.arXiv preprint arXiv:2307.15818, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13679","last_updated":"2025-06-16T16:34:20Z","snapshot_observed_at":"2026-08-15T19:49:02.336488Z","submitted_at":"2025-06-16T16:34:20Z","title":"ROSA: Harnessing Robot States for Vision-Language and Action Alignment","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:31.740812Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2506.13679"},"observation_digest":"sha256:ac84cc826bdd2360ef618b9b7a9927e9165f820df2a655f82e4a40eb2f1a8e43","observation_id":"6b56d11b-00c3-4ad2-aa8b-4ced69a563dd","resolution":{"observed_at":"2026-08-07T00:31:31.740812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14420","last_updated":"2025-02-21T07:28:36Z","snapshot_observed_at":"2026-08-16T12:56:43.999016Z","submitted_at":"2025-02-20T10:16:18Z","title":"ChatVLA: Unified Multimodal Understanding and Robot Control with Vision-Language-Action Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14420","snapshot_observed_at":"2026-08-07T00:31:31.745215Z","title":"Chatvla: Unified multimodal understanding and robot control with vision-language-action model.arXiv preprint arXiv:2502.14420, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13679","last_updated":"2025-06-16T16:34:20Z","snapshot_observed_at":"2026-08-15T19:49:02.336488Z","submitted_at":"2025-06-16T16:34:20Z","title":"ROSA: Harnessing Robot States for Vision-Language and Action Alignment","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:31.745215Z"},"links":{"cited_paper":"/paper/2502.14420","citing_paper":"/paper/2506.13679"},"observation_digest":"sha256:f87af1340a9788ff630c5f94cc66f14e96c77e92155c0b02391948b2a1f9ffae","observation_id":"165a2863-afd9-46ef-9a11-eeb195aa3bcd","resolution":{"observed_at":"2026-08-07T00:31:31.745215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.01823","last_updated":"2024-06-01T01:54:54Z","snapshot_observed_at":"2026-08-15T10:07:25.118684Z","submitted_at":"2024-03-04T08:16:11Z","title":"RT-H: Action Hierarchies Using Language","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.01823","snapshot_observed_at":"2026-08-07T00:31:31.748910Z","title":"Rt-h: Action hierarchies using language.arXiv preprint arXiv:2403.01823, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13679","last_updated":"2025-06-16T16:34:20Z","snapshot_observed_at":"2026-08-15T19:49:02.336488Z","submitted_at":"2025-06-16T16:34:20Z","title":"ROSA: Harnessing Robot States for Vision-Language and Action Alignment","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:31.748910Z"},"links":{"cited_paper":"/paper/2403.01823","citing_paper":"/paper/2506.13679"},"observation_digest":"sha256:2d7541bfa8c3233fb57b86f55cd1af816a13968c5131327a41352d98e8ff2c4c","observation_id":"0fac4feb-cba5-4cc3-b41a-23c6ed007222","resolution":{"observed_at":"2026-08-07T00:31:31.748910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:32.176097Z","title":"Octo: An open-source generalist robot policy","venue":null,"work_id":"16520265-fa5a-4729-b54c-666f30771917","year":2024},"citing_paper":{"arxiv_id":"2506.13679","last_updated":"2025-06-16T16:34:20Z","snapshot_observed_at":"2026-08-15T19:49:02.336488Z","submitted_at":"2025-06-16T16:34:20Z","title":"ROSA: Harnessing Robot States for Vision-Language and Action Alignment","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:31.752768Z"},"links":{"citing_paper":"/paper/2506.13679"},"observation_digest":"sha256:3ba4442d048342e571f04e630e1ff71fa584905d41c1c787d21c030c0a717192","observation_id":"74dab451-b4d4-4257-b8c1-0d5ecffc4965","resolution":{"observed_at":"2026-08-07T00:31:32.179617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:31.755909Z","title":"Perceiver-actor: A multi-task transformer for robotic manipulation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13679","last_updated":"2025-06-16T16:34:20Z","snapshot_observed_at":"2026-08-15T19:49:02.336488Z","submitted_at":"2025-06-16T16:34:20Z","title":"ROSA: Harnessing Robot States for Vision-Language and Action Alignment","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:31.755909Z"},"links":{"citing_paper":"/paper/2506.13679"},"observation_digest":"sha256:f9095ee21ce5d7b77d826c92b5e3ca28bac31916df779185f7c372beff675306","observation_id":"59b08fe7-ffbe-492e-9fcc-56f8c2beba24","resolution":{"observed_at":"2026-08-07T00:31:31.755909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-08-13T00:43:50.403870Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-08-07T00:31:31.758456Z","title":"Vision-language foundation models as effective robot imitators.arXiv preprint arXiv:2311.01378, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13679","last_updated":"2025-06-16T16:34:20Z","snapshot_observed_at":"2026-08-15T19:49:02.336488Z","submitted_at":"2025-06-16T16:34:20Z","title":"ROSA: Harnessing Robot States for Vision-Language and Action Alignment","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:31.758456Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2506.13679"},"observation_digest":"sha256:88d67b92c0736efe2429a7a78c725e24e8b02b05f0556c3d48c7193723debb37","observation_id":"7b4db716-9f2c-4606-9d99-6282f0170e54","resolution":{"observed_at":"2026-08-07T00:31:31.758456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:31.762158Z","title":"Rvt: Robotic view transformer for 3d object manipulation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13679","last_updated":"2025-06-16T16:34:20Z","snapshot_observed_at":"2026-08-15T19:49:02.336488Z","submitted_at":"2025-06-16T16:34:20Z","title":"ROSA: Harnessing Robot States for Vision-Language and Action Alignment","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:31.762158Z"},"links":{"citing_paper":"/paper/2506.13679"},"observation_digest":"sha256:afc8a0da49f9ba7a604038389f9d23180f59ed2d118d4340a42005d17693c39c","observation_id":"b992ffc5-e23c-4980-81b7-5aa8b2145abe","resolution":{"observed_at":"2026-08-07T00:31:31.762158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08545","last_updated":"2024-06-12T18:00:01Z","snapshot_observed_at":"2026-08-16T13:43:37.560927Z","submitted_at":"2024-06-12T18:00:01Z","title":"RVT-2: Learning Precise Manipulation from Few Demonstrations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08545","snapshot_observed_at":"2026-08-07T00:31:31.765815Z","title":"Rvt-2: Learning precise manipulation from few demonstrations.arXiv preprint arXiv:2406.08545, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13679","last_updated":"2025-06-16T16:34:20Z","snapshot_observed_at":"2026-08-15T19:49:02.336488Z","submitted_at":"2025-06-16T16:34:20Z","title":"ROSA: Harnessing Robot States for Vision-Language and Action Alignment","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:31.765815Z"},"links":{"cited_paper":"/paper/2406.08545","citing_paper":"/paper/2506.13679"},"observation_digest":"sha256:ea1aa31b85ff63dff0bad6d7c293234105c1e006cf75af37367202ad85ed8d11","observation_id":"d15c9dcd-c39e-4e06-8e8d-338192f51988","resolution":{"observed_at":"2026-08-07T00:31:31.765815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:31.768857Z","title":"Bc-z: Zero-shot task generalization with robotic imitation learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.13679","last_updated":"2025-06-16T16:34:20Z","snapshot_observed_at":"2026-08-15T19:49:02.336488Z","submitted_at":"2025-06-16T16:34:20Z","title":"ROSA: Harnessing Robot States for Vision-Language and Action Alignment","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:31.768857Z"},"links":{"citing_paper":"/paper/2506.13679"},"observation_digest":"sha256:25f584db568226872a17c6600e8dbaa9d23ebc893ebd929cb26f9401673d9ced","observation_id":"3bfe38de-0259-45f7-b169-78caaec5f641","resolution":{"observed_at":"2026-08-07T00:31:31.768857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:32.154834Z","title":"Coarse-to-fine q- attention: Efficient learning for visual robotic manipulation via discretisation","venue":null,"work_id":"ab9e0e9a-d6cf-4ca6-88dd-59c5ce280b48","year":2022},"citing_paper":{"arxiv_id":"2506.13679","last_updated":"2025-06-16T16:34:20Z","snapshot_observed_at":"2026-08-15T19:49:02.336488Z","submitted_at":"2025-06-16T16:34:20Z","title":"ROSA: Harnessing Robot States for Vision-Language and Action Alignment","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:31.771680Z"},"links":{"citing_paper":"/paper/2506.13679"},"observation_digest":"sha256:826aac533c9cdb7369a99aa1e1e6dedc808e8971440dfbed62ccdf16c97d3a83","observation_id":"0b281560-27ce-4836-b863-aace77d3cfc0","resolution":{"observed_at":"2026-08-07T00:31:32.157498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:31.774404Z","title":"Robot learning with sensorimotor pre-training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13679","last_updated":"2025-06-16T16:34:20Z","snapshot_observed_at":"2026-08-15T19:49:02.336488Z","submitted_at":"2025-06-16T16:34:20Z","title":"ROSA: Harnessing Robot States for Vision-Language and Action Alignment","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:31.774404Z"},"links":{"citing_paper":"/paper/2506.13679"},"observation_digest":"sha256:55cd53b09bd26132b03492ca2c06244efb915209eb8f4bc796d272c5339c93bd","observation_id":"e2a4cdef-d831-43af-b315-087c08719fd5","resolution":{"observed_at":"2026-08-07T00:31:31.774404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03094","last_updated":"2023-05-28T07:32:38Z","snapshot_observed_at":"2026-08-16T16:26:20.587132Z","submitted_at":"2022-10-06T17:50:11Z","title":"VIMA: General Robot Manipulation with Multimodal Prompts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03094","snapshot_observed_at":"2026-08-07T00:31:31.777184Z","title":"Vima: General robot manipulation with multimodal prompts.arXiv preprint arXiv:2210.03094, 2(3):6, 2022","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.13679","last_updated":"2025-06-16T16:34:20Z","snapshot_observed_at":"2026-08-15T19:49:02.336488Z","submitted_at":"2025-06-16T16:34:20Z","title":"ROSA: Harnessing Robot States for Vision-Language and Action Alignment","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:31.777184Z"},"links":{"cited_paper":"/paper/2210.03094","citing_paper":"/paper/2506.13679"},"observation_digest":"sha256:ee93b92b2b10df9d0db709c0c5a717f98e1079d02ec0aec0c8b09efc153693c3","observation_id":"0a70a004-3e9b-46d0-a405-26dc6d678029","resolution":{"observed_at":"2026-08-07T00:31:31.777184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06817","last_updated":"2023-08-11T17:45:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-13T18:55:15Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06817","snapshot_observed_at":"2026-08-07T00:31:31.781063Z","title":"Rt-1: Robotics transformer for real-world control at scale.arXiv preprint arXiv:2212.06817, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.13679","last_updated":"2025-06-16T16:34:20Z","snapshot_observed_at":"2026-08-15T19:49:02.336488Z","submitted_at":"2025-06-16T16:34:20Z","title":"ROSA: Harnessing Robot States for Vision-Language and Action Alignment","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:31.781063Z"},"links":{"cited_paper":"/paper/2212.06817","citing_paper":"/paper/2506.13679"},"observation_digest":"sha256:9433efa39d7253f4a2a068da14290daf29fb9e483cf7426e9c5e4ff1c58884d5","observation_id":"fd92e520-1295-4fd6-aee2-c3b5429fdcff","resolution":{"observed_at":"2026-08-07T00:31:31.781063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01390","last_updated":"2023-08-07T17:53:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-02T19:10:23Z","title":"OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01390","snapshot_observed_at":"2026-08-07T00:31:31.784315Z","title":"Openflamingo: An open- source framework for training large autoregressive vision-language models.arXiv preprint arXiv:2308.01390, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13679","last_updated":"2025-06-16T16:34:20Z","snapshot_observed_at":"2026-08-15T19:49:02.336488Z","submitted_at":"2025-06-16T16:34:20Z","title":"ROSA: Harnessing Robot States for Vision-Language and Action Alignment","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:31.784315Z"},"links":{"cited_paper":"/paper/2308.01390","citing_paper":"/paper/2506.13679"},"observation_digest":"sha256:bc3d3e83a2a5eacbede2eb750c461cb63143781430c871ef84efe032eeb73bf8","observation_id":"1ae0e367-31f4-4e7b-b225-0d48e47ac061","resolution":{"observed_at":"2026-08-07T00:31:31.784315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-08-14T18:47:26.721223Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-08-07T00:31:31.787616Z","title":"Palm-e: An embodied multimodal language model.arXiv preprint arXiv:2303.03378, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13679","last_updated":"2025-06-16T16:34:20Z","snapshot_observed_at":"2026-08-15T19:49:02.336488Z","submitted_at":"2025-06-16T16:34:20Z","title":"ROSA: Harnessing Robot States for Vision-Language and Action Alignment","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:31.787616Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2506.13679"},"observation_digest":"sha256:e88be1297fd89368451dd77b31d8a211945255739af17e4449eabce25b06f47f","observation_id":"acb22942-725d-4b03-9e9d-ad6442942450","resolution":{"observed_at":"2026-08-07T00:31:31.787616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:31.791156Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.13679","last_updated":"2025-06-16T16:34:20Z","snapshot_observed_at":"2026-08-15T19:49:02.336488Z","submitted_at":"2025-06-16T16:34:20Z","title":"ROSA: Harnessing Robot States for Vision-Language and Action Alignment","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:31.791156Z"},"links":{"citing_paper":"/paper/2506.13679"},"observation_digest":"sha256:fabc522a053a8cc44eff4d8c1cad88bc8fa1fc146275dc183e8c5e7c875e1fc4","observation_id":"f1192e56-1c1f-429e-8e4e-dcdfc069c8d9","resolution":{"observed_at":"2026-08-07T00:31:31.791156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:31.794838Z","title":"Blip: Bootstrapping language- image pre-training for unified vision-language understanding and generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.13679","last_updated":"2025-06-16T16:34:20Z","snapshot_observed_at":"2026-08-15T19:49:02.336488Z","submitted_at":"2025-06-16T16:34:20Z","title":"ROSA: Harnessing Robot States for Vision-Language and Action Alignment","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:31.794838Z"},"links":{"citing_paper":"/paper/2506.13679"},"observation_digest":"sha256:ea2e65e11685f68c3d03bd727d3a0d8f691ab5a6d99722b3eb859527d1f94dc0","observation_id":"8589d5cb-f1e4-4b80-b6c2-c6a8b42f89f1","resolution":{"observed_at":"2026-08-07T00:31:31.794838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08693","last_updated":"2025-03-06T19:29:03Z","snapshot_observed_at":"2026-08-07T02:44:43.738657Z","submitted_at":"2024-07-11T17:31:01Z","title":"Robotic Control via Embodied Chain-of-Thought Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08693","snapshot_observed_at":"2026-08-07T00:31:31.797767Z","title":"Robotic control via embodied chain-of-thought reasoning.arXiv preprint arXiv:2407.08693, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13679","last_updated":"2025-06-16T16:34:20Z","snapshot_observed_at":"2026-08-15T19:49:02.336488Z","submitted_at":"2025-06-16T16:34:20Z","title":"ROSA: Harnessing Robot States for Vision-Language and Action Alignment","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:31.797767Z"},"links":{"cited_paper":"/paper/2407.08693","citing_paper":"/paper/2506.13679"},"observation_digest":"sha256:23ec5b6defcd1e2d29e7173858baaafed7898430604a63ed00f52e8b2b72eb2a","observation_id":"ef2fa0cb-c995-4d5e-8dc1-51545a5300d9","resolution":{"observed_at":"2026-08-07T00:31:31.797767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14058","snapshot_observed_at":"2026-08-07T00:31:31.800648Z","title":"Towards generalist robot policies: What matters in building vision-language-action models.arXiv preprint arXiv:2412.14058, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13679","last_updated":"2025-06-16T16:34:20Z","snapshot_observed_at":"2026-08-15T19:49:02.336488Z","submitted_at":"2025-06-16T16:34:20Z","title":"ROSA: Harnessing Robot States for Vision-Language and Action Alignment","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:31.800648Z"},"links":{"cited_paper":"/paper/2412.14058","citing_paper":"/paper/2506.13679"},"observation_digest":"sha256:02e3adead1b0496942521fe6b06dc9d86dca203bca52f3b4dc9d98c1a321b965","observation_id":"3f6cc393-fa1c-4e30-bbae-f03991b8191f","resolution":{"observed_at":"2026-08-07T00:31:31.800648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:32.132362Z","title":"Llarva: Vision-action instruction tuning enhances robot learning","venue":null,"work_id":"7d22fba0-1b90-44eb-b75d-8ed0ce0fdff9","year":null},"citing_paper":{"arxiv_id":"2506.13679","last_updated":"2025-06-16T16:34:20Z","snapshot_observed_at":"2026-08-15T19:49:02.336488Z","submitted_at":"2025-06-16T16:34:20Z","title":"ROSA: Harnessing Robot States for Vision-Language and Action Alignment","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:31.804344Z"},"links":{"citing_paper":"/paper/2506.13679"},"observation_digest":"sha256:4673166bd8c2e6d271e4171021e03d70863ca57054511b13e55c6bfcace4734c","observation_id":"41f07b63-3605-43c8-a2ac-81775e33644d","resolution":{"observed_at":"2026-08-07T00:31:32.135298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10345","last_updated":"2025-06-05T21:26:08Z","snapshot_observed_at":"2026-08-12T18:17:40.083518Z","submitted_at":"2024-12-13T18:40:51Z","title":"TraceVLA: Visual Trace Prompting Enhances Spatial-Temporal Awareness for Generalist Robotic Policies","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10345","snapshot_observed_at":"2026-08-07T00:31:31.807156Z","title":"Tracevla: Visual trace prompting enhances spatial-temporal awareness for generalist robotic policies.arXiv preprint arXiv:2412.10345, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13679","last_updated":"2025-06-16T16:34:20Z","snapshot_observed_at":"2026-08-15T19:49:02.336488Z","submitted_at":"2025-06-16T16:34:20Z","title":"ROSA: Harnessing Robot States for Vision-Language and Action Alignment","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:31.807156Z"},"links":{"cited_paper":"/paper/2412.10345","citing_paper":"/paper/2506.13679"},"observation_digest":"sha256:40a451754107f7d1461b87f1d4f801e585e8f93a8eba353ed2a462989aa1f8ac","observation_id":"dd50b737-8aac-407b-a9c3-55f3d821b0cf","resolution":{"observed_at":"2026-08-07T00:31:31.807156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.20095","last_updated":"2025-01-30T17:34:37Z","snapshot_observed_at":"2026-08-16T13:38:39.507024Z","submitted_at":"2024-06-28T17:59:12Z","title":"LLaRA: Supercharging Robot Learning Data for Vision-Language Policy","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.20095","snapshot_observed_at":"2026-08-07T00:31:31.810526Z","title":"Llara: Supercharging robot learning data for vision-language policy.arXiv preprint arXiv:2406.20095, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13679","last_updated":"2025-06-16T16:34:20Z","snapshot_observed_at":"2026-08-15T19:49:02.336488Z","submitted_at":"2025-06-16T16:34:20Z","title":"ROSA: Harnessing Robot States for Vision-Language and Action Alignment","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:31.810526Z"},"links":{"cited_paper":"/paper/2406.20095","citing_paper":"/paper/2506.13679"},"observation_digest":"sha256:957b38306bb90a530a1b4ca55619c93fa51f47aad27aad820b37460fd33a4ca1","observation_id":"a53aae7b-3c62-416e-9a3a-fc5a03f3ecc1","resolution":{"observed_at":"2026-08-07T00:31:31.810526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:31.813608Z","title":"Tinyvla: Towards fast, data-efficient vision-language-action models for robotic manipulation.IEEE Robotics and Automation Letters, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13679","last_updated":"2025-06-16T16:34:20Z","snapshot_observed_at":"2026-08-15T19:49:02.336488Z","submitted_at":"2025-06-16T16:34:20Z","title":"ROSA: Harnessing Robot States for Vision-Language and Action Alignment","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:31.813608Z"},"links":{"citing_paper":"/paper/2506.13679"},"observation_digest":"sha256:4ee795fa8c1b8b9fe964cb837582235dc5d6ada896756400a3bcdc4f57025307","observation_id":"ced5fe00-6396-4a32-8e96-f20f57f39cb0","resolution":{"observed_at":"2026-08-07T00:31:31.813608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10322","last_updated":"2025-03-13T12:58:40Z","snapshot_observed_at":"2026-08-16T12:50:23.516565Z","submitted_at":"2025-03-13T12:58:40Z","title":"Towards Fast, Memory-based and Data-Efficient Vision-Language Policy","version":1},"cited_work":{"arxiv_id":"2503.10322","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.10322","snapshot_observed_at":"2026-08-07T00:31:31.928296Z","title":"Towards Fast, Memory-based and Data-Efficient Vision-Language Policy","venue":"cs.CV","work_id":"e84d471f-cfe2-476c-b370-0959fe1f06c9","year":2025},"citing_paper":{"arxiv_id":"2506.13679","last_updated":"2025-06-16T16:34:20Z","snapshot_observed_at":"2026-08-15T19:49:02.336488Z","submitted_at":"2025-06-16T16:34:20Z","title":"ROSA: Harnessing Robot States for Vision-Language and Action Alignment","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:31.816613Z"},"links":{"cited_paper":"/paper/2503.10322","citing_paper":"/paper/2506.13679"},"observation_digest":"sha256:da356d860cb6c0689bc850ba5716c162b84b01cb45ef95ba781d0fb4f340382b","observation_id":"1090907d-ac6e-4a27-ad05-3b22f1083705","resolution":{"observed_at":"2026-08-07T00:31:31.931357Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20384","last_updated":"2025-04-14T11:39:39Z","snapshot_observed_at":"2026-08-16T12:46:42.262426Z","submitted_at":"2025-03-26T10:05:38Z","title":"MoLe-VLA: Dynamic Layer-skipping Vision Language Action Model via Mixture-of-Layers for Efficient Robot Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20384","snapshot_observed_at":"2026-08-07T00:31:31.820504Z","title":"Mole-vla: Dynamic layer-skipping vision language action model via mixture-of-layers for efficient robot manipulation.arXiv preprint arXiv:2503.20384, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13679","last_updated":"2025-06-16T16:34:20Z","snapshot_observed_at":"2026-08-15T19:49:02.336488Z","submitted_at":"2025-06-16T16:34:20Z","title":"ROSA: Harnessing Robot States for Vision-Language and Action Alignment","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:31.820504Z"},"links":{"cited_paper":"/paper/2503.20384","citing_paper":"/paper/2506.13679"},"observation_digest":"sha256:22fc9b4a25eb290b34b09d2f87e71816a4f0224abe4607e12d27884eb44b46e2","observation_id":"fbe82f9c-440f-4a16-9397-b85d4f3eb02a","resolution":{"observed_at":"2026-08-07T00:31:31.820504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15068","last_updated":"2025-02-05T08:49:14Z","snapshot_observed_at":"2026-08-16T21:34:58.814505Z","submitted_at":"2025-01-25T04:19:33Z","title":"An Atomic Skill Library Construction Method for Data-Efficient Embodied Manipulation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.15068","snapshot_observed_at":"2026-08-07T00:31:31.824023Z","title":"An atomic skill library construction method for data-efficient embodied manipulation.arXiv preprint arXiv:2501.15068, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13679","last_updated":"2025-06-16T16:34:20Z","snapshot_observed_at":"2026-08-15T19:49:02.336488Z","submitted_at":"2025-06-16T16:34:20Z","title":"ROSA: Harnessing Robot States for Vision-Language and Action Alignment","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:31.824023Z"},"links":{"cited_paper":"/paper/2501.15068","citing_paper":"/paper/2506.13679"},"observation_digest":"sha256:04b68390f5635a4f9542f97038660e8fa96e83586ced94836fa31f69457da239","observation_id":"ee6b8ece-75f1-4d92-8a42-ee1ae762e9fc","resolution":{"observed_at":"2026-08-07T00:31:31.824023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:32.118384Z","title":"Pose estimation for an autonomous vehicle using monocular vision","venue":null,"work_id":"5812f171-080d-4130-8362-f2fed3d21c9e","year":2017},"citing_paper":{"arxiv_id":"2506.13679","last_updated":"2025-06-16T16:34:20Z","snapshot_observed_at":"2026-08-15T19:49:02.336488Z","submitted_at":"2025-06-16T16:34:20Z","title":"ROSA: Harnessing Robot States for Vision-Language and Action Alignment","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:31.827326Z"},"links":{"citing_paper":"/paper/2506.13679"},"observation_digest":"sha256:160875aa5262b9769e487b1955b6529a1305d3f2368769977fa70f48791b993a","observation_id":"b74616f8-37a9-4c9f-91d3-09548dfd9de0","resolution":{"observed_at":"2026-08-07T00:31:32.121947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:32.109803Z","title":"Pose estimation and map building with a time-of-flight-camera for robot navigation.International Journal of Intelligent Systems Technologies and Applications, 5(3-4):355–364, 2008","venue":null,"work_id":"ae515283-47dc-4da0-82bc-14d62edb7f14","year":2008},"citing_paper":{"arxiv_id":"2506.13679","last_updated":"2025-06-16T16:34:20Z","snapshot_observed_at":"2026-08-15T19:49:02.336488Z","submitted_at":"2025-06-16T16:34:20Z","title":"ROSA: Harnessing Robot States for Vision-Language and Action Alignment","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:31.829691Z"},"links":{"citing_paper":"/paper/2506.13679"},"observation_digest":"sha256:faa4f1bdd2e57ec6dde25c0f2e523a371e5ff02282437e5463be840c5f5fa15b","observation_id":"0e7fec20-bfcd-423a-8a42-f529c0193c35","resolution":{"observed_at":"2026-08-07T00:31:32.113138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:32.101354Z","title":"Learning human-to-robot handovers from point clouds","venue":null,"work_id":"243d7d58-095b-4ae9-9e59-3b03c2a396b6","year":2023},"citing_paper":{"arxiv_id":"2506.13679","last_updated":"2025-06-16T16:34:20Z","snapshot_observed_at":"2026-08-15T19:49:02.336488Z","submitted_at":"2025-06-16T16:34:20Z","title":"ROSA: Harnessing Robot States for Vision-Language and Action Alignment","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:31.832008Z"},"links":{"citing_paper":"/paper/2506.13679"},"observation_digest":"sha256:26cee87e0f4a97f279aa175db9428d76fd94023578490817b8ef15c5e620e7d6","observation_id":"0a41b70d-1cae-4cc4-9308-da39c0a7c1d1","resolution":{"observed_at":"2026-08-07T00:31:32.104564Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:32.091309Z","title":"Pose estima- tion and adaptive robot behaviour for human-robot interaction","venue":null,"work_id":"8a1d0a0f-52f7-4fcc-ab35-30d12dd6598e","year":2009},"citing_paper":{"arxiv_id":"2506.13679","last_updated":"2025-06-16T16:34:20Z","snapshot_observed_at":"2026-08-15T19:49:02.336488Z","submitted_at":"2025-06-16T16:34:20Z","title":"ROSA: Harnessing Robot States for Vision-Language and Action Alignment","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:31.834485Z"},"links":{"citing_paper":"/paper/2506.13679"},"observation_digest":"sha256:63ed9b1d7ae3074bf61e9c158093b121f950658a8f46585749e9e78ba6cc3ad7","observation_id":"a55ac823-aecf-4896-b0f8-5f943267b7d9","resolution":{"observed_at":"2026-08-07T00:31:32.095313Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.07387","last_updated":"2020-11-14T21:09:53Z","snapshot_observed_at":"2026-08-16T19:05:51.289869Z","submitted_at":"2020-11-14T21:09:53Z","title":"Privacy-Preserving Pose Estimation for Human-Robot Interaction","version":1},"cited_work":{"arxiv_id":"2011.07387","doi":null,"metadata_source":"pith","pith_arxiv_id":"2011.07387","snapshot_observed_at":"2026-08-07T00:31:31.902948Z","title":"Privacy-Preserving Pose Estimation for Human-Robot Interaction","venue":"cs.RO","work_id":"88a57271-05a5-4a19-b874-29d235adc21e","year":2020},"citing_paper":{"arxiv_id":"2506.13679","last_updated":"2025-06-16T16:34:20Z","snapshot_observed_at":"2026-08-15T19:49:02.336488Z","submitted_at":"2025-06-16T16:34:20Z","title":"ROSA: Harnessing Robot States for Vision-Language and Action Alignment","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:31.836905Z"},"links":{"cited_paper":"/paper/2011.07387","citing_paper":"/paper/2506.13679"},"observation_digest":"sha256:b72d4ae470c9653cec8f295123719c92ee8c5eeb3cbd4167d5efde57b68a49db","observation_id":"7401f7d3-8dbf-40dc-9761-86f2867a01d5","resolution":{"observed_at":"2026-08-07T00:31:31.906391Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1902.04987","last_updated":"2019-02-13T16:26:31Z","snapshot_observed_at":"2026-08-14T17:16:49.706639Z","submitted_at":"2019-02-13T16:26:31Z","title":"3D Robot Pose Estimation from 2D Images","version":1},"cited_work":{"arxiv_id":"1902.04987","doi":null,"metadata_source":"pith","pith_arxiv_id":"1902.04987","snapshot_observed_at":"2026-08-07T00:31:31.889387Z","title":"3D Robot Pose Estimation from 2D Images","venue":"cs.CV","work_id":"5f138d3f-8e8a-4b47-8b32-9c1db91a306f","year":2019},"citing_paper":{"arxiv_id":"2506.13679","last_updated":"2025-06-16T16:34:20Z","snapshot_observed_at":"2026-08-15T19:49:02.336488Z","submitted_at":"2025-06-16T16:34:20Z","title":"ROSA: Harnessing Robot States for Vision-Language and Action Alignment","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:31.839905Z"},"links":{"cited_paper":"/paper/1902.04987","citing_paper":"/paper/2506.13679"},"observation_digest":"sha256:f395a3a12d8b977750f311d3e38135e5708e0bfcccdbc41bb999a25676911cdb","observation_id":"ec4159cd-4cc7-4493-9087-514d9950cc0e","resolution":{"observed_at":"2026-08-07T00:31:31.894679Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:32.082892Z","title":"Multi-objective convolutional neural networks for robot localisation and 3d position estimation in 2d camera images","venue":null,"work_id":"44fbeb02-6adf-4820-a4d1-8a947de8b1d8","year":2018},"citing_paper":{"arxiv_id":"2506.13679","last_updated":"2025-06-16T16:34:20Z","snapshot_observed_at":"2026-08-15T19:49:02.336488Z","submitted_at":"2025-06-16T16:34:20Z","title":"ROSA: Harnessing Robot States for Vision-Language and Action Alignment","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:31.843312Z"},"links":{"citing_paper":"/paper/2506.13679"},"observation_digest":"sha256:53cac7b5369c4ded687e62032d253579e4c400e60aa40b25dcb6e84ad638c109","observation_id":"24dd54f8-a3d3-4790-a295-2b17553f9b5d","resolution":{"observed_at":"2026-08-07T00:31:32.086060Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:32.073036Z","title":"Robots’ state estimation and observability analysis based on statistical motion models.IEEE Transactions on Control Systems Technology, 30(5):2030–2045, 2022","venue":null,"work_id":"bfe0c064-6213-4e18-acc1-f9d23087e984","year":2022},"citing_paper":{"arxiv_id":"2506.13679","last_updated":"2025-06-16T16:34:20Z","snapshot_observed_at":"2026-08-15T19:49:02.336488Z","submitted_at":"2025-06-16T16:34:20Z","title":"ROSA: Harnessing Robot States for Vision-Language and Action Alignment","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:31.846316Z"},"links":{"citing_paper":"/paper/2506.13679"},"observation_digest":"sha256:0f61125e04dd72e903d5bf1a3de13c6170a399d9117bda09ffd3de4088b36af3","observation_id":"688cad5f-3aba-4f4b-956b-ee7eb8eda90f","resolution":{"observed_at":"2026-08-07T00:31:32.076280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:32.063582Z","title":"Real-time holistic robot pose estimation with unknown states","venue":null,"work_id":"e7ea9942-b640-43c1-8361-81a5f0611d7a","year":2024},"citing_paper":{"arxiv_id":"2506.13679","last_updated":"2025-06-16T16:34:20Z","snapshot_observed_at":"2026-08-15T19:49:02.336488Z","submitted_at":"2025-06-16T16:34:20Z","title":"ROSA: Harnessing Robot States for Vision-Language and Action Alignment","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:31.849212Z"},"links":{"citing_paper":"/paper/2506.13679"},"observation_digest":"sha256:81e407ab02877a6da9bd9d24af638b85c3494d33b329963d211e2c1390342da0","observation_id":"bc44f804-0131-4409-8eac-bd62b734ec53","resolution":{"observed_at":"2026-08-07T00:31:32.067024Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T00:31:31.852169Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13679","last_updated":"2025-06-16T16:34:20Z","snapshot_observed_at":"2026-08-15T19:49:02.336488Z","submitted_at":"2025-06-16T16:34:20Z","title":"ROSA: Harnessing Robot States for Vision-Language and Action Alignment","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:31.852169Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2506.13679"},"observation_digest":"sha256:bab633e9a78674546f254fa54fbf6adba125e02e38c9ef78bc950b97987d1d96","observation_id":"65460fd1-5104-4768-bee8-b9ebbc0aa0ab","resolution":{"observed_at":"2026-08-07T00:31:31.852169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:32.054302Z","title":"push the maroon button, then push the green button","venue":null,"work_id":"52c677d8-7064-4898-98d8-af9f577ab79c","year":2020},"citing_paper":{"arxiv_id":"2506.13679","last_updated":"2025-06-16T16:34:20Z","snapshot_observed_at":"2026-08-15T19:49:02.336488Z","submitted_at":"2025-06-16T16:34:20Z","title":"ROSA: Harnessing Robot States for Vision-Language and Action Alignment","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:31.854787Z"},"links":{"citing_paper":"/paper/2506.13679"},"observation_digest":"sha256:c4868586cf009ceca33ddf43d5fac58962be6a4a332281cf34028c29d7ee7c03","observation_id":"534a41be-be97-4cec-aa30-2727b67db404","resolution":{"observed_at":"2026-08-07T00:31:32.057279Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.13679","last_updated":"2025-06-16T16:34:20Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-15T19:49:02.336488Z","submitted_at":"2025-06-16T16:34:20Z","title":"ROSA: Harnessing Robot States for Vision-Language and Action Alignment"},"reference_resolution":{"displayed":46,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":31,"verified_exact":3,"verified_fuzzy":12},"total_outbound_references":46},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 46 of 46 outbound references and 2 inbound Pith citation observations for arXiv:2506.13679."}