{"as_of":"2026-08-10T19:08:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d314f79fb3a4e1a27eb5b10bbabc2d5100377b9bed1d610cc79067f77b682258","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":10,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":10,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":10,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":10,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T10:39:38.257200Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T02:26:26.937662Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"1912.04443","last_updated":"2020-06-21T20:16:28Z","snapshot_observed_at":"2026-07-06T08:43:17.319793Z","submitted_at":"2019-12-10T01:36:18Z","title":"AVID: Learning Multi-Stage Tasks via Pixel-Level Translation of Human Videos","version":3},"cited_work":{"arxiv_id":"1912.04443","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1912.04443","snapshot_observed_at":"2026-07-02T02:26:26.937662Z","title":"Avid: Learning multi-stage tasks via pixel-level translation of human videos","venue":null,"work_id":"c0825d84-9e71-4705-90da-50d016ea05a0","year":1912},"citing_paper":{"arxiv_id":"2310.08864","last_updated":"2025-05-14T15:22:36Z","snapshot_observed_at":"2026-08-10T14:16:30.405696Z","submitted_at":"2023-10-13T05:20:40Z","title":"Open X-Embodiment: Robotic Learning Datasets and RT-X Models","version":9},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-11T17:23:24.255829Z"},"links":{"cited_paper":"/paper/1912.04443","citing_paper":"/paper/2310.08864"},"observation_digest":"sha256:34524bf4a15e42e033afbb2f495c0c19bbfa5d36fd2d7f2797d31b7db8a0381d","observation_id":"1bf7b9b3-80c1-40ef-b636-f8128555e79f","resolution":{"observed_at":"2026-05-11T17:23:24.368656Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.04443","last_updated":"2020-06-21T20:16:28Z","snapshot_observed_at":"2026-07-06T08:43:17.319793Z","submitted_at":"2019-12-10T01:36:18Z","title":"AVID: Learning Multi-Stage Tasks via Pixel-Level Translation of Human Videos","version":3},"cited_work":{"arxiv_id":"1912.04443","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1912.04443","snapshot_observed_at":"2026-07-02T02:26:26.937662Z","title":"Avid: Learning multi-stage tasks via pixel-level translation of human videos","venue":null,"work_id":"c0825d84-9e71-4705-90da-50d016ea05a0","year":1912},"citing_paper":{"arxiv_id":"2401.02117","last_updated":"2024-01-04T07:55:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-04T07:55:53Z","title":"Mobile ALOHA: Learning Bimanual Mobile Manipulation with Low-Cost Whole-Body Teleoperation","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-05-14T22:02:55.240949Z"},"links":{"cited_paper":"/paper/1912.04443","citing_paper":"/paper/2401.02117"},"observation_digest":"sha256:636ae2f892255a73f8c0e90163b25c342569e5f950f31adc92ac0dddd27f146b","observation_id":"ce900b45-d18b-473b-b51d-ed8575245c92","resolution":{"observed_at":"2026-05-14T22:02:55.408431Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.04443","last_updated":"2020-06-21T20:16:28Z","snapshot_observed_at":"2026-07-06T08:43:17.319793Z","submitted_at":"2019-12-10T01:36:18Z","title":"AVID: Learning Multi-Stage Tasks via Pixel-Level Translation of Human Videos","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.04443","snapshot_observed_at":"2026-08-10T10:39:38.257200Z","title":"Avid: Learning multi-stage tasks via pixel-level translation of human videos","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2501.16800","last_updated":"2025-01-28T09:05:03Z","snapshot_observed_at":"2026-08-10T10:49:02.686992Z","submitted_at":"2025-01-28T09:05:03Z","title":"DIRIGENt: End-To-End Robotic Imitation of Human Demonstrations Based on a Diffusion Model","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-10T10:39:38.257200Z"},"links":{"cited_paper":"/paper/1912.04443","citing_paper":"/paper/2501.16800"},"observation_digest":"sha256:2cea3cbf18fbed2c719cf4b1de28a384246a2c96168dc25e5f435a1d3e851976","observation_id":"f19d7843-b3b5-4607-adb3-4e6d1a10c0af","resolution":{"observed_at":"2026-08-10T10:39:38.257200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.04443","last_updated":"2020-06-21T20:16:28Z","snapshot_observed_at":"2026-07-06T08:43:17.319793Z","submitted_at":"2019-12-10T01:36:18Z","title":"AVID: Learning Multi-Stage Tasks via Pixel-Level Translation of Human Videos","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.04443","snapshot_observed_at":"2026-08-09T14:52:27.279746Z","title":"Avid: Learning multi-stage tasks via pixel-level trans- lation of human videos","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2502.01616","last_updated":"2025-02-03T18:50:15Z","snapshot_observed_at":"2026-08-10T11:21:50.562010Z","submitted_at":"2025-02-03T18:50:15Z","title":"Preference VLM: Leveraging VLMs for Scalable Preference-Based Reinforcement Learning","version":1},"reference_index":2009,"source":"pdf_text","source_observed_at":"2026-08-09T14:52:27.279746Z"},"links":{"cited_paper":"/paper/1912.04443","citing_paper":"/paper/2502.01616"},"observation_digest":"sha256:e4eab2ed978a8c43fe0c8b09f3e82f5d9d2464055883855afdc79826156813f4","observation_id":"52287843-3473-4c86-9fc4-9eb2057dcd50","resolution":{"observed_at":"2026-08-09T14:52:27.279746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.04443","last_updated":"2020-06-21T20:16:28Z","snapshot_observed_at":"2026-07-06T08:43:17.319793Z","submitted_at":"2019-12-10T01:36:18Z","title":"AVID: Learning Multi-Stage Tasks via Pixel-Level Translation of Human Videos","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.04443","snapshot_observed_at":"2026-08-07T13:51:26.260839Z","title":"Smith, N","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2505.20795","last_updated":"2026-05-29T12:22:36Z","snapshot_observed_at":"2026-08-08T23:33:37.619713Z","submitted_at":"2025-05-27T06:56:14Z","title":"Learning Generalizable Robot Policy with Human Demonstration Video as a Prompt","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:26.260839Z"},"links":{"cited_paper":"/paper/1912.04443","citing_paper":"/paper/2505.20795"},"observation_digest":"sha256:8db87d6154439fe954673d271ab58dc7be93a2a5fc088c322b1acdcab493f20a","observation_id":"2d337009-913c-4a74-a656-5e40905d45cd","resolution":{"observed_at":"2026-08-07T13:51:26.260839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.04443","last_updated":"2020-06-21T20:16:28Z","snapshot_observed_at":"2026-07-06T08:43:17.319793Z","submitted_at":"2019-12-10T01:36:18Z","title":"AVID: Learning Multi-Stage Tasks via Pixel-Level Translation of Human Videos","version":3},"cited_work":{"arxiv_id":"1912.04443","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1912.04443","snapshot_observed_at":"2026-07-02T02:26:26.937662Z","title":"Avid: Learning multi-stage tasks via pixel-level translation of human videos","venue":null,"work_id":"c0825d84-9e71-4705-90da-50d016ea05a0","year":1912},"citing_paper":{"arxiv_id":"2507.00990","last_updated":"2026-05-13T01:35:48Z","snapshot_observed_at":"2026-07-06T21:50:35.488353Z","submitted_at":"2025-07-01T17:39:59Z","title":"Robotic Manipulation by Imitating Generated Videos Without Physical Demonstrations","version":3},"reference_index":107,"source":"pdf_text","source_observed_at":"2026-05-19T06:36:13.144868Z"},"links":{"cited_paper":"/paper/1912.04443","citing_paper":"/paper/2507.00990"},"observation_digest":"sha256:7726a75aa92f024c1eaa53a44c7fbf31c51d81820604400e9f78d5009fad8686","observation_id":"f69a72bb-c9be-40b5-a4f1-d5bc339b792b","resolution":{"observed_at":"2026-05-19T06:37:07.499088Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.04443","last_updated":"2020-06-21T20:16:28Z","snapshot_observed_at":"2026-07-06T08:43:17.319793Z","submitted_at":"2019-12-10T01:36:18Z","title":"AVID: Learning Multi-Stage Tasks via Pixel-Level Translation of Human Videos","version":3},"cited_work":{"arxiv_id":"1912.04443","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1912.04443","snapshot_observed_at":"2026-07-02T02:26:26.937662Z","title":"Avid: Learning multi-stage tasks via pixel-level translation of human videos","venue":null,"work_id":"c0825d84-9e71-4705-90da-50d016ea05a0","year":1912},"citing_paper":{"arxiv_id":"2604.04974","last_updated":"2026-06-03T17:05:28Z","snapshot_observed_at":"2026-08-05T03:49:14.637609Z","submitted_at":"2026-04-04T15:37:11Z","title":"From Video to Control: A Survey of Learning Manipulation Interfaces from Temporal Visual Data","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-05-13T17:02:18.358675Z"},"links":{"cited_paper":"/paper/1912.04443","citing_paper":"/paper/2604.04974"},"observation_digest":"sha256:0d0064a85a7b48157ae74961ecbbd05d467776050cb5323902910fb4c41ac97f","observation_id":"cfd2d52e-fea6-4740-9ea9-f480858a177f","resolution":{"observed_at":"2026-05-13T17:03:01.005282Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.04443","last_updated":"2020-06-21T20:16:28Z","snapshot_observed_at":"2026-07-06T08:43:17.319793Z","submitted_at":"2019-12-10T01:36:18Z","title":"AVID: Learning Multi-Stage Tasks via Pixel-Level Translation of Human Videos","version":3},"cited_work":{"arxiv_id":"1912.04443","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1912.04443","snapshot_observed_at":"2026-07-02T02:26:26.937662Z","title":"Avid: Learning multi-stage tasks via pixel-level translation of human videos","venue":null,"work_id":"c0825d84-9e71-4705-90da-50d016ea05a0","year":1912},"citing_paper":{"arxiv_id":"2604.07607","last_updated":"2026-07-07T17:04:24Z","snapshot_observed_at":"2026-08-10T10:03:25.795206Z","submitted_at":"2026-04-08T21:27:06Z","title":"EgoVerse: An Egocentric Human Dataset for Robot Learning from Around the World","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-10T17:07:41.489995Z"},"links":{"cited_paper":"/paper/1912.04443","citing_paper":"/paper/2604.07607"},"observation_digest":"sha256:585228956eaa4731042217bff1dae151e65a788e733d4bfd4aef0b2d36e2b4fb","observation_id":"12263698-48a1-4442-89f7-a4484a809f74","resolution":{"observed_at":"2026-05-11T07:35:56.985553Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.04443","last_updated":"2020-06-21T20:16:28Z","snapshot_observed_at":"2026-07-06T08:43:17.319793Z","submitted_at":"2019-12-10T01:36:18Z","title":"AVID: Learning Multi-Stage Tasks via Pixel-Level Translation of Human Videos","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.04443","snapshot_observed_at":"2026-07-13T08:25:22.011013Z","title":"Avid: Learning multi-stage tasks via pixel-level translation of human videos.arXiv preprint arXiv:1912.04443, 2019","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2604.07607","last_updated":"2026-07-07T17:04:24Z","snapshot_observed_at":"2026-08-10T10:03:25.795206Z","submitted_at":"2026-04-08T21:27:06Z","title":"EgoVerse: An Egocentric Human Dataset for Robot Learning from Around the World","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-13T08:25:22.011013Z"},"links":{"cited_paper":"/paper/1912.04443","citing_paper":"/paper/2604.07607"},"observation_digest":"sha256:64ae7c06c9be545992eacd69a050607c13678ccd449468e7eaaf57b0a6f3f66f","observation_id":"de5c3b6d-4c81-4b61-83b1-916bb357f3a3","resolution":{"observed_at":"2026-07-13T08:25:22.011013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.04443","last_updated":"2020-06-21T20:16:28Z","snapshot_observed_at":"2026-07-06T08:43:17.319793Z","submitted_at":"2019-12-10T01:36:18Z","title":"AVID: Learning Multi-Stage Tasks via Pixel-Level Translation of Human Videos","version":3},"cited_work":{"arxiv_id":"1912.04443","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1912.04443","snapshot_observed_at":"2026-07-02T02:26:26.937662Z","title":"Avid: Learning multi-stage tasks via pixel-level translation of human videos","venue":null,"work_id":"c0825d84-9e71-4705-90da-50d016ea05a0","year":1912},"citing_paper":{"arxiv_id":"2606.03201","last_updated":"2026-06-03T06:57:41Z","snapshot_observed_at":"2026-08-01T15:24:35.687860Z","submitted_at":"2026-06-02T06:00:15Z","title":"Reinforcement Learning from Cross-domain Videos with Video Prediction Model","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-28T10:54:49.582908Z"},"links":{"cited_paper":"/paper/1912.04443","citing_paper":"/paper/2606.03201"},"observation_digest":"sha256:bf8027bac94ddac964999cc384e0bb8ab986e1bb6fd19fda1907f0f22fd467c6","observation_id":"6abbc5bd-eaa8-43ee-b1e2-31fd4b2781e8","resolution":{"observed_at":"2026-07-02T02:26:26.939589Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/1912.04443/citation-record","integrity":"/paper/1912.04443/integrity","json":"/paper/1912.04443/citation-record.json","paper":"/paper/1912.04443"},"outbound":[],"paper":{"arxiv_id":"1912.04443","last_updated":"2020-06-21T20:16:28Z","latest_version":3,"primary_category":"cs.RO","snapshot_observed_at":"2026-07-06T08:43:17.319793Z","submitted_at":"2019-12-10T01:36:18Z","title":"AVID: Learning Multi-Stage Tasks via Pixel-Level Translation of Human Videos"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 10 inbound Pith citation observations for arXiv:1912.04443."}