{"as_of":"2026-08-17T08:23:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bd4fffd02868745afc47bcaf3193dba05ee116b6f241cadf42856138cb4904f0","coverage":[{"denominator":37,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":37,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T18:18:45.315881Z","state":"measured"},{"denominator":37,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":37,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.18382/citation-record","integrity":"/paper/2507.18382/integrity","json":"/paper/2507.18382/citation-record.json","paper":"/paper/2507.18382"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:18:44.676168Z","title":"Lan- guage2pose: Natural language grounded pose forecasting","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.18382","last_updated":"2025-07-24T12:57:22Z","snapshot_observed_at":"2026-08-15T18:10:47.274990Z","submitted_at":"2025-07-24T12:57:22Z","title":"Towards Consistent Long-Term Pose Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T18:18:44.676168Z"},"links":{"citing_paper":"/paper/2507.18382"},"observation_digest":"sha256:d654aa6dadce50e28991520dd5dc37cb05fa8ce5f9ad076c561d2e05c898eb38","observation_id":"22d58393-a99a-4860-bc76-3ff09eb381ee","resolution":{"observed_at":"2026-08-15T18:18:44.676168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:18:46.037407Z","title":"The pitfalls of next-token prediction, 2024","venue":null,"work_id":"b2d48076-4b7b-44c4-b4b5-ddf8eb0e5b1f","year":2024},"citing_paper":{"arxiv_id":"2507.18382","last_updated":"2025-07-24T12:57:22Z","snapshot_observed_at":"2026-08-15T18:10:47.274990Z","submitted_at":"2025-07-24T12:57:22Z","title":"Towards Consistent Long-Term Pose Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T18:18:44.729039Z"},"links":{"citing_paper":"/paper/2507.18382"},"observation_digest":"sha256:e9be2be6dec7d62e9f32cf180766e1c2c465c0a13fd4122a980fcd7c116aa836","observation_id":"3d480269-5183-4d54-989d-108ec5c56865","resolution":{"observed_at":"2026-08-15T18:18:46.094277Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-15T18:18:44.732895Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2507.18382","last_updated":"2025-07-24T12:57:22Z","snapshot_observed_at":"2026-08-15T18:10:47.274990Z","submitted_at":"2025-07-24T12:57:22Z","title":"Towards Consistent Long-Term Pose Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T18:18:44.732895Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2507.18382"},"observation_digest":"sha256:79d130234a7a023d9bc4ce9aa82172829e365d8917cefb7ccc6846abe69116e3","observation_id":"91dc1fa3-08e1-43a2-9518-d52823b5c425","resolution":{"observed_at":"2026-08-15T18:18:44.732895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:18:45.917169Z","title":"Realtime multi-person 2d pose estimation using part affinity fields","venue":null,"work_id":"347dfe82-094c-4099-9550-c3d170c8b8af","year":2017},"citing_paper":{"arxiv_id":"2507.18382","last_updated":"2025-07-24T12:57:22Z","snapshot_observed_at":"2026-08-15T18:10:47.274990Z","submitted_at":"2025-07-24T12:57:22Z","title":"Towards Consistent Long-Term Pose Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T18:18:44.737744Z"},"links":{"citing_paper":"/paper/2507.18382"},"observation_digest":"sha256:b2460ffb200212f937d2a69ee1cbe9df7d8f08f8f1439855bf18efa81a4a4b46","observation_id":"e9fd722d-3736-4a4c-8838-2b3ec58c4222","resolution":{"observed_at":"2026-08-15T18:18:45.973008Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2007.03672","last_updated":"2020-07-31T17:23:11Z","snapshot_observed_at":"2026-08-03T22:54:10.106647Z","submitted_at":"2020-07-07T17:59:53Z","title":"Long-term Human Motion Prediction with Scene Context","version":3},"cited_work":{"arxiv_id":"2007.03672","doi":null,"metadata_source":"pith","pith_arxiv_id":"2007.03672","snapshot_observed_at":"2026-08-15T18:18:45.409662Z","title":"Long-term Human Motion Prediction with Scene Context","venue":"cs.CV","work_id":"c66a9167-ea37-4e03-8874-c862faf99e36","year":2020},"citing_paper":{"arxiv_id":"2507.18382","last_updated":"2025-07-24T12:57:22Z","snapshot_observed_at":"2026-08-15T18:10:47.274990Z","submitted_at":"2025-07-24T12:57:22Z","title":"Towards Consistent Long-Term Pose Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T18:18:44.741648Z"},"links":{"cited_paper":"/paper/2007.03672","citing_paper":"/paper/2507.18382"},"observation_digest":"sha256:54979241c6a40f4f8e305ee023b8aa1e1e4862ac257b7182358e33d3b1b2e521","observation_id":"3f709893-89dd-48bb-ab66-8a66453aebaf","resolution":{"observed_at":"2026-08-15T18:18:45.415574Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:18:45.873976Z","title":"Forecasting human dynamics from static images","venue":null,"work_id":"0782ef52-1e0c-4748-a0b5-97b0b61fa57f","year":2017},"citing_paper":{"arxiv_id":"2507.18382","last_updated":"2025-07-24T12:57:22Z","snapshot_observed_at":"2026-08-15T18:10:47.274990Z","submitted_at":"2025-07-24T12:57:22Z","title":"Towards Consistent Long-Term Pose Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T18:18:44.745398Z"},"links":{"citing_paper":"/paper/2507.18382"},"observation_digest":"sha256:d052a8b389dc7cc7a5e42899b7de6aadba64ce49813d05913c2672b2e19fbb2f","observation_id":"f57584a0-ecc2-4a9e-9bbb-61bb7148ade0","resolution":{"observed_at":"2026-08-15T18:18:45.877731Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:18:45.862905Z","title":"Humanmac: Masked motion completion for human motion prediction","venue":null,"work_id":"9bc07270-7851-49f9-9879-e5baba0d189f","year":2023},"citing_paper":{"arxiv_id":"2507.18382","last_updated":"2025-07-24T12:57:22Z","snapshot_observed_at":"2026-08-15T18:10:47.274990Z","submitted_at":"2025-07-24T12:57:22Z","title":"Towards Consistent Long-Term Pose Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T18:18:44.748713Z"},"links":{"citing_paper":"/paper/2507.18382"},"observation_digest":"sha256:a7cedf5f09f627533d80a555a0aac2b807c34c36d48c559d6a654a36209fc314","observation_id":"e47854b9-a4c0-47ed-8e07-d5d72ac0d089","resolution":{"observed_at":"2026-08-15T18:18:45.866728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:18:45.852319Z","title":"Action-agnostic human pose fore- casting","venue":null,"work_id":"029b7be5-6038-469c-9a90-946fcea28cad","year":2019},"citing_paper":{"arxiv_id":"2507.18382","last_updated":"2025-07-24T12:57:22Z","snapshot_observed_at":"2026-08-15T18:10:47.274990Z","submitted_at":"2025-07-24T12:57:22Z","title":"Towards Consistent Long-Term Pose Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T18:18:44.752730Z"},"links":{"citing_paper":"/paper/2507.18382"},"observation_digest":"sha256:a6a87f20f79aa1e6daac7ac7131d0a7db96aaff379d3f3614c40f28adffca79f","observation_id":"be81cf9c-23fc-4d0f-ada8-e054c62edd57","resolution":{"observed_at":"2026-08-15T18:18:45.856016Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:18:45.841874Z","title":"Genhowto: Learning to generate actions and state trans- formations from instructional videos","venue":null,"work_id":"0058bd48-9b8e-4ea9-b842-5a29b86b01bf","year":2024},"citing_paper":{"arxiv_id":"2507.18382","last_updated":"2025-07-24T12:57:22Z","snapshot_observed_at":"2026-08-15T18:10:47.274990Z","submitted_at":"2025-07-24T12:57:22Z","title":"Towards Consistent Long-Term Pose Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T18:18:44.768788Z"},"links":{"citing_paper":"/paper/2507.18382"},"observation_digest":"sha256:24c9115c981cdd9b53b415ddc9c63a91a347e4527bdf9c780dbbf15b1a55ad6b","observation_id":"41f9baa5-e2d1-4d8b-9563-37133fead41b","resolution":{"observed_at":"2026-08-15T18:18:45.845287Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18654","last_updated":"2023-10-31T16:35:07Z","snapshot_observed_at":"2026-08-16T15:28:31.336480Z","submitted_at":"2023-05-29T23:24:14Z","title":"Faith and Fate: Limits of Transformers on Compositionality","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18654","snapshot_observed_at":"2026-08-15T18:18:44.837400Z","title":"Hwang, Soumya Sanyal, Sean Welleck, Xiang Ren, Allyson Ettinger, Za¨ıd Harchaoui, and Yejin Choi","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.18382","last_updated":"2025-07-24T12:57:22Z","snapshot_observed_at":"2026-08-15T18:10:47.274990Z","submitted_at":"2025-07-24T12:57:22Z","title":"Towards Consistent Long-Term Pose Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T18:18:44.837400Z"},"links":{"cited_paper":"/paper/2305.18654","citing_paper":"/paper/2507.18382"},"observation_digest":"sha256:b71b0b04d14eba437106dc3cd1c7bae57ad4b6cbdb0d3f0dbb93f321e7a35075","observation_id":"4c825746-d78a-463a-a21a-3eec9a29eaf7","resolution":{"observed_at":"2026-08-15T18:18:44.837400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:18:45.830214Z","title":null,"venue":null,"work_id":"6add2787-ead8-4f56-ba58-5706e5f944e3","year":2024},"citing_paper":{"arxiv_id":"2507.18382","last_updated":"2025-07-24T12:57:22Z","snapshot_observed_at":"2026-08-15T18:10:47.274990Z","submitted_at":"2025-07-24T12:57:22Z","title":"Towards Consistent Long-Term Pose Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T18:18:44.893276Z"},"links":{"citing_paper":"/paper/2507.18382"},"observation_digest":"sha256:73167c0e3e9ee22995394f151270c60c4cb5bfd46c09cd17a1acf236b4f4cb70","observation_id":"7ac73173-bdde-45e7-b1e3-d3da58452a8c","resolution":{"observed_at":"2026-08-15T18:18:45.834523Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:18:44.936177Z","title":"Recurrent network models for human dynam- ics","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.18382","last_updated":"2025-07-24T12:57:22Z","snapshot_observed_at":"2026-08-15T18:10:47.274990Z","submitted_at":"2025-07-24T12:57:22Z","title":"Towards Consistent Long-Term Pose Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T18:18:44.936177Z"},"links":{"citing_paper":"/paper/2507.18382"},"observation_digest":"sha256:809c932e51fee3964955ebec85aaba27699d400a16e093fd1b114fd43703d12d","observation_id":"85f3f0e2-fd6f-46e4-ad6f-98e6c93bc7c3","resolution":{"observed_at":"2026-08-15T18:18:44.936177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:18:45.812711Z","title":"Future pose pre- diction from 3d human skeleton sequence with surrounding situation","venue":null,"work_id":"e17f3f1c-de15-4884-85f0-06df77a77f68","year":2023},"citing_paper":{"arxiv_id":"2507.18382","last_updated":"2025-07-24T12:57:22Z","snapshot_observed_at":"2026-08-15T18:10:47.274990Z","submitted_at":"2025-07-24T12:57:22Z","title":"Towards Consistent Long-Term Pose Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T18:18:44.940067Z"},"links":{"citing_paper":"/paper/2507.18382"},"observation_digest":"sha256:005c3bc40e8f7c8b934febd7328a63e2858cc6074fc21ede8100044ce019a9a7","observation_id":"c8e171b6-2d7f-45a7-9912-bb187aec3aae","resolution":{"observed_at":"2026-08-15T18:18:45.816408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:18:45.800954Z","title":"First-person hand action bench- mark with rgb-d videos and 3d hand pose annotations","venue":null,"work_id":"b1c61755-9dbb-4415-b76c-d07070648624","year":2018},"citing_paper":{"arxiv_id":"2507.18382","last_updated":"2025-07-24T12:57:22Z","snapshot_observed_at":"2026-08-15T18:10:47.274990Z","submitted_at":"2025-07-24T12:57:22Z","title":"Towards Consistent Long-Term Pose Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T18:18:44.943277Z"},"links":{"citing_paper":"/paper/2507.18382"},"observation_digest":"sha256:d43d8cc11c8d2ebe86054f3e5ec51a2ce8a5f8c535dc26d12cf6cf2d3bf06dee","observation_id":"8a784d32-1eeb-403d-a78e-22388afef91a","resolution":{"observed_at":"2026-08-15T18:18:45.804769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:18:45.718928Z","title":"Tm2d: Bimodality driven 3d dance generation via music-text integration","venue":null,"work_id":"55066c43-60c2-4c36-87b6-7531a21d815f","year":null},"citing_paper":{"arxiv_id":"2507.18382","last_updated":"2025-07-24T12:57:22Z","snapshot_observed_at":"2026-08-15T18:10:47.274990Z","submitted_at":"2025-07-24T12:57:22Z","title":"Towards Consistent Long-Term Pose Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T18:18:44.946877Z"},"links":{"citing_paper":"/paper/2507.18382"},"observation_digest":"sha256:ffbcc963dd00db4ca451554c1f3593d93e3b43a7dc3bef1136785f2b5db73ab7","observation_id":"d962fd3c-7a9d-416d-bca2-c2654c628d63","resolution":{"observed_at":"2026-08-15T18:18:45.793700Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:18:45.677394Z","title":"Ac- tion2motion: Conditioned generation of 3d human motions","venue":null,"work_id":"40c1ac05-af08-487a-8dc4-19a6bd6737e2","year":2021},"citing_paper":{"arxiv_id":"2507.18382","last_updated":"2025-07-24T12:57:22Z","snapshot_observed_at":"2026-08-15T18:10:47.274990Z","submitted_at":"2025-07-24T12:57:22Z","title":"Towards Consistent Long-Term Pose Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T18:18:44.950578Z"},"links":{"citing_paper":"/paper/2507.18382"},"observation_digest":"sha256:ef7d88fb13aed65f79debdc0c6773c37fe7dca8a7bd54a3815db3c977794d34a","observation_id":"3b427560-9e6a-4620-8801-7a9fa6ce1a4b","resolution":{"observed_at":"2026-08-15T18:18:45.680876Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:18:45.667060Z","title":"Tm2t: Stochastic and tokenized modeling for the reciprocal genera- tion of 3d human motions and texts","venue":null,"work_id":"cff36ed7-e862-47a7-a427-55dee4600dc1","year":2022},"citing_paper":{"arxiv_id":"2507.18382","last_updated":"2025-07-24T12:57:22Z","snapshot_observed_at":"2026-08-15T18:10:47.274990Z","submitted_at":"2025-07-24T12:57:22Z","title":"Towards Consistent Long-Term Pose Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T18:18:44.953380Z"},"links":{"citing_paper":"/paper/2507.18382"},"observation_digest":"sha256:f10b9d7c3861b36c5c3d28760c094e56cb5c5aa37d284ba321b96d11b3a1cd8f","observation_id":"84ad989d-8051-4484-8e63-83a552aff8d2","resolution":{"observed_at":"2026-08-15T18:18:45.670259Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:18:44.957188Z","title":"Momask: Generative masked model- ing of 3d human motions","venue":null,"work_id":null,"year":1900},"citing_paper":{"arxiv_id":"2507.18382","last_updated":"2025-07-24T12:57:22Z","snapshot_observed_at":"2026-08-15T18:10:47.274990Z","submitted_at":"2025-07-24T12:57:22Z","title":"Towards Consistent Long-Term Pose Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T18:18:44.957188Z"},"links":{"citing_paper":"/paper/2507.18382"},"observation_digest":"sha256:01da6064692b0528421a7582311a561f6dde8c9dc489289711e77aa8cbefebb3","observation_id":"76234b6f-a788-4771-8bd6-15bd5d7ab8d2","resolution":{"observed_at":"2026-08-15T18:18:44.957188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:18:44.961077Z","title":"Long short-term memory","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2507.18382","last_updated":"2025-07-24T12:57:22Z","snapshot_observed_at":"2026-08-15T18:10:47.274990Z","submitted_at":"2025-07-24T12:57:22Z","title":"Towards Consistent Long-Term Pose Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T18:18:44.961077Z"},"links":{"citing_paper":"/paper/2507.18382"},"observation_digest":"sha256:c71acc693b54a19d0b2d2d252880a7ccca3ab78d5b14a17326cd4c98a6558b9f","observation_id":"20aaef7d-cfd7-4edf-9261-136396bf9b2a","resolution":{"observed_at":"2026-08-15T18:18:44.961077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:18:44.965817Z","title":"Diffusion- based generation, optimization, and planning in 3d scenes","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.18382","last_updated":"2025-07-24T12:57:22Z","snapshot_observed_at":"2026-08-15T18:10:47.274990Z","submitted_at":"2025-07-24T12:57:22Z","title":"Towards Consistent Long-Term Pose Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T18:18:44.965817Z"},"links":{"citing_paper":"/paper/2507.18382"},"observation_digest":"sha256:c99ab67fa81ca2766333949c3928bb187a665f2fb7322d1392b33791843909f6","observation_id":"ca8a1e7e-3750-4918-93b9-502cde8a25ce","resolution":{"observed_at":"2026-08-15T18:18:44.965817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.03849","last_updated":"2024-03-22T05:03:34Z","snapshot_observed_at":"2026-08-16T14:37:02.394146Z","submitted_at":"2023-12-06T19:02:40Z","title":"LEGO: Learning EGOcentric Action Frame Generation via Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.03849","snapshot_observed_at":"2026-08-15T18:18:44.970271Z","title":"Lego: Learning egocentric action frame generation via visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.18382","last_updated":"2025-07-24T12:57:22Z","snapshot_observed_at":"2026-08-15T18:10:47.274990Z","submitted_at":"2025-07-24T12:57:22Z","title":"Towards Consistent Long-Term Pose Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T18:18:44.970271Z"},"links":{"cited_paper":"/paper/2312.03849","citing_paper":"/paper/2507.18382"},"observation_digest":"sha256:7d7ba12608e48202ab8288e1bb7567befcc40eb47d248eefac28e02755347a9e","observation_id":"654b0d5c-34eb-461b-b940-d52fa7fe0ad5","resolution":{"observed_at":"2026-08-15T18:18:44.970271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.02001","last_updated":"2019-11-05T18:56:15Z","snapshot_observed_at":"2026-08-15T00:33:12.854837Z","submitted_at":"2019-11-05T18:56:15Z","title":"Dancing to Music","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.02001","snapshot_observed_at":"2026-08-15T18:18:44.973513Z","title":"Dancing to music","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2507.18382","last_updated":"2025-07-24T12:57:22Z","snapshot_observed_at":"2026-08-15T18:10:47.274990Z","submitted_at":"2025-07-24T12:57:22Z","title":"Towards Consistent Long-Term Pose Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T18:18:44.973513Z"},"links":{"cited_paper":"/paper/1911.02001","citing_paper":"/paper/2507.18382"},"observation_digest":"sha256:b6b929ea86c5039f7fb0b131a00a87646212ba2e64dc38d0d8dd7ca645ac7ea0","observation_id":"b035f630-5cd1-419d-b226-60e06bdc1ec5","resolution":{"observed_at":"2026-08-15T18:18:44.973513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:18:44.977504Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.18382","last_updated":"2025-07-24T12:57:22Z","snapshot_observed_at":"2026-08-15T18:10:47.274990Z","submitted_at":"2025-07-24T12:57:22Z","title":"Towards Consistent Long-Term Pose Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T18:18:44.977504Z"},"links":{"citing_paper":"/paper/2507.18382"},"observation_digest":"sha256:345ab520ee822666cfa36f3b16382dde0a663de89275216bb4666174cb7a9b78","observation_id":"f7c26d11-9268-499f-ba89-c52190040ee4","resolution":{"observed_at":"2026-08-15T18:18:44.977504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11838","last_updated":"2024-11-01T14:45:36Z","snapshot_observed_at":"2026-08-16T13:42:07.461220Z","submitted_at":"2024-06-17T17:59:58Z","title":"Autoregressive Image Generation without Vector Quantization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11838","snapshot_observed_at":"2026-08-15T18:18:44.981541Z","title":"Autoregressive image generation without vec- tor quantization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.18382","last_updated":"2025-07-24T12:57:22Z","snapshot_observed_at":"2026-08-15T18:10:47.274990Z","submitted_at":"2025-07-24T12:57:22Z","title":"Towards Consistent Long-Term Pose Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T18:18:44.981541Z"},"links":{"cited_paper":"/paper/2406.11838","citing_paper":"/paper/2507.18382"},"observation_digest":"sha256:8f9d935bf9de6138c8b2dda108fff1273dfd1ed223c2709840c4717db6c44d76","observation_id":"ed6387ff-48af-4500-b07c-ca585ec6ba79","resolution":{"observed_at":"2026-08-15T18:18:44.981541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.08172","last_updated":"2019-06-14T05:49:22Z","snapshot_observed_at":"2026-08-15T17:22:09.610128Z","submitted_at":"2019-06-14T05:49:22Z","title":"MediaPipe: A Framework for Building Perception Pipelines","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.08172","snapshot_observed_at":"2026-08-15T18:18:44.985960Z","title":"Medi- apipe: A framework for building perception pipelines","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2507.18382","last_updated":"2025-07-24T12:57:22Z","snapshot_observed_at":"2026-08-15T18:10:47.274990Z","submitted_at":"2025-07-24T12:57:22Z","title":"Towards Consistent Long-Term Pose Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T18:18:44.985960Z"},"links":{"cited_paper":"/paper/1906.08172","citing_paper":"/paper/2507.18382"},"observation_digest":"sha256:d654874be6d94a8de991cb036877dac34cd0d8dd0ffb026fb3660dff70894b30","observation_id":"de5db901-aeab-44d5-88d2-35adf9be74a7","resolution":{"observed_at":"2026-08-15T18:18:44.985960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.15709","last_updated":"2024-09-14T02:54:11Z","snapshot_observed_at":"2026-08-16T14:07:10.234925Z","submitted_at":"2024-03-23T04:08:39Z","title":"Contact-aware Human Motion Generation from Textual Descriptions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.15709","snapshot_observed_at":"2026-08-15T18:18:44.989416Z","title":"Contact-aware human motion generation from textual de- scriptions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.18382","last_updated":"2025-07-24T12:57:22Z","snapshot_observed_at":"2026-08-15T18:10:47.274990Z","submitted_at":"2025-07-24T12:57:22Z","title":"Towards Consistent Long-Term Pose Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T18:18:44.989416Z"},"links":{"cited_paper":"/paper/2403.15709","citing_paper":"/paper/2507.18382"},"observation_digest":"sha256:1c9a63058a6e6070a732a48ef97810d80efb0feac29c0ec752475e2fb29920f5","observation_id":"fea7b1e8-e66d-49a8-a296-83048db77915","resolution":{"observed_at":"2026-08-15T18:18:44.989416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:18:45.629689Z","title":"Action- conditioned 3d human motion synthesis with transformer vae","venue":null,"work_id":"3cb0a764-deea-4372-9d58-fdcbf191f917","year":2021},"citing_paper":{"arxiv_id":"2507.18382","last_updated":"2025-07-24T12:57:22Z","snapshot_observed_at":"2026-08-15T18:10:47.274990Z","submitted_at":"2025-07-24T12:57:22Z","title":"Towards Consistent Long-Term Pose Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T18:18:44.993367Z"},"links":{"citing_paper":"/paper/2507.18382"},"observation_digest":"sha256:f9b29eb6a78aab70241da1cc4b657de2e19a9303970cbe31287aa1baf9e4628b","observation_id":"17efa7d4-33db-4461-aedf-dc189f54dcec","resolution":{"observed_at":"2026-08-15T18:18:45.634741Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:18:45.618513Z","title":"What matters in learning from of- fline human demonstrations for robot manipulation","venue":null,"work_id":"3216bac8-3805-4f82-a40e-28ff4124a0e6","year":2022},"citing_paper":{"arxiv_id":"2507.18382","last_updated":"2025-07-24T12:57:22Z","snapshot_observed_at":"2026-08-15T18:10:47.274990Z","submitted_at":"2025-07-24T12:57:22Z","title":"Towards Consistent Long-Term Pose Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T18:18:44.997812Z"},"links":{"citing_paper":"/paper/2507.18382"},"observation_digest":"sha256:f5827265bd5548c3b9adbab2bc56db72af216202171ab96aca6a87dfe050def2","observation_id":"d363ea29-e6f9-411d-8d9a-efba4feb091a","resolution":{"observed_at":"2026-08-15T18:18:45.622516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:18:45.606647Z","title":"Bigram-based nat- ural language model and statistical motion symbol model for scalable language of humanoid robots","venue":null,"work_id":"ae4f3b73-0b59-4e98-b92a-b43cbbfd31fd","year":2012},"citing_paper":{"arxiv_id":"2507.18382","last_updated":"2025-07-24T12:57:22Z","snapshot_observed_at":"2026-08-15T18:10:47.274990Z","submitted_at":"2025-07-24T12:57:22Z","title":"Towards Consistent Long-Term Pose Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T18:18:45.001434Z"},"links":{"citing_paper":"/paper/2507.18382"},"observation_digest":"sha256:110ae3ec558fcce70ecf8b68b557f6ed16760fa5959d5bc20f9b2892f81961b1","observation_id":"2ff0a9ac-2df0-4435-a79a-23ecff90f565","resolution":{"observed_at":"2026-08-15T18:18:45.610632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:18:45.494395Z","title":"Statistical mu- tual conversion between whole body motion primitives and linguistic sentences for human motions","venue":null,"work_id":"901b4955-8b7a-41de-96c6-d3e8087cd1a1","year":2015},"citing_paper":{"arxiv_id":"2507.18382","last_updated":"2025-07-24T12:57:22Z","snapshot_observed_at":"2026-08-15T18:10:47.274990Z","submitted_at":"2025-07-24T12:57:22Z","title":"Towards Consistent Long-Term Pose Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T18:18:45.006734Z"},"links":{"citing_paper":"/paper/2507.18382"},"observation_digest":"sha256:7fb806cd2155b67719d8e8eef6335b61eac29f3d76e44e204545d244f381dbe9","observation_id":"85077765-de39-4eee-a7e2-5a814baae08a","resolution":{"observed_at":"2026-08-15T18:18:45.577023Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:18:45.010059Z","title":"Human motion diffu- sion model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.18382","last_updated":"2025-07-24T12:57:22Z","snapshot_observed_at":"2026-08-15T18:10:47.274990Z","submitted_at":"2025-07-24T12:57:22Z","title":"Towards Consistent Long-Term Pose Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T18:18:45.010059Z"},"links":{"citing_paper":"/paper/2507.18382"},"observation_digest":"sha256:04528e89ce7db431a6a7a27b44341707da0905d7c83560bb367b8f3fc847b2b6","observation_id":"da6e4c50-7b29-43eb-bf45-11c9bbaa4126","resolution":{"observed_at":"2026-08-15T18:18:45.010059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:18:45.074535Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.18382","last_updated":"2025-07-24T12:57:22Z","snapshot_observed_at":"2026-08-15T18:10:47.274990Z","submitted_at":"2025-07-24T12:57:22Z","title":"Towards Consistent Long-Term Pose Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T18:18:45.074535Z"},"links":{"citing_paper":"/paper/2507.18382"},"observation_digest":"sha256:5f74f6c2c25d3b470d01ca4d348b7ba7c90133a4a81d4e48ade63cb313ce9a43","observation_id":"7d66f039-5ff3-463c-9b8d-41f238abb8f4","resolution":{"observed_at":"2026-08-15T18:18:45.074535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:18:45.123180Z","title":"Synthesizing long-term 3d human motion and in- teraction in 3d scenes","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.18382","last_updated":"2025-07-24T12:57:22Z","snapshot_observed_at":"2026-08-15T18:10:47.274990Z","submitted_at":"2025-07-24T12:57:22Z","title":"Towards Consistent Long-Term Pose Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T18:18:45.123180Z"},"links":{"citing_paper":"/paper/2507.18382"},"observation_digest":"sha256:c1affb7b56127446228d9abb8c3af732bd8b6f4f8326315493111e0e8a5db1e5","observation_id":"02c654ab-a30d-47c0-93a5-999e76b7b154","resolution":{"observed_at":"2026-08-15T18:18:45.123180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:18:45.465664Z","title":"Humanise: Language-conditioned hu- man motion generation in 3d scenes","venue":null,"work_id":"9e3a3882-8cbc-497b-9438-b4753e2bf74d","year":2022},"citing_paper":{"arxiv_id":"2507.18382","last_updated":"2025-07-24T12:57:22Z","snapshot_observed_at":"2026-08-15T18:10:47.274990Z","submitted_at":"2025-07-24T12:57:22Z","title":"Towards Consistent Long-Term Pose Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T18:18:45.172477Z"},"links":{"citing_paper":"/paper/2507.18382"},"observation_digest":"sha256:037f5686923da147a46bcadfdee21d297c66290c556e635ebacdf8e17ca2840b","observation_id":"c1c230e1-c9fd-4b91-a554-5eb0910194f0","resolution":{"observed_at":"2026-08-15T18:18:45.469235Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:18:45.454225Z","title":"Move as you say, interact as you can: Language-guided human motion generation with scene af- fordance","venue":null,"work_id":"351926cd-0d86-4a05-b7fe-2990c029536b","year":2024},"citing_paper":{"arxiv_id":"2507.18382","last_updated":"2025-07-24T12:57:22Z","snapshot_observed_at":"2026-08-15T18:10:47.274990Z","submitted_at":"2025-07-24T12:57:22Z","title":"Towards Consistent Long-Term Pose Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T18:18:45.215989Z"},"links":{"citing_paper":"/paper/2507.18382"},"observation_digest":"sha256:1df918c78cde2dec6e0c8d36266af77611056bc9de67efb7389488fe231670eb","observation_id":"d2a1d716-e101-4728-a9e5-20752766b80a","resolution":{"observed_at":"2026-08-15T18:18:45.459165Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:18:45.443873Z","title":"Predicting 3d human dynamics from video","venue":null,"work_id":"9f45e5a0-9ad7-47e4-be2f-5ba9a956a89b","year":2019},"citing_paper":{"arxiv_id":"2507.18382","last_updated":"2025-07-24T12:57:22Z","snapshot_observed_at":"2026-08-15T18:10:47.274990Z","submitted_at":"2025-07-24T12:57:22Z","title":"Towards Consistent Long-Term Pose Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T18:18:45.264261Z"},"links":{"citing_paper":"/paper/2507.18382"},"observation_digest":"sha256:4403636572ef05b177b324d467c3dcb47eb22b5eabfbd5259a2420f4eb6bda09","observation_id":"d58b674d-042c-44c9-9764-b7a9c0b987ce","resolution":{"observed_at":"2026-08-15T18:18:45.447338Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:18:45.433776Z","title":"From actemes to action: A strongly-supervised representa- tion for detailed action understanding","venue":null,"work_id":"7d277c09-d791-46a4-b2d5-b692b45a12f3","year":2013},"citing_paper":{"arxiv_id":"2507.18382","last_updated":"2025-07-24T12:57:22Z","snapshot_observed_at":"2026-08-15T18:10:47.274990Z","submitted_at":"2025-07-24T12:57:22Z","title":"Towards Consistent Long-Term Pose Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T18:18:45.315881Z"},"links":{"citing_paper":"/paper/2507.18382"},"observation_digest":"sha256:e53d06f7bc0ccc892b6a6991fbcfcea7c72fed3dba43b1b1b7604fd55bbeb77c","observation_id":"8478f8a4-1349-4bb2-b8ef-6b5702d6d3c6","resolution":{"observed_at":"2026-08-15T18:18:45.437452Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.18382","last_updated":"2025-07-24T12:57:22Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T18:10:47.274990Z","submitted_at":"2025-07-24T12:57:22Z","title":"Towards Consistent Long-Term Pose Generation"},"reference_resolution":{"displayed":37,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":17,"verified_exact":1,"verified_fuzzy":19},"total_outbound_references":37},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 37 of 37 outbound references and 0 inbound Pith citation observations for arXiv:2507.18382."}