{"as_of":"2026-08-09T16:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:39407f897772db1a148239a4d490672f12115b82e9423659d04ad67750358193","coverage":[{"denominator":75,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":75,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T19:11:53.734059Z","state":"measured"},{"denominator":75,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":75,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2512.01803/citation-record","integrity":"/paper/2512.01803/integrity","json":"/paper/2512.01803/citation-record.json","paper":"/paper/2512.01803"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-03T19:11:46.924977Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.01803","last_updated":"2026-07-09T15:41:25Z","snapshot_observed_at":"2026-08-08T13:02:50.552789Z","submitted_at":"2025-12-01T15:36:33Z","title":"Generative Action Tell-Tales: Assessing Human Motion in Synthesized Videos","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T19:11:46.924977Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2512.01803"},"observation_digest":"sha256:388963c4553e142e68359029a7efefd5c1bb58c155755b0fbff62888c9aa121f","observation_id":"1e46809d-9a70-4797-8241-4deec7e0a2f4","resolution":{"observed_at":"2026-08-03T19:11:46.924977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:11:46.936018Z","title":"Kuhl, and Andrew N","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2512.01803","last_updated":"2026-07-09T15:41:25Z","snapshot_observed_at":"2026-08-08T13:02:50.552789Z","submitted_at":"2025-12-01T15:36:33Z","title":"Generative Action Tell-Tales: Assessing Human Motion in Synthesized Videos","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T19:11:46.936018Z"},"links":{"citing_paper":"/paper/2512.01803"},"observation_digest":"sha256:68794334b713ac1cbf363d725f25c0b38d7553da26cad855b787f0783588ad47","observation_id":"cec854e2-bc4f-4449-ab7d-2197fe791e67","resolution":{"observed_at":"2026-08-03T19:11:46.936018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00209","last_updated":"2025-04-30T22:34:52Z","snapshot_observed_at":"2026-08-07T15:57:31.572760Z","submitted_at":"2025-04-30T22:34:52Z","title":"Direct Motion Models for Assessing Generated Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.00209","snapshot_observed_at":"2026-08-03T19:11:46.950833Z","title":"Di- rect motion models for assessing generated videos.arXiv preprint arXiv:2505.00209, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.01803","last_updated":"2026-07-09T15:41:25Z","snapshot_observed_at":"2026-08-08T13:02:50.552789Z","submitted_at":"2025-12-01T15:36:33Z","title":"Generative Action Tell-Tales: Assessing Human Motion in Synthesized Videos","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T19:11:46.950833Z"},"links":{"cited_paper":"/paper/2505.00209","citing_paper":"/paper/2512.01803"},"observation_digest":"sha256:a809c9eade3ab290eae683602065c485760e47f5174ba8f260ec138310a89dab","observation_id":"59607d16-5b2f-462f-918f-99517183df23","resolution":{"observed_at":"2026-08-03T19:11:46.950833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:11:46.975768Z","title":"Amazon mechanical turk","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.01803","last_updated":"2026-07-09T15:41:25Z","snapshot_observed_at":"2026-08-08T13:02:50.552789Z","submitted_at":"2025-12-01T15:36:33Z","title":"Generative Action Tell-Tales: Assessing Human Motion in Synthesized Videos","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T19:11:46.975768Z"},"links":{"citing_paper":"/paper/2512.01803"},"observation_digest":"sha256:6601410b51ede6f6d33da826ec9e7fd4616dbe14df96961f719514fb00116f30","observation_id":"0f0ed7be-d989-412e-9c13-08e3cb8f61f2","resolution":{"observed_at":"2026-08-03T19:11:46.975768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10675","last_updated":"2023-05-30T05:00:37Z","snapshot_observed_at":"2026-08-06T02:25:15.479376Z","submitted_at":"2023-05-18T03:26:37Z","title":"Tuned Contrastive Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10675","snapshot_observed_at":"2026-08-03T19:11:47.001331Z","title":"Tuned con- trastive learning.arXiv preprint arXiv:2305.10675, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.01803","last_updated":"2026-07-09T15:41:25Z","snapshot_observed_at":"2026-08-08T13:02:50.552789Z","submitted_at":"2025-12-01T15:36:33Z","title":"Generative Action Tell-Tales: Assessing Human Motion in Synthesized Videos","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T19:11:47.001331Z"},"links":{"cited_paper":"/paper/2305.10675","citing_paper":"/paper/2512.01803"},"observation_digest":"sha256:585fb4870e88dfbb478a2a8f3abdc758a22214d4e201d296735073b3789a83f8","observation_id":"ea4f46b7-d3c0-41f7-9241-ebeb7ed20db7","resolution":{"observed_at":"2026-08-03T19:11:47.001331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03520","last_updated":"2024-10-03T17:24:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-05T17:53:55Z","title":"VideoPhy: Evaluating Physical Commonsense for Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.03520","snapshot_observed_at":"2026-08-03T19:11:47.027687Z","title":"Videophy: Evaluating physical commonsense for video generation.arXiv preprint arXiv:2406.03520, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.01803","last_updated":"2026-07-09T15:41:25Z","snapshot_observed_at":"2026-08-08T13:02:50.552789Z","submitted_at":"2025-12-01T15:36:33Z","title":"Generative Action Tell-Tales: Assessing Human Motion in Synthesized Videos","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T19:11:47.027687Z"},"links":{"cited_paper":"/paper/2406.03520","citing_paper":"/paper/2512.01803"},"observation_digest":"sha256:b1d4065660833abbfa228a42fc66487ae03295a490131892588512efbba6c389","observation_id":"ac3a21d3-1f39-47b5-8bff-d9548f411574","resolution":{"observed_at":"2026-08-03T19:11:47.027687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06800","last_updated":"2025-03-09T22:49:12Z","snapshot_observed_at":"2026-08-07T17:18:26.824890Z","submitted_at":"2025-03-09T22:49:12Z","title":"VideoPhy-2: A Challenging Action-Centric Physical Commonsense Evaluation in Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06800","snapshot_observed_at":"2026-08-03T19:11:47.098371Z","title":"Videophy-2: A challenging action-centric physical commonsense evaluation in video generation.arXiv preprint arXiv:2503.06800, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.01803","last_updated":"2026-07-09T15:41:25Z","snapshot_observed_at":"2026-08-08T13:02:50.552789Z","submitted_at":"2025-12-01T15:36:33Z","title":"Generative Action Tell-Tales: Assessing Human Motion in Synthesized Videos","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T19:11:47.098371Z"},"links":{"cited_paper":"/paper/2503.06800","citing_paper":"/paper/2512.01803"},"observation_digest":"sha256:1f2fc05bfaad0c1da4931e2ec76261d215418568741feef83d75cd32891693ac","observation_id":"2eaf1f6a-91c2-4d27-b10a-c018831d97ce","resolution":{"observed_at":"2026-08-03T19:11:47.098371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:11:47.207680Z","title":"Row, Peterson and Company, 1954","venue":null,"work_id":null,"year":1954},"citing_paper":{"arxiv_id":"2512.01803","last_updated":"2026-07-09T15:41:25Z","snapshot_observed_at":"2026-08-08T13:02:50.552789Z","submitted_at":"2025-12-01T15:36:33Z","title":"Generative Action Tell-Tales: Assessing Human Motion in Synthesized Videos","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T19:11:47.207680Z"},"links":{"citing_paper":"/paper/2512.01803"},"observation_digest":"sha256:6fe50147bfb8af4e55510d955311cd037855e580ea9c1fa1bbeb035f5ab1e84a","observation_id":"0fed9fdb-09e6-4a5d-bc6a-d92ba2d409a3","resolution":{"observed_at":"2026-08-03T19:11:47.207680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:11:47.282773Z","title":"Is space-time attention all you need for video understanding? International Conference on Machine Learning, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.01803","last_updated":"2026-07-09T15:41:25Z","snapshot_observed_at":"2026-08-08T13:02:50.552789Z","submitted_at":"2025-12-01T15:36:33Z","title":"Generative Action Tell-Tales: Assessing Human Motion in Synthesized Videos","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T19:11:47.282773Z"},"links":{"citing_paper":"/paper/2512.01803"},"observation_digest":"sha256:8691cf15175a2346ea2e057878672c0f6f05e2b22950ce72cedcd9adbb5d31ea","observation_id":"63523bea-8c2e-42cd-9b41-bfc3e3ca089e","resolution":{"observed_at":"2026-08-03T19:11:47.282773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-03T19:11:47.374210Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets.arXiv preprint arXiv:2311.15127, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.01803","last_updated":"2026-07-09T15:41:25Z","snapshot_observed_at":"2026-08-08T13:02:50.552789Z","submitted_at":"2025-12-01T15:36:33Z","title":"Generative Action Tell-Tales: Assessing Human Motion in Synthesized Videos","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T19:11:47.374210Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2512.01803"},"observation_digest":"sha256:797b76e21424157c6f8bd6e8f9349abdbeeccfc14da586ca2d712dbfeb7a4dfa","observation_id":"5800b29a-d619-42a4-80f9-3e21da877a0c","resolution":{"observed_at":"2026-08-03T19:11:47.374210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:11:47.490755Z","title":"Realtime multi-person 2d pose estimation using part affin- ity fields","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2512.01803","last_updated":"2026-07-09T15:41:25Z","snapshot_observed_at":"2026-08-08T13:02:50.552789Z","submitted_at":"2025-12-01T15:36:33Z","title":"Generative Action Tell-Tales: Assessing Human Motion in Synthesized Videos","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T19:11:47.490755Z"},"links":{"citing_paper":"/paper/2512.01803"},"observation_digest":"sha256:5627e7b7accffc2c0f9ce68dfde325fe58321e7f5c7d7dcea4f6e4ee6311907c","observation_id":"b97d5ab6-f76c-4618-adcd-fdded482727d","resolution":{"observed_at":"2026-08-03T19:11:47.490755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:11:47.534283Z","title":"Emerg- ing properties in self-supervised vision transformers.2021 IEEE/CVF International Conference on Computer Vision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.01803","last_updated":"2026-07-09T15:41:25Z","snapshot_observed_at":"2026-08-08T13:02:50.552789Z","submitted_at":"2025-12-01T15:36:33Z","title":"Generative Action Tell-Tales: Assessing Human Motion in Synthesized Videos","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T19:11:47.534283Z"},"links":{"citing_paper":"/paper/2512.01803"},"observation_digest":"sha256:985893566395e462a97a6fce5169287f43c1d65ebcff75caabbe78ee3deb6cb4","observation_id":"519e7c97-3405-488b-ad17-042643c13e25","resolution":{"observed_at":"2026-08-03T19:11:47.534283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:11:47.627552Z","title":"Emerg- ing properties in self-supervised vision transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.01803","last_updated":"2026-07-09T15:41:25Z","snapshot_observed_at":"2026-08-08T13:02:50.552789Z","submitted_at":"2025-12-01T15:36:33Z","title":"Generative Action Tell-Tales: Assessing Human Motion in Synthesized Videos","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T19:11:47.627552Z"},"links":{"citing_paper":"/paper/2512.01803"},"observation_digest":"sha256:0ea1aeaa43434d2af9835213fb97ffd9a050c9e3cf3600b891cf0bb05838cad4","observation_id":"7e903371-d048-41f7-b1f4-08e63b86af2b","resolution":{"observed_at":"2026-08-03T19:11:47.627552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.06987","last_updated":"2022-10-17T19:58:40Z","snapshot_observed_at":"2026-07-06T08:08:03.081236Z","submitted_at":"2019-07-15T12:58:21Z","title":"A Short Note on the Kinetics-700 Human Action Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.06987","snapshot_observed_at":"2026-08-03T19:11:47.697511Z","title":"A short note on the kinetics-700 human action dataset.arXiv preprint arXiv:1907.06987, 2019","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2512.01803","last_updated":"2026-07-09T15:41:25Z","snapshot_observed_at":"2026-08-08T13:02:50.552789Z","submitted_at":"2025-12-01T15:36:33Z","title":"Generative Action Tell-Tales: Assessing Human Motion in Synthesized Videos","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T19:11:47.697511Z"},"links":{"cited_paper":"/paper/1907.06987","citing_paper":"/paper/2512.01803"},"observation_digest":"sha256:e6f59b1e85bedf5aaa90c9c01e143c1828b7ffe288c6c8f9ad4fbc21318e4e39","observation_id":"1bb7785a-0c4c-452b-8409-32413a8414ba","resolution":{"observed_at":"2026-08-03T19:11:47.697511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:11:47.807539Z","title":"Sora as an agi world model? a complete survey on text-to-video generation.arXiv preprint arXiv:2403.05131, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.01803","last_updated":"2026-07-09T15:41:25Z","snapshot_observed_at":"2026-08-08T13:02:50.552789Z","submitted_at":"2025-12-01T15:36:33Z","title":"Generative Action Tell-Tales: Assessing Human Motion in Synthesized Videos","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T19:11:47.807539Z"},"links":{"citing_paper":"/paper/2512.01803"},"observation_digest":"sha256:95004e01a5b175ae896e00f93db15273926a156950026d6820cd64ff4bf12fdb","observation_id":"a8c152d7-7024-47b0-8593-3e28ffb38914","resolution":{"observed_at":"2026-08-03T19:11:47.807539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-08-03T19:11:47.920086Z","title":"Gemini 2.5: Pushing the frontier with advanced reasoning, multimodality, long context, and next generation agentic capabilities.arXiv preprint arXiv:2507.06261, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.01803","last_updated":"2026-07-09T15:41:25Z","snapshot_observed_at":"2026-08-08T13:02:50.552789Z","submitted_at":"2025-12-01T15:36:33Z","title":"Generative Action Tell-Tales: Assessing Human Motion in Synthesized Videos","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T19:11:47.920086Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2512.01803"},"observation_digest":"sha256:9c6bbd6377f886f2aa572d031862eb4c16d0c461e446ae2cecd17de741ee4007","observation_id":"d54a4dac-a48d-4b24-95fa-d6f7757f20a6","resolution":{"observed_at":"2026-08-03T19:11:47.920086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:11:48.034096Z","title":"Arcface: Additive angular margin loss for deep face recognition","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2512.01803","last_updated":"2026-07-09T15:41:25Z","snapshot_observed_at":"2026-08-08T13:02:50.552789Z","submitted_at":"2025-12-01T15:36:33Z","title":"Generative Action Tell-Tales: Assessing Human Motion in Synthesized Videos","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T19:11:48.034096Z"},"links":{"citing_paper":"/paper/2512.01803"},"observation_digest":"sha256:8349ffb1f89a617e3678bbe3c8f7eecce66b437988a671e06457a5c96d2fced3","observation_id":"5b7d29de-ce01-4711-8a4d-b54984fe1857","resolution":{"observed_at":"2026-08-03T19:11:48.034096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-03T19:11:48.109924Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale.arXiv preprint arXiv:2010.11929, 2020","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2512.01803","last_updated":"2026-07-09T15:41:25Z","snapshot_observed_at":"2026-08-08T13:02:50.552789Z","submitted_at":"2025-12-01T15:36:33Z","title":"Generative Action Tell-Tales: Assessing Human Motion in Synthesized Videos","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T19:11:48.109924Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2512.01803"},"observation_digest":"sha256:c01a0c3815a5a85f22c03cd128be7e751254aafe20b6838d3d49b4d11241d56e","observation_id":"61f313df-66be-4fe8-a019-cbb7613f0e99","resolution":{"observed_at":"2026-08-03T19:11:48.109924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:11:48.201517Z","title":"Tokenhmr: Advancing human mesh recov- ery with a tokenized pose representation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.01803","last_updated":"2026-07-09T15:41:25Z","snapshot_observed_at":"2026-08-08T13:02:50.552789Z","submitted_at":"2025-12-01T15:36:33Z","title":"Generative Action Tell-Tales: Assessing Human Motion in Synthesized Videos","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T19:11:48.201517Z"},"links":{"citing_paper":"/paper/2512.01803"},"observation_digest":"sha256:abdc03ba5b227f794d4d6a983278d9553c8ef941f55cfcefea0936e4dd5b72c1","observation_id":"20e32031-95c8-47e1-9b92-bf39885b544d","resolution":{"observed_at":"2026-08-03T19:11:48.201517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:11:48.313419Z","title":"Smpl made simple faqs.https : / / files","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.01803","last_updated":"2026-07-09T15:41:25Z","snapshot_observed_at":"2026-08-08T13:02:50.552789Z","submitted_at":"2025-12-01T15:36:33Z","title":"Generative Action Tell-Tales: Assessing Human Motion in Synthesized Videos","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T19:11:48.313419Z"},"links":{"citing_paper":"/paper/2512.01803"},"observation_digest":"sha256:5d3a63ad41fa30c422bdad7706e3bbd87f3ebf09d69a242f2f5a5d3057c94da2","observation_id":"f40a930f-5d33-4ecd-854a-04c53ee67cd5","resolution":{"observed_at":"2026-08-03T19:11:48.313419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:11:48.477684Z","title":"Ava: A video dataset of spatio-temporally localized atomic visual actions","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2512.01803","last_updated":"2026-07-09T15:41:25Z","snapshot_observed_at":"2026-08-08T13:02:50.552789Z","submitted_at":"2025-12-01T15:36:33Z","title":"Generative Action Tell-Tales: Assessing Human Motion in Synthesized Videos","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T19:11:48.477684Z"},"links":{"citing_paper":"/paper/2512.01803"},"observation_digest":"sha256:d3c9aef363f76c1b6858f94162edef2bbcb7b9788cb26ff270d7e2ac6ca64026","observation_id":"56fc8e7e-96df-4b7c-ba85-585db43add17","resolution":{"observed_at":"2026-08-03T19:11:48.477684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:11:48.629288Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2512.01803","last_updated":"2026-07-09T15:41:25Z","snapshot_observed_at":"2026-08-08T13:02:50.552789Z","submitted_at":"2025-12-01T15:36:33Z","title":"Generative Action Tell-Tales: Assessing Human Motion in Synthesized Videos","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T19:11:48.629288Z"},"links":{"citing_paper":"/paper/2512.01803"},"observation_digest":"sha256:df2920efde8228ff231ac7964cbb2035b1ff206f236c208d34d978512a5253e1","observation_id":"09294ba3-ca8f-497e-8df9-705b2ca71f52","resolution":{"observed_at":"2026-08-03T19:11:48.629288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:11:48.703230Z","title":"Videoscore: Building automatic metrics to simulate fine-grained human feedback for video genera- tion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.01803","last_updated":"2026-07-09T15:41:25Z","snapshot_observed_at":"2026-08-08T13:02:50.552789Z","submitted_at":"2025-12-01T15:36:33Z","title":"Generative Action Tell-Tales: Assessing Human Motion in Synthesized Videos","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T19:11:48.703230Z"},"links":{"citing_paper":"/paper/2512.01803"},"observation_digest":"sha256:81332ae8ca0fa1829ef81fe4eade1a8d5e6ece9605bf6ea13cd79bd43784cc20","observation_id":"74bba304-61e1-4dc7-a02a-8eb44dc8c32f","resolution":{"observed_at":"2026-08-03T19:11:48.703230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:11:48.800585Z","title":"Videoscore2: Think before you score in generative video evaluation.arXiv preprint arXiv:2509.22799, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.01803","last_updated":"2026-07-09T15:41:25Z","snapshot_observed_at":"2026-08-08T13:02:50.552789Z","submitted_at":"2025-12-01T15:36:33Z","title":"Generative Action Tell-Tales: Assessing Human Motion in Synthesized Videos","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T19:11:48.800585Z"},"links":{"citing_paper":"/paper/2512.01803"},"observation_digest":"sha256:59d3a22d704344d7e6d3b76089057a34e10eb2a7c7be16deb3ad5c177c3f2b1d","observation_id":"bf4d14d7-a2b3-477c-8509-a10f1b9a28f6","resolution":{"observed_at":"2026-08-03T19:11:48.800585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:11:48.934445Z","title":"Clipscore: A reference-free evaluation met- ric for image captioning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.01803","last_updated":"2026-07-09T15:41:25Z","snapshot_observed_at":"2026-08-08T13:02:50.552789Z","submitted_at":"2025-12-01T15:36:33Z","title":"Generative Action Tell-Tales: Assessing Human Motion in Synthesized Videos","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T19:11:48.934445Z"},"links":{"citing_paper":"/paper/2512.01803"},"observation_digest":"sha256:a321cd13d0a088b826e0965035460d866fc90f557da058f0a24658ca1aca0f67","observation_id":"25d71c0a-c6bf-4035-a5a3-b037ee57a234","resolution":{"observed_at":"2026-08-03T19:11:48.934445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:11:48.992907Z","title":"Video dif- fusion models.Advances in Neural Information Processing Systems, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.01803","last_updated":"2026-07-09T15:41:25Z","snapshot_observed_at":"2026-08-08T13:02:50.552789Z","submitted_at":"2025-12-01T15:36:33Z","title":"Generative Action Tell-Tales: Assessing Human Motion in Synthesized Videos","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T19:11:48.992907Z"},"links":{"citing_paper":"/paper/2512.01803"},"observation_digest":"sha256:3583fb119e29117015050ae6c99e31ffd5d0b6aa9e98b5b017c867005f8bcfc5","observation_id":"2e2889ab-f0ea-406c-a4ac-9025301fee8b","resolution":{"observed_at":"2026-08-03T19:11:48.992907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.15868","last_updated":"2022-05-29T19:02:15Z","snapshot_observed_at":"2026-07-06T13:15:58.303738Z","submitted_at":"2022-05-29T19:02:15Z","title":"CogVideo: Large-scale Pretraining for Text-to-Video Generation via Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.15868","snapshot_observed_at":"2026-08-03T19:11:49.063882Z","title":"Cogvideo: Large-scale pretraining for text-to-video generation via transformers.arXiv preprint arXiv:2205.15868, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.01803","last_updated":"2026-07-09T15:41:25Z","snapshot_observed_at":"2026-08-08T13:02:50.552789Z","submitted_at":"2025-12-01T15:36:33Z","title":"Generative Action Tell-Tales: Assessing Human Motion in Synthesized Videos","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T19:11:49.063882Z"},"links":{"cited_paper":"/paper/2205.15868","citing_paper":"/paper/2512.01803"},"observation_digest":"sha256:15a8603bdd0a3b72eadb6dc254bc8a27e49055f53c53f8f958986fca4b313217","observation_id":"505f2100-1cf7-4094-bac3-055c2b66e23c","resolution":{"observed_at":"2026-08-03T19:11:49.063882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:11:49.122411Z","title":"Image quality metrics: Psnr vs","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2512.01803","last_updated":"2026-07-09T15:41:25Z","snapshot_observed_at":"2026-08-08T13:02:50.552789Z","submitted_at":"2025-12-01T15:36:33Z","title":"Generative Action Tell-Tales: Assessing Human Motion in Synthesized Videos","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T19:11:49.122411Z"},"links":{"citing_paper":"/paper/2512.01803"},"observation_digest":"sha256:7486fa1ecf71d8bab28d15532d7e25779cec1bbc86ac57e75b26730007a55c87","observation_id":"6e942015-2ed0-4cdb-901f-8a152809e6d3","resolution":{"observed_at":"2026-08-03T19:11:49.122411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:11:49.225326Z","title":"Methodologies for the subjective assessment of the quality of television pic- tures","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2512.01803","last_updated":"2026-07-09T15:41:25Z","snapshot_observed_at":"2026-08-08T13:02:50.552789Z","submitted_at":"2025-12-01T15:36:33Z","title":"Generative Action Tell-Tales: Assessing Human Motion in Synthesized Videos","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T19:11:49.225326Z"},"links":{"citing_paper":"/paper/2512.01803"},"observation_digest":"sha256:74cc1d82fbbcd85adf8ddd90000b3c5a0ee0c1d2743300748b30d45a1ba7a51f","observation_id":"dc8c1724-c8dc-43ac-825b-f50ecb5b0b68","resolution":{"observed_at":"2026-08-03T19:11:49.225326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:11:49.314907Z","title":"Black, David W","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2512.01803","last_updated":"2026-07-09T15:41:25Z","snapshot_observed_at":"2026-08-08T13:02:50.552789Z","submitted_at":"2025-12-01T15:36:33Z","title":"Generative Action Tell-Tales: Assessing Human Motion in Synthesized Videos","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T19:11:49.314907Z"},"links":{"citing_paper":"/paper/2512.01803"},"observation_digest":"sha256:d62e54938a32202695457cae56802ad3739c0ea0890914b82e242f2642b263b1","observation_id":"3995b611-fea1-4a38-9908-cc45aca6359b","resolution":{"observed_at":"2026-08-03T19:11:49.314907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:11:49.382004Z","title":"Vibe: Video inference for human body pose and shape estimation","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2512.01803","last_updated":"2026-07-09T15:41:25Z","snapshot_observed_at":"2026-08-08T13:02:50.552789Z","submitted_at":"2025-12-01T15:36:33Z","title":"Generative Action Tell-Tales: Assessing Human Motion in Synthesized Videos","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T19:11:49.382004Z"},"links":{"citing_paper":"/paper/2512.01803"},"observation_digest":"sha256:9aae36c448156d95e729d6b03dcf3f6c3133d64607426f793aa3cfbfa67d3c8b","observation_id":"c97c56f2-3de8-47c9-8452-9bdb2a300790","resolution":{"observed_at":"2026-08-03T19:11:49.382004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-03T19:11:49.466700Z","title":"Hunyuanvideo: A systematic framework for large video generative models.arXiv preprint arXiv:2412.03603, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.01803","last_updated":"2026-07-09T15:41:25Z","snapshot_observed_at":"2026-08-08T13:02:50.552789Z","submitted_at":"2025-12-01T15:36:33Z","title":"Generative Action Tell-Tales: Assessing Human Motion in Synthesized Videos","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T19:11:49.466700Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2512.01803"},"observation_digest":"sha256:7a1cd334e645e92195b6f186e902c192712732b50f37b2ae947d160fecca1cd9","observation_id":"3419c7af-9678-46fd-a89a-f333b3941dd7","resolution":{"observed_at":"2026-08-03T19:11:49.466700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:11:49.560843Z","title":"Kling: High-fidelity and temporally consistent text-to-video generation.Technical Report, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.01803","last_updated":"2026-07-09T15:41:25Z","snapshot_observed_at":"2026-08-08T13:02:50.552789Z","submitted_at":"2025-12-01T15:36:33Z","title":"Generative Action Tell-Tales: Assessing Human Motion in Synthesized Videos","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T19:11:49.560843Z"},"links":{"citing_paper":"/paper/2512.01803"},"observation_digest":"sha256:7a4b8af3a9ef9dbf2f5d865d4211e1bb0792ca6f141d2b789d9f1008673bf6ca","observation_id":"f4655f19-de07-4742-9c88-d0758d8bf0d2","resolution":{"observed_at":"2026-08-03T19:11:49.560843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:11:49.614556Z","title":"What matters when building vision-language models? Advances in Neural Information Processing Systems, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.01803","last_updated":"2026-07-09T15:41:25Z","snapshot_observed_at":"2026-08-08T13:02:50.552789Z","submitted_at":"2025-12-01T15:36:33Z","title":"Generative Action Tell-Tales: Assessing Human Motion in Synthesized Videos","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-03T19:11:49.614556Z"},"links":{"citing_paper":"/paper/2512.01803"},"observation_digest":"sha256:98eeb425037adf6ae8ab516b5cdbaab8b3cde5fb0acd0473fa8135a69630146f","observation_id":"531d9955-6c08-45bc-940c-e9acfb081863","resolution":{"observed_at":"2026-08-03T19:11:49.614556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.01425","last_updated":"2025-05-02T17:59:55Z","snapshot_observed_at":"2026-08-09T02:03:35.540769Z","submitted_at":"2025-05-02T17:59:55Z","title":"GENMO: A GENeralist Model for Human MOtion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.01425","snapshot_observed_at":"2026-08-03T19:11:49.699592Z","title":"Genmo: A generalist model for human motion.arXiv preprint arXiv:2505.01425,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.01803","last_updated":"2026-07-09T15:41:25Z","snapshot_observed_at":"2026-08-08T13:02:50.552789Z","submitted_at":"2025-12-01T15:36:33Z","title":"Generative Action Tell-Tales: Assessing Human Motion in Synthesized Videos","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-03T19:11:49.699592Z"},"links":{"cited_paper":"/paper/2505.01425","citing_paper":"/paper/2512.01803"},"observation_digest":"sha256:dabd48af4ebf63f73935c3b340e6f9f6019dede7c5c9943fb5c872e65af62df6","observation_id":"7e90c269-d8da-46ee-95fe-0211a09294d7","resolution":{"observed_at":"2026-08-03T19:11:49.699592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:11:49.790866Z","title":"Visual instruction tuning.Advances in Neural Information Processing Systems, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.01803","last_updated":"2026-07-09T15:41:25Z","snapshot_observed_at":"2026-08-08T13:02:50.552789Z","submitted_at":"2025-12-01T15:36:33Z","title":"Generative Action Tell-Tales: Assessing Human Motion in Synthesized Videos","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-03T19:11:49.790866Z"},"links":{"citing_paper":"/paper/2512.01803"},"observation_digest":"sha256:769f11605b81e53ab0c5e68c6ded51fa46519a0c98467226e2b8f854b62079cd","observation_id":"140f99b2-7a0d-4e2c-8ad3-6f6836a307e7","resolution":{"observed_at":"2026-08-03T19:11:49.790866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:11:49.852690Z","title":"Llava-next: Im- proved reasoning, ocr, and world knowledge for large mul- timodal models (llava v1.6).https : / / llava - vl","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.01803","last_updated":"2026-07-09T15:41:25Z","snapshot_observed_at":"2026-08-08T13:02:50.552789Z","submitted_at":"2025-12-01T15:36:33Z","title":"Generative Action Tell-Tales: Assessing Human Motion in Synthesized Videos","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-03T19:11:49.852690Z"},"links":{"citing_paper":"/paper/2512.01803"},"observation_digest":"sha256:3a9e8f439cdb6a002e0d347283ba19961d70c9154562eec38e9644133d380871","observation_id":"b2070bf9-b5e4-450c-ae0f-d6dd68c66f96","resolution":{"observed_at":"2026-08-03T19:11:49.852690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:11:50.011502Z","title":"Evalcrafter: Benchmarking and eval- uating large video generation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.01803","last_updated":"2026-07-09T15:41:25Z","snapshot_observed_at":"2026-08-08T13:02:50.552789Z","submitted_at":"2025-12-01T15:36:33Z","title":"Generative Action Tell-Tales: Assessing Human Motion in Synthesized Videos","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-03T19:11:50.011502Z"},"links":{"citing_paper":"/paper/2512.01803"},"observation_digest":"sha256:b175c344248b046c953477627299e0a10efe08b9ab1b7208bf7511548b756c14","observation_id":"bb7740ed-4a00-4d42-b6b2-cf39c956ad7e","resolution":{"observed_at":"2026-08-03T19:11:50.011502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:11:50.078434Z","title":"Smpl: A skinned multi- person linear model.Seminal Graphics Papers: Pushing the Boundaries, Volume 2, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.01803","last_updated":"2026-07-09T15:41:25Z","snapshot_observed_at":"2026-08-08T13:02:50.552789Z","submitted_at":"2025-12-01T15:36:33Z","title":"Generative Action Tell-Tales: Assessing Human Motion in Synthesized Videos","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-03T19:11:50.078434Z"},"links":{"citing_paper":"/paper/2512.01803"},"observation_digest":"sha256:45280ffe59cadb5924255e095513a7ef9c84e53a7e8aa0ababfe6e97a42406d2","observation_id":"0603b751-eb3e-465c-9a43-23553e43e916","resolution":{"observed_at":"2026-08-03T19:11:50.078434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-03T19:11:50.117308Z","title":"Decoupled weight decay regularization.arXiv preprint arXiv:1711.05101, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2512.01803","last_updated":"2026-07-09T15:41:25Z","snapshot_observed_at":"2026-08-08T13:02:50.552789Z","submitted_at":"2025-12-01T15:36:33Z","title":"Generative Action Tell-Tales: Assessing Human Motion in Synthesized Videos","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-03T19:11:50.117308Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2512.01803"},"observation_digest":"sha256:83beba2b1e31c55f9d78968167fc1a51f558c0ef4e0b7f92948fff8299784f13","observation_id":"f33a00cd-d8d2-4e83-be16-4942445aeb21","resolution":{"observed_at":"2026-08-03T19:11:50.117308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:11:50.187345Z","title":"X-clip: End-to-end multi-grained con- trastive learning for video-text retrieval, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.01803","last_updated":"2026-07-09T15:41:25Z","snapshot_observed_at":"2026-08-08T13:02:50.552789Z","submitted_at":"2025-12-01T15:36:33Z","title":"Generative Action Tell-Tales: Assessing Human Motion in Synthesized Videos","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-03T19:11:50.187345Z"},"links":{"citing_paper":"/paper/2512.01803"},"observation_digest":"sha256:888160026456dd9b7555287e724ab4e216cd6de1885c984ca8ef9d40f12cd0de","observation_id":"46e271c2-f8f5-4479-a649-f62a945fbaed","resolution":{"observed_at":"2026-08-03T19:11:50.187345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:11:50.306125Z","title":"No-reference image quality assessment in the spa- tial domain.IEEE Transactions on Image Processing, 2012","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2512.01803","last_updated":"2026-07-09T15:41:25Z","snapshot_observed_at":"2026-08-08T13:02:50.552789Z","submitted_at":"2025-12-01T15:36:33Z","title":"Generative Action Tell-Tales: Assessing Human Motion in Synthesized Videos","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-03T19:11:50.306125Z"},"links":{"citing_paper":"/paper/2512.01803"},"observation_digest":"sha256:a24e8b10e7e6784ab020aad4020023aacb0c67357f966827491da1fd86170be8","observation_id":"84a353e6-dc24-411e-9334-4436bc0c6295","resolution":{"observed_at":"2026-08-03T19:11:50.306125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09038","last_updated":"2025-02-27T15:10:51Z","snapshot_observed_at":"2026-08-02T17:18:33.867969Z","submitted_at":"2025-01-14T20:59:37Z","title":"Do generative video models understand physical principles?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09038","snapshot_observed_at":"2026-08-03T19:11:50.463345Z","title":"Do generative video models understand physical principles?arXiv preprint arXiv:2501.09038, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.01803","last_updated":"2026-07-09T15:41:25Z","snapshot_observed_at":"2026-08-08T13:02:50.552789Z","submitted_at":"2025-12-01T15:36:33Z","title":"Generative Action Tell-Tales: Assessing Human Motion in Synthesized Videos","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-03T19:11:50.463345Z"},"links":{"cited_paper":"/paper/2501.09038","citing_paper":"/paper/2512.01803"},"observation_digest":"sha256:bf340c707bf9cc08c5543eb222213ceb60689b2bfc921c9e2d61edad2c51cdd7","observation_id":"ed43c1b0-425e-459d-be7e-7d72006dbca2","resolution":{"observed_at":"2026-08-03T19:11:50.463345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:11:50.607077Z","title":"Sora: A large-scale diffusion transformer for text- to-video generation.Technical Report, 2024.https:// openai.com/research/sora","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.01803","last_updated":"2026-07-09T15:41:25Z","snapshot_observed_at":"2026-08-08T13:02:50.552789Z","submitted_at":"2025-12-01T15:36:33Z","title":"Generative Action Tell-Tales: Assessing Human Motion in Synthesized Videos","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-03T19:11:50.607077Z"},"links":{"citing_paper":"/paper/2512.01803"},"observation_digest":"sha256:0ee5eabde23405451daa163f8dcc6b2d71303d657fcd3b63892ad1ed44b9f931","observation_id":"3b0a21e0-ce5f-4b0b-be31-b8824d44cf5d","resolution":{"observed_at":"2026-08-03T19:11:50.607077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:11:50.764465Z","title":"Gpt-5 system card","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.01803","last_updated":"2026-07-09T15:41:25Z","snapshot_observed_at":"2026-08-08T13:02:50.552789Z","submitted_at":"2025-12-01T15:36:33Z","title":"Generative Action Tell-Tales: Assessing Human Motion in Synthesized Videos","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-03T19:11:50.764465Z"},"links":{"citing_paper":"/paper/2512.01803"},"observation_digest":"sha256:9c5eeaff22073b77ef99899297b1d65438b2ba36880d7d9b9e32f0c6de6f000f","observation_id":"7b460a16-900a-4ea6-89e7-2c3155f1237f","resolution":{"observed_at":"2026-08-03T19:11:50.764465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-06T05:58:29.182448Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-03T19:11:51.046259Z","title":"Dinov2: Learning robust visual features without supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.01803","last_updated":"2026-07-09T15:41:25Z","snapshot_observed_at":"2026-08-08T13:02:50.552789Z","submitted_at":"2025-12-01T15:36:33Z","title":"Generative Action Tell-Tales: Assessing Human Motion in Synthesized Videos","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-03T19:11:51.046259Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2512.01803"},"observation_digest":"sha256:e3e4ddc628b1ec04bf1adaff200a29d8d3d07053069cdd467fc0d9fa72ccf302","observation_id":"414ea285-2c27-4825-ac2b-66fce01786c1","resolution":{"observed_at":"2026-08-03T19:11:51.046259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:11:51.164104Z","title":"Expressive body capture: 3d hands, face, and body from a single image","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2512.01803","last_updated":"2026-07-09T15:41:25Z","snapshot_observed_at":"2026-08-08T13:02:50.552789Z","submitted_at":"2025-12-01T15:36:33Z","title":"Generative Action Tell-Tales: Assessing Human Motion in Synthesized Videos","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-03T19:11:51.164104Z"},"links":{"citing_paper":"/paper/2512.01803"},"observation_digest":"sha256:b81e6a56e2c5fbeb6bc0bff9bec033d236a53c6322c23b9c12ef4620a0f5c8eb","observation_id":"eed990ca-641a-4806-bf8a-5da5bca08756","resolution":{"observed_at":"2026-08-03T19:11:51.164104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:11:51.308829Z","title":"Learn- ing transferable visual models from natural language super- vision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.01803","last_updated":"2026-07-09T15:41:25Z","snapshot_observed_at":"2026-08-08T13:02:50.552789Z","submitted_at":"2025-12-01T15:36:33Z","title":"Generative Action Tell-Tales: Assessing Human Motion in Synthesized Videos","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-03T19:11:51.308829Z"},"links":{"citing_paper":"/paper/2512.01803"},"observation_digest":"sha256:bc01939aa299c964ee7c09bbc561c8c0a08896bbcc15fa9634c860beafc5a147","observation_id":"9e363b04-c7fa-426b-b5c3-de420e55a775","resolution":{"observed_at":"2026-08-03T19:11:51.308829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:11:51.455502Z","title":"Two-stream con- volutional networks for action recognition in videos.Ad- vances in Neural Information Processing Systems, 2014","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2512.01803","last_updated":"2026-07-09T15:41:25Z","snapshot_observed_at":"2026-08-08T13:02:50.552789Z","submitted_at":"2025-12-01T15:36:33Z","title":"Generative Action Tell-Tales: Assessing Human Motion in Synthesized Videos","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-03T19:11:51.455502Z"},"links":{"citing_paper":"/paper/2512.01803"},"observation_digest":"sha256:e4d77e67d6e053a9db990b272a4e0508f5d1463d8131ea85169b13676244d84c","observation_id":"c10a9716-1eb5-4648-ab3b-01ebc272687e","resolution":{"observed_at":"2026-08-03T19:11:51.455502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1212.0402","last_updated":"2012-12-03T14:45:31Z","snapshot_observed_at":"2026-07-06T03:01:10.229407Z","submitted_at":"2012-12-03T14:45:31Z","title":"UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1212.0402","snapshot_observed_at":"2026-08-03T19:11:51.577844Z","title":"Ucf101: A dataset of 101 human actions classes from videos in the wild.arXiv preprint arXiv:1212.0402, 2012","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2512.01803","last_updated":"2026-07-09T15:41:25Z","snapshot_observed_at":"2026-08-08T13:02:50.552789Z","submitted_at":"2025-12-01T15:36:33Z","title":"Generative Action Tell-Tales: Assessing Human Motion in Synthesized Videos","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-03T19:11:51.577844Z"},"links":{"cited_paper":"/paper/1212.0402","citing_paper":"/paper/2512.01803"},"observation_digest":"sha256:b2532122580cc094da8e5e179035981d864e1f82233a124b8096cad78fa9b97f","observation_id":"201ab2bb-f1aa-462f-b7c5-57a56f4bf93a","resolution":{"observed_at":"2026-08-03T19:11:51.577844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:11:51.766307Z","title":"Runway gen-4: Advancing realistic text-to-video generation.Technical Report, 2024.https: //research.runwayml.com/gen4","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.01803","last_updated":"2026-07-09T15:41:25Z","snapshot_observed_at":"2026-08-08T13:02:50.552789Z","submitted_at":"2025-12-01T15:36:33Z","title":"Generative Action Tell-Tales: Assessing Human Motion in Synthesized Videos","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-03T19:11:51.766307Z"},"links":{"citing_paper":"/paper/2512.01803"},"observation_digest":"sha256:6b19d7d7f2d27cc65b72d9afce571cc70847360c972d83db88ebc253da126b19","observation_id":"3753a81d-0a9e-42fb-aa0d-f0fe917f72b0","resolution":{"observed_at":"2026-08-03T19:11:51.766307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14916","last_updated":"2022-10-03T09:17:41Z","snapshot_observed_at":"2026-07-06T13:57:50.746457Z","submitted_at":"2022-09-29T16:27:53Z","title":"Human Motion Diffusion Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14916","snapshot_observed_at":"2026-08-03T19:11:51.880760Z","title":"Human motion dif- fusion model.arXiv preprint arXiv:2209.14916, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.01803","last_updated":"2026-07-09T15:41:25Z","snapshot_observed_at":"2026-08-08T13:02:50.552789Z","submitted_at":"2025-12-01T15:36:33Z","title":"Generative Action Tell-Tales: Assessing Human Motion in Synthesized Videos","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-03T19:11:51.880760Z"},"links":{"cited_paper":"/paper/2209.14916","citing_paper":"/paper/2512.01803"},"observation_digest":"sha256:5f3d0029e62127a93b556c45533aa411e967e9a54a98285ffbe4272e2e197954","observation_id":"90064232-6f7e-46d5-86f4-263d7f4679b9","resolution":{"observed_at":"2026-08-03T19:11:51.880760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06698","last_updated":"2025-04-28T21:50:29Z","snapshot_observed_at":"2026-08-07T17:18:45.573219Z","submitted_at":"2025-03-09T17:29:01Z","title":"What's in a Latent? Leveraging Diffusion Latent Space for Domain Generalization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06698","snapshot_observed_at":"2026-08-03T19:11:52.004274Z","title":"What’s in a latent? leveraging diffusion latent space for domain generalization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.01803","last_updated":"2026-07-09T15:41:25Z","snapshot_observed_at":"2026-08-08T13:02:50.552789Z","submitted_at":"2025-12-01T15:36:33Z","title":"Generative Action Tell-Tales: Assessing Human Motion in Synthesized Videos","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-03T19:11:52.004274Z"},"links":{"cited_paper":"/paper/2503.06698","citing_paper":"/paper/2512.01803"},"observation_digest":"sha256:4a76cb31843d300e8b3da18d03b0d8f2f72418888ded0d149db2a69985853e6f","observation_id":"08e80cc4-e8d2-4e38-8228-f8c14775b894","resolution":{"observed_at":"2026-08-03T19:11:52.004274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:11:52.139770Z","title":"Videomae: Masked autoencoders are data-efficient learners for self-supervised video pre-training.Advances in Neural Information Processing Systems, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.01803","last_updated":"2026-07-09T15:41:25Z","snapshot_observed_at":"2026-08-08T13:02:50.552789Z","submitted_at":"2025-12-01T15:36:33Z","title":"Generative Action Tell-Tales: Assessing Human Motion in Synthesized Videos","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-03T19:11:52.139770Z"},"links":{"citing_paper":"/paper/2512.01803"},"observation_digest":"sha256:f18e49ae3aa05ac141a68291b2c0d879d2347bf954df7470a13f2e91c2e2009d","observation_id":"c0279f4f-6c9e-4aa6-81d6-c54b651d1163","resolution":{"observed_at":"2026-08-03T19:11:52.139770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.01717","last_updated":"2019-03-27T16:43:17Z","snapshot_observed_at":"2026-07-06T07:19:11.957225Z","submitted_at":"2018-12-03T03:57:42Z","title":"Towards Accurate Generative Models of Video: A New Metric & Challenges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.01717","snapshot_observed_at":"2026-08-03T19:11:52.231503Z","title":"To- wards accurate generative models of video: A new metric & challenges.arXiv preprint arXiv:1812.01717, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2512.01803","last_updated":"2026-07-09T15:41:25Z","snapshot_observed_at":"2026-08-08T13:02:50.552789Z","submitted_at":"2025-12-01T15:36:33Z","title":"Generative Action Tell-Tales: Assessing Human Motion in Synthesized Videos","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-03T19:11:52.231503Z"},"links":{"cited_paper":"/paper/1812.01717","citing_paper":"/paper/2512.01803"},"observation_digest":"sha256:f61690417e2a6763e281c74cec117fe8c032a7a08b2971ce0e786d2d4b56ae0c","observation_id":"337ad33b-6447-4e15-b6d3-e2efd39bdb73","resolution":{"observed_at":"2026-08-03T19:11:52.231503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:11:52.326763Z","title":"Visualizing data using t-sne.Journal of Machine Learning Research,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.01803","last_updated":"2026-07-09T15:41:25Z","snapshot_observed_at":"2026-08-08T13:02:50.552789Z","submitted_at":"2025-12-01T15:36:33Z","title":"Generative Action Tell-Tales: Assessing Human Motion in Synthesized Videos","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-03T19:11:52.326763Z"},"links":{"citing_paper":"/paper/2512.01803"},"observation_digest":"sha256:a805a21ed61f7021f20f0088de9618b02399209714f1c21a6c99b26c8f23d232","observation_id":"bbd96211-1915-43e5-a898-70ff043e1467","resolution":{"observed_at":"2026-08-03T19:11:52.326763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:11:52.421165Z","title":"Attention is all you need.Advances in Neural Information Processing Systems, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2512.01803","last_updated":"2026-07-09T15:41:25Z","snapshot_observed_at":"2026-08-08T13:02:50.552789Z","submitted_at":"2025-12-01T15:36:33Z","title":"Generative Action Tell-Tales: Assessing Human Motion in Synthesized Videos","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-03T19:11:52.421165Z"},"links":{"citing_paper":"/paper/2512.01803"},"observation_digest":"sha256:c7a6710f7add8905b72725263e402750f13826bed7e5886b8977a6f9f89d442d","observation_id":"5cd55fa3-c213-4363-8eab-6af0acbaf8a9","resolution":{"observed_at":"2026-08-03T19:11:52.421165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:11:52.521506Z","title":"Praneeth, Sumohana S","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2512.01803","last_updated":"2026-07-09T15:41:25Z","snapshot_observed_at":"2026-08-08T13:02:50.552789Z","submitted_at":"2025-12-01T15:36:33Z","title":"Generative Action Tell-Tales: Assessing Human Motion in Synthesized Videos","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-03T19:11:52.521506Z"},"links":{"citing_paper":"/paper/2512.01803"},"observation_digest":"sha256:da739bd68989b77d52957afbe92bc84e31c9053770e160b4d4e5027d73068513","observation_id":"37ef30c1-13ad-4488-86c2-d9bfc873cc26","resolution":{"observed_at":"2026-08-03T19:11:52.521506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-03T19:11:52.650027Z","title":"Wan: Open and advanced large-scale video gen- erative models.arXiv preprint arXiv:2503.20314, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.01803","last_updated":"2026-07-09T15:41:25Z","snapshot_observed_at":"2026-08-08T13:02:50.552789Z","submitted_at":"2025-12-01T15:36:33Z","title":"Generative Action Tell-Tales: Assessing Human Motion in Synthesized Videos","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-03T19:11:52.650027Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2512.01803"},"observation_digest":"sha256:bd92b1d4285e84e00e3ceaae84465a334dd23f0a7f60ec7cdfef4e7b23532652","observation_id":"78b8ec9a-4ead-4748-8301-7170b7fda776","resolution":{"observed_at":"2026-08-03T19:11:52.650027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:11:52.754913Z","title":"Bovik, H.R","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2512.01803","last_updated":"2026-07-09T15:41:25Z","snapshot_observed_at":"2026-08-08T13:02:50.552789Z","submitted_at":"2025-12-01T15:36:33Z","title":"Generative Action Tell-Tales: Assessing Human Motion in Synthesized Videos","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-03T19:11:52.754913Z"},"links":{"citing_paper":"/paper/2512.01803"},"observation_digest":"sha256:c555f665376c1e5192ee4bf90bcd24d2b0dbd14a1475606b3d1f33fc93e8ef46","observation_id":"5e0a4f94-5156-4fd5-9770-1db42cb3ced4","resolution":{"observed_at":"2026-08-03T19:11:52.754913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:11:52.850224Z","title":"Image quality assessment: from error visibility to structural similarity.IEEE Transactions on Image Process- ing, 2004","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2512.01803","last_updated":"2026-07-09T15:41:25Z","snapshot_observed_at":"2026-08-08T13:02:50.552789Z","submitted_at":"2025-12-01T15:36:33Z","title":"Generative Action Tell-Tales: Assessing Human Motion in Synthesized Videos","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-03T19:11:52.850224Z"},"links":{"citing_paper":"/paper/2512.01803"},"observation_digest":"sha256:c4a8c24ce87318602dea6bf115818981d6d8f1f7edaf6fc4a705cd1ecd095c9a","observation_id":"da141645-4fac-4f9b-96ca-26d8a2a801b5","resolution":{"observed_at":"2026-08-03T19:11:52.850224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.20328","snapshot_observed_at":"2026-08-03T19:11:52.916096Z","title":"Video models are zero-shot learn- ers and reasoners.arXiv preprint arXiv:2509.20328, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.01803","last_updated":"2026-07-09T15:41:25Z","snapshot_observed_at":"2026-08-08T13:02:50.552789Z","submitted_at":"2025-12-01T15:36:33Z","title":"Generative Action Tell-Tales: Assessing Human Motion in Synthesized Videos","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-03T19:11:52.916096Z"},"links":{"cited_paper":"/paper/2509.20328","citing_paper":"/paper/2512.01803"},"observation_digest":"sha256:519c278914857812282db1a1f7800b2e9c81bc1e04bac6e69ca051d7daef22cf","observation_id":"a76490f6-51a5-4fbc-a34f-6206a431792d","resolution":{"observed_at":"2026-08-03T19:11:52.916096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:11:52.987345Z","title":"Detectron2.https://github","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2512.01803","last_updated":"2026-07-09T15:41:25Z","snapshot_observed_at":"2026-08-08T13:02:50.552789Z","submitted_at":"2025-12-01T15:36:33Z","title":"Generative Action Tell-Tales: Assessing Human Motion in Synthesized Videos","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-03T19:11:52.987345Z"},"links":{"citing_paper":"/paper/2512.01803"},"observation_digest":"sha256:e30558792890280b8d65f88c1788add9b599fad53e4918382e16b448bd9208de","observation_id":"4919ae3b-347c-4a5a-9448-84db3f1c8abe","resolution":{"observed_at":"2026-08-03T19:11:52.987345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:11:53.050463Z","title":"A survey on video diffusion models.ACM Computing Surveys, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.01803","last_updated":"2026-07-09T15:41:25Z","snapshot_observed_at":"2026-08-08T13:02:50.552789Z","submitted_at":"2025-12-01T15:36:33Z","title":"Generative Action Tell-Tales: Assessing Human Motion in Synthesized Videos","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-03T19:11:53.050463Z"},"links":{"citing_paper":"/paper/2512.01803"},"observation_digest":"sha256:59c7404b8b07af563daddd867d79007567d4485367fdf36d4108de711fb17a96","observation_id":"6635ec69-8943-4e31-adcb-7d04ae3b6db2","resolution":{"observed_at":"2026-08-03T19:11:53.050463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:11:53.109454Z","title":"Seeing the ar- row of time in large multimodal models.arXiv preprint arXiv:2506.03340, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.01803","last_updated":"2026-07-09T15:41:25Z","snapshot_observed_at":"2026-08-08T13:02:50.552789Z","submitted_at":"2025-12-01T15:36:33Z","title":"Generative Action Tell-Tales: Assessing Human Motion in Synthesized Videos","version":3},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-03T19:11:53.109454Z"},"links":{"citing_paper":"/paper/2512.01803"},"observation_digest":"sha256:11724d0a3bf814ba90d3acf7b5ea73832bca5f484d272640d588af3ce2c3e795","observation_id":"1e7f5e1d-ada5-492a-84ee-f73dc5ed1672","resolution":{"observed_at":"2026-08-03T19:11:53.109454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-03T19:11:53.172983Z","title":"Qwen3 technical report.arXiv preprint arXiv:2505.09388, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.01803","last_updated":"2026-07-09T15:41:25Z","snapshot_observed_at":"2026-08-08T13:02:50.552789Z","submitted_at":"2025-12-01T15:36:33Z","title":"Generative Action Tell-Tales: Assessing Human Motion in Synthesized Videos","version":3},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-03T19:11:53.172983Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2512.01803"},"observation_digest":"sha256:0e20f21e4eed6997d993eed027791bf13c628f9e277825c8236f2a882a75a617","observation_id":"9c4d2d31-db6e-4028-ad84-e569517c99c6","resolution":{"observed_at":"2026-08-03T19:11:53.172983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:11:53.236150Z","title":"Effec- tive whole-body pose estimation with two-stages distillation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.01803","last_updated":"2026-07-09T15:41:25Z","snapshot_observed_at":"2026-08-08T13:02:50.552789Z","submitted_at":"2025-12-01T15:36:33Z","title":"Generative Action Tell-Tales: Assessing Human Motion in Synthesized Videos","version":3},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-03T19:11:53.236150Z"},"links":{"citing_paper":"/paper/2512.01803"},"observation_digest":"sha256:0fcfd230593149b57f055cdf7407db6029f4b448e9d4a36149e433e398df85be","observation_id":"f7e396ba-874d-4a75-9f70-6aec6aa4efcb","resolution":{"observed_at":"2026-08-03T19:11:53.236150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:11:53.300093Z","title":"The unreasonable effectiveness of deep features as a perceptual metric","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2512.01803","last_updated":"2026-07-09T15:41:25Z","snapshot_observed_at":"2026-08-08T13:02:50.552789Z","submitted_at":"2025-12-01T15:36:33Z","title":"Generative Action Tell-Tales: Assessing Human Motion in Synthesized Videos","version":3},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-03T19:11:53.300093Z"},"links":{"citing_paper":"/paper/2512.01803"},"observation_digest":"sha256:82e4d7642baba2bccdb7a6bc4c92c229bb1f42f02f10356e79f34ef0e7804168","observation_id":"5bb97ca7-36cf-401a-921d-590e6f214d47","resolution":{"observed_at":"2026-08-03T19:11:53.300093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04145","last_updated":"2023-11-07T17:16:06Z","snapshot_observed_at":"2026-08-02T12:25:34.488259Z","submitted_at":"2023-11-07T17:16:06Z","title":"I2VGen-XL: High-Quality Image-to-Video Synthesis via Cascaded Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04145","snapshot_observed_at":"2026-08-03T19:11:53.352938Z","title":"I2vgen-xl: High-quality image-to-video synthesis via cascaded diffusion models.arXiv preprint arXiv:2311.04145, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.01803","last_updated":"2026-07-09T15:41:25Z","snapshot_observed_at":"2026-08-08T13:02:50.552789Z","submitted_at":"2025-12-01T15:36:33Z","title":"Generative Action Tell-Tales: Assessing Human Motion in Synthesized Videos","version":3},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-03T19:11:53.352938Z"},"links":{"cited_paper":"/paper/2311.04145","citing_paper":"/paper/2512.01803"},"observation_digest":"sha256:d01164ec543c6896ab68ec9c1ecd584fc395641a520e025043039833f33600dd","observation_id":"be830186-9a0a-48c8-ac68-783537c97a49","resolution":{"observed_at":"2026-08-03T19:11:53.352938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-02T12:24:31.329178Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02713","snapshot_observed_at":"2026-08-03T19:11:53.418782Z","title":"Video instruction tuning with synthetic data.arXiv preprint arXiv:2410.02713, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.01803","last_updated":"2026-07-09T15:41:25Z","snapshot_observed_at":"2026-08-08T13:02:50.552789Z","submitted_at":"2025-12-01T15:36:33Z","title":"Generative Action Tell-Tales: Assessing Human Motion in Synthesized Videos","version":3},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-03T19:11:53.418782Z"},"links":{"cited_paper":"/paper/2410.02713","citing_paper":"/paper/2512.01803"},"observation_digest":"sha256:228d823b18d7b1be7ebef6413f94b794374b8ba08eb8e3eeb399cc3b60d05fc6","observation_id":"7dfb4cde-dffd-4ca0-800e-78e26826345d","resolution":{"observed_at":"2026-08-03T19:11:53.418782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-08-03T19:11:53.511931Z","title":"Vbench-2.0: Advancing video generation benchmark suite for intrinsic faithfulness.arXiv preprint arXiv:2503.21755, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.01803","last_updated":"2026-07-09T15:41:25Z","snapshot_observed_at":"2026-08-08T13:02:50.552789Z","submitted_at":"2025-12-01T15:36:33Z","title":"Generative Action Tell-Tales: Assessing Human Motion in Synthesized Videos","version":3},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-03T19:11:53.511931Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2512.01803"},"observation_digest":"sha256:f62809307c6afe334358702975d9103064e847c392f5d65d87a4e08c759072d0","observation_id":"00b4eaac-2f57-44cb-a055-d6fb0a4a26cb","resolution":{"observed_at":"2026-08-03T19:11:53.511931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.20404","last_updated":"2024-12-29T08:52:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-29T08:52:49Z","title":"Open-Sora: Democratizing Efficient Video Production for All","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.20404","snapshot_observed_at":"2026-08-03T19:11:53.585896Z","title":"HulaHoop","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.01803","last_updated":"2026-07-09T15:41:25Z","snapshot_observed_at":"2026-08-08T13:02:50.552789Z","submitted_at":"2025-12-01T15:36:33Z","title":"Generative Action Tell-Tales: Assessing Human Motion in Synthesized Videos","version":3},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-03T19:11:53.585896Z"},"links":{"cited_paper":"/paper/2412.20404","citing_paper":"/paper/2512.01803"},"observation_digest":"sha256:78f2ae6e1c396811c77f94aecd2c12d16f82a720d044f9b5c1e3382a6588500a","observation_id":"81ec3117-b6b7-4165-beff-7b9750aa5bf3","resolution":{"observed_at":"2026-08-03T19:11:53.585896Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:11:53.672760Z","title":"- Check pose, motion pattern, timing, and repeated evidence of that action","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.01803","last_updated":"2026-07-09T15:41:25Z","snapshot_observed_at":"2026-08-08T13:02:50.552789Z","submitted_at":"2025-12-01T15:36:33Z","title":"Generative Action Tell-Tales: Assessing Human Motion in Synthesized Videos","version":3},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-03T19:11:53.672760Z"},"links":{"citing_paper":"/paper/2512.01803"},"observation_digest":"sha256:64be6b8b435a59529a156685454ea7bac08e3ccc479a31ff7b0b0844af430ce9","observation_id":"f3bdd3ff-7918-4c97-8918-7c18b1ecc9b9","resolution":{"observed_at":"2026-08-03T19:11:53.672760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:11:53.734059Z","title":"action_consistency","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.01803","last_updated":"2026-07-09T15:41:25Z","snapshot_observed_at":"2026-08-08T13:02:50.552789Z","submitted_at":"2025-12-01T15:36:33Z","title":"Generative Action Tell-Tales: Assessing Human Motion in Synthesized Videos","version":3},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-03T19:11:53.734059Z"},"links":{"citing_paper":"/paper/2512.01803"},"observation_digest":"sha256:a8380bb0be269657085b34c60b9b07b21d58a7302ecb3c73fd119ff9a2e34e4c","observation_id":"a6448e26-8c99-45eb-a134-f416aba96eec","resolution":{"observed_at":"2026-08-03T19:11:53.734059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:11:50.921407Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.01803","last_updated":"2026-07-09T15:41:25Z","snapshot_observed_at":"2026-08-08T13:02:50.552789Z","submitted_at":"2025-12-01T15:36:33Z","title":"Generative Action Tell-Tales: Assessing Human Motion in Synthesized Videos","version":3},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-03T19:11:50.921407Z"},"links":{"citing_paper":"/paper/2512.01803"},"observation_digest":"sha256:12d0417eea241bb8d3b57eaa5708da35c3e813d41cf72ff0a414034f0ebd37be","observation_id":"ac5fb7a1-bfd5-4d47-81e2-fbbdec96b275","resolution":{"observed_at":"2026-08-03T19:11:50.921407Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2512.01803","last_updated":"2026-07-09T15:41:25Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T13:02:50.552789Z","submitted_at":"2025-12-01T15:36:33Z","title":"Generative Action Tell-Tales: Assessing Human Motion in Synthesized Videos"},"reference_resolution":{"displayed":75,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":73,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":75},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 75 of 75 outbound references and 0 inbound Pith citation observations for arXiv:2512.01803."}