{"as_of":"2026-08-10T03:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:71d03a1d3817f5ab17f6baa318a7b63b8d0062098d7ff655d64335806add6f6e","coverage":[{"denominator":104,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T16:49:54.185917Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.12463/citation-record","integrity":"/paper/2507.12463/integrity","json":"/paper/2507.12463/citation-record.json","paper":"/paper/2507.12463"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:36.455478Z","title":"Auxiliary tasks benefit 3d skeleton-based human motion prediction","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12463","last_updated":"2025-07-16T17:59:30Z","snapshot_observed_at":"2026-08-08T01:56:12.851297Z","submitted_at":"2025-07-16T17:59:30Z","title":"MMHU: A Massive-Scale Multimodal Benchmark for Human Behavior Understanding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:36.455478Z"},"links":{"citing_paper":"/paper/2507.12463"},"observation_digest":"sha256:322edb570b3bad67aa00382da26c0fc4195a0da2e4f624b14e96076a49d1c6ca","observation_id":"71839772-d37c-4bb6-8090-7cbf3de9a016","resolution":{"observed_at":"2026-08-06T16:49:36.455478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:36.600197Z","title":"Tamformer: Multi-modal transformer with learned attention mask for early intent prediction","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12463","last_updated":"2025-07-16T17:59:30Z","snapshot_observed_at":"2026-08-08T01:56:12.851297Z","submitted_at":"2025-07-16T17:59:30Z","title":"MMHU: A Massive-Scale Multimodal Benchmark for Human Behavior Understanding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:36.600197Z"},"links":{"citing_paper":"/paper/2507.12463"},"observation_digest":"sha256:838ec3830fb4e4ea19131d73e380c0795bcc2872c8e5e7ba4e1aec7e7f0db02c","observation_id":"a96daa7f-fbc2-4f4a-880c-6c94bc60c808","resolution":{"observed_at":"2026-08-06T16:49:36.600197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.20223","last_updated":"2025-05-09T18:51:10Z","snapshot_observed_at":"2026-08-07T03:25:24.138097Z","submitted_at":"2024-09-30T12:02:17Z","title":"GTransPDM: A Graph-embedded Transformer with Positional Decoupling for Pedestrian Crossing Intention Prediction","version":2},"cited_work":{"arxiv_id":"2409.20223","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.20223","snapshot_observed_at":"2026-08-06T16:49:55.109798Z","title":"GTransPDM: A Graph-embedded Transformer with Positional Decoupling for Pedestrian Crossing Intention Prediction","venue":"cs.CV","work_id":"395f0101-2873-497b-b8e4-8cd3105c4f74","year":2024},"citing_paper":{"arxiv_id":"2507.12463","last_updated":"2025-07-16T17:59:30Z","snapshot_observed_at":"2026-08-08T01:56:12.851297Z","submitted_at":"2025-07-16T17:59:30Z","title":"MMHU: A Massive-Scale Multimodal Benchmark for Human Behavior Understanding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:36.704505Z"},"links":{"cited_paper":"/paper/2409.20223","citing_paper":"/paper/2507.12463"},"observation_digest":"sha256:67308a72c5cbc0fc54a20b02745a90712da6f24c9b01067835776a38ca52d14a","observation_id":"c47b113e-39f4-4286-8073-9c025b0ab892","resolution":{"observed_at":"2026-08-06T16:49:55.192546Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:36.860276Z","title":"Predicting pedestrian crossing intention with feature fusion and spatio-temporal attention","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.12463","last_updated":"2025-07-16T17:59:30Z","snapshot_observed_at":"2026-08-08T01:56:12.851297Z","submitted_at":"2025-07-16T17:59:30Z","title":"MMHU: A Massive-Scale Multimodal Benchmark for Human Behavior Understanding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:36.860276Z"},"links":{"citing_paper":"/paper/2507.12463"},"observation_digest":"sha256:e4da0da3d67f28b56b9434442baa5af5063701d4b9fbf5b65f91858191ce9323","observation_id":"27815572-f287-4085-a7ad-e23add9bdce2","resolution":{"observed_at":"2026-08-06T16:49:36.860276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:36.992085Z","title":"Incorporating physics principles for precise human motion prediction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12463","last_updated":"2025-07-16T17:59:30Z","snapshot_observed_at":"2026-08-08T01:56:12.851297Z","submitted_at":"2025-07-16T17:59:30Z","title":"MMHU: A Massive-Scale Multimodal Benchmark for Human Behavior Understanding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:36.992085Z"},"links":{"citing_paper":"/paper/2507.12463"},"observation_digest":"sha256:0b5fb10d435aef3e63ed88b18b09135581cdb74f6cf14abe480ba49c442f79a4","observation_id":"e65c5890-52c5-41db-8aec-26f07361ddfc","resolution":{"observed_at":"2026-08-06T16:49:36.992085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:37.104896Z","title":"Behavioral intention prediction in driving scenes: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12463","last_updated":"2025-07-16T17:59:30Z","snapshot_observed_at":"2026-08-08T01:56:12.851297Z","submitted_at":"2025-07-16T17:59:30Z","title":"MMHU: A Massive-Scale Multimodal Benchmark for Human Behavior Understanding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:37.104896Z"},"links":{"citing_paper":"/paper/2507.12463"},"observation_digest":"sha256:190cf65bedc41339f750f478580bdaf13a6046cd810fc220bde1bb34eb4b30cb","observation_id":"f19f81f0-32c3-4616-976b-4e360e651e53","resolution":{"observed_at":"2026-08-06T16:49:37.104896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:37.233375Z","title":"Scalability in perception for autonomous driving: Waymo open dataset","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.12463","last_updated":"2025-07-16T17:59:30Z","snapshot_observed_at":"2026-08-08T01:56:12.851297Z","submitted_at":"2025-07-16T17:59:30Z","title":"MMHU: A Massive-Scale Multimodal Benchmark for Human Behavior Understanding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:37.233375Z"},"links":{"citing_paper":"/paper/2507.12463"},"observation_digest":"sha256:504b60e3df68b297e73757bf8495e1ee8ef784e1c4b86f1a733662f3db0e86da","observation_id":"668c5fa7-85d0-4f6d-a0aa-a5a34ede1a94","resolution":{"observed_at":"2026-08-06T16:49:37.233375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:37.369537Z","title":"nuscenes: A multimodal dataset for autonomous driving","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.12463","last_updated":"2025-07-16T17:59:30Z","snapshot_observed_at":"2026-08-08T01:56:12.851297Z","submitted_at":"2025-07-16T17:59:30Z","title":"MMHU: A Massive-Scale Multimodal Benchmark for Human Behavior Understanding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:37.369537Z"},"links":{"citing_paper":"/paper/2507.12463"},"observation_digest":"sha256:6d708b9f7d2679b9a50e4de4ce3f953292df8031a087e6cdea09a142b066b288","observation_id":"8f10b2ba-4ba7-4d84-bdfa-d7cb13c856f6","resolution":{"observed_at":"2026-08-06T16:49:37.369537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:37.511468Z","title":"Vision meets robotics: The kitti dataset","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2507.12463","last_updated":"2025-07-16T17:59:30Z","snapshot_observed_at":"2026-08-08T01:56:12.851297Z","submitted_at":"2025-07-16T17:59:30Z","title":"MMHU: A Massive-Scale Multimodal Benchmark for Human Behavior Understanding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:37.511468Z"},"links":{"citing_paper":"/paper/2507.12463"},"observation_digest":"sha256:b2185ebeb7f745d313d88f6b226d45f5359c4bd4e69693e3040e4767daf3b796","observation_id":"6b0d5c9a-88d9-44fe-b3ba-60febd80c9e9","resolution":{"observed_at":"2026-08-06T16:49:37.511468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:37.661119Z","title":"Pie: A large-scale dataset and models for pedestrian intention estimation and trajectory prediction","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.12463","last_updated":"2025-07-16T17:59:30Z","snapshot_observed_at":"2026-08-08T01:56:12.851297Z","submitted_at":"2025-07-16T17:59:30Z","title":"MMHU: A Massive-Scale Multimodal Benchmark for Human Behavior Understanding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:37.661119Z"},"links":{"citing_paper":"/paper/2507.12463"},"observation_digest":"sha256:3c1d3e9ad576b3c43a037318155343422b34534a9bd953f627ea35345d28dddb","observation_id":"6a6153d1-418d-4584-bf64-aab75b599cfb","resolution":{"observed_at":"2026-08-06T16:49:37.661119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:37.815286Z","title":"Euro-pvi: Pedestrian vehicle interactions in dense urban centers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.12463","last_updated":"2025-07-16T17:59:30Z","snapshot_observed_at":"2026-08-08T01:56:12.851297Z","submitted_at":"2025-07-16T17:59:30Z","title":"MMHU: A Massive-Scale Multimodal Benchmark for Human Behavior Understanding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:37.815286Z"},"links":{"citing_paper":"/paper/2507.12463"},"observation_digest":"sha256:d08504ff2d6293f9c2a3ba0357f18039edfa009ad8a1702b3d9c5d4a7fbb2dd2","observation_id":"b50f0152-fb57-4c86-824d-22574cc8200a","resolution":{"observed_at":"2026-08-06T16:49:37.815286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:37.957541Z","title":"Are they going to cross? a benchmark dataset and baseline for pedestrian crosswalk behavior","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.12463","last_updated":"2025-07-16T17:59:30Z","snapshot_observed_at":"2026-08-08T01:56:12.851297Z","submitted_at":"2025-07-16T17:59:30Z","title":"MMHU: A Massive-Scale Multimodal Benchmark for Human Behavior Understanding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:37.957541Z"},"links":{"citing_paper":"/paper/2507.12463"},"observation_digest":"sha256:ce7ed9cdfce56562d40ccdacffc9db8644ba621ed15adcb1b603469763a188d8","observation_id":"75c4dd4a-6aa8-4f10-b74c-b9cbea0c36f2","resolution":{"observed_at":"2026-08-06T16:49:37.957541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:38.083776Z","title":"Recovering accurate 3d human pose in the wild using imus and a moving camera","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.12463","last_updated":"2025-07-16T17:59:30Z","snapshot_observed_at":"2026-08-08T01:56:12.851297Z","submitted_at":"2025-07-16T17:59:30Z","title":"MMHU: A Massive-Scale Multimodal Benchmark for Human Behavior Understanding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:38.083776Z"},"links":{"citing_paper":"/paper/2507.12463"},"observation_digest":"sha256:a971e2e28db6c7a77f36fd8fd20fd5cb0044fc2d1dd32038ec745da89262140b","observation_id":"2c03a62f-90fb-4846-abd9-0525de31d5b6","resolution":{"observed_at":"2026-08-06T16:49:38.083776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:38.220473Z","title":"Pedestrian motion reconstruction: A large-scale benchmark via mixed reality rendering with multiple perspectives and modalities","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.12463","last_updated":"2025-07-16T17:59:30Z","snapshot_observed_at":"2026-08-08T01:56:12.851297Z","submitted_at":"2025-07-16T17:59:30Z","title":"MMHU: A Massive-Scale Multimodal Benchmark for Human Behavior Understanding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:38.220473Z"},"links":{"citing_paper":"/paper/2507.12463"},"observation_digest":"sha256:ea4d11ed07ec8478d13029d8f91a2c5179f9ad8dc84912a3fd1ae5e4ba0d76d8","observation_id":"de699b7c-0835-46f1-9b34-031d2a002a56","resolution":{"observed_at":"2026-08-06T16:49:38.220473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:38.336758Z","title":"Text to blind motion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12463","last_updated":"2025-07-16T17:59:30Z","snapshot_observed_at":"2026-08-08T01:56:12.851297Z","submitted_at":"2025-07-16T17:59:30Z","title":"MMHU: A Massive-Scale Multimodal Benchmark for Human Behavior Understanding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:38.336758Z"},"links":{"citing_paper":"/paper/2507.12463"},"observation_digest":"sha256:e799182c4421b370ca3c73e4db223a0aff00c2eafcdc1dbfc0f09adca64423fe","observation_id":"35a10f2d-3953-4c15-83fd-a9fd04b6a633","resolution":{"observed_at":"2026-08-06T16:49:38.336758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:38.508404Z","title":"Learning to generate diverse pedestrian move- ments from web videos with noisy labels","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12463","last_updated":"2025-07-16T17:59:30Z","snapshot_observed_at":"2026-08-08T01:56:12.851297Z","submitted_at":"2025-07-16T17:59:30Z","title":"MMHU: A Massive-Scale Multimodal Benchmark for Human Behavior Understanding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:38.508404Z"},"links":{"citing_paper":"/paper/2507.12463"},"observation_digest":"sha256:10a4c34699feb14cb69a6e01b300c7e83e26ac78712a286133b5149d41358ee8","observation_id":"522147a0-1c2e-4da7-b5dc-f7fc850ea232","resolution":{"observed_at":"2026-08-06T16:49:38.508404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-06T16:49:38.658154Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12463","last_updated":"2025-07-16T17:59:30Z","snapshot_observed_at":"2026-08-08T01:56:12.851297Z","submitted_at":"2025-07-16T17:59:30Z","title":"MMHU: A Massive-Scale Multimodal Benchmark for Human Behavior Understanding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:38.658154Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2507.12463"},"observation_digest":"sha256:7dd6560ceab3af78f279c77c562691fc64c6f83768aeed7d90e53f9054025619","observation_id":"5f264ace-4e2b-475a-8332-4e25d805e24b","resolution":{"observed_at":"2026-08-06T16:49:38.658154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:38.780959Z","title":"Vila: On pre-training for visual language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12463","last_updated":"2025-07-16T17:59:30Z","snapshot_observed_at":"2026-08-08T01:56:12.851297Z","submitted_at":"2025-07-16T17:59:30Z","title":"MMHU: A Massive-Scale Multimodal Benchmark for Human Behavior Understanding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:38.780959Z"},"links":{"citing_paper":"/paper/2507.12463"},"observation_digest":"sha256:9db03f5148df95e8ef462436fe30f7ade9b33c37583389016ef4ddbe986af457","observation_id":"c37d2d69-251c-4188-a3a1-f199219b0a40","resolution":{"observed_at":"2026-08-06T16:49:38.780959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:38.897379Z","title":"Longvila: Scaling long-context visual language models for long videos, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12463","last_updated":"2025-07-16T17:59:30Z","snapshot_observed_at":"2026-08-08T01:56:12.851297Z","submitted_at":"2025-07-16T17:59:30Z","title":"MMHU: A Massive-Scale Multimodal Benchmark for Human Behavior Understanding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:38.897379Z"},"links":{"citing_paper":"/paper/2507.12463"},"observation_digest":"sha256:8613f5f47353e43c1a9edb17e2b2055a4a13c587fbff4de44edb230f9350df30","observation_id":"7ba56018-4ad9-4ac4-91cf-f28fe1dadac0","resolution":{"observed_at":"2026-08-06T16:49:38.897379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:39.033356Z","title":"Nvila: Efficient frontier visual language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12463","last_updated":"2025-07-16T17:59:30Z","snapshot_observed_at":"2026-08-08T01:56:12.851297Z","submitted_at":"2025-07-16T17:59:30Z","title":"MMHU: A Massive-Scale Multimodal Benchmark for Human Behavior Understanding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:39.033356Z"},"links":{"citing_paper":"/paper/2507.12463"},"observation_digest":"sha256:f580d829e8d545d9b074818357ae9eb8fa7977b180dd9eda5c005da9b39c50f5","observation_id":"693cdbeb-5477-427d-9c0c-ccac7a52ccb5","resolution":{"observed_at":"2026-08-06T16:49:39.033356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:39.144588Z","title":"Visual instruction tuning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12463","last_updated":"2025-07-16T17:59:30Z","snapshot_observed_at":"2026-08-08T01:56:12.851297Z","submitted_at":"2025-07-16T17:59:30Z","title":"MMHU: A Massive-Scale Multimodal Benchmark for Human Behavior Understanding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:39.144588Z"},"links":{"citing_paper":"/paper/2507.12463"},"observation_digest":"sha256:8902391508d40041224b97589625ff6f27ce9364b2ff61ffb5785c96059f0123","observation_id":"297c659b-7536-4a3d-ad99-c81590c0b5f8","resolution":{"observed_at":"2026-08-06T16:49:39.144588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:39.289917Z","title":"Llava-next: Improved reasoning, ocr, and world knowledge, January 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12463","last_updated":"2025-07-16T17:59:30Z","snapshot_observed_at":"2026-08-08T01:56:12.851297Z","submitted_at":"2025-07-16T17:59:30Z","title":"MMHU: A Massive-Scale Multimodal Benchmark for Human Behavior Understanding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:39.289917Z"},"links":{"citing_paper":"/paper/2507.12463"},"observation_digest":"sha256:a8eef118e2193871527544b2307258a22e1403391f933ef5adba2a2a0cb3ff63","observation_id":"a63ec538-4950-44c5-b9a0-10b1c4594b7f","resolution":{"observed_at":"2026-08-06T16:49:39.289917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:39.431858Z","title":"Improved baselines with visual instruction tuning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12463","last_updated":"2025-07-16T17:59:30Z","snapshot_observed_at":"2026-08-08T01:56:12.851297Z","submitted_at":"2025-07-16T17:59:30Z","title":"MMHU: A Massive-Scale Multimodal Benchmark for Human Behavior Understanding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:39.431858Z"},"links":{"citing_paper":"/paper/2507.12463"},"observation_digest":"sha256:c18cbc536faa41b64d24da81ae95a4d147a279ea80afd57fcdb2cd8921c787ea","observation_id":"1453a2f1-8bde-4cfd-9337-264e70df223f","resolution":{"observed_at":"2026-08-06T16:49:39.431858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:39.607726Z","title":"Video instruction tuning with synthetic data, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12463","last_updated":"2025-07-16T17:59:30Z","snapshot_observed_at":"2026-08-08T01:56:12.851297Z","submitted_at":"2025-07-16T17:59:30Z","title":"MMHU: A Massive-Scale Multimodal Benchmark for Human Behavior Understanding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:39.607726Z"},"links":{"citing_paper":"/paper/2507.12463"},"observation_digest":"sha256:e104b865bd48c5a54c0005421251750360b0ba3a6c525b544df37d54b27e3da8","observation_id":"2eb5d404-b758-49a9-b3a4-66d32a56798c","resolution":{"observed_at":"2026-08-06T16:49:39.607726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-06T16:49:39.726727Z","title":"Qwen technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12463","last_updated":"2025-07-16T17:59:30Z","snapshot_observed_at":"2026-08-08T01:56:12.851297Z","submitted_at":"2025-07-16T17:59:30Z","title":"MMHU: A Massive-Scale Multimodal Benchmark for Human Behavior Understanding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:39.726727Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2507.12463"},"observation_digest":"sha256:d21a475fbe39fcce347e5fc35eaa0239fe234eb350ac8bac55406e7386be753c","observation_id":"aea0b38f-be94-4ce3-8094-dbf9f85e5196","resolution":{"observed_at":"2026-08-06T16:49:39.726727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:39.878547Z","title":"2d human pose estimation calibration and keypoint visibility classification","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12463","last_updated":"2025-07-16T17:59:30Z","snapshot_observed_at":"2026-08-08T01:56:12.851297Z","submitted_at":"2025-07-16T17:59:30Z","title":"MMHU: A Massive-Scale Multimodal Benchmark for Human Behavior Understanding","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:39.878547Z"},"links":{"citing_paper":"/paper/2507.12463"},"observation_digest":"sha256:7d2afcc4c00bb7ad66e3ab21d37b31d9d4692d42ae307a67b2fc4c7ec412d8e2","observation_id":"a666b112-4d18-43ab-b4ba-28345d4a0e29","resolution":{"observed_at":"2026-08-06T16:49:39.878547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:40.039779Z","title":"Recurrent human pose estimation","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.12463","last_updated":"2025-07-16T17:59:30Z","snapshot_observed_at":"2026-08-08T01:56:12.851297Z","submitted_at":"2025-07-16T17:59:30Z","title":"MMHU: A Massive-Scale Multimodal Benchmark for Human Behavior Understanding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:40.039779Z"},"links":{"citing_paper":"/paper/2507.12463"},"observation_digest":"sha256:cd06b3d4b53695dcb75dc8c109f642fb38906c2a33d563925889f45473bb10ba","observation_id":"c57d3b76-d08b-4d33-b7f5-c64d243f7602","resolution":{"observed_at":"2026-08-06T16:49:40.039779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:50:04.724844Z","title":"Rethinking the heatmap regression for bottom-up human pose estimation","venue":null,"work_id":"e1fc1d9e-0967-4043-bb28-155ca3b5e2a9","year":2021},"citing_paper":{"arxiv_id":"2507.12463","last_updated":"2025-07-16T17:59:30Z","snapshot_observed_at":"2026-08-08T01:56:12.851297Z","submitted_at":"2025-07-16T17:59:30Z","title":"MMHU: A Massive-Scale Multimodal Benchmark for Human Behavior Understanding","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:40.230695Z"},"links":{"citing_paper":"/paper/2507.12463"},"observation_digest":"sha256:2bfcb306970db8837af574da1b98e9601f39009a1356ea9edf44fd408780b319","observation_id":"fa480358-192c-4714-9253-d3f1016384a7","resolution":{"observed_at":"2026-08-06T16:50:04.784210Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:50:04.568142Z","title":"Tokenpose: Learning keypoint tokens for human pose estimation","venue":null,"work_id":"b70942db-5c22-482a-9d5b-28b5788cc6a6","year":2021},"citing_paper":{"arxiv_id":"2507.12463","last_updated":"2025-07-16T17:59:30Z","snapshot_observed_at":"2026-08-08T01:56:12.851297Z","submitted_at":"2025-07-16T17:59:30Z","title":"MMHU: A Massive-Scale Multimodal Benchmark for Human Behavior Understanding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:40.355038Z"},"links":{"citing_paper":"/paper/2507.12463"},"observation_digest":"sha256:b9eeed0443905eff7ee8e60c41d303f487b69c582e66d03426cd7ec78f4c75ad","observation_id":"892c2586-5580-411a-8265-3ab02a313167","resolution":{"observed_at":"2026-08-06T16:50:04.659736Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:41.266257Z","title":"Whole- body human pose estimation in the wild","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.12463","last_updated":"2025-07-16T17:59:30Z","snapshot_observed_at":"2026-08-08T01:56:12.851297Z","submitted_at":"2025-07-16T17:59:30Z","title":"MMHU: A Massive-Scale Multimodal Benchmark for Human Behavior Understanding","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:41.266257Z"},"links":{"citing_paper":"/paper/2507.12463"},"observation_digest":"sha256:28763042d922e6a898fe92ce03af0069c4f5c513913919b7848e901d4fb242af","observation_id":"8a758109-a470-4bd3-a647-71bfc7302460","resolution":{"observed_at":"2026-08-06T16:49:41.266257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:50:04.332562Z","title":null,"venue":null,"work_id":"453716a5-2c38-4b10-8c68-6409c0d7a71d","year":2015},"citing_paper":{"arxiv_id":"2507.12463","last_updated":"2025-07-16T17:59:30Z","snapshot_observed_at":"2026-08-08T01:56:12.851297Z","submitted_at":"2025-07-16T17:59:30Z","title":"MMHU: A Massive-Scale Multimodal Benchmark for Human Behavior Understanding","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:42.533122Z"},"links":{"citing_paper":"/paper/2507.12463"},"observation_digest":"sha256:f38bd250e7d52e682f7298b3a85be9bc63612ae5d95d8c2cc44f63c238a31fdb","observation_id":"94e049d9-f517-4a89-a27f-b739d48817cb","resolution":{"observed_at":"2026-08-06T16:50:04.442700Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:50:04.074890Z","title":null,"venue":null,"work_id":"20562753-7166-4dd8-bf8c-9ef97caba9f2","year":2017},"citing_paper":{"arxiv_id":"2507.12463","last_updated":"2025-07-16T17:59:30Z","snapshot_observed_at":"2026-08-08T01:56:12.851297Z","submitted_at":"2025-07-16T17:59:30Z","title":"MMHU: A Massive-Scale Multimodal Benchmark for Human Behavior Understanding","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:42.642434Z"},"links":{"citing_paper":"/paper/2507.12463"},"observation_digest":"sha256:493069dffa982324138cefd6f56b96f1dfb445a5bed1203d85d08f47f3d3fbfa","observation_id":"9b883b61-44b7-437b-bcc5-0cd0cc3b1c58","resolution":{"observed_at":"2026-08-06T16:50:04.210756Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:50:03.795788Z","title":null,"venue":null,"work_id":"11876b80-94b1-40c8-8443-c46d345e6dd5","year":2019},"citing_paper":{"arxiv_id":"2507.12463","last_updated":"2025-07-16T17:59:30Z","snapshot_observed_at":"2026-08-08T01:56:12.851297Z","submitted_at":"2025-07-16T17:59:30Z","title":"MMHU: A Massive-Scale Multimodal Benchmark for Human Behavior Understanding","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:43.103542Z"},"links":{"citing_paper":"/paper/2507.12463"},"observation_digest":"sha256:cce15da7553e3fa0f3ed0dd94e0fd3eb6af7fe194689daa981a5bde64629c067","observation_id":"59899439-f75b-4e85-a161-55b8cac73f39","resolution":{"observed_at":"2026-08-06T16:50:03.926076Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:45.787654Z","title":null,"venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2507.12463","last_updated":"2025-07-16T17:59:30Z","snapshot_observed_at":"2026-08-08T01:56:12.851297Z","submitted_at":"2025-07-16T17:59:30Z","title":"MMHU: A Massive-Scale Multimodal Benchmark for Human Behavior Understanding","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:45.787654Z"},"links":{"citing_paper":"/paper/2507.12463"},"observation_digest":"sha256:41578ad4180226a3b5ee84ab9484fb0aeec89f7fa1361f3a0807cd3e5320cc1f","observation_id":"1c010a3d-66b7-4b03-9a71-7c68846f1581","resolution":{"observed_at":"2026-08-06T16:49:45.787654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13790","last_updated":"2024-10-17T17:31:24Z","snapshot_observed_at":"2026-07-06T19:35:30.732080Z","submitted_at":"2024-10-17T17:31:24Z","title":"MotionBank: A Large-scale Video Motion Benchmark with Disentangled Rule-based Annotations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13790","snapshot_observed_at":"2026-08-06T16:49:45.980246Z","title":"Motionbank: A large-scale video motion benchmark with disentangled rule-based annotations","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.12463","last_updated":"2025-07-16T17:59:30Z","snapshot_observed_at":"2026-08-08T01:56:12.851297Z","submitted_at":"2025-07-16T17:59:30Z","title":"MMHU: A Massive-Scale Multimodal Benchmark for Human Behavior Understanding","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:45.980246Z"},"links":{"cited_paper":"/paper/2410.13790","citing_paper":"/paper/2507.12463"},"observation_digest":"sha256:c806e0376d937499597652e385a65ac3816b529ee8515face836dfa49e83546c","observation_id":"0a50da58-49dc-4d31-8ab4-40816ba7ab2e","resolution":{"observed_at":"2026-08-06T16:49:45.980246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:46.171972Z","title":"Amass: Archive of motion capture as surface shapes","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.12463","last_updated":"2025-07-16T17:59:30Z","snapshot_observed_at":"2026-08-08T01:56:12.851297Z","submitted_at":"2025-07-16T17:59:30Z","title":"MMHU: A Massive-Scale Multimodal Benchmark for Human Behavior Understanding","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:46.171972Z"},"links":{"citing_paper":"/paper/2507.12463"},"observation_digest":"sha256:bfd300e80fa21cf2a2470e16470b53cd32d220232074f2bd5363737dbc10eb63","observation_id":"27b6e82b-430e-42c8-9144-895cccf7a313","resolution":{"observed_at":"2026-08-06T16:49:46.171972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:50:03.531782Z","title":"Motion- x: A large-scale 3d expressive whole-body human motion dataset","venue":null,"work_id":"9b7f862d-3a2b-49f2-880c-57d27780a4bf","year":2023},"citing_paper":{"arxiv_id":"2507.12463","last_updated":"2025-07-16T17:59:30Z","snapshot_observed_at":"2026-08-08T01:56:12.851297Z","submitted_at":"2025-07-16T17:59:30Z","title":"MMHU: A Massive-Scale Multimodal Benchmark for Human Behavior Understanding","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:46.305846Z"},"links":{"citing_paper":"/paper/2507.12463"},"observation_digest":"sha256:28b415c58cf077fa9da50c33d82b9b51464f9fec54be854529f143b2fb1296ab","observation_id":"f4e72f73-3dac-49b6-a2cc-7bbff6b27495","resolution":{"observed_at":"2026-08-06T16:50:03.653273Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:50:03.238670Z","title":"Dynamic multi-person mesh recovery from uncalibrated multi-view cameras","venue":null,"work_id":"c6f8a9d1-c633-4520-92ea-6744f52706a0","year":2021},"citing_paper":{"arxiv_id":"2507.12463","last_updated":"2025-07-16T17:59:30Z","snapshot_observed_at":"2026-08-08T01:56:12.851297Z","submitted_at":"2025-07-16T17:59:30Z","title":"MMHU: A Massive-Scale Multimodal Benchmark for Human Behavior Understanding","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:46.407522Z"},"links":{"citing_paper":"/paper/2507.12463"},"observation_digest":"sha256:cf51b46d9a5edc0a14d9db85a0405ba6cd0ac92a2fcc722d189c62531598204b","observation_id":"d30fa8f4-654e-4a01-9c9a-f20182624064","resolution":{"observed_at":"2026-08-06T16:50:03.383774Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:50:03.030091Z","title":"Motion capture from internet videos","venue":null,"work_id":"468bfe47-b6b8-44a8-b4ac-ccdb3c691851","year":2020},"citing_paper":{"arxiv_id":"2507.12463","last_updated":"2025-07-16T17:59:30Z","snapshot_observed_at":"2026-08-08T01:56:12.851297Z","submitted_at":"2025-07-16T17:59:30Z","title":"MMHU: A Massive-Scale Multimodal Benchmark for Human Behavior Understanding","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:46.555723Z"},"links":{"citing_paper":"/paper/2507.12463"},"observation_digest":"sha256:e1a00cafc65ea59ccb2d02e9ea0781b0c8a95ac0929a9e1902dfb2c80182038f","observation_id":"867a74ba-8797-4300-a5cb-9d6c5274a6f9","resolution":{"observed_at":"2026-08-06T16:50:03.152948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:50:02.855311Z","title":"Scene-aware 3d multi-human motion capture from a single camera","venue":null,"work_id":"01b0eea3-4411-4c45-b7cf-13a7afd4a428","year":2023},"citing_paper":{"arxiv_id":"2507.12463","last_updated":"2025-07-16T17:59:30Z","snapshot_observed_at":"2026-08-08T01:56:12.851297Z","submitted_at":"2025-07-16T17:59:30Z","title":"MMHU: A Massive-Scale Multimodal Benchmark for Human Behavior Understanding","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:46.756807Z"},"links":{"citing_paper":"/paper/2507.12463"},"observation_digest":"sha256:6ac21dae96ddb067c45754ea0eeb77f3bdd14378af804313b8ba45f56a210ea2","observation_id":"8d9a3d61-079c-4639-a8bb-838233d8e2f8","resolution":{"observed_at":"2026-08-06T16:50:02.962878Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:50:02.643644Z","title":"D &d: Learning human dynamics from dynamic camera","venue":null,"work_id":"af2fd0da-158a-4c87-800e-d5c07ca1d6b8","year":2022},"citing_paper":{"arxiv_id":"2507.12463","last_updated":"2025-07-16T17:59:30Z","snapshot_observed_at":"2026-08-08T01:56:12.851297Z","submitted_at":"2025-07-16T17:59:30Z","title":"MMHU: A Massive-Scale Multimodal Benchmark for Human Behavior Understanding","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:46.912517Z"},"links":{"citing_paper":"/paper/2507.12463"},"observation_digest":"sha256:66bb637853906ff84cf706116460ff8c3875f48ab0178e596b250c0111fad21b","observation_id":"2291b9e1-8e3d-4ee4-afc5-36e6e2ef7029","resolution":{"observed_at":"2026-08-06T16:50:02.746385Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:50:02.425915Z","title":"Decoupling human and camera motion from videos in the wild","venue":null,"work_id":"0a1f17c5-3456-441d-bec2-a4e0002168fd","year":2023},"citing_paper":{"arxiv_id":"2507.12463","last_updated":"2025-07-16T17:59:30Z","snapshot_observed_at":"2026-08-08T01:56:12.851297Z","submitted_at":"2025-07-16T17:59:30Z","title":"MMHU: A Massive-Scale Multimodal Benchmark for Human Behavior Understanding","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:47.066608Z"},"links":{"citing_paper":"/paper/2507.12463"},"observation_digest":"sha256:9f6849da8294908d19c0d7f84fd7a43ff57cf6d5a790b5dcd50a6e818fbb1d8d","observation_id":"c096dc11-32ef-427e-8d4b-02f99abb36f5","resolution":{"observed_at":"2026-08-06T16:50:02.536495Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:50:02.205846Z","title":"Glamr: Global occlusion-aware human mesh recovery with dynamic cameras","venue":null,"work_id":"408b9bb9-8202-459c-addf-12c4b4b7aa92","year":2022},"citing_paper":{"arxiv_id":"2507.12463","last_updated":"2025-07-16T17:59:30Z","snapshot_observed_at":"2026-08-08T01:56:12.851297Z","submitted_at":"2025-07-16T17:59:30Z","title":"MMHU: A Massive-Scale Multimodal Benchmark for Human Behavior Understanding","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:47.201746Z"},"links":{"citing_paper":"/paper/2507.12463"},"observation_digest":"sha256:8e3e6880eb6883f4918ef484d76508ebb6a1e2566149a127623d3fb2f1b3a2e4","observation_id":"6aefdd6d-1981-4a44-a1f1-0dddfaf1523e","resolution":{"observed_at":"2026-08-06T16:50:02.319830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:50:02.014096Z","title":"Implicit neural representations for variable length human motion generation","venue":null,"work_id":"909a10db-15f8-47de-b273-714f5fea614f","year":2022},"citing_paper":{"arxiv_id":"2507.12463","last_updated":"2025-07-16T17:59:30Z","snapshot_observed_at":"2026-08-08T01:56:12.851297Z","submitted_at":"2025-07-16T17:59:30Z","title":"MMHU: A Massive-Scale Multimodal Benchmark for Human Behavior Understanding","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:47.271744Z"},"links":{"citing_paper":"/paper/2507.12463"},"observation_digest":"sha256:50854821aada69c55e7701208a419af6e761731a893b2b02c4cb05a97fb7412d","observation_id":"9820c467-ba5a-4440-aa1b-2bf2e57f7dc5","resolution":{"observed_at":"2026-08-06T16:50:02.098770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14916","last_updated":"2022-10-03T09:17:41Z","snapshot_observed_at":"2026-07-06T13:57:50.746457Z","submitted_at":"2022-09-29T16:27:53Z","title":"Human Motion Diffusion Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14916","snapshot_observed_at":"2026-08-06T16:49:47.444311Z","title":"Human motion diffusion model","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.12463","last_updated":"2025-07-16T17:59:30Z","snapshot_observed_at":"2026-08-08T01:56:12.851297Z","submitted_at":"2025-07-16T17:59:30Z","title":"MMHU: A Massive-Scale Multimodal Benchmark for Human Behavior Understanding","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:47.444311Z"},"links":{"cited_paper":"/paper/2209.14916","citing_paper":"/paper/2507.12463"},"observation_digest":"sha256:218be8ebb63185b6a857139813c9454524320767b45193aaebd2abca2803dd2f","observation_id":"376615c3-cc43-41f0-9c2c-c1b895599a2c","resolution":{"observed_at":"2026-08-06T16:49:47.444311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:47.619490Z","title":"Motiondiffuse: Text-driven human motion generation with diffusion model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12463","last_updated":"2025-07-16T17:59:30Z","snapshot_observed_at":"2026-08-08T01:56:12.851297Z","submitted_at":"2025-07-16T17:59:30Z","title":"MMHU: A Massive-Scale Multimodal Benchmark for Human Behavior Understanding","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:47.619490Z"},"links":{"citing_paper":"/paper/2507.12463"},"observation_digest":"sha256:6df193a37610c0870ebd5d65fb3fd7b4c9da0f93dc3465bbcda06a848de8511a","observation_id":"03f7e6d3-2a41-4896-8caa-e2297dc1c84a","resolution":{"observed_at":"2026-08-06T16:49:47.619490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:47.780696Z","title":"Home action genome: Cooperative compositional action understanding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.12463","last_updated":"2025-07-16T17:59:30Z","snapshot_observed_at":"2026-08-08T01:56:12.851297Z","submitted_at":"2025-07-16T17:59:30Z","title":"MMHU: A Massive-Scale Multimodal Benchmark for Human Behavior Understanding","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:47.780696Z"},"links":{"citing_paper":"/paper/2507.12463"},"observation_digest":"sha256:24387c7aa99e283b05db0769f65bdbc3380ed5b67a3dfd385cd2aedc0ba44600","observation_id":"9ea47c99-d57c-4a00-904f-4631a1ac504c","resolution":{"observed_at":"2026-08-06T16:49:47.780696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:50:01.819944Z","title":"Babel: Bodies, action and behavior with english labels","venue":null,"work_id":"2766f840-a095-4630-bf30-2a6130715ca0","year":2021},"citing_paper":{"arxiv_id":"2507.12463","last_updated":"2025-07-16T17:59:30Z","snapshot_observed_at":"2026-08-08T01:56:12.851297Z","submitted_at":"2025-07-16T17:59:30Z","title":"MMHU: A Massive-Scale Multimodal Benchmark for Human Behavior Understanding","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:47.926998Z"},"links":{"citing_paper":"/paper/2507.12463"},"observation_digest":"sha256:5c5722cf911f1108c161e1f9663b00dd98b1f120d14222ff57eb1826fa5a3c59","observation_id":"b4758825-c618-4953-bb34-bb8a00c56d74","resolution":{"observed_at":"2026-08-06T16:50:01.923957Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:50:01.580438Z","title":"Mining actionlet ensemble for action recognition with depth cameras","venue":null,"work_id":"abe28124-df3c-4c62-ad5c-f93a9df7d7f6","year":2012},"citing_paper":{"arxiv_id":"2507.12463","last_updated":"2025-07-16T17:59:30Z","snapshot_observed_at":"2026-08-08T01:56:12.851297Z","submitted_at":"2025-07-16T17:59:30Z","title":"MMHU: A Massive-Scale Multimodal Benchmark for Human Behavior Understanding","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:48.054445Z"},"links":{"citing_paper":"/paper/2507.12463"},"observation_digest":"sha256:e28ded60505060aba68f184071fb22f323b0cc709fa674914c58ac645357801b","observation_id":"be6c8ef9-7a1f-4292-a862-7d67243e69d2","resolution":{"observed_at":"2026-08-06T16:50:01.710745Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:50:01.392392Z","title":"Action recognition based on a bag of 3d points","venue":null,"work_id":"c7597cf9-5f52-4a5a-9a78-24061646c275","year":2010},"citing_paper":{"arxiv_id":"2507.12463","last_updated":"2025-07-16T17:59:30Z","snapshot_observed_at":"2026-08-08T01:56:12.851297Z","submitted_at":"2025-07-16T17:59:30Z","title":"MMHU: A Massive-Scale Multimodal Benchmark for Human Behavior Understanding","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:48.182938Z"},"links":{"citing_paper":"/paper/2507.12463"},"observation_digest":"sha256:250246f48e12cf8c34ea267fdd8b8ff49d776b7513f0bb5d8ee5cb2c77d4b0f7","observation_id":"92a5830b-19b3-47c5-a2b6-c13a1da481bb","resolution":{"observed_at":"2026-08-06T16:50:01.495068Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1212.0402","last_updated":"2012-12-03T14:45:31Z","snapshot_observed_at":"2026-07-06T03:01:10.229407Z","submitted_at":"2012-12-03T14:45:31Z","title":"UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1212.0402","snapshot_observed_at":"2026-08-06T16:49:48.439467Z","title":"Ucf101: A dataset of 101 human actions classes from videos in the wild","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2507.12463","last_updated":"2025-07-16T17:59:30Z","snapshot_observed_at":"2026-08-08T01:56:12.851297Z","submitted_at":"2025-07-16T17:59:30Z","title":"MMHU: A Massive-Scale Multimodal Benchmark for Human Behavior Understanding","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:48.439467Z"},"links":{"cited_paper":"/paper/1212.0402","citing_paper":"/paper/2507.12463"},"observation_digest":"sha256:2a714828f70db28e9c81457b7f5b51460710454df6649a08497a80b03833c0a2","observation_id":"6a2104d7-8a74-41c3-be0e-22d7490af9a9","resolution":{"observed_at":"2026-08-06T16:49:48.439467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:50:01.242425Z","title":"Modeling temporal structure of decomposable motion segments for activity classification","venue":null,"work_id":"6ff6d4dd-983b-4f2f-9d91-0406cfef9df0","year":2010},"citing_paper":{"arxiv_id":"2507.12463","last_updated":"2025-07-16T17:59:30Z","snapshot_observed_at":"2026-08-08T01:56:12.851297Z","submitted_at":"2025-07-16T17:59:30Z","title":"MMHU: A Massive-Scale Multimodal Benchmark for Human Behavior Understanding","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:48.662758Z"},"links":{"citing_paper":"/paper/2507.12463"},"observation_digest":"sha256:1d440e183eab7586f0709a871e5e7cfb8158f20835711fe7c2af456e47482f7a","observation_id":"d4bca55f-f114-4a84-8c6b-b03b8097020a","resolution":{"observed_at":"2026-08-06T16:50:01.314815Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.06950","last_updated":"2017-05-19T12:07:01Z","snapshot_observed_at":"2026-08-08T17:46:50.107463Z","submitted_at":"2017-05-19T12:07:01Z","title":"The Kinetics Human Action Video Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.06950","snapshot_observed_at":"2026-08-06T16:49:48.737903Z","title":"The kinetics human action video dataset","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.12463","last_updated":"2025-07-16T17:59:30Z","snapshot_observed_at":"2026-08-08T01:56:12.851297Z","submitted_at":"2025-07-16T17:59:30Z","title":"MMHU: A Massive-Scale Multimodal Benchmark for Human Behavior Understanding","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:48.737903Z"},"links":{"cited_paper":"/paper/1705.06950","citing_paper":"/paper/2507.12463"},"observation_digest":"sha256:30fe6854a87be66713eef9603b7361a7a11b3b4823b1a85430271b812494e824","observation_id":"c58ba53b-e930-46e4-8461-78f9e80d71dd","resolution":{"observed_at":"2026-08-06T16:49:48.737903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:50:01.033381Z","title":"Actions in context","venue":null,"work_id":"4e7f23f9-463c-4426-9d7c-5d57069c480c","year":2009},"citing_paper":{"arxiv_id":"2507.12463","last_updated":"2025-07-16T17:59:30Z","snapshot_observed_at":"2026-08-08T01:56:12.851297Z","submitted_at":"2025-07-16T17:59:30Z","title":"MMHU: A Massive-Scale Multimodal Benchmark for Human Behavior Understanding","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:48.924740Z"},"links":{"citing_paper":"/paper/2507.12463"},"observation_digest":"sha256:0d379eec2e7d7a96cd6a7f0eba5e83bf7f156e022d7d2fbf3d5afa989c717d29","observation_id":"92b440a4-e734-4821-a45c-8212ea0819ed","resolution":{"observed_at":"2026-08-06T16:50:01.161871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:50:00.876373Z","title":"Auxformer: Robust approach to audiovisual emotion recognition","venue":null,"work_id":"96939033-76fa-477e-a79a-cf6e9315f05a","year":2022},"citing_paper":{"arxiv_id":"2507.12463","last_updated":"2025-07-16T17:59:30Z","snapshot_observed_at":"2026-08-08T01:56:12.851297Z","submitted_at":"2025-07-16T17:59:30Z","title":"MMHU: A Massive-Scale Multimodal Benchmark for Human Behavior Understanding","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:49.076536Z"},"links":{"citing_paper":"/paper/2507.12463"},"observation_digest":"sha256:2a6879adcdb1389f6989a36f98a53a52f1d8d16ce230bd0c4a8f0d3187d076e7","observation_id":"164e9ab0-c904-4bf8-8d68-3c8a9b41626b","resolution":{"observed_at":"2026-08-06T16:50:00.946957Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:50:00.736198Z","title":"Context-based inter- pretable spatio-temporal graph convolutional network for human motion forecasting","venue":null,"work_id":"012c7a26-9104-4862-a05b-4bd340cd0d57","year":2024},"citing_paper":{"arxiv_id":"2507.12463","last_updated":"2025-07-16T17:59:30Z","snapshot_observed_at":"2026-08-08T01:56:12.851297Z","submitted_at":"2025-07-16T17:59:30Z","title":"MMHU: A Massive-Scale Multimodal Benchmark for Human Behavior Understanding","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:49.207068Z"},"links":{"citing_paper":"/paper/2507.12463"},"observation_digest":"sha256:c496582ea11f6f2daa15e2cad6d02f1bc74c627d42ec212f7e740fa6f964c12e","observation_id":"7ead9bb5-7390-4fe1-8aaa-50dc25b53977","resolution":{"observed_at":"2026-08-06T16:50:00.804751Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:50:00.519380Z","title":"Gcnext: Towards the unity of graph convo- lutions for human motion prediction","venue":null,"work_id":"572176e3-d2af-4bfd-9fcb-50e3864d6748","year":2024},"citing_paper":{"arxiv_id":"2507.12463","last_updated":"2025-07-16T17:59:30Z","snapshot_observed_at":"2026-08-08T01:56:12.851297Z","submitted_at":"2025-07-16T17:59:30Z","title":"MMHU: A Massive-Scale Multimodal Benchmark for Human Behavior Understanding","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:49.340159Z"},"links":{"citing_paper":"/paper/2507.12463"},"observation_digest":"sha256:4f6b09a09e29d6e01f952a386602f4748c32a33a523fe2488747a6c4ab65bacb","observation_id":"c0391ee2-d79c-45bd-99b2-d74667c2bae5","resolution":{"observed_at":"2026-08-06T16:50:00.618553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:50:00.305255Z","title":"Back to mlp: A simple baseline for human motion prediction","venue":null,"work_id":"9dbde66e-cc51-4f50-949a-3e1be052b4c9","year":2023},"citing_paper":{"arxiv_id":"2507.12463","last_updated":"2025-07-16T17:59:30Z","snapshot_observed_at":"2026-08-08T01:56:12.851297Z","submitted_at":"2025-07-16T17:59:30Z","title":"MMHU: A Massive-Scale Multimodal Benchmark for Human Behavior Understanding","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:49.443157Z"},"links":{"citing_paper":"/paper/2507.12463"},"observation_digest":"sha256:7ef11290f68ee718b0bf4b143ff0b503f2de411981eeb428183217f9cca95c5c","observation_id":"2f2d564a-098b-42ee-927d-698371054ade","resolution":{"observed_at":"2026-08-06T16:50:00.387378Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:50:00.082233Z","title":"History repeats itself: Human motion prediction via motion attention","venue":null,"work_id":"0a92f28c-3a31-438b-a8ad-85c3659124b4","year":2020},"citing_paper":{"arxiv_id":"2507.12463","last_updated":"2025-07-16T17:59:30Z","snapshot_observed_at":"2026-08-08T01:56:12.851297Z","submitted_at":"2025-07-16T17:59:30Z","title":"MMHU: A Massive-Scale Multimodal Benchmark for Human Behavior Understanding","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:49.578637Z"},"links":{"citing_paper":"/paper/2507.12463"},"observation_digest":"sha256:7b81bf03489c4b1e3593a1bbd73ee373904d9c0099aa95263229f65a503fd7a5","observation_id":"ed0b00e1-56de-4771-950a-999aac11ce18","resolution":{"observed_at":"2026-08-06T16:50:00.194250Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:59.828940Z","title":"Trep: Transformer-based evidential prediction for pedestrian intention with uncertainty","venue":null,"work_id":"6bc74212-0952-482e-a78f-ef20adc4cdff","year":2023},"citing_paper":{"arxiv_id":"2507.12463","last_updated":"2025-07-16T17:59:30Z","snapshot_observed_at":"2026-08-08T01:56:12.851297Z","submitted_at":"2025-07-16T17:59:30Z","title":"MMHU: A Massive-Scale Multimodal Benchmark for Human Behavior Understanding","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:49.698402Z"},"links":{"citing_paper":"/paper/2507.12463"},"observation_digest":"sha256:8a533a8ae15f8e7bfc0158c3b062610d3ab5de7c40b7b48587e9e8f914690d63","observation_id":"85d4f0b6-6f2d-4329-bc6b-378e3b4f8379","resolution":{"observed_at":"2026-08-06T16:49:59.936136Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:59.658595Z","title":"Visual–motion–interaction-guided pedestrian intention prediction framework","venue":null,"work_id":"a0ee6439-b89f-4359-871e-6a89f44bd5b7","year":2023},"citing_paper":{"arxiv_id":"2507.12463","last_updated":"2025-07-16T17:59:30Z","snapshot_observed_at":"2026-08-08T01:56:12.851297Z","submitted_at":"2025-07-16T17:59:30Z","title":"MMHU: A Massive-Scale Multimodal Benchmark for Human Behavior Understanding","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:49.805932Z"},"links":{"citing_paper":"/paper/2507.12463"},"observation_digest":"sha256:96def8fe9251fd5f61ff34f2e9a9e16d7872f782fce534c9cae2121da2b0cc75","observation_id":"2e0955c3-2a8a-4fe0-bb23-cbb3bf827409","resolution":{"observed_at":"2026-08-06T16:49:59.759578Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:59.427022Z","title":"Benchmark for evaluating pedestrian action prediction","venue":null,"work_id":"79a6f90c-9366-4e87-a0dc-30fede0c4260","year":2021},"citing_paper":{"arxiv_id":"2507.12463","last_updated":"2025-07-16T17:59:30Z","snapshot_observed_at":"2026-08-08T01:56:12.851297Z","submitted_at":"2025-07-16T17:59:30Z","title":"MMHU: A Massive-Scale Multimodal Benchmark for Human Behavior Understanding","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:49.841996Z"},"links":{"citing_paper":"/paper/2507.12463"},"observation_digest":"sha256:3eaf2400d2521c3ce20c9ed4fe3a02d72303f1798b8c302da28775b8023d0683","observation_id":"f0fe421d-6901-4329-b2f8-aab7dc2edacd","resolution":{"observed_at":"2026-08-06T16:49:59.547880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:59.226789Z","title":"Agreeing to cross: How drivers and pedestrians communicate","venue":null,"work_id":"ffeea87d-355a-4f35-9c1d-99025d23db8c","year":2017},"citing_paper":{"arxiv_id":"2507.12463","last_updated":"2025-07-16T17:59:30Z","snapshot_observed_at":"2026-08-08T01:56:12.851297Z","submitted_at":"2025-07-16T17:59:30Z","title":"MMHU: A Massive-Scale Multimodal Benchmark for Human Behavior Understanding","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:50.076568Z"},"links":{"citing_paper":"/paper/2507.12463"},"observation_digest":"sha256:ced89ba2aead905be4dfb624030901b5edfdeb4a119a6260b5c4a8476a232f02","observation_id":"8ceeceaf-1327-4ba8-bea8-02410bca2679","resolution":{"observed_at":"2026-08-06T16:49:59.335344Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:59.057738Z","title":"Pedestrian intention prediction based on dynamic fuzzy automata for vehicle driving at nighttime","venue":null,"work_id":"280e2533-9eac-41a5-89ad-6bcbefcb349a","year":2017},"citing_paper":{"arxiv_id":"2507.12463","last_updated":"2025-07-16T17:59:30Z","snapshot_observed_at":"2026-08-08T01:56:12.851297Z","submitted_at":"2025-07-16T17:59:30Z","title":"MMHU: A Massive-Scale Multimodal Benchmark for Human Behavior Understanding","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:50.298586Z"},"links":{"citing_paper":"/paper/2507.12463"},"observation_digest":"sha256:5956ef8b39b8a8f823a8b74710cbb3cfc099e0dd815c2713ee03075e6fb064e2","observation_id":"179f464a-4f06-48cc-8735-37ee93e2c362","resolution":{"observed_at":"2026-08-06T16:49:59.134669Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:58.883519Z","title":"Pedestrian intention and pose prediction through dynamical models and behaviour classification","venue":null,"work_id":"a314c035-7c6b-4a62-adaf-8974654ee858","year":2015},"citing_paper":{"arxiv_id":"2507.12463","last_updated":"2025-07-16T17:59:30Z","snapshot_observed_at":"2026-08-08T01:56:12.851297Z","submitted_at":"2025-07-16T17:59:30Z","title":"MMHU: A Massive-Scale Multimodal Benchmark for Human Behavior Understanding","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:50.432971Z"},"links":{"citing_paper":"/paper/2507.12463"},"observation_digest":"sha256:044b3827c807cc333b0ad9452a822babe8be68fcd56f7437fdd0c82db160ed83","observation_id":"7fa810cf-0bc2-4a02-b7fd-52823e3d55f3","resolution":{"observed_at":"2026-08-06T16:49:58.977044Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:58.705247Z","title":"Pedestrian path prediction with recursive bayesian filters: A comparative study","venue":null,"work_id":"ab59c625-ee5f-4834-a5a1-4cfcf5a9944d","year":2013},"citing_paper":{"arxiv_id":"2507.12463","last_updated":"2025-07-16T17:59:30Z","snapshot_observed_at":"2026-08-08T01:56:12.851297Z","submitted_at":"2025-07-16T17:59:30Z","title":"MMHU: A Massive-Scale Multimodal Benchmark for Human Behavior Understanding","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:50.558560Z"},"links":{"citing_paper":"/paper/2507.12463"},"observation_digest":"sha256:aff653f070985c2ae393b73b83ac87b179216b9a16f3a8e4fb0d0786d22fbe43","observation_id":"bea57fc8-781b-4767-99e4-422fe8c50f5d","resolution":{"observed_at":"2026-08-06T16:49:58.799103Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:50.712847Z","title":"Dolphins: Multimodal language model for driving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12463","last_updated":"2025-07-16T17:59:30Z","snapshot_observed_at":"2026-08-08T01:56:12.851297Z","submitted_at":"2025-07-16T17:59:30Z","title":"MMHU: A Massive-Scale Multimodal Benchmark for Human Behavior Understanding","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:50.712847Z"},"links":{"citing_paper":"/paper/2507.12463"},"observation_digest":"sha256:22d5ef9fb2a08f47e69c793434009ddc4aa6b657829d4ab982c3d8dfbb24c6d7","observation_id":"51bebc89-e5e6-4884-b173-a92fa96ceabd","resolution":{"observed_at":"2026-08-06T16:49:50.712847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:58.492825Z","title":"Drivelm: Driving with graph visual question answering","venue":null,"work_id":"56b4b346-96e1-4f8c-a683-1cf4ee30a16a","year":2024},"citing_paper":{"arxiv_id":"2507.12463","last_updated":"2025-07-16T17:59:30Z","snapshot_observed_at":"2026-08-08T01:56:12.851297Z","submitted_at":"2025-07-16T17:59:30Z","title":"MMHU: A Massive-Scale Multimodal Benchmark for Human Behavior Understanding","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:50.803207Z"},"links":{"citing_paper":"/paper/2507.12463"},"observation_digest":"sha256:847765ec3e6f84a9f39b29248d991f765d58a2169709b8043059277e800f1d66","observation_id":"2d51aa2e-fb38-43af-8dac-c2b5fcf3ba25","resolution":{"observed_at":"2026-08-06T16:49:58.596482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:58.318367Z","title":"Tem-adapter: Adapting image-text pretraining for video question answer","venue":null,"work_id":"b2266940-078e-45fc-994c-37786104395b","year":2023},"citing_paper":{"arxiv_id":"2507.12463","last_updated":"2025-07-16T17:59:30Z","snapshot_observed_at":"2026-08-08T01:56:12.851297Z","submitted_at":"2025-07-16T17:59:30Z","title":"MMHU: A Massive-Scale Multimodal Benchmark for Human Behavior Understanding","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:50.879641Z"},"links":{"citing_paper":"/paper/2507.12463"},"observation_digest":"sha256:e08c621d95b3761697be50bd6f15ed27c2744b2d62b40df225945d93081ebcde","observation_id":"10676d0d-7943-42c1-9a00-4e7cbe2b0cd8","resolution":{"observed_at":"2026-08-06T16:49:58.389195Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:50.978757Z","title":"Lmdrive: Closed-loop end-to-end driving with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12463","last_updated":"2025-07-16T17:59:30Z","snapshot_observed_at":"2026-08-08T01:56:12.851297Z","submitted_at":"2025-07-16T17:59:30Z","title":"MMHU: A Massive-Scale Multimodal Benchmark for Human Behavior Understanding","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:50.978757Z"},"links":{"citing_paper":"/paper/2507.12463"},"observation_digest":"sha256:3bbdcecd898447d8aa77a8b1933a6878e095c8e6fdea59505c708f11e2aee13b","observation_id":"e6c44bc0-0547-4c9c-bdfb-b981eedf1829","resolution":{"observed_at":"2026-08-06T16:49:50.978757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01533","last_updated":"2025-04-16T15:12:21Z","snapshot_observed_at":"2026-08-07T03:24:13.032388Z","submitted_at":"2024-05-02T17:59:24Z","title":"OmniDrive: A Holistic Vision-Language Dataset for Autonomous Driving with Counterfactual Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.01533","snapshot_observed_at":"2026-08-06T16:49:51.079501Z","title":"Omnidrive: A holistic llm-agent framework for autonomous driving with 3d perception, reasoning and planning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12463","last_updated":"2025-07-16T17:59:30Z","snapshot_observed_at":"2026-08-08T01:56:12.851297Z","submitted_at":"2025-07-16T17:59:30Z","title":"MMHU: A Massive-Scale Multimodal Benchmark for Human Behavior Understanding","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:51.079501Z"},"links":{"cited_paper":"/paper/2405.01533","citing_paper":"/paper/2507.12463"},"observation_digest":"sha256:bdf96e0b8a91066d7157c40fda0e970b1dc29246d65728a82499356394515960","observation_id":"0d2be7b6-6737-4ed4-ae54-7934b12a7f6f","resolution":{"observed_at":"2026-08-06T16:49:51.079501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:51.158814Z","title":"Rag-driver: Generalisable driving explanations with retrieval-augmented in-context learning in multi- modal large language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12463","last_updated":"2025-07-16T17:59:30Z","snapshot_observed_at":"2026-08-08T01:56:12.851297Z","submitted_at":"2025-07-16T17:59:30Z","title":"MMHU: A Massive-Scale Multimodal Benchmark for Human Behavior Understanding","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:51.158814Z"},"links":{"citing_paper":"/paper/2507.12463"},"observation_digest":"sha256:0c03efa8db7ecd4895a22541ad0d627018737aceee27d837c4ad738b4d79493a","observation_id":"d39b9996-86f6-481e-8701-3389039ebcf5","resolution":{"observed_at":"2026-08-06T16:49:51.158814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:58.076411Z","title":"Driving with llms: Fusing object-level vector modality for explainable autonomous driving","venue":null,"work_id":"db6e666a-4ecf-463a-9c47-8803f03b0084","year":2024},"citing_paper":{"arxiv_id":"2507.12463","last_updated":"2025-07-16T17:59:30Z","snapshot_observed_at":"2026-08-08T01:56:12.851297Z","submitted_at":"2025-07-16T17:59:30Z","title":"MMHU: A Massive-Scale Multimodal Benchmark for Human Behavior Understanding","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:51.254950Z"},"links":{"citing_paper":"/paper/2507.12463"},"observation_digest":"sha256:b566d6f6d06f4dfb50bb8fe03f67ecc330db52ce921171a85fe220f9bac5f416","observation_id":"68838d8b-e6f7-43f1-872d-d54892d9d338","resolution":{"observed_at":"2026-08-06T16:49:58.167373Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:57.865152Z","title":"Lingoqa: Visual question answering for autonomous driving","venue":null,"work_id":"5150769a-3d7e-4d61-9ecf-7911d40c60a7","year":2024},"citing_paper":{"arxiv_id":"2507.12463","last_updated":"2025-07-16T17:59:30Z","snapshot_observed_at":"2026-08-08T01:56:12.851297Z","submitted_at":"2025-07-16T17:59:30Z","title":"MMHU: A Massive-Scale Multimodal Benchmark for Human Behavior Understanding","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:51.438008Z"},"links":{"citing_paper":"/paper/2507.12463"},"observation_digest":"sha256:5e3fce2696213dfd8068d730bfd47ed807dcd942852b81802c13a73cc7769031","observation_id":"da9bb143-f317-4cbe-8537-f40b3002c5e2","resolution":{"observed_at":"2026-08-06T16:49:57.984400Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:51.633873Z","title":"Covla: Comprehensive vision-language-action dataset for autonomous driving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12463","last_updated":"2025-07-16T17:59:30Z","snapshot_observed_at":"2026-08-08T01:56:12.851297Z","submitted_at":"2025-07-16T17:59:30Z","title":"MMHU: A Massive-Scale Multimodal Benchmark for Human Behavior Understanding","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:51.633873Z"},"links":{"citing_paper":"/paper/2507.12463"},"observation_digest":"sha256:f9b99a30d57987e78fa44c0b7240696ff88305a8f088037c45d68a617cf7002b","observation_id":"fd6b48ab-d441-4973-8c40-d5b1556c37ac","resolution":{"observed_at":"2026-08-06T16:49:51.633873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:57.635242Z","title":"Rea- son2drive: Towards interpretable and chain-based reasoning for autonomous driving","venue":null,"work_id":"da818814-d510-43bd-9a1d-907ea8899ad3","year":2024},"citing_paper":{"arxiv_id":"2507.12463","last_updated":"2025-07-16T17:59:30Z","snapshot_observed_at":"2026-08-08T01:56:12.851297Z","submitted_at":"2025-07-16T17:59:30Z","title":"MMHU: A Massive-Scale Multimodal Benchmark for Human Behavior Understanding","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:51.737098Z"},"links":{"citing_paper":"/paper/2507.12463"},"observation_digest":"sha256:6a3238e3b2fbfb15b0996ada17f50ff36c2b43706bd1f66bf3d2887660e5e97b","observation_id":"3e784a95-c9bb-45c9-9b7d-d40f50b91555","resolution":{"observed_at":"2026-08-06T16:49:57.751162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:57.405883Z","title":"Nuscenes-mqa: Integrated evaluation of captions and qa for autonomous driving datasets using markup annotations","venue":null,"work_id":"538076b4-cdd1-4590-81f1-2cfa348b82eb","year":2024},"citing_paper":{"arxiv_id":"2507.12463","last_updated":"2025-07-16T17:59:30Z","snapshot_observed_at":"2026-08-08T01:56:12.851297Z","submitted_at":"2025-07-16T17:59:30Z","title":"MMHU: A Massive-Scale Multimodal Benchmark for Human Behavior Understanding","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:51.910116Z"},"links":{"citing_paper":"/paper/2507.12463"},"observation_digest":"sha256:ac793f1ddd86a29c57e63ab402cbf0e0d0b79e07233505d7f2b772b1972a9fbd","observation_id":"607d30e9-3a00-4aaf-9820-30d0b87c37e2","resolution":{"observed_at":"2026-08-06T16:49:57.500537Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14836","last_updated":"2024-02-20T05:04:58Z","snapshot_observed_at":"2026-08-03T10:52:29.042946Z","submitted_at":"2023-05-24T07:40:50Z","title":"NuScenes-QA: A Multi-modal Visual Question Answering Benchmark for Autonomous Driving Scenario","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14836","snapshot_observed_at":"2026-08-06T16:49:52.051367Z","title":"Nuscenes-qa: A multi-modal visual question answering benchmark for autonomous driving scenario","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12463","last_updated":"2025-07-16T17:59:30Z","snapshot_observed_at":"2026-08-08T01:56:12.851297Z","submitted_at":"2025-07-16T17:59:30Z","title":"MMHU: A Massive-Scale Multimodal Benchmark for Human Behavior Understanding","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:52.051367Z"},"links":{"cited_paper":"/paper/2305.14836","citing_paper":"/paper/2507.12463"},"observation_digest":"sha256:4833799d1cb113501db2c7b7ad3df28ab8ab22b6fdce29a15ccf44e2c7a7291c","observation_id":"e5f7465c-63d7-4549-83db-691b68c40cc8","resolution":{"observed_at":"2026-08-06T16:49:52.051367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:57.191911Z","title":"1 year, 1000 km: The oxford robotcar dataset","venue":null,"work_id":"43ef5251-05e3-45e7-99d6-74b8045bdd20","year":2017},"citing_paper":{"arxiv_id":"2507.12463","last_updated":"2025-07-16T17:59:30Z","snapshot_observed_at":"2026-08-08T01:56:12.851297Z","submitted_at":"2025-07-16T17:59:30Z","title":"MMHU: A Massive-Scale Multimodal Benchmark for Human Behavior Understanding","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:52.224282Z"},"links":{"citing_paper":"/paper/2507.12463"},"observation_digest":"sha256:fc12599962af421533cf37cfe922a9da0ad74a7957e4012f86836268801639aa","observation_id":"a79d6fa2-8fd4-4d0e-bd84-197aed7768f3","resolution":{"observed_at":"2026-08-06T16:49:57.288537Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:57.039043Z","title":"Dada: Driver attention prediction in driving accident scenarios","venue":null,"work_id":"9eb9eb22-0276-4a1f-a5c5-6561baa6dbbd","year":2021},"citing_paper":{"arxiv_id":"2507.12463","last_updated":"2025-07-16T17:59:30Z","snapshot_observed_at":"2026-08-08T01:56:12.851297Z","submitted_at":"2025-07-16T17:59:30Z","title":"MMHU: A Massive-Scale Multimodal Benchmark for Human Behavior Understanding","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:52.296701Z"},"links":{"citing_paper":"/paper/2507.12463"},"observation_digest":"sha256:d532bbd8e888eced3bd949d0e39fd1006130782d56cda9185c9cdb779746dcf7","observation_id":"9bb8aba5-a4b5-4106-9d54-f1f3eba09c6d","resolution":{"observed_at":"2026-08-06T16:49:57.106647Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:56.838624Z","title":"Snow removal in video: A new dataset and a novel method","venue":null,"work_id":"141bf0d7-ad24-4fd2-bb3b-d47fc09d2cb3","year":2023},"citing_paper":{"arxiv_id":"2507.12463","last_updated":"2025-07-16T17:59:30Z","snapshot_observed_at":"2026-08-08T01:56:12.851297Z","submitted_at":"2025-07-16T17:59:30Z","title":"MMHU: A Massive-Scale Multimodal Benchmark for Human Behavior Understanding","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:52.391187Z"},"links":{"citing_paper":"/paper/2507.12463"},"observation_digest":"sha256:6b48c4c4d3060f00952e08e8372352c18012a172fac3d3e8eb96a919a4ea464d","observation_id":"ef3aa4fc-2030-4b75-91b9-11c50c2c4fe4","resolution":{"observed_at":"2026-08-06T16:49:56.933123Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:56.625160Z","title":"Semantic foggy scene understanding with synthetic data","venue":null,"work_id":"ae5067f3-57d3-4b53-a293-ddd33b96ea20","year":2018},"citing_paper":{"arxiv_id":"2507.12463","last_updated":"2025-07-16T17:59:30Z","snapshot_observed_at":"2026-08-08T01:56:12.851297Z","submitted_at":"2025-07-16T17:59:30Z","title":"MMHU: A Massive-Scale Multimodal Benchmark for Human Behavior Understanding","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:52.460177Z"},"links":{"citing_paper":"/paper/2507.12463"},"observation_digest":"sha256:2346978ffed01c690032e8704e78a378c4ebcf4a8f0f73b784bc3bf0c28bd3e7","observation_id":"633e92b7-df81-4138-bd02-74811c27fd65","resolution":{"observed_at":"2026-08-06T16:49:56.711029Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:56.409389Z","title":"Wham: Reconstructing world-grounded humans with accurate 3d motion","venue":null,"work_id":"9198c08f-8a63-4785-97f1-d6c6fc3cae2b","year":2024},"citing_paper":{"arxiv_id":"2507.12463","last_updated":"2025-07-16T17:59:30Z","snapshot_observed_at":"2026-08-08T01:56:12.851297Z","submitted_at":"2025-07-16T17:59:30Z","title":"MMHU: A Massive-Scale Multimodal Benchmark for Human Behavior Understanding","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:52.544376Z"},"links":{"citing_paper":"/paper/2507.12463"},"observation_digest":"sha256:e322e6e44b9c6a3bcdba230423298bfe2a723967d0c8547625bd329d5d9dca7f","observation_id":"14e4f89f-40d7-4f5b-9d28-723b02c3b296","resolution":{"observed_at":"2026-08-06T16:49:56.501706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:56.264552Z","title":"Recov- ering accurate 3d human pose in the wild using imus and a moving camera","venue":null,"work_id":"d06a9a85-8160-4d25-bb8d-5cb8925bfd62","year":2018},"citing_paper":{"arxiv_id":"2507.12463","last_updated":"2025-07-16T17:59:30Z","snapshot_observed_at":"2026-08-08T01:56:12.851297Z","submitted_at":"2025-07-16T17:59:30Z","title":"MMHU: A Massive-Scale Multimodal Benchmark for Human Behavior Understanding","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:52.648254Z"},"links":{"citing_paper":"/paper/2507.12463"},"observation_digest":"sha256:b5ca3fead1f8582b0917077fab9bb09010014d4955f9613412751ca966b911eb","observation_id":"5dfdc58d-34c0-4e05-afb3-b59c6fd130fe","resolution":{"observed_at":"2026-08-06T16:49:56.335057Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:52.765409Z","title":"Drama: Joint risk localization and captioning in driving","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12463","last_updated":"2025-07-16T17:59:30Z","snapshot_observed_at":"2026-08-08T01:56:12.851297Z","submitted_at":"2025-07-16T17:59:30Z","title":"MMHU: A Massive-Scale Multimodal Benchmark for Human Behavior Understanding","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:52.765409Z"},"links":{"citing_paper":"/paper/2507.12463"},"observation_digest":"sha256:6302f554a3ba70cea526f54f2dde83b8f6e85c28eb18b3484cecb409363b84ea","observation_id":"d3a61028-8328-42fc-adfe-ee4e7bb0957b","resolution":{"observed_at":"2026-08-06T16:49:52.765409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:56.063004Z","title":"Posescript: 3d human poses from natural language","venue":null,"work_id":"22f3cdfe-8a2b-4f9f-bb35-a6cc90320709","year":2022},"citing_paper":{"arxiv_id":"2507.12463","last_updated":"2025-07-16T17:59:30Z","snapshot_observed_at":"2026-08-08T01:56:12.851297Z","submitted_at":"2025-07-16T17:59:30Z","title":"MMHU: A Massive-Scale Multimodal Benchmark for Human Behavior Understanding","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:52.848079Z"},"links":{"citing_paper":"/paper/2507.12463"},"observation_digest":"sha256:ba7d2c3515aaf2fd693ec3db01797b2716fa7f725e5f3b5a30892f6efaaf9396","observation_id":"a7cc4c9c-ef71-4152-930d-8a4d0a52d6f3","resolution":{"observed_at":"2026-08-06T16:49:56.146203Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:52.954611Z","title":"Motiongpt: Human motion as a foreign language","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12463","last_updated":"2025-07-16T17:59:30Z","snapshot_observed_at":"2026-08-08T01:56:12.851297Z","submitted_at":"2025-07-16T17:59:30Z","title":"MMHU: A Massive-Scale Multimodal Benchmark for Human Behavior Understanding","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:52.954611Z"},"links":{"citing_paper":"/paper/2507.12463"},"observation_digest":"sha256:d9e5ad3bfdcb6cfe72b00c1c04b22a8dfe532dc14d07c6ec49e434bfda254dba","observation_id":"d09a7f04-0b4f-465b-b0ce-31e679d39e3b","resolution":{"observed_at":"2026-08-06T16:49:52.954611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:53.064565Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilibrium","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.12463","last_updated":"2025-07-16T17:59:30Z","snapshot_observed_at":"2026-08-08T01:56:12.851297Z","submitted_at":"2025-07-16T17:59:30Z","title":"MMHU: A Massive-Scale Multimodal Benchmark for Human Behavior Understanding","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:53.064565Z"},"links":{"citing_paper":"/paper/2507.12463"},"observation_digest":"sha256:ebfaa4168dc5e92f3ecc0966bfb5dc97355589ef79c3ea84acfecc2486410d62","observation_id":"d6efac6a-c297-4a31-abc6-8c9401a22094","resolution":{"observed_at":"2026-08-06T16:49:53.064565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-08-09T11:59:10.408717Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-08-06T16:49:53.159318Z","title":"Phi-4-mini technical report: Com- pact yet powerful multimodal language models via mixture-of-loras","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.12463","last_updated":"2025-07-16T17:59:30Z","snapshot_observed_at":"2026-08-08T01:56:12.851297Z","submitted_at":"2025-07-16T17:59:30Z","title":"MMHU: A Massive-Scale Multimodal Benchmark for Human Behavior Understanding","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:53.159318Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2507.12463"},"observation_digest":"sha256:0d3369e5e5413575fb2445d0b80caa90203006ff723182a0064537a6977d5128","observation_id":"b8fa220a-9394-478e-ae1a-55896c6ea69d","resolution":{"observed_at":"2026-08-06T16:49:53.159318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-06T16:49:53.272808Z","title":"Minicpm-v: A gpt-4v level mllm on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12463","last_updated":"2025-07-16T17:59:30Z","snapshot_observed_at":"2026-08-08T01:56:12.851297Z","submitted_at":"2025-07-16T17:59:30Z","title":"MMHU: A Massive-Scale Multimodal Benchmark for Human Behavior Understanding","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:53.272808Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2507.12463"},"observation_digest":"sha256:ee537bed8150cadf15ae45d697fb216fe2ac98d626137873faf4cd7f456c93c0","observation_id":"716f75ef-6c74-4cd4-9f30-f5613f70e6bd","resolution":{"observed_at":"2026-08-06T16:49:53.272808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-06T16:49:53.371557Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12463","last_updated":"2025-07-16T17:59:30Z","snapshot_observed_at":"2026-08-08T01:56:12.851297Z","submitted_at":"2025-07-16T17:59:30Z","title":"MMHU: A Massive-Scale Multimodal Benchmark for Human Behavior Understanding","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:53.371557Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2507.12463"},"observation_digest":"sha256:80bffef78c1207c44abd3a8e0493ac3e0a95524fe801a148a7ea2e53b48a93cf","observation_id":"7200b3b0-b926-4848-bd33-5343c9a6842c","resolution":{"observed_at":"2026-08-06T16:49:53.371557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-06T16:49:53.451178Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.12463","last_updated":"2025-07-16T17:59:30Z","snapshot_observed_at":"2026-08-08T01:56:12.851297Z","submitted_at":"2025-07-16T17:59:30Z","title":"MMHU: A Massive-Scale Multimodal Benchmark for Human Behavior Understanding","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:53.451178Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2507.12463"},"observation_digest":"sha256:9862dc8ad01338420edb03fff938f02ac741f766e118d5f2088051df76289911","observation_id":"a5b2b250-4156-402e-98a8-275f3f32c366","resolution":{"observed_at":"2026-08-06T16:49:53.451178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-06T16:49:53.541236Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12463","last_updated":"2025-07-16T17:59:30Z","snapshot_observed_at":"2026-08-08T01:56:12.851297Z","submitted_at":"2025-07-16T17:59:30Z","title":"MMHU: A Massive-Scale Multimodal Benchmark for Human Behavior Understanding","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:53.541236Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2507.12463"},"observation_digest":"sha256:1a6ae1e229fc6e2b8ffa55b78258c432cfbeda45558cc3815229a0f494f0c5d4","observation_id":"26395a82-440b-4d02-9634-af4b864fd32f","resolution":{"observed_at":"2026-08-06T16:49:53.541236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01483","last_updated":"2024-11-15T06:31:44Z","snapshot_observed_at":"2026-07-06T18:08:56.480769Z","submitted_at":"2024-05-02T17:14:57Z","title":"MANTIS: Interleaved Multi-Image Instruction Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.01483","snapshot_observed_at":"2026-08-06T16:49:53.632371Z","title":"Mantis: Interleaved multi-image instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12463","last_updated":"2025-07-16T17:59:30Z","snapshot_observed_at":"2026-08-08T01:56:12.851297Z","submitted_at":"2025-07-16T17:59:30Z","title":"MMHU: A Massive-Scale Multimodal Benchmark for Human Behavior Understanding","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:53.632371Z"},"links":{"cited_paper":"/paper/2405.01483","citing_paper":"/paper/2507.12463"},"observation_digest":"sha256:f128b08f37a2204f58e498a90e26bfab99d5f074719c1eebdcdc543061e35782","observation_id":"68ea932b-35ff-451a-91b8-44938f6df4d9","resolution":{"observed_at":"2026-08-06T16:49:53.632371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:53.709943Z","title":"Building and better understanding vision-language models: insights and future directions., 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12463","last_updated":"2025-07-16T17:59:30Z","snapshot_observed_at":"2026-08-08T01:56:12.851297Z","submitted_at":"2025-07-16T17:59:30Z","title":"MMHU: A Massive-Scale Multimodal Benchmark for Human Behavior Understanding","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:53.709943Z"},"links":{"citing_paper":"/paper/2507.12463"},"observation_digest":"sha256:1a6fae244e6e8939a72e5440f3d1853a91b89c37e1b65a185c2a9024de361c99","observation_id":"f3e330ce-1d74-48eb-a971-be76d1ae37d0","resolution":{"observed_at":"2026-08-06T16:49:53.709943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07073","last_updated":"2024-10-10T17:59:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-09T17:16:22Z","title":"Pixtral 12B","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07073","snapshot_observed_at":"2026-08-06T16:49:53.785315Z","title":"Pixtral 12b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.12463","last_updated":"2025-07-16T17:59:30Z","snapshot_observed_at":"2026-08-08T01:56:12.851297Z","submitted_at":"2025-07-16T17:59:30Z","title":"MMHU: A Massive-Scale Multimodal Benchmark for Human Behavior Understanding","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:53.785315Z"},"links":{"cited_paper":"/paper/2410.07073","citing_paper":"/paper/2507.12463"},"observation_digest":"sha256:c4c2a111e0180871d56706dd564ff6773ba3c0bd6334a6f3d52f7bf6a521e880","observation_id":"de930206-53e1-4297-90c8-e1418f1cbca7","resolution":{"observed_at":"2026-08-06T16:49:53.785315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19786","last_updated":"2025-03-25T15:52:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T15:52:34Z","title":"Gemma 3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19786","snapshot_observed_at":"2026-08-06T16:49:53.884739Z","title":"Gemma 3 technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.12463","last_updated":"2025-07-16T17:59:30Z","snapshot_observed_at":"2026-08-08T01:56:12.851297Z","submitted_at":"2025-07-16T17:59:30Z","title":"MMHU: A Massive-Scale Multimodal Benchmark for Human Behavior Understanding","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:53.884739Z"},"links":{"cited_paper":"/paper/2503.19786","citing_paper":"/paper/2507.12463"},"observation_digest":"sha256:e22c1740179d3b7c9f417ef2e97fbb9211c455ec419e4b6ae6118df76915ced1","observation_id":"31e8e320-eaac-4ab4-8bc5-b55eee0c7e62","resolution":{"observed_at":"2026-08-06T16:49:53.884739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10302","last_updated":"2024-12-13T17:37:48Z","snapshot_observed_at":"2026-08-07T03:01:29.031129Z","submitted_at":"2024-12-13T17:37:48Z","title":"DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10302","snapshot_observed_at":"2026-08-06T16:49:53.990949Z","title":"Deepseek-vl2: Mixture-of-experts vision-language models for advanced multimodal understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12463","last_updated":"2025-07-16T17:59:30Z","snapshot_observed_at":"2026-08-08T01:56:12.851297Z","submitted_at":"2025-07-16T17:59:30Z","title":"MMHU: A Massive-Scale Multimodal Benchmark for Human Behavior Understanding","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:53.990949Z"},"links":{"cited_paper":"/paper/2412.10302","citing_paper":"/paper/2507.12463"},"observation_digest":"sha256:bfd25322ee3d8e3b184d9145e893b739fcd34409c19a12893760e0fa09c40d9e","observation_id":"f4b662be-748a-4797-b619-ddf3794da39d","resolution":{"observed_at":"2026-08-06T16:49:53.990949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-08-09T09:48:45.884814Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-08-06T16:49:54.072518Z","title":"Kimi-vl technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.12463","last_updated":"2025-07-16T17:59:30Z","snapshot_observed_at":"2026-08-08T01:56:12.851297Z","submitted_at":"2025-07-16T17:59:30Z","title":"MMHU: A Massive-Scale Multimodal Benchmark for Human Behavior Understanding","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:54.072518Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2507.12463"},"observation_digest":"sha256:a05532a057212b73061b2937abd84d6858fb4f718da7e54526e66cc820abd9e6","observation_id":"84beb5f3-69ff-4066-9f02-b08cae3daa5f","resolution":{"observed_at":"2026-08-06T16:49:54.072518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04741","last_updated":"2020-04-22T21:59:50Z","snapshot_observed_at":"2026-08-09T13:25:19.880360Z","submitted_at":"2016-09-15T17:15:28Z","title":"Joint Attention in Autonomous Driving (JAAD)","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.04741","snapshot_observed_at":"2026-08-06T16:49:54.185917Z","title":"Joint attention in autonomous driving (jaad)","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.12463","last_updated":"2025-07-16T17:59:30Z","snapshot_observed_at":"2026-08-08T01:56:12.851297Z","submitted_at":"2025-07-16T17:59:30Z","title":"MMHU: A Massive-Scale Multimodal Benchmark for Human Behavior Understanding","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:54.185917Z"},"links":{"cited_paper":"/paper/1609.04741","citing_paper":"/paper/2507.12463"},"observation_digest":"sha256:2fcd87327ad0f9cc9e346fde6ca0b9ef1679e371d1e59d8bf29b99eb15543e09","observation_id":"f1010b81-99b5-464e-8195-5401d9bd769b","resolution":{"observed_at":"2026-08-06T16:49:54.185917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.12463","last_updated":"2025-07-16T17:59:30Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T01:56:12.851297Z","submitted_at":"2025-07-16T17:59:30Z","title":"MMHU: A Massive-Scale Multimodal Benchmark for Human Behavior Understanding"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":59,"verified_exact":1,"verified_fuzzy":40},"total_outbound_references":104},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 100 of 104 outbound references and 0 inbound Pith citation observations for arXiv:2507.12463."}