{"as_of":"2026-08-19T09:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7520cdc4a2ecf8fdc7ba13fc153ca82c90e6cf7bbb04bba965c4b6d4c4be791e","coverage":[{"denominator":90,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":90,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:23:50.931348Z","state":"measured"},{"denominator":90,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":90,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.21586/citation-record","integrity":"/paper/2506.21586/integrity","json":"/paper/2506.21586/citation-record.json","paper":"/paper/2506.21586"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:37.317472Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.21586","last_updated":"2025-08-07T04:59:32Z","snapshot_observed_at":"2026-08-14T13:11:56.557075Z","submitted_at":"2025-06-17T13:37:42Z","title":"Can Vision Language Models Understand Mimed Actions?","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T00:23:37.317472Z"},"links":{"citing_paper":"/paper/2506.21586"},"observation_digest":"sha256:910db1a057f25c0f0401437c6d2da1f0272900c6beda703db69a785411b5b5de","observation_id":"37592391-9f27-466e-b4f4-fd2d24d3d3ed","resolution":{"observed_at":"2026-08-07T00:23:37.317472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:37.463979Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.21586","last_updated":"2025-08-07T04:59:32Z","snapshot_observed_at":"2026-08-14T13:11:56.557075Z","submitted_at":"2025-06-17T13:37:42Z","title":"Can Vision Language Models Understand Mimed Actions?","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T00:23:37.463979Z"},"links":{"citing_paper":"/paper/2506.21586"},"observation_digest":"sha256:0299bae0e477f4075f7c969ad5c13d43935b60b0a91dab7400581b2dc577c927","observation_id":"cfa58a2e-7619-4516-9c07-70d3a99bef8b","resolution":{"observed_at":"2026-08-07T00:23:37.463979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-08-17T03:25:04.404839Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-07T00:23:37.621631Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21586","last_updated":"2025-08-07T04:59:32Z","snapshot_observed_at":"2026-08-14T13:11:56.557075Z","submitted_at":"2025-06-17T13:37:42Z","title":"Can Vision Language Models Understand Mimed Actions?","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T00:23:37.621631Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2506.21586"},"observation_digest":"sha256:0acf702756e6dc4cf3b09aaaccea68ab591913a95ad00a11ba31d7fa0f12c922","observation_id":"1361554e-ef8d-474c-bd9d-d3761b5a8962","resolution":{"observed_at":"2026-08-07T00:23:37.621631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:37.711660Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.21586","last_updated":"2025-08-07T04:59:32Z","snapshot_observed_at":"2026-08-14T13:11:56.557075Z","submitted_at":"2025-06-17T13:37:42Z","title":"Can Vision Language Models Understand Mimed Actions?","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T00:23:37.711660Z"},"links":{"citing_paper":"/paper/2506.21586"},"observation_digest":"sha256:5fd98c2c88e0b6b78f6ca4ba5894105c7ac2256b4c95996e25fa9d94652190ef","observation_id":"1d822a72-4b77-44a6-b110-2f22fdf10580","resolution":{"observed_at":"2026-08-07T00:23:37.711660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:37.873215Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.21586","last_updated":"2025-08-07T04:59:32Z","snapshot_observed_at":"2026-08-14T13:11:56.557075Z","submitted_at":"2025-06-17T13:37:42Z","title":"Can Vision Language Models Understand Mimed Actions?","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T00:23:37.873215Z"},"links":{"citing_paper":"/paper/2506.21586"},"observation_digest":"sha256:0203878c0fe54909aca66e4dc6517eaa9fad7512b047a322c2db8977f792dc0a","observation_id":"80d60c72-f67d-494a-ac70-e20369a4d725","resolution":{"observed_at":"2026-08-07T00:23:37.873215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:38.038257Z","title":null,"venue":null,"work_id":null,"year":1979},"citing_paper":{"arxiv_id":"2506.21586","last_updated":"2025-08-07T04:59:32Z","snapshot_observed_at":"2026-08-14T13:11:56.557075Z","submitted_at":"2025-06-17T13:37:42Z","title":"Can Vision Language Models Understand Mimed Actions?","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T00:23:38.038257Z"},"links":{"citing_paper":"/paper/2506.21586"},"observation_digest":"sha256:1f1af31d987f1e6843777b807236a1420aacfab8be8b891c33510cf65d022e8b","observation_id":"1dcfcb12-d98d-4184-b6c7-52518ba63cb0","resolution":{"observed_at":"2026-08-07T00:23:38.038257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-07T00:23:38.250999Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21586","last_updated":"2025-08-07T04:59:32Z","snapshot_observed_at":"2026-08-14T13:11:56.557075Z","submitted_at":"2025-06-17T13:37:42Z","title":"Can Vision Language Models Understand Mimed Actions?","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T00:23:38.250999Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2506.21586"},"observation_digest":"sha256:8621e718991bf6f8f75f329ce4252bf60685a0f9bb17be5e25bfb0ddda5e638a","observation_id":"645b35a1-e3b7-4004-871c-c56b7d29296a","resolution":{"observed_at":"2026-08-07T00:23:38.250999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T00:23:38.400654Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21586","last_updated":"2025-08-07T04:59:32Z","snapshot_observed_at":"2026-08-14T13:11:56.557075Z","submitted_at":"2025-06-17T13:37:42Z","title":"Can Vision Language Models Understand Mimed Actions?","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T00:23:38.400654Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2506.21586"},"observation_digest":"sha256:df94ca9d77500e98f8d844a926e477bf3256f5703f640a2497a68947666f63ee","observation_id":"a1b5c09b-fe55-4511-a0da-1bf971f4b8d2","resolution":{"observed_at":"2026-08-07T00:23:38.400654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:38.562682Z","title":null,"venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2506.21586","last_updated":"2025-08-07T04:59:32Z","snapshot_observed_at":"2026-08-14T13:11:56.557075Z","submitted_at":"2025-06-17T13:37:42Z","title":"Can Vision Language Models Understand Mimed Actions?","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T00:23:38.562682Z"},"links":{"citing_paper":"/paper/2506.21586"},"observation_digest":"sha256:edf584528fe06d7ad06cdb155aee083a9a04984ca33b22118e25c1ee702e5249","observation_id":"91dbe338-7ea0-4782-b42c-db271e74520c","resolution":{"observed_at":"2026-08-07T00:23:38.562682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2015.24759","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:52.773748Z","title":null,"venue":null,"work_id":"aae43b39-f915-4c72-84c9-f5535f0b0618","year":2015},"citing_paper":{"arxiv_id":"2506.21586","last_updated":"2025-08-07T04:59:32Z","snapshot_observed_at":"2026-08-14T13:11:56.557075Z","submitted_at":"2025-06-17T13:37:42Z","title":"Can Vision Language Models Understand Mimed Actions?","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T00:23:38.728933Z"},"links":{"citing_paper":"/paper/2506.21586"},"observation_digest":"sha256:a8f13b4b8a7138a1250044f030131a9dc31210520c68e39e96c71868ec8af43e","observation_id":"d64019fa-b450-4fb3-8576-d9090a9e5b75","resolution":{"observed_at":"2026-08-07T00:23:52.922444Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:38.900530Z","title":null,"venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2506.21586","last_updated":"2025-08-07T04:59:32Z","snapshot_observed_at":"2026-08-14T13:11:56.557075Z","submitted_at":"2025-06-17T13:37:42Z","title":"Can Vision Language Models Understand Mimed Actions?","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T00:23:38.900530Z"},"links":{"citing_paper":"/paper/2506.21586"},"observation_digest":"sha256:6d83da199216b027b7313f931435e112697a005d8dc499f51e6362380a7da301","observation_id":"15a3efab-64b7-4adc-a586-44f03ac16112","resolution":{"observed_at":"2026-08-07T00:23:38.900530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:39.106281Z","title":"Narayanan","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2506.21586","last_updated":"2025-08-07T04:59:32Z","snapshot_observed_at":"2026-08-14T13:11:56.557075Z","submitted_at":"2025-06-17T13:37:42Z","title":"Can Vision Language Models Understand Mimed Actions?","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T00:23:39.106281Z"},"links":{"citing_paper":"/paper/2506.21586"},"observation_digest":"sha256:5af4be0c2f91b2695101c7524b566199a51232afdcdd5e7dade846a3ff9be088","observation_id":"6abd43c5-fd6c-4736-b00d-fd5b0c532a54","resolution":{"observed_at":"2026-08-07T00:23:39.106281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:39.250115Z","title":"Cass, Kristina Striegnitz, and Nick Webb","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.21586","last_updated":"2025-08-07T04:59:32Z","snapshot_observed_at":"2026-08-14T13:11:56.557075Z","submitted_at":"2025-06-17T13:37:42Z","title":"Can Vision Language Models Understand Mimed Actions?","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T00:23:39.250115Z"},"links":{"citing_paper":"/paper/2506.21586"},"observation_digest":"sha256:dd0555798adf0a976089b6e47f6727ba34dc2930963bf63db7b03795e3727fd3","observation_id":"f07be7ea-c390-44ad-80dd-ddd94c6f7fcd","resolution":{"observed_at":"2026-08-07T00:23:39.250115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:39.363578Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21586","last_updated":"2025-08-07T04:59:32Z","snapshot_observed_at":"2026-08-14T13:11:56.557075Z","submitted_at":"2025-06-17T13:37:42Z","title":"Can Vision Language Models Understand Mimed Actions?","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T00:23:39.363578Z"},"links":{"citing_paper":"/paper/2506.21586"},"observation_digest":"sha256:abed4a4199432a4b8d8dd1c5d11c8aeca41d4d4277242cad704e25c5de175d85","observation_id":"1d31f55a-90c2-4230-b027-e2fc59db3670","resolution":{"observed_at":"2026-08-07T00:23:39.363578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:12.818617Z","title":null,"venue":null,"work_id":"af9537a9-6ae5-4052-8dba-b02d9d79e48f","year":2018},"citing_paper":{"arxiv_id":"2506.21586","last_updated":"2025-08-07T04:59:32Z","snapshot_observed_at":"2026-08-14T13:11:56.557075Z","submitted_at":"2025-06-17T13:37:42Z","title":"Can Vision Language Models Understand Mimed Actions?","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T00:23:39.476347Z"},"links":{"citing_paper":"/paper/2506.21586"},"observation_digest":"sha256:d8762e4fb5b23f110e56f22927fb6a1d4771f21e7e0f15661a2675bbbbd3d9bd","observation_id":"8e6447b7-5e40-4647-8e90-2477a10a2fff","resolution":{"observed_at":"2026-08-07T00:24:12.821252Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:12.806397Z","title":null,"venue":null,"work_id":"752e81cd-0d97-4ac9-a465-0c8e3ae76fce","year":1969},"citing_paper":{"arxiv_id":"2506.21586","last_updated":"2025-08-07T04:59:32Z","snapshot_observed_at":"2026-08-14T13:11:56.557075Z","submitted_at":"2025-06-17T13:37:42Z","title":"Can Vision Language Models Understand Mimed Actions?","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T00:23:39.590557Z"},"links":{"citing_paper":"/paper/2506.21586"},"observation_digest":"sha256:b21a6e6b81195e6fb85eaa5351d22090e1a0ae2fbdb2cb32254fcc72c671ba13","observation_id":"1d72b0ac-1752-41d9-a65a-53e7c44ee26b","resolution":{"observed_at":"2026-08-07T00:24:12.813503Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:12.794958Z","title":null,"venue":null,"work_id":"1225bf08-8086-4d14-a998-29b893cba7b5","year":2015},"citing_paper":{"arxiv_id":"2506.21586","last_updated":"2025-08-07T04:59:32Z","snapshot_observed_at":"2026-08-14T13:11:56.557075Z","submitted_at":"2025-06-17T13:37:42Z","title":"Can Vision Language Models Understand Mimed Actions?","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T00:23:39.676519Z"},"links":{"citing_paper":"/paper/2506.21586"},"observation_digest":"sha256:713d89d9b3196c37d550d5ef2b5691bc2e32f05a6317f4c998a8bba574b2a464","observation_id":"676b038d-c02f-44b0-9507-a035b2e2f8e2","resolution":{"observed_at":"2026-08-07T00:24:12.797788Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:12.787126Z","title":null,"venue":null,"work_id":"b22aaf61-1ad7-4a2d-a0f5-91d6b4cb48a7","year":1979},"citing_paper":{"arxiv_id":"2506.21586","last_updated":"2025-08-07T04:59:32Z","snapshot_observed_at":"2026-08-14T13:11:56.557075Z","submitted_at":"2025-06-17T13:37:42Z","title":"Can Vision Language Models Understand Mimed Actions?","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T00:23:39.787771Z"},"links":{"citing_paper":"/paper/2506.21586"},"observation_digest":"sha256:c8dc3c54236529e96dbd4c6bd7a7c53c257928d03258b5f996636408a097c5c3","observation_id":"708d5edf-f2bf-4b1c-b937-308ddd091bba","resolution":{"observed_at":"2026-08-07T00:24:12.789548Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-08-14T18:15:53.516440Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-07T00:23:39.883208Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21586","last_updated":"2025-08-07T04:59:32Z","snapshot_observed_at":"2026-08-14T13:11:56.557075Z","submitted_at":"2025-06-17T13:37:42Z","title":"Can Vision Language Models Understand Mimed Actions?","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T00:23:39.883208Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2506.21586"},"observation_digest":"sha256:b608d2f27755a52f9c20fd5bcdbed4e57ed340441e1cc2aa0ac21d0980a7eabd","observation_id":"e4bdfe04-9edd-408e-bd81-14c00740c3f9","resolution":{"observed_at":"2026-08-07T00:23:39.883208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:12.779884Z","title":null,"venue":null,"work_id":"5314b5b5-6c04-4e9f-9f4f-9b289a4817dc","year":2002},"citing_paper":{"arxiv_id":"2506.21586","last_updated":"2025-08-07T04:59:32Z","snapshot_observed_at":"2026-08-14T13:11:56.557075Z","submitted_at":"2025-06-17T13:37:42Z","title":"Can Vision Language Models Understand Mimed Actions?","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T00:23:39.999596Z"},"links":{"citing_paper":"/paper/2506.21586"},"observation_digest":"sha256:d19469d0c83d2d957eebcd566e0965d930b71835bf08a96b5f9a5b5e5d5c8abe","observation_id":"7968a06e-8467-4adc-b809-1d017240e9ff","resolution":{"observed_at":"2026-08-07T00:24:12.782555Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:12.771913Z","title":"Grafsgaard, Christopher Mitchell, Kristy Elizabeth Boyer, and James C","venue":null,"work_id":"783070bc-9ba3-4013-bb42-33cc1ccb182d","year":2012},"citing_paper":{"arxiv_id":"2506.21586","last_updated":"2025-08-07T04:59:32Z","snapshot_observed_at":"2026-08-14T13:11:56.557075Z","submitted_at":"2025-06-17T13:37:42Z","title":"Can Vision Language Models Understand Mimed Actions?","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T00:23:40.117738Z"},"links":{"citing_paper":"/paper/2506.21586"},"observation_digest":"sha256:ad47ff82ab322ea275d93cd78eac7a068ee001a0e5a9de3ada180c3c5e4a6df5","observation_id":"aa225235-9b41-4d0d-bca2-96be172e01cc","resolution":{"observed_at":"2026-08-07T00:24:12.774734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:12.764624Z","title":null,"venue":null,"work_id":"5234118d-6e3f-4fe7-9486-c56d22e8a124","year":2015},"citing_paper":{"arxiv_id":"2506.21586","last_updated":"2025-08-07T04:59:32Z","snapshot_observed_at":"2026-08-14T13:11:56.557075Z","submitted_at":"2025-06-17T13:37:42Z","title":"Can Vision Language Models Understand Mimed Actions?","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T00:23:40.207894Z"},"links":{"citing_paper":"/paper/2506.21586"},"observation_digest":"sha256:e788b936b66b69b999677097fba7c4735a91adf217a7d89b852f88503a92606f","observation_id":"20330e2d-48b6-42f0-80fa-df3177923e68","resolution":{"observed_at":"2026-08-07T00:24:12.766888Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:40.324828Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21586","last_updated":"2025-08-07T04:59:32Z","snapshot_observed_at":"2026-08-14T13:11:56.557075Z","submitted_at":"2025-06-17T13:37:42Z","title":"Can Vision Language Models Understand Mimed Actions?","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T00:23:40.324828Z"},"links":{"citing_paper":"/paper/2506.21586"},"observation_digest":"sha256:ac414d6e7660a0d3a80dfa5a8715f5bfb885a2e83fdf16206105e860c869e45e","observation_id":"ab0f7978-4134-41d6-91de-001914594264","resolution":{"observed_at":"2026-08-07T00:23:40.324828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:12.749302Z","title":"in the wild","venue":null,"work_id":"ae3db695-eaf4-4d91-94c1-f4ceb8e68b0d","year":2017},"citing_paper":{"arxiv_id":"2506.21586","last_updated":"2025-08-07T04:59:32Z","snapshot_observed_at":"2026-08-14T13:11:56.557075Z","submitted_at":"2025-06-17T13:37:42Z","title":"Can Vision Language Models Understand Mimed Actions?","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T00:23:40.446577Z"},"links":{"citing_paper":"/paper/2506.21586"},"observation_digest":"sha256:90f56184d283d5cc7588407ef26ca07f1845aad0dfd5032905c9e6b6cad44a5d","observation_id":"2a6de430-50f8-4ed8-975c-f984cbc0f43a","resolution":{"observed_at":"2026-08-07T00:24:12.756308Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:12.737003Z","title":null,"venue":null,"work_id":"2cdd664d-b4a1-407e-8533-aa0e73d3dfc2","year":2018},"citing_paper":{"arxiv_id":"2506.21586","last_updated":"2025-08-07T04:59:32Z","snapshot_observed_at":"2026-08-14T13:11:56.557075Z","submitted_at":"2025-06-17T13:37:42Z","title":"Can Vision Language Models Understand Mimed Actions?","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T00:23:40.643606Z"},"links":{"citing_paper":"/paper/2506.21586"},"observation_digest":"sha256:4baa0c67a3b37c6b733b8af1424e97f1d7d5f00908b3809037006d3f8d2c88ad","observation_id":"06ab4401-4a20-4f49-95ea-402bda2ba038","resolution":{"observed_at":"2026-08-07T00:24:12.741258Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:12.724102Z","title":null,"venue":null,"work_id":"998742c2-b96c-40f7-bcbf-19bba65da4fb","year":2015},"citing_paper":{"arxiv_id":"2506.21586","last_updated":"2025-08-07T04:59:32Z","snapshot_observed_at":"2026-08-14T13:11:56.557075Z","submitted_at":"2025-06-17T13:37:42Z","title":"Can Vision Language Models Understand Mimed Actions?","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T00:23:40.804403Z"},"links":{"citing_paper":"/paper/2506.21586"},"observation_digest":"sha256:ff9d3cea2e609702645c941f3ba4ee2121ef411c3adb571c05c5a14409ab50ec","observation_id":"5e8cfe85-8050-4469-ac10-38d98bd4ab05","resolution":{"observed_at":"2026-08-07T00:24:12.732160Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:12.709496Z","title":null,"venue":null,"work_id":"dbd5e2b7-f1cc-414d-8600-1a9af13fd75e","year":2013},"citing_paper":{"arxiv_id":"2506.21586","last_updated":"2025-08-07T04:59:32Z","snapshot_observed_at":"2026-08-14T13:11:56.557075Z","submitted_at":"2025-06-17T13:37:42Z","title":"Can Vision Language Models Understand Mimed Actions?","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T00:23:40.913904Z"},"links":{"citing_paper":"/paper/2506.21586"},"observation_digest":"sha256:25b25771da5516b3cad63f15c418fd2bb0dce8bf9a954b714ecd3c864635e7b8","observation_id":"8ca6dd38-8772-41ce-bf38-1ded3d16dfb8","resolution":{"observed_at":"2026-08-07T00:24:12.713637Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:12.697035Z","title":null,"venue":null,"work_id":"6ef2b7f1-029a-440e-8b93-321af112a533","year":2014},"citing_paper":{"arxiv_id":"2506.21586","last_updated":"2025-08-07T04:59:32Z","snapshot_observed_at":"2026-08-14T13:11:56.557075Z","submitted_at":"2025-06-17T13:37:42Z","title":"Can Vision Language Models Understand Mimed Actions?","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T00:23:41.026307Z"},"links":{"citing_paper":"/paper/2506.21586"},"observation_digest":"sha256:13836c927c486f531a62e083c6594de3b1798400ab1f9b03c5f78baa8033a07c","observation_id":"0fddda93-860c-490f-8df0-0dbd8c531aa9","resolution":{"observed_at":"2026-08-07T00:24:12.699667Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:12.690176Z","title":null,"venue":null,"work_id":"0de80b76-6c25-4608-bfd4-7ff46069af88","year":2016},"citing_paper":{"arxiv_id":"2506.21586","last_updated":"2025-08-07T04:59:32Z","snapshot_observed_at":"2026-08-14T13:11:56.557075Z","submitted_at":"2025-06-17T13:37:42Z","title":"Can Vision Language Models Understand Mimed Actions?","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T00:23:41.113875Z"},"links":{"citing_paper":"/paper/2506.21586"},"observation_digest":"sha256:5b5edb8d68074572fe7e4d9e77a2e42db21047595951649fcc5281a1f9fbf86e","observation_id":"87518dfd-1839-42d7-882e-6ee790eff8ba","resolution":{"observed_at":"2026-08-07T00:24:12.692940Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:12.682884Z","title":null,"venue":null,"work_id":"c8b10000-3543-4bfb-b6b4-fc715d6ed2ad","year":2016},"citing_paper":{"arxiv_id":"2506.21586","last_updated":"2025-08-07T04:59:32Z","snapshot_observed_at":"2026-08-14T13:11:56.557075Z","submitted_at":"2025-06-17T13:37:42Z","title":"Can Vision Language Models Understand Mimed Actions?","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T00:23:41.192006Z"},"links":{"citing_paper":"/paper/2506.21586"},"observation_digest":"sha256:8e79b171d10401e3adb86b4305f04b7b1c3bdd1504ba3912e4d0b488cc3ad842","observation_id":"596a2e81-0033-4786-994e-81aa426edaf1","resolution":{"observed_at":"2026-08-07T00:24:12.685682Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06059","last_updated":"2024-01-11T17:24:49Z","snapshot_observed_at":"2026-08-17T18:53:54.955991Z","submitted_at":"2024-01-11T17:24:49Z","title":"Investigating Data Contamination for Pre-training Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06059","snapshot_observed_at":"2026-08-07T00:23:41.260222Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21586","last_updated":"2025-08-07T04:59:32Z","snapshot_observed_at":"2026-08-14T13:11:56.557075Z","submitted_at":"2025-06-17T13:37:42Z","title":"Can Vision Language Models Understand Mimed Actions?","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T00:23:41.260222Z"},"links":{"cited_paper":"/paper/2401.06059","citing_paper":"/paper/2506.21586"},"observation_digest":"sha256:26e8d585d56a207f6b290ee972688d9c69c853037a27856c5dc460f6984e4f4b","observation_id":"b460b024-0bbc-47a7-b8f4-f7159f6800f8","resolution":{"observed_at":"2026-08-07T00:23:41.260222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:12.671945Z","title":null,"venue":null,"work_id":"dc80c69c-e854-464e-95c6-c4a786ef18b4","year":2010},"citing_paper":{"arxiv_id":"2506.21586","last_updated":"2025-08-07T04:59:32Z","snapshot_observed_at":"2026-08-14T13:11:56.557075Z","submitted_at":"2025-06-17T13:37:42Z","title":"Can Vision Language Models Understand Mimed Actions?","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T00:23:41.393246Z"},"links":{"citing_paper":"/paper/2506.21586"},"observation_digest":"sha256:8597df77c5d7990c28f5ec24317df72fdda350fe9f0337df5a453d567c3f16f9","observation_id":"e1419777-cfd9-4a2e-9896-6deb1e235b8e","resolution":{"observed_at":"2026-08-07T00:24:12.676580Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:12.652858Z","title":null,"venue":null,"work_id":"5ac3d32f-7896-42ad-94a0-24d88186bfa9","year":2024},"citing_paper":{"arxiv_id":"2506.21586","last_updated":"2025-08-07T04:59:32Z","snapshot_observed_at":"2026-08-14T13:11:56.557075Z","submitted_at":"2025-06-17T13:37:42Z","title":"Can Vision Language Models Understand Mimed Actions?","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T00:23:41.468992Z"},"links":{"citing_paper":"/paper/2506.21586"},"observation_digest":"sha256:e790700b986ff01e2d84e80cb20ce850adc8cc8e0b2b1a68f240849386b58243","observation_id":"7e9d763f-85ee-45f5-87fe-f61aa3c32194","resolution":{"observed_at":"2026-08-07T00:24:12.665518Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:12.635498Z","title":null,"venue":null,"work_id":"2f8b8047-d646-4932-abe5-d8db54faf5bf","year":2024},"citing_paper":{"arxiv_id":"2506.21586","last_updated":"2025-08-07T04:59:32Z","snapshot_observed_at":"2026-08-14T13:11:56.557075Z","submitted_at":"2025-06-17T13:37:42Z","title":"Can Vision Language Models Understand Mimed Actions?","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T00:23:41.598971Z"},"links":{"citing_paper":"/paper/2506.21586"},"observation_digest":"sha256:32f309f46224d51c062169291dab1d5cf4c6cab96e88f2aec68c431d886267cf","observation_id":"13aa67f5-7f49-4a56-ab0b-de69cdb60a4c","resolution":{"observed_at":"2026-08-07T00:24:12.638205Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:12.619028Z","title":null,"venue":null,"work_id":"e07ffc95-61a1-4caf-9e76-1bee47b51ea8","year":2014},"citing_paper":{"arxiv_id":"2506.21586","last_updated":"2025-08-07T04:59:32Z","snapshot_observed_at":"2026-08-14T13:11:56.557075Z","submitted_at":"2025-06-17T13:37:42Z","title":"Can Vision Language Models Understand Mimed Actions?","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T00:23:41.718878Z"},"links":{"citing_paper":"/paper/2506.21586"},"observation_digest":"sha256:97e6d3135e465ae79d89c97c7e7fbffcde17b01088348ee2ca8c2183648cb50c","observation_id":"5e3d3704-9dd2-4307-8e75-12298e90f1f7","resolution":{"observed_at":"2026-08-07T00:24:12.627591Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.06950","last_updated":"2017-05-19T12:07:01Z","snapshot_observed_at":"2026-08-15T11:35:18.832923Z","submitted_at":"2017-05-19T12:07:01Z","title":"The Kinetics Human Action Video Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.06950","snapshot_observed_at":"2026-08-07T00:23:41.824791Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.21586","last_updated":"2025-08-07T04:59:32Z","snapshot_observed_at":"2026-08-14T13:11:56.557075Z","submitted_at":"2025-06-17T13:37:42Z","title":"Can Vision Language Models Understand Mimed Actions?","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T00:23:41.824791Z"},"links":{"cited_paper":"/paper/1705.06950","citing_paper":"/paper/2506.21586"},"observation_digest":"sha256:056e43c1dd546702ad57725f6e070897a5ca0a7b4504323155e762519b1d754c","observation_id":"194e58e3-6424-4280-8aeb-d7967270bb57","resolution":{"observed_at":"2026-08-07T00:23:41.824791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:12.604914Z","title":null,"venue":null,"work_id":"d5f5b213-bd34-46a6-875b-96171d50ae6c","year":1967},"citing_paper":{"arxiv_id":"2506.21586","last_updated":"2025-08-07T04:59:32Z","snapshot_observed_at":"2026-08-14T13:11:56.557075Z","submitted_at":"2025-06-17T13:37:42Z","title":"Can Vision Language Models Understand Mimed Actions?","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T00:23:41.926799Z"},"links":{"citing_paper":"/paper/2506.21586"},"observation_digest":"sha256:3e04e8f986c145f9571d850fd52fcdf2fea26a476e6083aa99b93d84fcd66e09","observation_id":"a7232ac4-6c8e-46e4-ad5b-4069171ab717","resolution":{"observed_at":"2026-08-07T00:24:12.611156Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2023.eacl-main.200","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":null,"venue":null,"work_id":"e5ba470c-32a8-4e3e-b816-f207fcd9c3c4","year":2023},"citing_paper":{"arxiv_id":"2506.21586","last_updated":"2025-08-07T04:59:32Z","snapshot_observed_at":"2026-08-14T13:11:56.557075Z","submitted_at":"2025-06-17T13:37:42Z","title":"Can Vision Language Models Understand Mimed Actions?","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T00:23:42.040590Z"},"links":{"citing_paper":"/paper/2506.21586"},"observation_digest":"sha256:ae87a477a189b5ad5ec3b72618ab1663edfb214b1c9429b94ebd89a630fe718f","observation_id":"b91b51eb-0e6b-405c-91ed-6d0a9003066b","resolution":{"observed_at":"2026-08-07T00:23:52.197053Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:12.587420Z","title":null,"venue":null,"work_id":"1c83d2e2-4899-4f70-8eed-e9abb6896e74","year":2009},"citing_paper":{"arxiv_id":"2506.21586","last_updated":"2025-08-07T04:59:32Z","snapshot_observed_at":"2026-08-14T13:11:56.557075Z","submitted_at":"2025-06-17T13:37:42Z","title":"Can Vision Language Models Understand Mimed Actions?","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T00:23:42.157312Z"},"links":{"citing_paper":"/paper/2506.21586"},"observation_digest":"sha256:37e0b161eb40008f5a1c56f7f22dc29a5a284dc2f9ceb82daf0f99e0a9936d1b","observation_id":"01e8990d-ecd8-4e36-9192-1f1f03ea0a97","resolution":{"observed_at":"2026-08-07T00:24:12.595237Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:12.579199Z","title":null,"venue":null,"work_id":"8ef47034-dc7c-41d4-af16-c7867cc50c61","year":2022},"citing_paper":{"arxiv_id":"2506.21586","last_updated":"2025-08-07T04:59:32Z","snapshot_observed_at":"2026-08-14T13:11:56.557075Z","submitted_at":"2025-06-17T13:37:42Z","title":"Can Vision Language Models Understand Mimed Actions?","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T00:23:42.346980Z"},"links":{"citing_paper":"/paper/2506.21586"},"observation_digest":"sha256:7c902ee0b137d60e9b6640233c6ed5890b2d3805468ffb06066362987b997a41","observation_id":"599a0e41-f37d-4e3a-a0af-87161952f8c6","resolution":{"observed_at":"2026-08-07T00:24:12.581670Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:42.522313Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.21586","last_updated":"2025-08-07T04:59:32Z","snapshot_observed_at":"2026-08-14T13:11:56.557075Z","submitted_at":"2025-06-17T13:37:42Z","title":"Can Vision Language Models Understand Mimed Actions?","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T00:23:42.522313Z"},"links":{"citing_paper":"/paper/2506.21586"},"observation_digest":"sha256:f8a4fec8d3dcb143293f9fe669618df1a88250757e3d4ef99457f52944c895d5","observation_id":"e0548615-3d78-4dfc-8553-1505ab3b3092","resolution":{"observed_at":"2026-08-07T00:23:42.522313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:12.568374Z","title":null,"venue":null,"work_id":"12bfe9f5-eb8c-4703-8c38-70fcb489d8b4","year":2011},"citing_paper":{"arxiv_id":"2506.21586","last_updated":"2025-08-07T04:59:32Z","snapshot_observed_at":"2026-08-14T13:11:56.557075Z","submitted_at":"2025-06-17T13:37:42Z","title":"Can Vision Language Models Understand Mimed Actions?","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T00:23:42.686207Z"},"links":{"citing_paper":"/paper/2506.21586"},"observation_digest":"sha256:6eafd7f52ace75e309dc511f77cb8e8b0f4cb282d57ae57dfbfacaf79e51f840","observation_id":"4ad973c2-0294-4223-a113-1b6aa02112cf","resolution":{"observed_at":"2026-08-07T00:24:12.570769Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:12.551046Z","title":"Hodgins, Adam W","venue":null,"work_id":"b255f911-8c40-474a-b1b1-8d300c723ca9","year":2008},"citing_paper":{"arxiv_id":"2506.21586","last_updated":"2025-08-07T04:59:32Z","snapshot_observed_at":"2026-08-14T13:11:56.557075Z","submitted_at":"2025-06-17T13:37:42Z","title":"Can Vision Language Models Understand Mimed Actions?","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T00:23:42.938799Z"},"links":{"citing_paper":"/paper/2506.21586"},"observation_digest":"sha256:21275758ded8a4c8a55fa00585271f74343922958ca2df9273d66f35774181f9","observation_id":"f72d301e-b8f2-47ae-b849-99257dc23553","resolution":{"observed_at":"2026-08-07T00:24:12.558001Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:12.531012Z","title":null,"venue":null,"work_id":"1a26ccf9-e9f6-4823-889b-3ddb5416d9c5","year":2010},"citing_paper":{"arxiv_id":"2506.21586","last_updated":"2025-08-07T04:59:32Z","snapshot_observed_at":"2026-08-14T13:11:56.557075Z","submitted_at":"2025-06-17T13:37:42Z","title":"Can Vision Language Models Understand Mimed Actions?","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T00:23:43.072042Z"},"links":{"citing_paper":"/paper/2506.21586"},"observation_digest":"sha256:91c8a6d725088371b77949bce6b4e56235195a547e854bf3d4998029ce32fd39","observation_id":"6a9d659d-ae9a-4bfd-bf92-12e822b897a1","resolution":{"observed_at":"2026-08-07T00:24:12.536221Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:12.506636Z","title":null,"venue":null,"work_id":"dc9741f9-3d7a-45a6-9128-f3dd3289fbfa","year":2016},"citing_paper":{"arxiv_id":"2506.21586","last_updated":"2025-08-07T04:59:32Z","snapshot_observed_at":"2026-08-14T13:11:56.557075Z","submitted_at":"2025-06-17T13:37:42Z","title":"Can Vision Language Models Understand Mimed Actions?","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T00:23:43.255058Z"},"links":{"citing_paper":"/paper/2506.21586"},"observation_digest":"sha256:03a06b4158e0182278713a8f361d7dd82900ce3df18446e9be3a2e8b6c8f337d","observation_id":"1310b527-cc24-4bcf-a7c2-5a0343893900","resolution":{"observed_at":"2026-08-07T00:24:12.518175Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:12.490605Z","title":null,"venue":null,"work_id":"0815f2a5-d52f-411f-ba52-1eb4722ea658","year":2021},"citing_paper":{"arxiv_id":"2506.21586","last_updated":"2025-08-07T04:59:32Z","snapshot_observed_at":"2026-08-14T13:11:56.557075Z","submitted_at":"2025-06-17T13:37:42Z","title":"Can Vision Language Models Understand Mimed Actions?","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T00:23:43.462615Z"},"links":{"citing_paper":"/paper/2506.21586"},"observation_digest":"sha256:de862a0cb37a0c6e9d7dc98209be2fe7221b97513bb682fac4efb21bf08204aa","observation_id":"b6bbd9d9-ed58-4e3d-9e57-ea49d1733f52","resolution":{"observed_at":"2026-08-07T00:24:12.497802Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:12.476240Z","title":null,"venue":null,"work_id":"9a705a30-c3da-49c4-89ba-730803667c09","year":2007},"citing_paper":{"arxiv_id":"2506.21586","last_updated":"2025-08-07T04:59:32Z","snapshot_observed_at":"2026-08-14T13:11:56.557075Z","submitted_at":"2025-06-17T13:37:42Z","title":"Can Vision Language Models Understand Mimed Actions?","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T00:23:43.652777Z"},"links":{"citing_paper":"/paper/2506.21586"},"observation_digest":"sha256:da2eb747e932d9edd080423297301ef86131774fccd163edafd11526a6afb8b7","observation_id":"bc286dde-f540-4d18-875b-1964f0c5cab8","resolution":{"observed_at":"2026-08-07T00:24:12.481913Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:12.456653Z","title":null,"venue":null,"work_id":"c852c1ad-7fb2-4dc0-98a7-4eb8d4f281d7","year":2013},"citing_paper":{"arxiv_id":"2506.21586","last_updated":"2025-08-07T04:59:32Z","snapshot_observed_at":"2026-08-14T13:11:56.557075Z","submitted_at":"2025-06-17T13:37:42Z","title":"Can Vision Language Models Understand Mimed Actions?","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T00:23:43.848892Z"},"links":{"citing_paper":"/paper/2506.21586"},"observation_digest":"sha256:cce74dba7787f567fa18e3ee3be0ebbaeaa1b1c622b32cb842d4156a18e48130","observation_id":"d63a6051-9448-40c8-94e6-bfd6dbeec1a9","resolution":{"observed_at":"2026-08-07T00:24:12.464628Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:12.387574Z","title":null,"venue":null,"work_id":"5dc7fd35-4d26-4371-82fe-d15cda58e6a9","year":1992},"citing_paper":{"arxiv_id":"2506.21586","last_updated":"2025-08-07T04:59:32Z","snapshot_observed_at":"2026-08-14T13:11:56.557075Z","submitted_at":"2025-06-17T13:37:42Z","title":"Can Vision Language Models Understand Mimed Actions?","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T00:23:44.040002Z"},"links":{"citing_paper":"/paper/2506.21586"},"observation_digest":"sha256:a83ae887d5624c746237b1929d18238117bab6b6a46fb81c8f96ec37a976199b","observation_id":"aab9d94c-94b1-469d-8efd-c75027586a66","resolution":{"observed_at":"2026-08-07T00:24:12.442008Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:12.289058Z","title":null,"venue":null,"work_id":"1ec9e77e-b045-4e40-b198-fdbfa40a1729","year":1972},"citing_paper":{"arxiv_id":"2506.21586","last_updated":"2025-08-07T04:59:32Z","snapshot_observed_at":"2026-08-14T13:11:56.557075Z","submitted_at":"2025-06-17T13:37:42Z","title":"Can Vision Language Models Understand Mimed Actions?","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T00:23:44.191898Z"},"links":{"citing_paper":"/paper/2506.21586"},"observation_digest":"sha256:f903194c0494b23df4c38116751ae84911986beb4ef649cdf5b202f61d09946a","observation_id":"4952ff6c-129c-4664-a087-2cd11247aa40","resolution":{"observed_at":"2026-08-07T00:24:12.350638Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2008.01018","last_updated":"2020-08-03T16:53:35Z","snapshot_observed_at":"2026-08-11T21:51:03.462926Z","submitted_at":"2020-08-03T16:53:35Z","title":"RareAct: A video dataset of unusual interactions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2008.01018","snapshot_observed_at":"2026-08-07T00:23:44.355548Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.21586","last_updated":"2025-08-07T04:59:32Z","snapshot_observed_at":"2026-08-14T13:11:56.557075Z","submitted_at":"2025-06-17T13:37:42Z","title":"Can Vision Language Models Understand Mimed Actions?","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T00:23:44.355548Z"},"links":{"cited_paper":"/paper/2008.01018","citing_paper":"/paper/2506.21586"},"observation_digest":"sha256:2153196ddf9059b42afefb789aa79ca66e1b848d9b612f66e051bd725d10472f","observation_id":"41f1f91e-822d-44a5-a952-ea88f071b0f0","resolution":{"observed_at":"2026-08-07T00:23:44.355548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:12.168977Z","title":null,"venue":null,"work_id":"28120226-4da3-46d4-be86-b958f8d13c51","year":2019},"citing_paper":{"arxiv_id":"2506.21586","last_updated":"2025-08-07T04:59:32Z","snapshot_observed_at":"2026-08-14T13:11:56.557075Z","submitted_at":"2025-06-17T13:37:42Z","title":"Can Vision Language Models Understand Mimed Actions?","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T00:23:44.504346Z"},"links":{"citing_paper":"/paper/2506.21586"},"observation_digest":"sha256:579ec90b6ffdc0891167c773de9aa4557adfa2e6d8a6d1696126d83940c653d5","observation_id":"20c7dae7-e065-4bbf-9649-49cef0ba9cfb","resolution":{"observed_at":"2026-08-07T00:24:12.231300Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:12.031818Z","title":null,"venue":null,"work_id":"4826e2c7-a010-49f5-9bd9-dc6983c52e1b","year":1995},"citing_paper":{"arxiv_id":"2506.21586","last_updated":"2025-08-07T04:59:32Z","snapshot_observed_at":"2026-08-14T13:11:56.557075Z","submitted_at":"2025-06-17T13:37:42Z","title":"Can Vision Language Models Understand Mimed Actions?","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T00:23:44.807892Z"},"links":{"citing_paper":"/paper/2506.21586"},"observation_digest":"sha256:cc229298c13729552ba3c50d97e32dcafd7c0796287009fbc550def32fe0df94","observation_id":"9617b39a-267e-4c05-96ab-137c5420f484","resolution":{"observed_at":"2026-08-07T00:24:12.105291Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:09.823202Z","title":null,"venue":null,"work_id":"c0110d18-3c57-4a91-a45a-176d349baee7","year":2012},"citing_paper":{"arxiv_id":"2506.21586","last_updated":"2025-08-07T04:59:32Z","snapshot_observed_at":"2026-08-14T13:11:56.557075Z","submitted_at":"2025-06-17T13:37:42Z","title":"Can Vision Language Models Understand Mimed Actions?","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T00:23:44.971802Z"},"links":{"citing_paper":"/paper/2506.21586"},"observation_digest":"sha256:899f342252c9327138c0bb30e06d2c60ebb7e6661321e6de8ef85e73456e6192","observation_id":"f2506492-c769-4e26-bb21-80df0c74ff1e","resolution":{"observed_at":"2026-08-07T00:24:11.798564Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:57.843482Z","title":null,"venue":null,"work_id":"b8cae344-f80f-4801-bc6f-24b6a485ce71","year":2021},"citing_paper":{"arxiv_id":"2506.21586","last_updated":"2025-08-07T04:59:32Z","snapshot_observed_at":"2026-08-14T13:11:56.557075Z","submitted_at":"2025-06-17T13:37:42Z","title":"Can Vision Language Models Understand Mimed Actions?","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T00:23:45.098187Z"},"links":{"citing_paper":"/paper/2506.21586"},"observation_digest":"sha256:ec96761930acabf9040cab63d9221a93f35e4ec235102a87125f63c87788469f","observation_id":"f16fb30c-157b-4d91-9e7c-372d663c3beb","resolution":{"observed_at":"2026-08-07T00:23:57.975292Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2022.aacl-demo.3","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":null,"venue":null,"work_id":"e6208d34-e7a1-4a89-a12e-549405ad3057","year":2022},"citing_paper":{"arxiv_id":"2506.21586","last_updated":"2025-08-07T04:59:32Z","snapshot_observed_at":"2026-08-14T13:11:56.557075Z","submitted_at":"2025-06-17T13:37:42Z","title":"Can Vision Language Models Understand Mimed Actions?","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T00:23:45.275090Z"},"links":{"citing_paper":"/paper/2506.21586"},"observation_digest":"sha256:5659b2bfbf5b06c2cd320e462271c2e3ddf9aae6b02ed3ff41f1444ba7103963","observation_id":"f148e70c-b714-4e29-8c79-4e4889c72547","resolution":{"observed_at":"2026-08-07T00:23:51.903948Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:57.450145Z","title":null,"venue":null,"work_id":"90d768f3-fd40-45e4-8ca4-ee54571f780a","year":1983},"citing_paper":{"arxiv_id":"2506.21586","last_updated":"2025-08-07T04:59:32Z","snapshot_observed_at":"2026-08-14T13:11:56.557075Z","submitted_at":"2025-06-17T13:37:42Z","title":"Can Vision Language Models Understand Mimed Actions?","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T00:23:45.437935Z"},"links":{"citing_paper":"/paper/2506.21586"},"observation_digest":"sha256:c0d84a348178bb5fb9069c7153905159eff5a5f45db6df3abb3aa0afad49af1f","observation_id":"d39cde1f-7686-477b-8527-72edeb883d2c","resolution":{"observed_at":"2026-08-07T00:23:57.621431Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:57.096924Z","title":null,"venue":null,"work_id":"aa065650-d1cc-4ebc-98cf-eb9f3676abd0","year":2024},"citing_paper":{"arxiv_id":"2506.21586","last_updated":"2025-08-07T04:59:32Z","snapshot_observed_at":"2026-08-14T13:11:56.557075Z","submitted_at":"2025-06-17T13:37:42Z","title":"Can Vision Language Models Understand Mimed Actions?","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T00:23:45.617433Z"},"links":{"citing_paper":"/paper/2506.21586"},"observation_digest":"sha256:84063e8bef7a2912a3e63d8d1bb6d36783c14c68f84eb7773a2b778079567cc2","observation_id":"8397d9e6-4458-4cc6-92e4-e44ea6883d6c","resolution":{"observed_at":"2026-08-07T00:23:57.289921Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:45.790997Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.21586","last_updated":"2025-08-07T04:59:32Z","snapshot_observed_at":"2026-08-14T13:11:56.557075Z","submitted_at":"2025-06-17T13:37:42Z","title":"Can Vision Language Models Understand Mimed Actions?","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-07T00:23:45.790997Z"},"links":{"citing_paper":"/paper/2506.21586"},"observation_digest":"sha256:79d08242147c5bb45cfafe94b57ed88ab2e8570e7e91d5f16a6a210adedacdb4","observation_id":"fa0ca2cc-abce-4390-b6f2-3d19c76d60dd","resolution":{"observed_at":"2026-08-07T00:23:45.790997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:45.990864Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.21586","last_updated":"2025-08-07T04:59:32Z","snapshot_observed_at":"2026-08-14T13:11:56.557075Z","submitted_at":"2025-06-17T13:37:42Z","title":"Can Vision Language Models Understand Mimed Actions?","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-07T00:23:45.990864Z"},"links":{"citing_paper":"/paper/2506.21586"},"observation_digest":"sha256:c0989a1038fd7d32ddef14b810081b751f75564beacf4282441f97e27c2ca094","observation_id":"c6846d75-e6b9-4f64-a5bc-acc92143b533","resolution":{"observed_at":"2026-08-07T00:23:45.990864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:56.723501Z","title":null,"venue":null,"work_id":"5d1d211f-ca51-4508-8f51-4bcea8468770","year":2015},"citing_paper":{"arxiv_id":"2506.21586","last_updated":"2025-08-07T04:59:32Z","snapshot_observed_at":"2026-08-14T13:11:56.557075Z","submitted_at":"2025-06-17T13:37:42Z","title":"Can Vision Language Models Understand Mimed Actions?","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-07T00:23:46.155847Z"},"links":{"citing_paper":"/paper/2506.21586"},"observation_digest":"sha256:9b1da02e0a499a3343f2a4bc86a72e185deb3ca5c8a60b546e6aaf2f067835e0","observation_id":"8c84b672-c304-4ccc-9514-2ac1bad12d94","resolution":{"observed_at":"2026-08-07T00:23:56.866479Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:56.549850Z","title":null,"venue":null,"work_id":"d9346a48-0606-4799-83b8-eabff717d538","year":2017},"citing_paper":{"arxiv_id":"2506.21586","last_updated":"2025-08-07T04:59:32Z","snapshot_observed_at":"2026-08-14T13:11:56.557075Z","submitted_at":"2025-06-17T13:37:42Z","title":"Can Vision Language Models Understand Mimed Actions?","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-07T00:23:46.338800Z"},"links":{"citing_paper":"/paper/2506.21586"},"observation_digest":"sha256:ba96608234c55b9f502a50261f997e60e4f4fd36034484ad8dd288443efb41e5","observation_id":"cc458629-6d1d-4081-ae45-8eb1709b0467","resolution":{"observed_at":"2026-08-07T00:23:56.618928Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:56.392557Z","title":null,"venue":null,"work_id":"a58b103f-c4d8-4cd5-8abc-b6372f9b11b2","year":2015},"citing_paper":{"arxiv_id":"2506.21586","last_updated":"2025-08-07T04:59:32Z","snapshot_observed_at":"2026-08-14T13:11:56.557075Z","submitted_at":"2025-06-17T13:37:42Z","title":"Can Vision Language Models Understand Mimed Actions?","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-07T00:23:46.579943Z"},"links":{"citing_paper":"/paper/2506.21586"},"observation_digest":"sha256:e3aa16c9d087755a7351947b29abe40286e55fcaad402dd1dcd4d392850c30a7","observation_id":"d7a5af6a-33bc-44e2-abae-1914bfc4fb32","resolution":{"observed_at":"2026-08-07T00:23:56.469754Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:56.254544Z","title":null,"venue":null,"work_id":"c6270fe6-2cbc-4321-8b82-ef7122716efd","year":2018},"citing_paper":{"arxiv_id":"2506.21586","last_updated":"2025-08-07T04:59:32Z","snapshot_observed_at":"2026-08-14T13:11:56.557075Z","submitted_at":"2025-06-17T13:37:42Z","title":"Can Vision Language Models Understand Mimed Actions?","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-07T00:23:46.721897Z"},"links":{"citing_paper":"/paper/2506.21586"},"observation_digest":"sha256:5aa283f1c82d42411b0659375c702a4892f5fd1c9f248818cb42ced65c10a5aa","observation_id":"4baf8073-f89a-4e38-950a-49511ccd7260","resolution":{"observed_at":"2026-08-07T00:23:56.321199Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.04251","last_updated":"2024-10-31T01:39:48Z","snapshot_observed_at":"2026-08-18T10:35:00.391493Z","submitted_at":"2024-04-05T17:57:16Z","title":"Who Evaluates the Evaluations? Objectively Scoring Text-to-Image Prompt Coherence Metrics with T2IScoreScore (TS2)","version":3},"cited_work":{"arxiv_id":"2404.04251","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.04251","snapshot_observed_at":"2026-08-07T00:23:52.366906Z","title":"Who Evaluates the Evaluations? Objectively Scoring Text-to-Image Prompt Coherence Metrics with T2IScoreScore (TS2)","venue":"cs.CV","work_id":"46b14c31-6743-4300-a746-170a49113a08","year":2024},"citing_paper":{"arxiv_id":"2506.21586","last_updated":"2025-08-07T04:59:32Z","snapshot_observed_at":"2026-08-14T13:11:56.557075Z","submitted_at":"2025-06-17T13:37:42Z","title":"Can Vision Language Models Understand Mimed Actions?","version":2},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-07T00:23:46.914781Z"},"links":{"cited_paper":"/paper/2404.04251","citing_paper":"/paper/2506.21586"},"observation_digest":"sha256:699cff5f48a4f4d1002327278c828fcff7af75f076fb7b5da01de4cc0cf7dc6a","observation_id":"96e1344e-2fcf-4a6a-8a4e-709b867c2c07","resolution":{"observed_at":"2026-08-07T00:23:52.518687Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:56.066051Z","title":null,"venue":null,"work_id":"e647befd-5949-4a16-b442-c49df1ce4a6a","year":2023},"citing_paper":{"arxiv_id":"2506.21586","last_updated":"2025-08-07T04:59:32Z","snapshot_observed_at":"2026-08-14T13:11:56.557075Z","submitted_at":"2025-06-17T13:37:42Z","title":"Can Vision Language Models Understand Mimed Actions?","version":2},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-07T00:23:47.143859Z"},"links":{"citing_paper":"/paper/2506.21586"},"observation_digest":"sha256:4f36581d0b824892f255a973685a33c7e59dcc2e210b6675aacdef384ac1f2ac","observation_id":"efc3c774-5827-4924-ab48-ed354a40ebe9","resolution":{"observed_at":"2026-08-07T00:23:56.148631Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:55.900838Z","title":null,"venue":null,"work_id":"f01facfb-4df2-4304-9f3a-043430d3b471","year":2011},"citing_paper":{"arxiv_id":"2506.21586","last_updated":"2025-08-07T04:59:32Z","snapshot_observed_at":"2026-08-14T13:11:56.557075Z","submitted_at":"2025-06-17T13:37:42Z","title":"Can Vision Language Models Understand Mimed Actions?","version":2},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-07T00:23:47.303491Z"},"links":{"citing_paper":"/paper/2506.21586"},"observation_digest":"sha256:0bd219fe0addaa22d599565e5e1673553bf56784f5bb0979e30ecf0b6204febc","observation_id":"b60430e3-9490-417b-823a-578aeda74d84","resolution":{"observed_at":"2026-08-07T00:23:55.992172Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:55.754281Z","title":null,"venue":null,"work_id":"1ccf6d18-ae5a-4d87-b44b-2ad3390c2664","year":2016},"citing_paper":{"arxiv_id":"2506.21586","last_updated":"2025-08-07T04:59:32Z","snapshot_observed_at":"2026-08-14T13:11:56.557075Z","submitted_at":"2025-06-17T13:37:42Z","title":"Can Vision Language Models Understand Mimed Actions?","version":2},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-07T00:23:47.393749Z"},"links":{"citing_paper":"/paper/2506.21586"},"observation_digest":"sha256:d73865413bb753ef9ac278bd76771293fe0b1099735ee672c4a9a6c0422eda76","observation_id":"fb93ac09-3abf-4ada-b9aa-451357d25c8f","resolution":{"observed_at":"2026-08-07T00:23:55.808416Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1212.0402","last_updated":"2012-12-03T14:45:31Z","snapshot_observed_at":"2026-08-16T21:21:44.768787Z","submitted_at":"2012-12-03T14:45:31Z","title":"UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1212.0402","snapshot_observed_at":"2026-08-07T00:23:47.609792Z","title":null,"venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2506.21586","last_updated":"2025-08-07T04:59:32Z","snapshot_observed_at":"2026-08-14T13:11:56.557075Z","submitted_at":"2025-06-17T13:37:42Z","title":"Can Vision Language Models Understand Mimed Actions?","version":2},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-07T00:23:47.609792Z"},"links":{"cited_paper":"/paper/1212.0402","citing_paper":"/paper/2506.21586"},"observation_digest":"sha256:8dba212f7cebe037efa2cf68e95cb5f539e60031365b4d8efc405cc5f280d397","observation_id":"eedeed26-6381-401e-8da8-373c35f32345","resolution":{"observed_at":"2026-08-07T00:23:47.609792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:55.635125Z","title":"Narayanan","venue":null,"work_id":"61673294-379e-4fed-a98c-d61acbf91095","year":2009},"citing_paper":{"arxiv_id":"2506.21586","last_updated":"2025-08-07T04:59:32Z","snapshot_observed_at":"2026-08-14T13:11:56.557075Z","submitted_at":"2025-06-17T13:37:42Z","title":"Can Vision Language Models Understand Mimed Actions?","version":2},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-07T00:23:47.760551Z"},"links":{"citing_paper":"/paper/2506.21586"},"observation_digest":"sha256:2e312ade67e21ff861dbcbc98aa0e83d00ccd04a776732df9914658c37dd91a9","observation_id":"1804173a-4a36-4633-a79b-3c87d92724e9","resolution":{"observed_at":"2026-08-07T00:23:55.687195Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:55.538227Z","title":null,"venue":null,"work_id":"4fb3de90-893a-4c25-94fd-253c27d7a7fa","year":2011},"citing_paper":{"arxiv_id":"2506.21586","last_updated":"2025-08-07T04:59:32Z","snapshot_observed_at":"2026-08-14T13:11:56.557075Z","submitted_at":"2025-06-17T13:37:42Z","title":"Can Vision Language Models Understand Mimed Actions?","version":2},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-07T00:23:47.899516Z"},"links":{"citing_paper":"/paper/2506.21586"},"observation_digest":"sha256:bc5b3589ca2bf106c0dfc431d252c855e68957e6ef296ef180bc5268ed2c9a33","observation_id":"9934bd89-d42a-4a26-a360-9f398ba3efe4","resolution":{"observed_at":"2026-08-07T00:23:55.626885Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02265","last_updated":"2024-11-06T09:15:27Z","snapshot_observed_at":"2026-08-16T13:03:06.425740Z","submitted_at":"2024-11-04T16:56:26Z","title":"Hunyuan-Large: An Open-Source MoE Model with 52 Billion Activated Parameters by Tencent","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02265","snapshot_observed_at":"2026-08-07T00:23:48.050373Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21586","last_updated":"2025-08-07T04:59:32Z","snapshot_observed_at":"2026-08-14T13:11:56.557075Z","submitted_at":"2025-06-17T13:37:42Z","title":"Can Vision Language Models Understand Mimed Actions?","version":2},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-07T00:23:48.050373Z"},"links":{"cited_paper":"/paper/2411.02265","citing_paper":"/paper/2506.21586"},"observation_digest":"sha256:489eb31f6c7803d133d854a9a0f77c7db4e56176080c416fcbae50fafb662baa","observation_id":"ce6e3534-dc16-42b7-8919-bb123d0d56f4","resolution":{"observed_at":"2026-08-07T00:23:48.050373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:55.263357Z","title":null,"venue":null,"work_id":"b143fb06-09f8-4138-97e3-4cdb4e21af3e","year":2022},"citing_paper":{"arxiv_id":"2506.21586","last_updated":"2025-08-07T04:59:32Z","snapshot_observed_at":"2026-08-14T13:11:56.557075Z","submitted_at":"2025-06-17T13:37:42Z","title":"Can Vision Language Models Understand Mimed Actions?","version":2},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-07T00:23:48.256159Z"},"links":{"citing_paper":"/paper/2506.21586"},"observation_digest":"sha256:b49f583feee413dfa1ab30fd3eb5fa9c9e600b3e487de2f0568aaa055646da44","observation_id":"84d4ad8a-4c56-4071-8585-407384eed692","resolution":{"observed_at":"2026-08-07T00:23:55.349613Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:54.968331Z","title":null,"venue":null,"work_id":"ff8332fd-c24e-4585-a1c6-8e4c3a3ee542","year":2025},"citing_paper":{"arxiv_id":"2506.21586","last_updated":"2025-08-07T04:59:32Z","snapshot_observed_at":"2026-08-14T13:11:56.557075Z","submitted_at":"2025-06-17T13:37:42Z","title":"Can Vision Language Models Understand Mimed Actions?","version":2},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-07T00:23:48.406488Z"},"links":{"citing_paper":"/paper/2506.21586"},"observation_digest":"sha256:80e1e9d7743b21452e305430cde26577acf147963effe3a007a86019c68a58ae","observation_id":"dc1c50a8-d6ad-4c1c-a3a8-a2bac34be6cb","resolution":{"observed_at":"2026-08-07T00:23:55.136747Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.5281/zenodo.11247979","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":null,"venue":"Zenodo (CERN European Organization for Nuclear Research)","work_id":"3bebbefe-1518-4761-8ba4-39fed0dd989a","year":2024},"citing_paper":{"arxiv_id":"2506.21586","last_updated":"2025-08-07T04:59:32Z","snapshot_observed_at":"2026-08-14T13:11:56.557075Z","submitted_at":"2025-06-17T13:37:42Z","title":"Can Vision Language Models Understand Mimed Actions?","version":2},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-07T00:23:48.557172Z"},"links":{"citing_paper":"/paper/2506.21586"},"observation_digest":"sha256:801c3977f5ba9baa581e1385b07882a4b677a376c3a5bb5c94b5dcdc94673a63","observation_id":"e5ab8f80-219a-4ac0-ad6b-53af7ec17191","resolution":{"observed_at":"2026-08-07T00:23:51.634336Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1503.01070","last_updated":"2015-03-03T19:22:01Z","snapshot_observed_at":"2026-08-14T22:57:48.721233Z","submitted_at":"2015-03-03T19:22:01Z","title":"Using Descriptive Video Services to Create a Large Data Source for Video Annotation Research","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.01070","snapshot_observed_at":"2026-08-07T00:23:48.750123Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.21586","last_updated":"2025-08-07T04:59:32Z","snapshot_observed_at":"2026-08-14T13:11:56.557075Z","submitted_at":"2025-06-17T13:37:42Z","title":"Can Vision Language Models Understand Mimed Actions?","version":2},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-07T00:23:48.750123Z"},"links":{"cited_paper":"/paper/1503.01070","citing_paper":"/paper/2506.21586"},"observation_digest":"sha256:2febf5ce316ca28395ce09bd6e0461814bc8db2a72805c78f184c5a32e906907","observation_id":"bf0c7ec7-ab7f-48a4-be07-1a4fc79ccb8f","resolution":{"observed_at":"2026-08-07T00:23:48.750123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:54.699302Z","title":null,"venue":null,"work_id":"a8590fcc-993e-41e0-908e-0fedfcceb0d9","year":2021},"citing_paper":{"arxiv_id":"2506.21586","last_updated":"2025-08-07T04:59:32Z","snapshot_observed_at":"2026-08-14T13:11:56.557075Z","submitted_at":"2025-06-17T13:37:42Z","title":"Can Vision Language Models Understand Mimed Actions?","version":2},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-07T00:23:48.886231Z"},"links":{"citing_paper":"/paper/2506.21586"},"observation_digest":"sha256:f9a9d349394dbb39f4b8f6c4c0e2730a78fe8904c2b1a4b7d679c16ae2680ee7","observation_id":"45a69f4e-5f3e-4d21-8e10-2fe2d58824d3","resolution":{"observed_at":"2026-08-07T00:23:54.800575Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:54.466306Z","title":null,"venue":null,"work_id":"a39c99f4-ed7d-4686-be03-d6f8715301b2","year":2017},"citing_paper":{"arxiv_id":"2506.21586","last_updated":"2025-08-07T04:59:32Z","snapshot_observed_at":"2026-08-14T13:11:56.557075Z","submitted_at":"2025-06-17T13:37:42Z","title":"Can Vision Language Models Understand Mimed Actions?","version":2},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-07T00:23:48.987850Z"},"links":{"citing_paper":"/paper/2506.21586"},"observation_digest":"sha256:d26776a15991006fd4fa818de05768fd6931ecd2de7b00323dfcc56b3178174b","observation_id":"c75360d9-b70d-420e-9116-34892d99f76e","resolution":{"observed_at":"2026-08-07T00:23:54.577711Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:54.209190Z","title":null,"venue":null,"work_id":"a5f026b3-e6ca-4a75-ac5c-bdb3264eac9a","year":2023},"citing_paper":{"arxiv_id":"2506.21586","last_updated":"2025-08-07T04:59:32Z","snapshot_observed_at":"2026-08-14T13:11:56.557075Z","submitted_at":"2025-06-17T13:37:42Z","title":"Can Vision Language Models Understand Mimed Actions?","version":2},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-07T00:23:49.102941Z"},"links":{"citing_paper":"/paper/2506.21586"},"observation_digest":"sha256:cc2a40ab4467b28dba899a4638a29831e88f3c6ed7db96348439f8dec51022c7","observation_id":"4d8d208a-6962-4294-a595-b460e8d24f64","resolution":{"observed_at":"2026-08-07T00:23:54.323850Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:49.266536Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.21586","last_updated":"2025-08-07T04:59:32Z","snapshot_observed_at":"2026-08-14T13:11:56.557075Z","submitted_at":"2025-06-17T13:37:42Z","title":"Can Vision Language Models Understand Mimed Actions?","version":2},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-07T00:23:49.266536Z"},"links":{"citing_paper":"/paper/2506.21586"},"observation_digest":"sha256:e1969975afcb9bf1a9f57501ee27e7ad3ee82a9504585d1a0f15a975e8746525","observation_id":"e8409d3c-da82-4427-8cef-7d0e9ca993bf","resolution":{"observed_at":"2026-08-07T00:23:49.266536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-17T07:44:10.213698Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-07T00:23:49.449642Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21586","last_updated":"2025-08-07T04:59:32Z","snapshot_observed_at":"2026-08-14T13:11:56.557075Z","submitted_at":"2025-06-17T13:37:42Z","title":"Can Vision Language Models Understand Mimed Actions?","version":2},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-07T00:23:49.449642Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2506.21586"},"observation_digest":"sha256:3531ad2bdc1821018e49d9b9dbef43741212d2ccd70543d7535a81da7f29ee82","observation_id":"4a6dcf03-cd68-4549-b7de-09563432304a","resolution":{"observed_at":"2026-08-07T00:23:49.449642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:53.924858Z","title":null,"venue":null,"work_id":"fdd00e47-143c-4346-b639-195d562889c7","year":2021},"citing_paper":{"arxiv_id":"2506.21586","last_updated":"2025-08-07T04:59:32Z","snapshot_observed_at":"2026-08-14T13:11:56.557075Z","submitted_at":"2025-06-17T13:37:42Z","title":"Can Vision Language Models Understand Mimed Actions?","version":2},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-07T00:23:49.609675Z"},"links":{"citing_paper":"/paper/2506.21586"},"observation_digest":"sha256:4e0b51285d5cc95220d05befa84d78f90c730aca552133d64abe37339e67a343","observation_id":"8f6f270a-8b3e-4d7a-b393-fd286b51b9ce","resolution":{"observed_at":"2026-08-07T00:23:54.038197Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:49.822749Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.21586","last_updated":"2025-08-07T04:59:32Z","snapshot_observed_at":"2026-08-14T13:11:56.557075Z","submitted_at":"2025-06-17T13:37:42Z","title":"Can Vision Language Models Understand Mimed Actions?","version":2},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-07T00:23:49.822749Z"},"links":{"citing_paper":"/paper/2506.21586"},"observation_digest":"sha256:0f009d925d9073abf19bf251b22f092a1ff33fba797dae5a630f3415f81fcb7c","observation_id":"ed7bf379-ec3b-4850-8582-f829aaf420be","resolution":{"observed_at":"2026-08-07T00:23:49.822749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:49.933540Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.21586","last_updated":"2025-08-07T04:59:32Z","snapshot_observed_at":"2026-08-14T13:11:56.557075Z","submitted_at":"2025-06-17T13:37:42Z","title":"Can Vision Language Models Understand Mimed Actions?","version":2},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-07T00:23:49.933540Z"},"links":{"citing_paper":"/paper/2506.21586"},"observation_digest":"sha256:ad61adbe51d3234fe6322ead7e445fd9733ed1b8b8261e7919d27beddfaf1599","observation_id":"e7929bfc-786a-425d-a7a2-b5e18d32d6f5","resolution":{"observed_at":"2026-08-07T00:23:49.933540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18824","last_updated":"2024-04-29T16:05:36Z","snapshot_observed_at":"2026-08-16T13:56:54.401073Z","submitted_at":"2024-04-29T16:05:36Z","title":"Benchmarking Benchmark Leakage in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18824","snapshot_observed_at":"2026-08-07T00:23:50.139856Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21586","last_updated":"2025-08-07T04:59:32Z","snapshot_observed_at":"2026-08-14T13:11:56.557075Z","submitted_at":"2025-06-17T13:37:42Z","title":"Can Vision Language Models Understand Mimed Actions?","version":2},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-07T00:23:50.139856Z"},"links":{"cited_paper":"/paper/2404.18824","citing_paper":"/paper/2506.21586"},"observation_digest":"sha256:be9e37107d347a4de30a78eee5e4aaf49220544e73b9bdf549b5dfe67a1c78fb","observation_id":"d9b1cdac-411b-4f68-9f04-6e3dc58cf728","resolution":{"observed_at":"2026-08-07T00:23:50.139856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:53.638187Z","title":null,"venue":null,"work_id":"9724662a-a037-436a-a0e8-ace34acd1155","year":2022},"citing_paper":{"arxiv_id":"2506.21586","last_updated":"2025-08-07T04:59:32Z","snapshot_observed_at":"2026-08-14T13:11:56.557075Z","submitted_at":"2025-06-17T13:37:42Z","title":"Can Vision Language Models Understand Mimed Actions?","version":2},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-07T00:23:50.317555Z"},"links":{"citing_paper":"/paper/2506.21586"},"observation_digest":"sha256:967c97b5dbf348d77fa12850f972c3c67470f1f9b69ef63d7c5775e4fc95eecb","observation_id":"63573223-da5c-4610-9bf2-1c0a893bec4e","resolution":{"observed_at":"2026-08-07T00:23:53.774544Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:53.370652Z","title":null,"venue":null,"work_id":"714171e4-c712-4273-9200-dcc3227e3714","year":2023},"citing_paper":{"arxiv_id":"2506.21586","last_updated":"2025-08-07T04:59:32Z","snapshot_observed_at":"2026-08-14T13:11:56.557075Z","submitted_at":"2025-06-17T13:37:42Z","title":"Can Vision Language Models Understand Mimed Actions?","version":2},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-07T00:23:50.455294Z"},"links":{"citing_paper":"/paper/2506.21586"},"observation_digest":"sha256:213b586db8adee3803d7d52e0c514cf2772692f3d7a89d3d10bb772878d4bc4d","observation_id":"bd0f5588-1498-426b-aa96-0a8e0efe8af3","resolution":{"observed_at":"2026-08-07T00:23:53.523325Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09675","last_updated":"2020-02-24T18:59:28Z","snapshot_observed_at":"2026-07-29T15:42:51.774083Z","submitted_at":"2019-04-21T23:08:53Z","title":"BERTScore: Evaluating Text Generation with BERT","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.09675","snapshot_observed_at":"2026-08-07T00:23:50.626303Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.21586","last_updated":"2025-08-07T04:59:32Z","snapshot_observed_at":"2026-08-14T13:11:56.557075Z","submitted_at":"2025-06-17T13:37:42Z","title":"Can Vision Language Models Understand Mimed Actions?","version":2},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-07T00:23:50.626303Z"},"links":{"cited_paper":"/paper/1904.09675","citing_paper":"/paper/2506.21586"},"observation_digest":"sha256:11075c1caf32f49c396a741f9658aaa6eea89565c5e01fd6ffc03bcfa718e9dc","observation_id":"6c7ddda5-66b5-4640-acb9-e7e1ce5e6d57","resolution":{"observed_at":"2026-08-07T00:23:50.626303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01964","last_updated":"2023-11-03T14:59:54Z","snapshot_observed_at":"2026-08-16T14:46:11.658740Z","submitted_at":"2023-11-03T14:59:54Z","title":"Don't Make Your LLM an Evaluation Benchmark Cheater","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01964","snapshot_observed_at":"2026-08-07T00:23:50.793745Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21586","last_updated":"2025-08-07T04:59:32Z","snapshot_observed_at":"2026-08-14T13:11:56.557075Z","submitted_at":"2025-06-17T13:37:42Z","title":"Can Vision Language Models Understand Mimed Actions?","version":2},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-07T00:23:50.793745Z"},"links":{"cited_paper":"/paper/2311.01964","citing_paper":"/paper/2506.21586"},"observation_digest":"sha256:a08de8c1bfe8d1911b3908ba61395dd7e5b13c57bf7c0fdff6b17b60ec3ab4fb","observation_id":"c201a5ad-d818-43c7-b7a5-0128eba0b6ae","resolution":{"observed_at":"2026-08-07T00:23:50.793745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:53.119873Z","title":null,"venue":null,"work_id":"b3a37850-15c2-43b6-9702-c22efd5fe40b","year":2018},"citing_paper":{"arxiv_id":"2506.21586","last_updated":"2025-08-07T04:59:32Z","snapshot_observed_at":"2026-08-14T13:11:56.557075Z","submitted_at":"2025-06-17T13:37:42Z","title":"Can Vision Language Models Understand Mimed Actions?","version":2},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-07T00:23:50.931348Z"},"links":{"citing_paper":"/paper/2506.21586"},"observation_digest":"sha256:37da97fd8d20d76ab6337b40fdc3b549306f061a0f45ddcbc2a74c547fa045d3","observation_id":"433064bb-158c-46a7-a13b-798346348560","resolution":{"observed_at":"2026-08-07T00:23:53.205462Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.21586","last_updated":"2025-08-07T04:59:32Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-14T13:11:56.557075Z","submitted_at":"2025-06-17T13:37:42Z","title":"Can Vision Language Models Understand Mimed Actions?"},"reference_resolution":{"displayed":90,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":81,"verified_exact":4,"verified_fuzzy":4},"total_outbound_references":90},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 90 of 90 outbound references and 0 inbound Pith citation observations for arXiv:2506.21586."}