{"as_of":"2026-08-19T20:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5920f8fa20299fbca11540dd01f7bfbbc8ee87282effa0a816e3a64b30f6c3f2","coverage":[{"denominator":38,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T22:56:23.789593Z","state":"measured"},{"denominator":38,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":38,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.00432/citation-record","integrity":"/paper/2501.00432/integrity","json":"/paper/2501.00432/citation-record.json","paper":"/paper/2501.00432"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-10T22:56:23.603998Z","title":"Llama: Open and efficient foundation language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.00432","last_updated":"2024-12-31T13:22:00Z","snapshot_observed_at":"2026-08-18T11:16:31.922131Z","submitted_at":"2024-12-31T13:22:00Z","title":"OV-HHIR: Open Vocabulary Human Interaction Recognition Using Cross-modal Integration of Large Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T22:56:23.603998Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2501.00432"},"observation_digest":"sha256:c862b9a32853f480c900c699c48d34d3f43b0c22e1179826d23cffc3ab135ebf","observation_id":"87e86ae7-c9a5-44ca-a0f7-d84752eff623","resolution":{"observed_at":"2026-08-10T22:56:23.603998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08295","last_updated":"2024-04-16T12:52:47Z","snapshot_observed_at":"2026-08-03T03:29:01.959523Z","submitted_at":"2024-03-13T06:59:16Z","title":"Gemma: Open Models Based on Gemini Research and Technology","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08295","snapshot_observed_at":"2026-08-10T22:56:23.610325Z","title":"Gemma: Open models based on gemini research and technology,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00432","last_updated":"2024-12-31T13:22:00Z","snapshot_observed_at":"2026-08-18T11:16:31.922131Z","submitted_at":"2024-12-31T13:22:00Z","title":"OV-HHIR: Open Vocabulary Human Interaction Recognition Using Cross-modal Integration of Large Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T22:56:23.610325Z"},"links":{"cited_paper":"/paper/2403.08295","citing_paper":"/paper/2501.00432"},"observation_digest":"sha256:ac87712e36a7b5385d117290fc71c15226d4787bd626aa4805a9d36b67136cec","observation_id":"38df0fac-9e36-4d14-92a5-48fe7147a714","resolution":{"observed_at":"2026-08-10T22:56:23.610325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:56:24.466660Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models,","venue":null,"work_id":"044f9585-c140-4d0c-acd0-903cdea56703","year":2023},"citing_paper":{"arxiv_id":"2501.00432","last_updated":"2024-12-31T13:22:00Z","snapshot_observed_at":"2026-08-18T11:16:31.922131Z","submitted_at":"2024-12-31T13:22:00Z","title":"OV-HHIR: Open Vocabulary Human Interaction Recognition Using Cross-modal Integration of Large Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T22:56:23.615502Z"},"links":{"citing_paper":"/paper/2501.00432"},"observation_digest":"sha256:9ee157e5880b0b118afde8d21a4548c2f478b9e2f707794d66f431e4f9db8fa6","observation_id":"b2a1420b-504d-4ce1-8243-97e034835968","resolution":{"observed_at":"2026-08-10T22:56:24.472616Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:56:24.449021Z","title":"Language-grounded dynamic scene graphs for interactive object search with mobile manipulation,","venue":null,"work_id":"65c77114-bd43-42b7-9823-fff50483280d","year":2024},"citing_paper":{"arxiv_id":"2501.00432","last_updated":"2024-12-31T13:22:00Z","snapshot_observed_at":"2026-08-18T11:16:31.922131Z","submitted_at":"2024-12-31T13:22:00Z","title":"OV-HHIR: Open Vocabulary Human Interaction Recognition Using Cross-modal Integration of Large Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T22:56:23.620658Z"},"links":{"citing_paper":"/paper/2501.00432"},"observation_digest":"sha256:9247148e20a4b01000a87d195895f2e52e7533754fcf611dcf424d7d9637cf83","observation_id":"bb9d0b30-a686-48cc-9731-7bcfe6af0515","resolution":{"observed_at":"2026-08-10T22:56:24.455214Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11176","last_updated":"2023-05-24T04:17:34Z","snapshot_observed_at":"2026-08-16T15:31:55.161030Z","submitted_at":"2023-05-18T17:59:49Z","title":"Instruct2Act: Mapping Multi-modality Instructions to Robotic Actions with Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11176","snapshot_observed_at":"2026-08-10T22:56:23.625900Z","title":"Instruct2act: Mapping multi-modality instruc- tions to robotic actions with large language model,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.00432","last_updated":"2024-12-31T13:22:00Z","snapshot_observed_at":"2026-08-18T11:16:31.922131Z","submitted_at":"2024-12-31T13:22:00Z","title":"OV-HHIR: Open Vocabulary Human Interaction Recognition Using Cross-modal Integration of Large Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T22:56:23.625900Z"},"links":{"cited_paper":"/paper/2305.11176","citing_paper":"/paper/2501.00432"},"observation_digest":"sha256:989eb760bf028e9a333f9659e65fb80e374bd3aab5c2b7ade33fa82da3d3d0cb","observation_id":"4c4088ad-c387-4a9e-86b6-dd42d59b8338","resolution":{"observed_at":"2026-08-10T22:56:23.625900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12950","last_updated":"2024-01-31T19:47:26Z","snapshot_observed_at":"2026-08-18T03:59:39.242039Z","submitted_at":"2023-08-24T17:39:13Z","title":"Code Llama: Open Foundation Models for Code","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12950","snapshot_observed_at":"2026-08-10T22:56:23.631491Z","title":"Code llama: Open foundation models for code,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.00432","last_updated":"2024-12-31T13:22:00Z","snapshot_observed_at":"2026-08-18T11:16:31.922131Z","submitted_at":"2024-12-31T13:22:00Z","title":"OV-HHIR: Open Vocabulary Human Interaction Recognition Using Cross-modal Integration of Large Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T22:56:23.631491Z"},"links":{"cited_paper":"/paper/2308.12950","citing_paper":"/paper/2501.00432"},"observation_digest":"sha256:86d46e031254d7212fb35972e15d6b2b25264c9be6e7e2dadf2cb22040d5a5df","observation_id":"065d66d5-1452-4bf7-a252-c822fe8f44e6","resolution":{"observed_at":"2026-08-10T22:56:23.631491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.13474","last_updated":"2023-02-27T21:26:48Z","snapshot_observed_at":"2026-08-13T14:36:56.609471Z","submitted_at":"2022-03-25T06:55:15Z","title":"CodeGen: An Open Large Language Model for Code with Multi-Turn Program Synthesis","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.13474","snapshot_observed_at":"2026-08-10T22:56:23.637769Z","title":"Codegen: An open large language model for code with multi-turn program synthesis,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.00432","last_updated":"2024-12-31T13:22:00Z","snapshot_observed_at":"2026-08-18T11:16:31.922131Z","submitted_at":"2024-12-31T13:22:00Z","title":"OV-HHIR: Open Vocabulary Human Interaction Recognition Using Cross-modal Integration of Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T22:56:23.637769Z"},"links":{"cited_paper":"/paper/2203.13474","citing_paper":"/paper/2501.00432"},"observation_digest":"sha256:86539edf62bfff248b6baa376cf02bb8a604b0f3722d52f182b779bfef5b70b5","observation_id":"bc779ece-c635-45cb-bb9a-a23e874f2ed6","resolution":{"observed_at":"2026-08-10T22:56:23.637769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:56:24.432328Z","title":"Text me the data: Generating ground pressure sequence from textual descriptions for har,","venue":null,"work_id":"6c758561-4a48-4188-8495-1bf290299b0e","year":2024},"citing_paper":{"arxiv_id":"2501.00432","last_updated":"2024-12-31T13:22:00Z","snapshot_observed_at":"2026-08-18T11:16:31.922131Z","submitted_at":"2024-12-31T13:22:00Z","title":"OV-HHIR: Open Vocabulary Human Interaction Recognition Using Cross-modal Integration of Large Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T22:56:23.642943Z"},"links":{"citing_paper":"/paper/2501.00432"},"observation_digest":"sha256:f5e9389d68964ebbac2af607c7ab90a18259f755490c43f47456d890d6255966","observation_id":"03ec1088-e661-4fce-8483-36849b6b1f6b","resolution":{"observed_at":"2026-08-10T22:56:24.437533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-08-13T15:50:38.254753Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-10T22:56:23.647629Z","title":"Video-llama: An instruction- tuned audio-visual language model for video understanding,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.00432","last_updated":"2024-12-31T13:22:00Z","snapshot_observed_at":"2026-08-18T11:16:31.922131Z","submitted_at":"2024-12-31T13:22:00Z","title":"OV-HHIR: Open Vocabulary Human Interaction Recognition Using Cross-modal Integration of Large Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T22:56:23.647629Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2501.00432"},"observation_digest":"sha256:0060668f095bdcbb00b4ce9fbd9ed244d6b32ba0ee13d6f2e6b7259ebe6c3a8d","observation_id":"d096f72a-b7db-47f1-8beb-f690a8bd9a96","resolution":{"observed_at":"2026-08-10T22:56:23.647629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:56:24.416236Z","title":"Bliva: A simple multimodal llm for better handling of text-rich visual questions,","venue":null,"work_id":"feea65b0-2040-4925-97e7-4be0cbd25ce8","year":2024},"citing_paper":{"arxiv_id":"2501.00432","last_updated":"2024-12-31T13:22:00Z","snapshot_observed_at":"2026-08-18T11:16:31.922131Z","submitted_at":"2024-12-31T13:22:00Z","title":"OV-HHIR: Open Vocabulary Human Interaction Recognition Using Cross-modal Integration of Large Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T22:56:23.652741Z"},"links":{"citing_paper":"/paper/2501.00432"},"observation_digest":"sha256:ca117d0d779523c101fae7910cc0830155b937a6cf773f2ca07214c067ab1479","observation_id":"72ec3e0b-5e59-4793-b5ea-8f0473dbf639","resolution":{"observed_at":"2026-08-10T22:56:24.421483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:56:24.400425Z","title":"Infogcn: Representation learning for human skeleton-based action recognition,","venue":null,"work_id":"fc9d9af5-3139-4ee2-9e63-8625c72267b6","year":2022},"citing_paper":{"arxiv_id":"2501.00432","last_updated":"2024-12-31T13:22:00Z","snapshot_observed_at":"2026-08-18T11:16:31.922131Z","submitted_at":"2024-12-31T13:22:00Z","title":"OV-HHIR: Open Vocabulary Human Interaction Recognition Using Cross-modal Integration of Large Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T22:56:23.657569Z"},"links":{"citing_paper":"/paper/2501.00432"},"observation_digest":"sha256:c04b997f401e11eb2ae332cd5858eb142f71cda0a5bb6b52fa79baa4643202a4","observation_id":"6cdbf847-6e40-47f2-885b-ce49ad5fcced","resolution":{"observed_at":"2026-08-10T22:56:24.405639Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03857","last_updated":"2025-02-06T12:37:09Z","snapshot_observed_at":"2026-08-16T13:45:37.840269Z","submitted_at":"2024-06-06T08:42:36Z","title":"MuJo: Multimodal Joint Feature Space Learning for Human Activity Recognition","version":3},"cited_work":{"arxiv_id":"2406.03857","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.03857","snapshot_observed_at":"2026-08-10T22:56:24.006407Z","title":"MuJo: Multimodal Joint Feature Space Learning for Human Activity Recognition","venue":"cs.LG","work_id":"9b664f6d-8864-4e31-b816-c0607f3cbaee","year":2024},"citing_paper":{"arxiv_id":"2501.00432","last_updated":"2024-12-31T13:22:00Z","snapshot_observed_at":"2026-08-18T11:16:31.922131Z","submitted_at":"2024-12-31T13:22:00Z","title":"OV-HHIR: Open Vocabulary Human Interaction Recognition Using Cross-modal Integration of Large Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T22:56:23.662217Z"},"links":{"cited_paper":"/paper/2406.03857","citing_paper":"/paper/2501.00432"},"observation_digest":"sha256:ea3d27006b2b0d34208c275747fa0106a83ddf51f5762b67f9387c85072e46d3","observation_id":"e2742733-127e-4afb-b79f-0fe78d0b7222","resolution":{"observed_at":"2026-08-10T22:56:24.011915Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:56:24.382634Z","title":"Decoupled spatial- temporal attention network for skeleton-based action-gesture recogni- tion,","venue":null,"work_id":"688616c0-16c9-4c89-a4ab-98789e5b64dd","year":2020},"citing_paper":{"arxiv_id":"2501.00432","last_updated":"2024-12-31T13:22:00Z","snapshot_observed_at":"2026-08-18T11:16:31.922131Z","submitted_at":"2024-12-31T13:22:00Z","title":"OV-HHIR: Open Vocabulary Human Interaction Recognition Using Cross-modal Integration of Large Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T22:56:23.667838Z"},"links":{"citing_paper":"/paper/2501.00432"},"observation_digest":"sha256:020c2267e377c5df59fef464edad6f88c79fed74ea448fb47fa54ba8fcd40a42","observation_id":"c0d010bc-eef7-4ae9-850f-5435a80c912e","resolution":{"observed_at":"2026-08-10T22:56:24.387833Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.09527","last_updated":"2024-08-22T09:03:13Z","snapshot_observed_at":"2026-08-16T13:25:42.908159Z","submitted_at":"2024-08-18T16:24:22Z","title":"ALS-HAR: Harnessing Wearable Ambient Light Sensors to Enhance IMU-based Human Activity Recogntion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.09527","snapshot_observed_at":"2026-08-10T22:56:23.672238Z","title":"Als-har: Harnessing wearable ambient light sensors to enhance imu-based har,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00432","last_updated":"2024-12-31T13:22:00Z","snapshot_observed_at":"2026-08-18T11:16:31.922131Z","submitted_at":"2024-12-31T13:22:00Z","title":"OV-HHIR: Open Vocabulary Human Interaction Recognition Using Cross-modal Integration of Large Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T22:56:23.672238Z"},"links":{"cited_paper":"/paper/2408.09527","citing_paper":"/paper/2501.00432"},"observation_digest":"sha256:a844a2a27ed944eb9fe63ca19fc84b96e5258c5e36886992679e7cdbe69b169c","observation_id":"bde806a5-987e-46eb-a94e-645309497de0","resolution":{"observed_at":"2026-08-10T22:56:23.672238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:56:24.365832Z","title":"Human- to-human interaction detection,","venue":null,"work_id":"7be5bfef-2c56-4c82-9403-6a51cb5698fc","year":2023},"citing_paper":{"arxiv_id":"2501.00432","last_updated":"2024-12-31T13:22:00Z","snapshot_observed_at":"2026-08-18T11:16:31.922131Z","submitted_at":"2024-12-31T13:22:00Z","title":"OV-HHIR: Open Vocabulary Human Interaction Recognition Using Cross-modal Integration of Large Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T22:56:23.677125Z"},"links":{"citing_paper":"/paper/2501.00432"},"observation_digest":"sha256:013619adc8af218f191aeb08dc473339e845669f6a75c6f630e5b9d1b1c34da2","observation_id":"4617cad2-2272-4829-9dea-f1deff563e5c","resolution":{"observed_at":"2026-08-10T22:56:24.371202Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.00409","last_updated":"2023-12-31T06:46:46Z","snapshot_observed_at":"2026-08-16T14:30:40.414332Z","submitted_at":"2023-12-31T06:46:46Z","title":"A Two-stream Hybrid CNN-Transformer Network for Skeleton-based Human Interaction Recognition","version":1},"cited_work":{"arxiv_id":"2401.00409","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.00409","snapshot_observed_at":"2026-08-10T22:56:23.964081Z","title":"A Two-stream Hybrid CNN-Transformer Network for Skeleton-based Human Interaction Recognition","venue":"cs.CV","work_id":"24ce4f4e-f499-4f5d-9dc8-9fa06023fbcc","year":2023},"citing_paper":{"arxiv_id":"2501.00432","last_updated":"2024-12-31T13:22:00Z","snapshot_observed_at":"2026-08-18T11:16:31.922131Z","submitted_at":"2024-12-31T13:22:00Z","title":"OV-HHIR: Open Vocabulary Human Interaction Recognition Using Cross-modal Integration of Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T22:56:23.681815Z"},"links":{"cited_paper":"/paper/2401.00409","citing_paper":"/paper/2501.00432"},"observation_digest":"sha256:1f3e52f693bd76b91ff39e4da01bcfe6599128815b251b891b367356a6b356fc","observation_id":"64f0c954-6907-4a33-89d6-f0f86dd997b9","resolution":{"observed_at":"2026-08-10T22:56:23.971278Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:56:24.349868Z","title":"Hargpt: Are llms zero-shot human activity recognizers?,","venue":null,"work_id":"b6e5df9b-b9d3-49e5-b2f6-44b2b7c983b4","year":2024},"citing_paper":{"arxiv_id":"2501.00432","last_updated":"2024-12-31T13:22:00Z","snapshot_observed_at":"2026-08-18T11:16:31.922131Z","submitted_at":"2024-12-31T13:22:00Z","title":"OV-HHIR: Open Vocabulary Human Interaction Recognition Using Cross-modal Integration of Large Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T22:56:23.686911Z"},"links":{"citing_paper":"/paper/2501.00432"},"observation_digest":"sha256:46744604177068e7548af6c27dcf140ca83030a0bc0da2e8ca7da0ebc37a1d34","observation_id":"395dfb42-dcd6-46c8-b341-a0f9637baa1d","resolution":{"observed_at":"2026-08-10T22:56:24.355129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02140","last_updated":"2023-06-03T15:41:59Z","snapshot_observed_at":"2026-08-16T15:26:53.249481Z","submitted_at":"2023-06-03T15:41:59Z","title":"Unsupervised Human Activity Recognition through Two-stage Prompting with ChatGPT","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02140","snapshot_observed_at":"2026-08-10T22:56:23.691724Z","title":"Unsupervised human activity recognition through two-stage prompting with chatgpt,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.00432","last_updated":"2024-12-31T13:22:00Z","snapshot_observed_at":"2026-08-18T11:16:31.922131Z","submitted_at":"2024-12-31T13:22:00Z","title":"OV-HHIR: Open Vocabulary Human Interaction Recognition Using Cross-modal Integration of Large Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T22:56:23.691724Z"},"links":{"cited_paper":"/paper/2306.02140","citing_paper":"/paper/2501.00432"},"observation_digest":"sha256:c4c4db39ce1caa94beeb7addde20af9884bd88b5d8615c578a3cd289e3c2a93a","observation_id":"657d9849-0e6d-4ebf-8902-ccfec0004185","resolution":{"observed_at":"2026-08-10T22:56:23.691724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:56:24.332541Z","title":"Segment anything,","venue":null,"work_id":"670004cd-e46e-4905-8806-a5d7d85b54ef","year":2023},"citing_paper":{"arxiv_id":"2501.00432","last_updated":"2024-12-31T13:22:00Z","snapshot_observed_at":"2026-08-18T11:16:31.922131Z","submitted_at":"2024-12-31T13:22:00Z","title":"OV-HHIR: Open Vocabulary Human Interaction Recognition Using Cross-modal Integration of Large Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T22:56:23.696802Z"},"links":{"citing_paper":"/paper/2501.00432"},"observation_digest":"sha256:2fd753c4cdda2faa0d865f0a9ebec0ce297a7b3eb66583dd668019affa68720e","observation_id":"23e7e97a-c047-4ddd-9efe-647631874ae8","resolution":{"observed_at":"2026-08-10T22:56:24.338026Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:56:24.315462Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale,","venue":null,"work_id":"ac7c8792-91df-48f0-933b-bf8066418195","year":2021},"citing_paper":{"arxiv_id":"2501.00432","last_updated":"2024-12-31T13:22:00Z","snapshot_observed_at":"2026-08-18T11:16:31.922131Z","submitted_at":"2024-12-31T13:22:00Z","title":"OV-HHIR: Open Vocabulary Human Interaction Recognition Using Cross-modal Integration of Large Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T22:56:23.701590Z"},"links":{"citing_paper":"/paper/2501.00432"},"observation_digest":"sha256:1597e803d0dc4eaed7a64ec1ab09fcea3d8a75ade8d5a54ce4e634cd8ea7b5b4","observation_id":"33c1a0c1-e98c-4e43-85b1-977c4e80d32a","resolution":{"observed_at":"2026-08-10T22:56:24.320721Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-10T22:56:23.706672Z","title":"Llama 2: Open foundation and fine- tuned chat models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.00432","last_updated":"2024-12-31T13:22:00Z","snapshot_observed_at":"2026-08-18T11:16:31.922131Z","submitted_at":"2024-12-31T13:22:00Z","title":"OV-HHIR: Open Vocabulary Human Interaction Recognition Using Cross-modal Integration of Large Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T22:56:23.706672Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2501.00432"},"observation_digest":"sha256:4af2cd40ec8e6a1a60bfc6c15eade096f7eafd2b047fb207fc81383b0d9286b3","observation_id":"5133d8c2-772f-4b07-92b2-f6779863812e","resolution":{"observed_at":"2026-08-10T22:56:23.706672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-10T22:56:23.711560Z","title":"Gpt-4 technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.00432","last_updated":"2024-12-31T13:22:00Z","snapshot_observed_at":"2026-08-18T11:16:31.922131Z","submitted_at":"2024-12-31T13:22:00Z","title":"OV-HHIR: Open Vocabulary Human Interaction Recognition Using Cross-modal Integration of Large Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T22:56:23.711560Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2501.00432"},"observation_digest":"sha256:0a5310a554fda01dc4f791a466c10930f3a8941bc171983e533e738b0dba656b","observation_id":"bd55a662-375e-404f-a130-6b7fa18f9898","resolution":{"observed_at":"2026-08-10T22:56:23.711560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.11968","last_updated":"2023-04-28T03:21:27Z","snapshot_observed_at":"2026-08-17T08:48:49.593119Z","submitted_at":"2023-04-24T10:04:06Z","title":"Track Anything: Segment Anything Meets Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.11968","snapshot_observed_at":"2026-08-10T22:56:23.716449Z","title":"Track anything: Segment anything meets videos,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.00432","last_updated":"2024-12-31T13:22:00Z","snapshot_observed_at":"2026-08-18T11:16:31.922131Z","submitted_at":"2024-12-31T13:22:00Z","title":"OV-HHIR: Open Vocabulary Human Interaction Recognition Using Cross-modal Integration of Large Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T22:56:23.716449Z"},"links":{"cited_paper":"/paper/2304.11968","citing_paper":"/paper/2501.00432"},"observation_digest":"sha256:e981b6fa44d98f243244158457a4904ef8292b45d1d4d5d151f95592f00f4ffd","observation_id":"c3bafba6-9543-4549-bc43-8a2c5ec89cca","resolution":{"observed_at":"2026-08-10T22:56:23.716449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:56:24.299556Z","title":"Actions in context,","venue":null,"work_id":"642cf0d0-cf19-46b2-85fd-3643a61d7629","year":2009},"citing_paper":{"arxiv_id":"2501.00432","last_updated":"2024-12-31T13:22:00Z","snapshot_observed_at":"2026-08-18T11:16:31.922131Z","submitted_at":"2024-12-31T13:22:00Z","title":"OV-HHIR: Open Vocabulary Human Interaction Recognition Using Cross-modal Integration of Large Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T22:56:23.722466Z"},"links":{"citing_paper":"/paper/2501.00432"},"observation_digest":"sha256:38b497871416b6bbc24966d09c660fc3744f0400c07487279c82be71a84b9cce","observation_id":"b899e3e7-ec58-4afc-83ad-3c78f8d0bb6b","resolution":{"observed_at":"2026-08-10T22:56:24.304524Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:56:24.283287Z","title":"Sportshhi: A dataset for human-human interaction detection in sports videos,","venue":null,"work_id":"09e81417-223b-477d-8beb-0fc89c5e4d2a","year":2024},"citing_paper":{"arxiv_id":"2501.00432","last_updated":"2024-12-31T13:22:00Z","snapshot_observed_at":"2026-08-18T11:16:31.922131Z","submitted_at":"2024-12-31T13:22:00Z","title":"OV-HHIR: Open Vocabulary Human Interaction Recognition Using Cross-modal Integration of Large Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T22:56:23.727378Z"},"links":{"citing_paper":"/paper/2501.00432"},"observation_digest":"sha256:2d7fdfe39dd7c8ce45391d1b4882724fafea695631b87ec471b0c4650b5b5f08","observation_id":"f2ed5518-f78d-4e2f-aa19-02a0c6d631ca","resolution":{"observed_at":"2026-08-10T22:56:24.288579Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:56:24.267179Z","title":"High five: Recognising human interactions in tv shows.,","venue":null,"work_id":"a2d4271d-9207-4b0e-9fc4-d251d0fcbab7","year":2010},"citing_paper":{"arxiv_id":"2501.00432","last_updated":"2024-12-31T13:22:00Z","snapshot_observed_at":"2026-08-18T11:16:31.922131Z","submitted_at":"2024-12-31T13:22:00Z","title":"OV-HHIR: Open Vocabulary Human Interaction Recognition Using Cross-modal Integration of Large Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T22:56:23.732128Z"},"links":{"citing_paper":"/paper/2501.00432"},"observation_digest":"sha256:baff95151904a154fb2f7fc224e74ae647ccc5a757646a3f675ce5d7c41e9084","observation_id":"81615868-aa76-4666-8700-2b1e3b646c9e","resolution":{"observed_at":"2026-08-10T22:56:24.272260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:56:24.250594Z","title":"Two-person interaction detection using body- pose features and multiple instance learning,","venue":null,"work_id":"1f4f48c7-1e28-4aa0-9a08-3cbbd2cdaede","year":2012},"citing_paper":{"arxiv_id":"2501.00432","last_updated":"2024-12-31T13:22:00Z","snapshot_observed_at":"2026-08-18T11:16:31.922131Z","submitted_at":"2024-12-31T13:22:00Z","title":"OV-HHIR: Open Vocabulary Human Interaction Recognition Using Cross-modal Integration of Large Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T22:56:23.736755Z"},"links":{"citing_paper":"/paper/2501.00432"},"observation_digest":"sha256:1e5377ad9b9b571b14846c2bf44b8d9e1739e746d064fbcc69254e4ae7a11521","observation_id":"775c389b-6dff-4080-9af3-82b417bfe29c","resolution":{"observed_at":"2026-08-10T22:56:24.255791Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:56:24.234009Z","title":"First-person activity recognition: What are they doing to me?,","venue":null,"work_id":"ebc292aa-8621-446c-afd8-2e0ab910a3ec","year":2013},"citing_paper":{"arxiv_id":"2501.00432","last_updated":"2024-12-31T13:22:00Z","snapshot_observed_at":"2026-08-18T11:16:31.922131Z","submitted_at":"2024-12-31T13:22:00Z","title":"OV-HHIR: Open Vocabulary Human Interaction Recognition Using Cross-modal Integration of Large Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T22:56:23.741467Z"},"links":{"citing_paper":"/paper/2501.00432"},"observation_digest":"sha256:93a7fd10bd3df66542b1fa65c12dac48695a8278aabe5c191ab714f45c9226c0","observation_id":"edb78eb0-4d28-49be-9d84-56f615613598","resolution":{"observed_at":"2026-08-10T22:56:24.239362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:56:24.216151Z","title":"Interaction relational net- work for mutual action recognition,","venue":null,"work_id":"e2cd15b1-d3b3-434b-918b-2a4f12c04c6e","year":2021},"citing_paper":{"arxiv_id":"2501.00432","last_updated":"2024-12-31T13:22:00Z","snapshot_observed_at":"2026-08-18T11:16:31.922131Z","submitted_at":"2024-12-31T13:22:00Z","title":"OV-HHIR: Open Vocabulary Human Interaction Recognition Using Cross-modal Integration of Large Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T22:56:23.746258Z"},"links":{"citing_paper":"/paper/2501.00432"},"observation_digest":"sha256:fda8262603272c6933414ed24846b5d05d3fbddbccda5fd99aaee75785efa6a8","observation_id":"11898bc6-75b9-4896-8fde-d47ebddf5a3d","resolution":{"observed_at":"2026-08-10T22:56:24.222094Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.06950","last_updated":"2017-05-19T12:07:01Z","snapshot_observed_at":"2026-08-15T11:35:18.832923Z","submitted_at":"2017-05-19T12:07:01Z","title":"The Kinetics Human Action Video Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.06950","snapshot_observed_at":"2026-08-10T22:56:23.750838Z","title":"The kinetics human action video dataset,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.00432","last_updated":"2024-12-31T13:22:00Z","snapshot_observed_at":"2026-08-18T11:16:31.922131Z","submitted_at":"2024-12-31T13:22:00Z","title":"OV-HHIR: Open Vocabulary Human Interaction Recognition Using Cross-modal Integration of Large Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T22:56:23.750838Z"},"links":{"cited_paper":"/paper/1705.06950","citing_paper":"/paper/2501.00432"},"observation_digest":"sha256:709e6a5ecc8add79107f024d2450a47f09f2e5669081a41ed05de6c0cdd7f3fc","observation_id":"b0c9739a-7184-421c-ac69-12b35725793c","resolution":{"observed_at":"2026-08-10T22:56:23.750838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:56:24.199095Z","title":"Air- act2act: Human–human interaction dataset for teaching non-verbal social behaviors to robots,","venue":null,"work_id":"9dbf3eb9-8cba-484f-b990-5fa7d72f0e37","year":2021},"citing_paper":{"arxiv_id":"2501.00432","last_updated":"2024-12-31T13:22:00Z","snapshot_observed_at":"2026-08-18T11:16:31.922131Z","submitted_at":"2024-12-31T13:22:00Z","title":"OV-HHIR: Open Vocabulary Human Interaction Recognition Using Cross-modal Integration of Large Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T22:56:23.756151Z"},"links":{"citing_paper":"/paper/2501.00432"},"observation_digest":"sha256:ffc1c0b6563c85d17d603b6b9304e48f9d1fe0aacc558ef4a4efbf55e9023de4","observation_id":"aa397625-c615-4051-ad4f-7954a0ce4db9","resolution":{"observed_at":"2026-08-10T22:56:24.204484Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:56:24.180761Z","title":"Human behavior under- standing,","venue":null,"work_id":"a0fa9442-60a6-4cec-8c1c-7d5eb812ef4c","year":2014},"citing_paper":{"arxiv_id":"2501.00432","last_updated":"2024-12-31T13:22:00Z","snapshot_observed_at":"2026-08-18T11:16:31.922131Z","submitted_at":"2024-12-31T13:22:00Z","title":"OV-HHIR: Open Vocabulary Human Interaction Recognition Using Cross-modal Integration of Large Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T22:56:23.760835Z"},"links":{"citing_paper":"/paper/2501.00432"},"observation_digest":"sha256:454e7a81f3a95475bfa45eaac1279dfb31db7a3c91db7f46e519fd7649f8141c","observation_id":"579d3cd5-eaba-4fd1-82c2-27bad80a2ba5","resolution":{"observed_at":"2026-08-10T22:56:24.187189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:56:24.163076Z","title":"Ntu rgb+ d 120: A large-scale benchmark for 3d human activity understanding,","venue":null,"work_id":"860dbd16-829e-4e84-a80a-b7702abed4d0","year":2019},"citing_paper":{"arxiv_id":"2501.00432","last_updated":"2024-12-31T13:22:00Z","snapshot_observed_at":"2026-08-18T11:16:31.922131Z","submitted_at":"2024-12-31T13:22:00Z","title":"OV-HHIR: Open Vocabulary Human Interaction Recognition Using Cross-modal Integration of Large Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T22:56:23.766462Z"},"links":{"citing_paper":"/paper/2501.00432"},"observation_digest":"sha256:11377cff3881b2538228a46908176dde4b1cd0589a905e2d34b2bfa43a42f207","observation_id":"ab50a7af-e2f7-4ff8-bc9e-dc65f055ff5a","resolution":{"observed_at":"2026-08-10T22:56:24.169124Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.02677","last_updated":"2023-07-06T13:47:21Z","snapshot_observed_at":"2026-08-18T11:15:44.490559Z","submitted_at":"2023-05-04T09:48:22Z","title":"Caption Anything: Interactive Image Description with Diverse Multimodal Controls","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.02677","snapshot_observed_at":"2026-08-10T22:56:23.771088Z","title":"Caption anything: Interactive image description with diverse multimodal controls,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.00432","last_updated":"2024-12-31T13:22:00Z","snapshot_observed_at":"2026-08-18T11:16:31.922131Z","submitted_at":"2024-12-31T13:22:00Z","title":"OV-HHIR: Open Vocabulary Human Interaction Recognition Using Cross-modal Integration of Large Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T22:56:23.771088Z"},"links":{"cited_paper":"/paper/2305.02677","citing_paper":"/paper/2501.00432"},"observation_digest":"sha256:f1e5c9f92092511a492beb48ae7e479e0fd1d466589893e9ca39b9315d1ecc62","observation_id":"b619f521-e1ed-4712-b6f6-6b22246a16ba","resolution":{"observed_at":"2026-08-10T22:56:23.771088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:56:24.145421Z","title":"Vitpose: Sim- ple vision transformer baselines for human pose estimation,","venue":null,"work_id":"cb30d1e0-5b2d-4010-b629-11f138302b63","year":2022},"citing_paper":{"arxiv_id":"2501.00432","last_updated":"2024-12-31T13:22:00Z","snapshot_observed_at":"2026-08-18T11:16:31.922131Z","submitted_at":"2024-12-31T13:22:00Z","title":"OV-HHIR: Open Vocabulary Human Interaction Recognition Using Cross-modal Integration of Large Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T22:56:23.775670Z"},"links":{"citing_paper":"/paper/2501.00432"},"observation_digest":"sha256:9ab082358414122422081c05e44bfdf8451f7a91006eb45532943186476910db","observation_id":"12207379-a3be-4412-a41d-7ea6de79d4da","resolution":{"observed_at":"2026-08-10T22:56:24.151800Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:56:24.127768Z","title":"Tokens- to-token vit: Training vision transformers from scratch on imagenet,","venue":null,"work_id":"1eb2aeba-ab8f-41fe-85d3-b999cf843dde","year":2021},"citing_paper":{"arxiv_id":"2501.00432","last_updated":"2024-12-31T13:22:00Z","snapshot_observed_at":"2026-08-18T11:16:31.922131Z","submitted_at":"2024-12-31T13:22:00Z","title":"OV-HHIR: Open Vocabulary Human Interaction Recognition Using Cross-modal Integration of Large Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T22:56:23.780097Z"},"links":{"citing_paper":"/paper/2501.00432"},"observation_digest":"sha256:e853b8eec42164c3ea221ad754df34a8aa0c450dc57ed814e46713ce66550c65","observation_id":"b58fb453-5b87-4516-9d1e-db0f902034fe","resolution":{"observed_at":"2026-08-10T22:56:24.133634Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-08-14T16:25:22.654846Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-10T22:56:23.784686Z","title":"Vide- ollama 2: Advancing spatial-temporal modeling and audio understanding in video-llms,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00432","last_updated":"2024-12-31T13:22:00Z","snapshot_observed_at":"2026-08-18T11:16:31.922131Z","submitted_at":"2024-12-31T13:22:00Z","title":"OV-HHIR: Open Vocabulary Human Interaction Recognition Using Cross-modal Integration of Large Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T22:56:23.784686Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2501.00432"},"observation_digest":"sha256:505d22ba82d46234fffc6bc7ffff35941668053cc7372b8ccd5a8b293317aad1","observation_id":"a500a090-c4bf-43d6-acef-9ca4d3e8d58d","resolution":{"observed_at":"2026-08-10T22:56:23.784686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-17T18:04:53.578114Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-10T22:56:23.789593Z","title":"Lora: Low-rank adaptation of large language models,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.00432","last_updated":"2024-12-31T13:22:00Z","snapshot_observed_at":"2026-08-18T11:16:31.922131Z","submitted_at":"2024-12-31T13:22:00Z","title":"OV-HHIR: Open Vocabulary Human Interaction Recognition Using Cross-modal Integration of Large Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T22:56:23.789593Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2501.00432"},"observation_digest":"sha256:dba1115523eacbb2d2f7810fcfd341906516f14f2fa4cda1be46f12af7aede9f","observation_id":"91384ef2-fb44-493f-8492-a01fe3816933","resolution":{"observed_at":"2026-08-10T22:56:23.789593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.00432","last_updated":"2024-12-31T13:22:00Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-18T11:16:31.922131Z","submitted_at":"2024-12-31T13:22:00Z","title":"OV-HHIR: Open Vocabulary Human Interaction Recognition Using Cross-modal Integration of Large Language Models"},"reference_resolution":{"displayed":38,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":15,"verified_exact":2,"verified_fuzzy":21},"total_outbound_references":38},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 0 inbound Pith citation observations for arXiv:2501.00432."}