{"as_of":"2026-08-10T04:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6e05940e71063358372d65c63acc64194114cb68f626318e2e5ad0e62e7780a0","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T04:44:58.910397Z","state":"measured"},{"denominator":57,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":57,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2502.03459/citation-record","integrity":"/paper/2502.03459/integrity","json":"/paper/2502.03459/citation-record.json","paper":"/paper/2502.03459"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:44:58.739680Z","title":", \" * write output.state after.block = add.period write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.739680Z"},"links":{"citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:3b36e83355550a8222513a5b23ec825b89f67db07f56756633efbc2acc89fbf6","observation_id":"a09c5ffe-d7c5-4a20-a2c9-ce6ba00e2cae","resolution":{"observed_at":"2026-08-09T04:44:58.739680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:44:58.743392Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.743392Z"},"links":{"citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:cff006216683d4136d07e4711b51ca2cdb89e3ac3b2529b0a9a35e1ba815c542","observation_id":"4f6807ed-6db9-4ec3-98c4-febcecead612","resolution":{"observed_at":"2026-08-09T04:44:58.743392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-09T04:44:58.747112Z","title":"L.; Almeida, D.; Altenschmidt, J.; Altman, S.; Anadkat, S.; et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.747112Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:b47b468761a0b287ab79cfdcad347bf2abe3306f132be43b60c203f1e5fbf23b","observation_id":"cc067b34-46b2-4595-bee6-e9419a29f7f9","resolution":{"observed_at":"2026-08-09T04:44:58.747112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:44:59.381059Z","title":null,"venue":null,"work_id":"a7b7b6c8-eb1f-402e-afd6-2d218bff1255","year":2016},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.750548Z"},"links":{"citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:dc18631524e2ddfc6a28a0c6f2f8dc9c723112fbd9cac93efc3dca325494c14b","observation_id":"f80afc5e-07e6-468e-982f-0eec120e20ca","resolution":{"observed_at":"2026-08-09T04:44:59.384190Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:44:59.372674Z","title":null,"venue":null,"work_id":"1ac45998-cdfc-4307-8820-9fba1e277eb6","year":2015},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.753636Z"},"links":{"citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:7954fb1d5a295e96a349a81720e8072d8b7706de6f19bd84b8803f9626e85ff9","observation_id":"45365206-6f49-4d6a-b69d-8c516c560bfb","resolution":{"observed_at":"2026-08-09T04:44:59.375481Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:44:59.364287Z","title":null,"venue":null,"work_id":"214169e0-b8d9-4420-877c-603702505fe3","year":2024},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.757401Z"},"links":{"citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:0670c0440786d4c847a9ff88a8affa98b21f7137701c2c372a814ad42fe8c0f5","observation_id":"f7a4e3ea-b264-435d-b50f-aba1b6f51a87","resolution":{"observed_at":"2026-08-09T04:44:59.367040Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:44:59.355369Z","title":null,"venue":null,"work_id":"041ce2d4-4147-47fa-9ccf-ce2c5e359896","year":2020},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.760473Z"},"links":{"citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:2515ce5dd7536f26b2f819734314a09acbe7f8829b9af57eebf76dc01a637649","observation_id":"b1657822-4607-476a-9942-8927d45b8dff","resolution":{"observed_at":"2026-08-09T04:44:59.358290Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:44:58.763620Z","title":"E.; Stoica, I.; and Xing, E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.763620Z"},"links":{"citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:3a01f9fd6829cc3028a9cb7b2a0e1edfd19941a14b9e10bedbf69d460f2a153b","observation_id":"74124eed-04fb-4b42-aace-8b2990a08336","resolution":{"observed_at":"2026-08-09T04:44:58.763620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:44:59.341733Z","title":null,"venue":null,"work_id":"41059b01-d545-4913-b0bf-0933dc450b2b","year":2019},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.766847Z"},"links":{"citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:6afbaebde37c4ba16323af0c162e4448758d1e9574cb92d593fcb118f320552e","observation_id":"a46e8080-61a8-43a2-a237-a1b6a75d6267","resolution":{"observed_at":"2026-08-09T04:44:59.344668Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16588","last_updated":"2024-04-12T09:38:33Z","snapshot_observed_at":"2026-08-07T09:40:32.614733Z","submitted_at":"2023-09-28T16:45:46Z","title":"Vision Transformers Need Registers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16588","snapshot_observed_at":"2026-08-09T04:44:58.770111Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.770111Z"},"links":{"cited_paper":"/paper/2309.16588","citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:90f58a755dfa1b99bc95a9ec1ab6abafaedde999ee7ea724b042df24cfafd066","observation_id":"84ed8ecd-1680-455f-8062-2924e9e12524","resolution":{"observed_at":"2026-08-09T04:44:58.770111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:44:59.332990Z","title":null,"venue":null,"work_id":"90c05cbf-e850-4864-ad3a-16db9016c4ed","year":2019},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.774535Z"},"links":{"citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:f891078dae47cfd6d9d0909699efd279700b3c3cadb85dcbfceb78e346090048","observation_id":"9768034e-e4d3-4f33-86a9-e67abcf99ef3","resolution":{"observed_at":"2026-08-09T04:44:59.335786Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:44:59.324660Z","title":null,"venue":null,"work_id":"1c799f9f-82cf-4f28-874a-4d9625d29b3e","year":2021},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.777364Z"},"links":{"citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:ac14c7de3b688979fa8668dac29442f3766d9fd7652cdd2992ae080136e65ecd","observation_id":"6c824462-e257-48e1-9d20-41056c32535c","resolution":{"observed_at":"2026-08-09T04:44:59.327639Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:44:59.315950Z","title":null,"venue":null,"work_id":"412601b1-354d-47d8-b559-385227b89a2c","year":2020},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.780311Z"},"links":{"citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:981b7dd4c1767e674d35ecff55d1d16a65665aae820d82de589aaa83d3992504","observation_id":"4862d20d-3eb7-45d6-a138-0dc844aa3e0f","resolution":{"observed_at":"2026-08-09T04:44:59.319320Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:44:59.307603Z","title":null,"venue":null,"work_id":"f20ace06-d82e-48a2-9091-dd135b2aa7c7","year":2022},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.783021Z"},"links":{"citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:f8277bed6253e5d327df140f57fabedae7919e0a46864058121d6a7c2ebeb8ee","observation_id":"bc61fd4b-297a-4c8a-b3d0-f1e4cc34aef3","resolution":{"observed_at":"2026-08-09T04:44:59.310476Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:44:59.298346Z","title":"K.; Sun, Y.; Patel, P.; and Black, M","venue":null,"work_id":"8cc327fc-ec12-4140-a6e7-e879afd4d4a8","year":2024},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.785815Z"},"links":{"citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:ca99e8137b7ddeb3f5bbd54e68287aae777cba7b0e13329b556d53d0fac5de7b","observation_id":"1b8533ee-f3aa-4fc6-a219-9df01b1f972b","resolution":{"observed_at":"2026-08-09T04:44:59.301511Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:44:58.788512Z","title":"V.; Joulin, A.; and Misra, I","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.788512Z"},"links":{"citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:0e26f932d826b14a664fcec493ea74cfb0bbe5fd7839a3cf8aaeb5f79c428df6","observation_id":"4801c7b1-12b4-448e-a577-15719e8fa9f9","resolution":{"observed_at":"2026-08-09T04:44:58.788512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:44:59.284260Z","title":null,"venue":null,"work_id":"ce63c842-dcdd-423f-b24b-37a9e2d95a69","year":2021},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.791341Z"},"links":{"citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:cdc38785582dd3f0d864c170f0f2dd36ea83a9c1b393731b40e445e54e08a674","observation_id":"25f595f6-74c1-43a4-b478-16ed7a7bf540","resolution":{"observed_at":"2026-08-09T04:44:59.287126Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:44:59.275775Z","title":null,"venue":null,"work_id":"eaddf6cd-8bf0-414c-b360-14629274aff1","year":2016},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.794349Z"},"links":{"citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:a21f41b2cd536da94b9ee7fd7f52e410e20c215a948c2ace3fe9370c8412b3a6","observation_id":"8fcb828b-0ccd-480b-b82b-3bbfb925e32e","resolution":{"observed_at":"2026-08-09T04:44:59.278740Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:44:59.267630Z","title":null,"venue":null,"work_id":"f0646447-f777-40b4-9d3a-210cf2f79056","year":2021},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.797434Z"},"links":{"citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:c2bea8df60ee8447ccedc2cb264191ad46fcb70c1bbe8568cfa0a970dc4e98ad","observation_id":"04f3e484-de05-46b8-91b7-3b8f7a01426c","resolution":{"observed_at":"2026-08-09T04:44:59.270413Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-07-06T04:11:24.157003Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-09T04:44:58.800197Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.800197Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:958c32df3677977d132352e5142d4b7da953d62822cd7a080d85319d04551e3b","observation_id":"2fb2dafd-00bc-47e2-977d-ad1b43a34929","resolution":{"observed_at":"2026-08-09T04:44:58.800197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:44:59.258564Z","title":null,"venue":null,"work_id":"76abf7dc-ca3d-45e6-925b-d5b4123279c2","year":2024},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.803531Z"},"links":{"citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:1df3467a7b2d6c1b978885d385ec4f1f2143d313ef1610458b1d8c714eedc2cb","observation_id":"15bbbb5d-93ec-47fb-964e-e2320581e371","resolution":{"observed_at":"2026-08-09T04:44:59.261860Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.06950","last_updated":"2017-05-19T12:07:01Z","snapshot_observed_at":"2026-08-08T17:46:50.107463Z","submitted_at":"2017-05-19T12:07:01Z","title":"The Kinetics Human Action Video Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.06950","snapshot_observed_at":"2026-08-09T04:44:58.806472Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.806472Z"},"links":{"cited_paper":"/paper/1705.06950","citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:7a049e243752030bdf83f08c1a20b4203bc236dfafd56d5be2d6b67c555eb33a","observation_id":"c58284bd-b098-4379-af3f-343171e0e46b","resolution":{"observed_at":"2026-08-09T04:44:58.806472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:44:59.249684Z","title":null,"venue":null,"work_id":"7f36f0a8-9b71-4ff9-a842-000e054e5875","year":2011},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.809749Z"},"links":{"citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:86cb50f532fd351ca4836d062a77782a67cc3764d8e2abb3a784dbf4820b1b48","observation_id":"5f68b827-35f3-43fd-920a-3bd5c78e0da8","resolution":{"observed_at":"2026-08-09T04:44:59.252627Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-09T04:44:58.812526Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.812526Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:3110f428d1bca72e1a7b19aa733e20959e28ed7c0dd219bbe233d30576108526","observation_id":"f0185f63-076d-4d4e-bb3c-4941aa59afee","resolution":{"observed_at":"2026-08-09T04:44:58.812526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:44:59.240211Z","title":null,"venue":null,"work_id":"5e380f19-e3be-4a6a-91a7-3cf3f6764545","year":2019},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.816041Z"},"links":{"citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:f7385ce6201d6936159f96a7265ea654efa2544e576be6745f5520bdb5609f34","observation_id":"03564d78-d7cf-46c8-9c14-5f20059224c2","resolution":{"observed_at":"2026-08-09T04:44:59.243761Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.08916","last_updated":"2022-10-04T22:37:32Z","snapshot_observed_at":"2026-07-06T13:22:09.403770Z","submitted_at":"2022-06-17T17:53:47Z","title":"Unified-IO: A Unified Model for Vision, Language, and Multi-Modal Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.08916","snapshot_observed_at":"2026-08-09T04:44:58.818749Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.818749Z"},"links":{"cited_paper":"/paper/2206.08916","citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:e0a0f4471e5c99d61d9047cda64bdfb1f7d206dd7e2ef935c74db9b810264748","observation_id":"18821cef-6e58-4eb4-af69-e4f3a8c919e3","resolution":{"observed_at":"2026-08-09T04:44:58.818749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:44:59.231602Z","title":null,"venue":null,"work_id":"cf063df4-a581-4804-b810-3701972c1021","year":2024},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.821991Z"},"links":{"citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:692df4e517f423997af901fb1173e366099e2497726630497f8441d17afc47a9","observation_id":"67c4e852-cfd2-4f61-99a9-f7bc149e8cb3","resolution":{"observed_at":"2026-08-09T04:44:59.234701Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-09T04:44:58.824885Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.824885Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:8e4d9206d46d3c30f038e7ce4754f3f8a11d6514bc91a3d0c18b779a36cc9bc9","observation_id":"7c18f423-58a6-4cc6-bb56-b31f4dae4b8e","resolution":{"observed_at":"2026-08-09T04:44:58.824885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:44:59.222822Z","title":null,"venue":null,"work_id":"6950745a-6bdd-42bd-a680-bcd2d8828c69","year":2022},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.827928Z"},"links":{"citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:7dd158a562a02cfba694935bd0ee4b3e0af3939bbfa6480402c67da71700972c","observation_id":"ff28a171-010d-40ad-8c36-95aef13f6509","resolution":{"observed_at":"2026-08-09T04:44:59.225734Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:44:59.214372Z","title":null,"venue":null,"work_id":"ad56b342-c425-40c9-b883-4e01ee9becf9","year":2022},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.830716Z"},"links":{"citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:444ea972385cbf7ab593a5c9380105911ef1b12fdf4ce0a9b00a46461b0c1fc8","observation_id":"749eccfb-893d-40db-ab5d-dcbd09789a76","resolution":{"observed_at":"2026-08-09T04:44:59.217434Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.07646","last_updated":"2022-07-15T17:59:11Z","snapshot_observed_at":"2026-08-06T19:04:25.950223Z","submitted_at":"2022-07-15T17:59:11Z","title":"Multimodal Open-Vocabulary Video Classification via Pre-Trained Vision and Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.07646","snapshot_observed_at":"2026-08-09T04:44:58.833389Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.833389Z"},"links":{"cited_paper":"/paper/2207.07646","citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:a6ca046743bd6b469c65b6faffe843f78882f7b345c58aa558a4ce17c296986f","observation_id":"b78052dd-89a8-4c07-bc01-c7ccf6886ff5","resolution":{"observed_at":"2026-08-09T04:44:58.833389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:44:58.836457Z","title":"W.; Hallacy, C.; Ramesh, A.; Goh, G.; Agarwal, S.; Sastry, G.; Askell, A.; Mishkin, P.; Clark, J.; Krueger, G.; and Sutskever, I","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.836457Z"},"links":{"citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:3c8866d6d4af2728b042827966333ec7e8061e312fab28828a745dc5df98fa93","observation_id":"49db148f-90d3-4744-b915-d2662f195c39","resolution":{"observed_at":"2026-08-09T04:44:58.836457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:44:59.200394Z","title":"U.; Maaz, M.; Khan, S.; and Khan, F","venue":null,"work_id":"6495a891-d5d7-4241-b4bd-8d60a2a31491","year":2023},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.839261Z"},"links":{"citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:7372bfeb53aabce0f2d5f66778c307fb0f9d2737978071e987be29cdd300bf5a","observation_id":"0525f685-af0a-46c7-b05d-aeb541a94456","resolution":{"observed_at":"2026-08-09T04:44:59.203460Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09390","last_updated":"2025-03-25T18:54:55Z","snapshot_observed_at":"2026-07-06T18:30:32.982860Z","submitted_at":"2024-06-13T17:59:05Z","title":"LLAVIDAL: A Large LAnguage VIsion Model for Daily Activities of Living","version":3},"cited_work":{"arxiv_id":"2406.09390","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.09390","snapshot_observed_at":"2026-08-09T04:44:59.020845Z","title":"LLAVIDAL: A Large LAnguage VIsion Model for Daily Activities of Living","venue":"cs.CV","work_id":"0b61fed4-4520-476b-860a-990e61c76bff","year":2024},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.841940Z"},"links":{"cited_paper":"/paper/2406.09390","citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:b0cb839eeb4e76198cef989b59083e57ac8accd8449b5bf192dc74e07cd10975","observation_id":"a3eec8cb-faec-43b6-bc86-fae6cf883a5c","resolution":{"observed_at":"2026-08-09T04:44:59.026175Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:44:59.192487Z","title":null,"venue":null,"work_id":"0bb4c6bb-b731-43d5-87c7-f01c0080863b","year":2024},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.845095Z"},"links":{"citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:118b72634bc42a0deb672758c37464c5828975096f1b2e4f588e1b6816b82fbc","observation_id":"55c85646-dcd8-473f-b317-6461ed194c75","resolution":{"observed_at":"2026-08-09T04:44:59.195267Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:44:59.184211Z","title":null,"venue":null,"work_id":"93ebeb49-97b2-44a3-8e24-0e44c8d8d3f0","year":2019},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.847930Z"},"links":{"citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:6aae7610aec507441bbc5d01b016e6062f89c9a632aeae1012e0722149c110c8","observation_id":"dd19305e-74af-4d64-8c16-5ffdbf45c023","resolution":{"observed_at":"2026-08-09T04:44:59.187474Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:44:59.176193Z","title":null,"venue":null,"work_id":"1619292b-f07d-49cc-b01f-bae87ec4e3ad","year":2023},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.850749Z"},"links":{"citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:fde9233ea762a3cc302246b801767745afbdd1f41cac17556a781323603f7a92","observation_id":"7d778381-38af-498e-91b2-57f95639bc67","resolution":{"observed_at":"2026-08-09T04:44:59.178768Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:44:59.167977Z","title":null,"venue":null,"work_id":"ec2dfe63-e06a-4f2e-8dba-4a5bf705a0e9","year":2016},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.853607Z"},"links":{"citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:8ad0ac33d317cb763e574fd3ec5b929479ef31d8b44bda6a689e09f08e089d79","observation_id":"f28fa74d-1357-4fd5-ba01-e31703e02d8b","resolution":{"observed_at":"2026-08-09T04:44:59.170988Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:44:59.159808Z","title":null,"venue":null,"work_id":"e0af27dc-19e1-4781-83d4-394cc3c0c948","year":2019},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.856293Z"},"links":{"citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:8d37fb7a1db33bea8185ed5d28d5fcea41bc5607bcf87460f83fa42818b05634","observation_id":"c94a6557-7f97-4894-9c2a-ed49b206b94a","resolution":{"observed_at":"2026-08-09T04:44:59.162729Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:44:59.151188Z","title":"A.; Varol, G.; Wang, X.; Farhadi, A.; Laptev, I.; and Gupta, A","venue":null,"work_id":"1adc52ef-bf99-4560-9f56-5adcccadb62d","year":2016},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.858982Z"},"links":{"citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:f32f4e536754b2952ab64ba422da07b06bd7374439bc947b2689b5c87c0859c4","observation_id":"d428651c-b0cb-4bde-8702-dc59826bd4d6","resolution":{"observed_at":"2026-08-09T04:44:59.154375Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:44:59.142356Z","title":null,"venue":null,"work_id":"a0edfffb-32b6-48c1-b2e6-76a0d0587ad0","year":2014},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.861661Z"},"links":{"citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:29d0327d44f3f543a785f500c0acbb963ebfcffee9ccaacb396fbe1216dbc844","observation_id":"3c6ceb8f-dc0a-4012-bc1f-c1ed69ce8b63","resolution":{"observed_at":"2026-08-09T04:44:59.145730Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1212.0402","last_updated":"2012-12-03T14:45:31Z","snapshot_observed_at":"2026-07-06T03:01:10.229407Z","submitted_at":"2012-12-03T14:45:31Z","title":"UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1212.0402","snapshot_observed_at":"2026-08-09T04:44:58.864413Z","title":"R.; and Shah, M","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.864413Z"},"links":{"cited_paper":"/paper/1212.0402","citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:402c0243a2e7142d94e57b138c20e356815e7c69761ac57e453faca588afd293","observation_id":"809ffe0b-5ff6-47f5-86df-a1297608fc55","resolution":{"observed_at":"2026-08-09T04:44:58.864413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16355","last_updated":"2023-05-25T04:16:07Z","snapshot_observed_at":"2026-08-02T07:50:35.580500Z","submitted_at":"2023-05-25T04:16:07Z","title":"PandaGPT: One Model To Instruction-Follow Them All","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16355","snapshot_observed_at":"2026-08-09T04:44:58.867443Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.867443Z"},"links":{"cited_paper":"/paper/2305.16355","citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:6798189649e4579ff954ae53b51e12d1769173608bb574b95299f0b3113f8163","observation_id":"9b476259-d7b6-4e9e-afec-275cefff6106","resolution":{"observed_at":"2026-08-09T04:44:58.867443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-09T04:44:58.870821Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.870821Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:fdf4c6e1ce127c8fbc371e06786f6b32ff1433f33497d6fd525f6ce1b33b8bb5","observation_id":"7fbbbcde-d7f9-43f9-8396-ae4a38f4a4a1","resolution":{"observed_at":"2026-08-09T04:44:58.870821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-09T04:44:58.873900Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.873900Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:56eecd6d8b69eb83fed6dde372439fc9535f32880d539a5f112dadd418c4f6f5","observation_id":"48467c18-75a4-4263-b5f4-cb0eb9e2c9e4","resolution":{"observed_at":"2026-08-09T04:44:58.873900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.08472","last_updated":"2021-09-17T11:21:34Z","snapshot_observed_at":"2026-07-06T11:48:42.000083Z","submitted_at":"2021-09-17T11:21:34Z","title":"ActionCLIP: A New Paradigm for Video Action Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.08472","snapshot_observed_at":"2026-08-09T04:44:58.877082Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.877082Z"},"links":{"cited_paper":"/paper/2109.08472","citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:e8eed75ed4671ed1e53bc1a1d65b65fa27191c6fdfe48a16f2e54f1b844fa8d3","observation_id":"717a7f45-29f6-4f8d-a1c0-9a0d749f5d34","resolution":{"observed_at":"2026-08-09T04:44:58.877082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-09T04:44:58.880265Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.880265Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:6fa8b58543b7d9d9b2e6d86a2ce1cb670378a977ebd793e116d54aa88fbf40a2","observation_id":"9f8917dd-0a2a-4a17-889c-e93499148733","resolution":{"observed_at":"2026-08-09T04:44:58.880265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:44:59.132937Z","title":null,"venue":null,"work_id":"bf4c11f8-ded0-456d-91da-14ff68adba91","year":2021},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.883755Z"},"links":{"citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:e03233724fab2aa4e33d51f751bcd0131379fa696a7b21e95df2f1db80ded4bf","observation_id":"ea4c7457-1e85-4795-9aef-25e4d221c7f4","resolution":{"observed_at":"2026-08-09T04:44:59.136172Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:44:59.123918Z","title":null,"venue":null,"work_id":"5e6fbee2-b2fd-4953-914c-cf191a6a82ea","year":2018},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.886845Z"},"links":{"citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:6a1c6255ea618565f4deccd42f8e93525b5fd4f8ac6cdc9b3691101db950561c","observation_id":"c67b4078-98c3-43da-9dad-e60ba0f55d4f","resolution":{"observed_at":"2026-08-09T04:44:59.127192Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.10082","last_updated":"2024-03-15T07:51:35Z","snapshot_observed_at":"2026-08-04T15:31:16.544639Z","submitted_at":"2024-03-15T07:51:35Z","title":"CrossGLG: LLM Guides One-shot Skeleton-based 3D Action Recognition in a Cross-level Manner","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.10082","snapshot_observed_at":"2026-08-09T04:44:58.889585Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.889585Z"},"links":{"cited_paper":"/paper/2403.10082","citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:4f5d83c41778ed9f94b937d66f15b2fa2dff9c45b1007af5c02b58cfade5d9bd","observation_id":"c24f294b-10e9-4497-82aa-61c797d398aa","resolution":{"observed_at":"2026-08-09T04:44:58.889585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:44:59.114424Z","title":null,"venue":null,"work_id":"ce9677da-29e8-4993-92dd-8534634ca880","year":2023},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.892781Z"},"links":{"citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:64831f8f4db50a947e781cd8585d348b5057b3745ef90f167e7629234803d1ac","observation_id":"5767af60-c35c-4b60-a239-ae281cc10ef7","resolution":{"observed_at":"2026-08-09T04:44:59.117989Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11000","last_updated":"2023-05-19T14:41:16Z","snapshot_observed_at":"2026-08-07T10:56:05.622094Z","submitted_at":"2023-05-18T14:23:25Z","title":"SpeechGPT: Empowering Large Language Models with Intrinsic Cross-Modal Conversational Abilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11000","snapshot_observed_at":"2026-08-09T04:44:58.895795Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.895795Z"},"links":{"cited_paper":"/paper/2305.11000","citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:33d9d52407ea988706b40c03139beacd3bad4f028fde49e8e7fc472190116353","observation_id":"dafa6a34-9a96-4a51-b004-cbb2b41f7904","resolution":{"observed_at":"2026-08-09T04:44:58.895795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-07-06T15:38:39.712379Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-09T04:44:58.898707Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.898707Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:d7e56e8e751bbdf9f43cb374f5f2601954e2dfdba9d71b9d7048bb3559521d5a","observation_id":"fe6622ee-4080-42c8-9e88-a4f32c5ec3cb","resolution":{"observed_at":"2026-08-09T04:44:58.898707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:44:59.105166Z","title":null,"venue":null,"work_id":"cdf8a07f-4512-4130-95d4-16c5cacf8e52","year":2012},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.901971Z"},"links":{"citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:4127a21a2dbf63f71a2b16f50da8f3dc09f8f48ce25bf2506ba887a4e14efdda","observation_id":"9602cfe7-07a7-48d8-836c-4fcd743cae2c","resolution":{"observed_at":"2026-08-09T04:44:59.108218Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09590","last_updated":"2023-03-21T17:34:34Z","snapshot_observed_at":"2026-08-09T18:51:28.652024Z","submitted_at":"2022-11-17T15:36:48Z","title":"Hypergraph Transformer for Skeleton-based Action Recognition","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09590","snapshot_observed_at":"2026-08-09T04:44:58.904658Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.904658Z"},"links":{"cited_paper":"/paper/2211.09590","citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:42e2411b39b7aa701ef214a5f094d3b384cff64078428690875feb9a08c7ffe6","observation_id":"91f593e9-4257-4750-9abc-3b818c95ddbc","resolution":{"observed_at":"2026-08-09T04:44:58.904658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:44:59.096213Z","title":null,"venue":null,"work_id":"9fbf2359-3b48-40db-8f8a-2c60e5198c5a","year":2023},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.907612Z"},"links":{"citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:df04500edbe69761bf7bdf5db54db73631fd442f3d9c44892ee7b41e539944bb","observation_id":"8cae0090-2e98-432c-8121-24a2515bc481","resolution":{"observed_at":"2026-08-09T04:44:59.099260Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01852","last_updated":"2024-01-22T03:11:15Z","snapshot_observed_at":"2026-08-07T05:10:33.059352Z","submitted_at":"2023-10-03T07:33:27Z","title":"LanguageBind: Extending Video-Language Pretraining to N-modality by Language-based Semantic Alignment","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01852","snapshot_observed_at":"2026-08-09T04:44:58.910397Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.910397Z"},"links":{"cited_paper":"/paper/2310.01852","citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:8bfa27e632d0557833c5c10d424ca7cfdcb619851fda1099e487da5b43951d68","observation_id":"5d6eaf64-e9e8-4b4f-931f-72eaeb08b46f","resolution":{"observed_at":"2026-08-09T04:44:58.910397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":53,"verified_exact":0,"verified_fuzzy":3},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 0 inbound Pith citation observations for arXiv:2502.03459."}