{"as_of":"2026-08-17T03:19:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:065ed80ef10112a630be8f1fe75511acff59e704fd2d169385a9f64863861f58","coverage":[{"denominator":64,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":64,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-15T14:07:39.892672Z","state":"measured"},{"denominator":64,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":64,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2603.05962/citation-record","integrity":"/paper/2603.05962/integrity","json":"/paper/2603.05962/citation-record.json","paper":"/paper/2603.05962"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-15T15:25:14.741952Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:00b9db4a2c8f70257c40bbfd092452c3cc6c0de02813d2854dfce59f0de5d5a0","observation_id":"0b75b2e5-1c3a-41ef-b654-34161a5a6193","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"Masked autoencoders are scalable vision learners,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-15T15:25:14.741952Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:d194d46c5e5c295eacf88d7d0a90d12c0cb7f88f4f90c066ea06b0b3784709c6","observation_id":"16f48e47-3aa3-4e18-b672-e4c201c07bc8","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"Scaling up visual and vision-language representation learning with noisy text supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-15T15:25:14.741952Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:042eca92875a03e0dab0f1424d425d4e6f8fb801e219a593f4ef4261152c1e6c","observation_id":"92c9d89a-73d8-4c1b-ac04-65fb376299ef","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"Flava: A foundational language and vision alignment model,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-15T15:25:14.741952Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:ef3091455cacd95ce867833ee6928deaa6c6ed632bcb7ef98dc2c8eff8e0ca2f","observation_id":"611b93f7-047a-4f4e-93b2-bb6f6c8d3918","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01133","last_updated":"2024-09-02T10:11:52Z","snapshot_observed_at":"2026-08-16T13:22:07.505618Z","submitted_at":"2024-09-02T10:11:52Z","title":"Large Language Models Can Understanding Depth from Monocular Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.01133","snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"Large language models can un- derstanding depth from monocular images,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-15T15:25:14.741952Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"cited_paper":"/paper/2409.01133","citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:8afc4b59456d028a51d859d9d5539d7ed5ceb72241be1acedc0ef9506eec882a","observation_id":"0fa5598e-b729-4188-9b37-d89559577fa9","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"Depth anything: Unleashing the power of large-scale unlabeled data,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-15T15:25:14.741952Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:e401eb0cd93caef63f1ecbe74ee7a7f0d1636f9e42e3ec08ea2afb18f7cfd9ec","observation_id":"b723cfb6-611a-40cd-8b77-87c161635084","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"Pad: Self-supervised pre-training with patchwise-scale adapter for infrared images,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-15T15:25:14.741952Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:d9b097bac34020aa414c88ab100199081b01e14ac1a91ace868748dd21e6eaa1","observation_id":"111a5061-44b3-4a7b-b6f5-f05989653757","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02801","last_updated":"2025-04-03T17:47:06Z","snapshot_observed_at":"2026-08-16T12:44:10.875309Z","submitted_at":"2025-04-03T17:47:06Z","title":"F-ViTA: Foundation Model Guided Visible to Thermal Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.02801","snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"F-vita: Foundation model guided visible to thermal transla- tion,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-15T15:25:14.741952Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"cited_paper":"/paper/2504.02801","citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:bc5680c566d687138ba780dad32025405b915d834ea765c5fc40531386fd1661","observation_id":"4d44a9db-978a-4e93-a2e7-8b5f2b33831d","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"VideoMAE: Masked autoencoders are data-efficient learners for self-supervised video pre-training,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-15T15:25:14.741952Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:eeb8eaea786b6b08677721a1a64beb75ba38321fde649600afbabb85a5df614e","observation_id":"cb6d7a1b-7ea7-4cf0-8a8e-490e188954be","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"Videomae v2: Scaling video masked autoencoders with dual masking,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-15T15:25:14.741952Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:cd701a95809f7ab8d862b7be89cb962a31bd6903bc5fcfa976e164cee73769e5","observation_id":"a1a9f6db-c3d4-4f08-a9f3-795658efce97","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"Omnivl: One foundation model for image-language and video- language tasks,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-15T15:25:14.741952Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:5fd4a8a7d51db78edc4bbca98ee8cf74fe717f75b1e8cc7eabe25b54181f8aad","observation_id":"5cd75477-a027-4bc3-a3bb-406a26e6666f","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"P2p: Tuning pre-trained image models for point cloud analysis with point-to-pixel prompting,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-15T15:25:14.741952Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:57390ca1ecedd2e8fb79388ce39d0a464943af174b1b6707681f9583a20ce368","observation_id":"2488037c-a727-417a-86f3-ba826fa6122d","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"Pointclip: Point cloud understanding by clip,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-15T15:25:14.741952Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:252bb211f6843f6deaff57bbf8f216038e448241bf06ef8881e46851ba28b863","observation_id":"8ff34b17-245a-4985-b3c0-d6a3df311583","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"Diffusion models as masked autoencoders,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-15T15:25:14.741952Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:27bd54364f70d276048f21033070e9fc5b7a7f5799a9d929640e10a0d9e4f69a","observation_id":"e8ed976e-f73d-4c0e-a362-3c5a0ec23c39","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"Hierarchical recurrent neural network for skeleton based action recogni- tion,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-15T15:25:14.741952Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:f3a44a625b31fbbb77991fc26b35a51c9994fdd45b37b9c8b92506e427390798","observation_id":"e2978196-0f8b-4c2b-8286-b08a02d76dab","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"Skeleton-based action recognition using spatio-temporal lstm network with trust gates,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-15T15:25:14.741952Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:a6fce24618afc0df97528b957ac72dc7bb6a32138e898122905cd79797a35144","observation_id":"5523ccd9-7c6d-4732-8217-9691868bda82","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"View adaptive recurrent neural networks for high performance human action recognition from skeleton data,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-15T15:25:14.741952Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:fcd2dc98ed985d0d41ea4a305e262422d7bb4bcf6efb4103ce97f3be86fb5a13","observation_id":"796176f6-e6ad-4eae-a3b5-6aef00f31692","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"Skeleton based action recognition with convolutional neural network,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-15T15:25:14.741952Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:97b04a421fa9adad9dc78082e211453de4a25ee86b53e78f7755ed816d07c791","observation_id":"20f3bb99-eea7-42ce-890b-d1798d643c43","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"A new representation of skeleton sequences for 3d action recognition,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-15T15:25:14.741952Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:8af82c3cb67c796470546daaf384e7f0917cd50623e73c422e7939f103bc85af","observation_id":"15bc7c7d-9e61-43b4-955d-1681751aecb2","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"Co-occurrence feature learning from skeleton data for action recog- nition and detection with hierarchical aggregation,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-15T15:25:14.741952Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:0195006b163adf2a73e7207d8285ae539483f62448091942bd0275b796c49287","observation_id":"2e481554-1aec-4c89-a9af-94710de46594","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"Spatial temporal graph convolutional networks for skeleton-based ac- tion recognition,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-15T15:25:14.741952Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:5c4261e71cc798385f7208039a8442e6ee5493ee217d7695bc370f72f60e0922","observation_id":"35da2927-a66f-4c57-8013-ed70c2d900e5","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"Two- stream adaptive graph convolutional networks for skeleton-based action recognition,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-15T15:25:14.741952Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:74b67a2e469b104622b12f75fb312b5fe0f37dbdde530d1e7bad941083036f39","observation_id":"3b0ed4d5-9bcd-4331-8754-fc6dbfa591b0","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"Channel-wise topology refinement graph convolution for skeleton-based action recognition,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-15T15:25:14.741952Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:4135f371f4a1c83ac5c6da39f53bf896a05e913e72f7906ea40069604904987e","observation_id":"685c5728-0bbd-42f3-a779-efdebabb2314","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"Stst: Spatial-temporal specialized transformer for skeleton- based action recognition,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-15T15:25:14.741952Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:e8842393c9c7297fae58a0dcd1cb8b04324d077a6371c2cc1085b3d1a245a470","observation_id":"0dd03cef-bd49-4e90-8736-0dc1cf81cf84","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"Hypergraph transformer for skeleton-based action recognition,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-15T15:25:14.741952Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:2ee497211f2aa3fa7306f09eb5163c6406fbcc8de52feee31d5afdf9ac941127","observation_id":"40655a0a-789d-48f3-841e-4af85e150dc8","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"3d human action representation learning via cross-view consistency pursuit,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-15T15:25:14.741952Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:5be443d35cafadb853a14089eb8de0300a2f7fe925144d694ea131ba172c6b48","observation_id":"0e4e9a83-972a-4ea9-bee0-aafbbdb67098","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"Contrastive learning from extremely aug- mented skeleton sequences for self-supervised action recognition,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-15T15:25:14.741952Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:3e2e1980c7c60d6fe5ef2a9f8add5876b81ecdb073d4870a70fe694622cb8b2c","observation_id":"ff3fe65c-ac7b-4946-866c-0cf3d22890f4","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"Contrastive positive mining for unsupervised 3d action represen- tation learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-15T15:25:14.741952Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:1fd17d51e16e7bd1de343e1f46a6981a558daff838dd0027cc79d58ebd44ffe5","observation_id":"36cbc4a1-ebc3-4c8d-9e15-b43af9bbe8e0","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"Masked motion predictors are strong 3d action representation learners,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-15T15:25:14.741952Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:448b9a23b87d7efb2723e4cc1eaafb60e45b67613563f367c070627aa77f512a","observation_id":"d7610019-3dee-4acd-ae89-32d6669e20f4","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"Macdiff: Unified skeleton modeling with masked conditional diffusion,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-15T15:25:14.741952Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:da887a3a7b0b0935178b2f054839ca3a3852ccf2058a91c3c3542a56466fc042","observation_id":"e1b9ff96-6b20-470d-83d8-866757908ec9","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"Skeletonmae: Spatial-temporal masked au- toencoders for self-supervised skeleton action recog- nition,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-15T15:25:14.741952Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:a38f8d05cb0569c57ebbc1f1aaf30d9c1e05da64b2047309500ac73015d852eb","observation_id":"8e3d93a3-9fd4-44d4-ad14-3bc87e06cc2c","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"Momen- tum contrast for unsupervised visual representation learning,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-15T15:25:14.741952Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:41402f64dd12dd9d4dfe0a7a802c9881a06bb4736efc8f3c98cced73f9ee845a","observation_id":"c1d1644d-adc5-4f5d-9dae-0c4a96b9cc1a","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"A simple framework for contrastive learning of visual representations,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-15T15:25:14.741952Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:88f9d8c251fae0612b048300286ff560db6554c910dae07f0472cf70cc3b9e95","observation_id":"bc34bf90-a585-42aa-b5e5-4d1c071e875b","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"Spatiotemporal contrastive video representation learning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-15T15:25:14.741952Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:6e584dd90cb91ebdc12bca4580f4fb559a176958a43de2091962c0a166f4cb1b","observation_id":"2d1cac2a-ec23-459a-ac93-88679ac68309","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"BEit: BERT pre-training of image transformers,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-15T15:25:14.741952Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:ba536a8990901277990a9aa3c21a0485eec64776bf249c9249b4955c4161399d","observation_id":"a1e20b50-8770-416c-9a95-5c0ebfe960be","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"Masked feature prediction for self- supervised visual pre-training,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-15T15:25:14.741952Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:2ad14bebe40711d0010864d8cd2be51e431256f8e0765f23a385f7fb1cad7502","observation_id":"963da4a3-adcc-4625-9d6d-06b317d49c95","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"Dynamic multiscale graph neural networks for 3d skeleton based human motion prediction,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-15T15:25:14.741952Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:acb8ff8e2aa2fbef90d1d330a064314452720fca0f33fa7660068609c353484e","observation_id":"d72f2d0e-9b95-4758-a0ca-4fc926622d97","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"Exploiting spatial-temporal relationships for 3d pose estimation via graph con- volutional networks,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-15T15:25:14.741952Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:ff6a602c0d4f6314e975e078bfd85755d5300ee14ead06fab938e843c076e143","observation_id":"45bf7f52-8a73-4808-89d0-3ae3b0957aa4","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.03993","last_updated":"2021-11-07T03:50:50Z","snapshot_observed_at":"2026-08-16T17:43:31.415473Z","submitted_at":"2021-11-07T03:50:50Z","title":"Multi-Scale Semantics-Guided Neural Networks for Efficient Skeleton-Based Human Action Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.03993","snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"Multi-scale semantics-guided neural net- works for efficient skeleton-based human action recognition,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-15T15:25:14.741952Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"cited_paper":"/paper/2111.03993","citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:e5f68fecb3e421d5c8c32f349c0a0e648f3fa8df370885ba769525892259993b","observation_id":"e7fc133c-520b-4a72-8b5e-26dd6b02075d","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"Skele- ton cloud colorization for unsupervised 3d action rep- resentation learning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-15T15:25:14.741952Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:5d42cb12fd264fc159823ef0ba372bfac96770d6e58b508e0eb8de0d99a7b225","observation_id":"d86fc034-19a8-4dd6-919a-b288fbf868cd","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"Collaborating domain-shared and target-specific feature clustering for cross-domain 3d action recognition,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-15T15:25:14.741952Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:8dbd69ba0f97e1d07fa6bd8ab1d5f4c81d7f97d76a3528ee885f5cb36af2853a","observation_id":"954ff6b5-b7a8-4f83-9fd0-fb72b4f4c071","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"Ntu rgb+d: A large scale dataset for 3d human activity analysis,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-15T15:25:14.741952Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:9ce766d7da34fc2eeff6cc5e6f02adbc72bbfe640e6c2ec4ce6f1c5b1dc5c811","observation_id":"ad617174-7455-431d-a686-caf1be3f010a","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"Ntu rgb+d 120: A large-scale bench- mark for 3d human activity understanding,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-15T15:25:14.741952Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:95e3f346bc61574e4f8fb6b717e218edcf88548c9aee92beea62d1f3e579ee15","observation_id":"740dac90-8092-4db9-8de0-d5d43b59df45","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"A bench- mark dataset and comparison study for multi-modal human action analytics,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-15T15:25:14.741952Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:545f67c199998928f2b7f9bd220564c69c3c46d71f63360d4a2b4b76c615c4a6","observation_id":"ff22536a-2572-415b-b8c0-3906f6120615","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"Cross- view action modeling, learning and recognition,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-15T15:25:14.741952Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:e80b40e120bd53cdd01b9f378d2a33eb8459af46766915f9fca49f917cbba82d","observation_id":"f5abd89c-e6a2-404d-9f42-56e41e5d601f","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"Toyota smarthome: Real-world activities of daily living,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-15T15:25:14.741952Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:f3c611493b85509ff34fd3ea2b98892a4dac676e3b34f55c87d12465b5218384","observation_id":"d2685dd8-9338-4a53-9c5f-5a8340194899","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"Semantics-guided neural networks for efficient skeleton-based human action recognition,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-15T15:25:14.741952Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:bc4b885e002e1cea73b5bae0930e78ce4638059fcfd4b16c4591554201ed2792","observation_id":"e3c34f84-7f86-4f64-bbe4-10bc643a5541","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"Skeleton-based action recognition with shift graph convolutional network,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-15T15:25:14.741952Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:a628f8b43129fcc465b46880ac7ba4ca00d528e295708e3828fcd8ff47bb068e","observation_id":"07840b59-f146-4267-82a8-24f6ea7549ab","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"Unsupervised representation learning with JOURNAL OF LATEX CLASS FILES, VOL. 14, NO. 8, AUGUST 2021 13 long-term dynamics for skeleton based action recogni- tion,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-15T15:25:14.741952Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:9a7eead89ffa2591fc6259989878d71f92b60ef454f6ed0ebad7c1da518c8a36","observation_id":"b3831f3d-0de6-44a6-a7fa-d9684c4d738e","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"Predict & cluster: Unsupervised skeleton based action recognition,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-15T15:25:14.741952Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:61cf1a96918e27df2392498a2e575adfe26132501bb6446452089409a6410874","observation_id":"a4dc1a56-1fcd-4595-93c2-7a8bcba78426","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"Ms2l: Multi- task self-supervised learning for skeleton based action recognition,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-15T15:25:14.741952Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:6a8351bbfe77b882a83e3358b6baa7c1ce8e992e0cbe81ec820193c6fc5dfe7c","observation_id":"366592a3-c611-4679-9308-2319924da831","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"Skeleton- contrastive 3d action representation learning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-15T15:25:14.741952Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:450338a64ddf16851872b030ca9f298f1820670449cc9776fb8d67861c7c0fbb","observation_id":"a19d53fe-c254-490d-9dd5-be4d7fee82b3","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"Global- local motion transformer for unsupervised skeleton- based action learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-15T15:25:14.741952Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:05052dec158d6ae2cf08e3f10144a9bbbc707a6f7fe0622e9de371f113d087c2","observation_id":"802284f4-345b-49f0-ac4c-5ccd63fcca5c","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"Cmd: Self-supervised 3d action representation learning with cross-modal mutual distillation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-15T15:25:14.741952Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:fb957a8f60661f08848c3b0ad2de31594e33aeb79cc716a9ff7aca0f16c688bc","observation_id":"7e277e30-1c62-4f1d-9927-ac0c2ce9a2f2","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"Actionlet-dependent contrastive learning for unsupervised skeleton-based action recognition,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-15T15:25:14.741952Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:0c94f79ed70b04c0e318edd100df832bc353858f8ad3fd5221d76149d780c0bd","observation_id":"c8c519ac-761c-4d41-afd3-011be7da6b74","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"Self-supervised 3d skeleton action representation learning with motion consis- tency and continuity,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-15T15:25:14.741952Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:562b6d2fa64b24e5f18b04167c7b054bff04323c79a7c8b6ff9bca364907ecbf","observation_id":"90aecfd8-ccd5-491b-92e3-9ecb43fed72d","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"View-invariant skele- ton action representation learning via motion retarget- ing,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-15T15:25:14.741952Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:e3667bc2aa43b9a530a5242c9bccf995b10fb50519aa9cd35d2718470e658868","observation_id":"6db2b46a-de0f-4d0c-ba3b-f61c51bc18c4","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"Hierarchically self- supervised transformer for human skeleton represen- tation learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-15T15:25:14.741952Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:a7e0b63b5f326b8ab188acc292188c68d85e75dd98557e6c0ae0cbbf670b7766","observation_id":"d3d46f76-0065-48ac-8b8a-6ff8312fb83e","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"Adversarial self-supervised learning for semi-supervised 3d action recognition,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-15T15:25:14.741952Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:2a3115a9db3e43f0f95310dc39bdf6903dbd64b8def996049989a34f9f784023","observation_id":"c66f9d00-dc82-41f9-aac8-616cf56e6707","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.08580","last_updated":"2021-07-19T02:00:28Z","snapshot_observed_at":"2026-08-16T18:09:13.644112Z","submitted_at":"2021-07-19T02:00:28Z","title":"UNIK: A Unified Framework for Real-world Skeleton-based Action Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.08580","snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"Unik: A uni- fied framework for real-world skeleton-based action recognition,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-15T15:25:14.741952Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"cited_paper":"/paper/2107.08580","citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:70d2d470f77966fe02cbd286b9153143e176b3ee2a57850dec48f694601d339c","observation_id":"3d8de597-38e6-4b43-a71f-51f897f56250","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-15T15:25:14.741952Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:249c624fc15ead5aac3e6ec2f34d9a6c7d09d1a69ba79a7d4c92d47dcb42c7da","observation_id":"0d29d8a5-a399-450c-a9ac-72ec1b85f4ca","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1607.06450","last_updated":"2016-07-21T19:57:52Z","snapshot_observed_at":"2026-08-15T04:53:45.483331Z","submitted_at":"2016-07-21T19:57:52Z","title":"Layer Normalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.06450","snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"Layer normal- ization,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-15T15:25:14.741952Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"cited_paper":"/paper/1607.06450","citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:fda467152230c88b645089a584efd02c64f41f5ebbd2b4618c1fbbb49b51eada","observation_id":"074e8d82-25c1-415f-b0b8-120a18f04c28","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"Denoising diffusion probabilistic models,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-15T15:25:14.741952Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:20692d0ba4a9a69eee0ed3cba62f9f7f69269e4c91110f6f18a8b4c13aebd40e","observation_id":"1649a5a0-0926-4997-bedf-1ebce901ada5","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"Lcr-net++: Multi-person 2d and 3d pose detection in natural im- ages,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-15T15:25:14.741952Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:cea8d0cb92dae9b0eb25b0470ba3ee7257193b5e14f80d0a63a8e249b5767ca1","observation_id":"9cb9a11b-b15b-47ae-9fe5-27f1c93b65f1","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T15:25:14.741952Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP"},"reference_resolution":{"displayed":64,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":64,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":64},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 64 of 64 outbound references and 0 inbound Pith citation observations for arXiv:2603.05962."}