{"as_of":"2026-08-19T13:24:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0f6f55bc3bcf151cc3640e9eb76c17a188e09bd6e39d9e494417824a439cfc2e","coverage":[{"denominator":70,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":70,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T15:36:19.443783Z","state":"measured"},{"denominator":70,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":70,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.15542/citation-record","integrity":"/paper/2507.15542/integrity","json":"/paper/2507.15542/citation-record.json","paper":"/paper/2507.15542"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:36:12.433022Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15542","last_updated":"2025-08-04T02:28:09Z","snapshot_observed_at":"2026-08-14T18:20:35.027776Z","submitted_at":"2025-07-21T12:15:27Z","title":"HOLa: Zero-Shot HOI Detection with Low-Rank Decomposed VLM Feature Adaptation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T15:36:12.433022Z"},"links":{"citing_paper":"/paper/2507.15542"},"observation_digest":"sha256:e04482f07d52165f62dc1c95f7aaaf48bd10293c2b00ffc765b7656eb583d46d","observation_id":"9b214684-00d9-4a6e-8a19-070e7b02a0d3","resolution":{"observed_at":"2026-08-06T15:36:12.433022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:36:20.765338Z","title":"Detecting human-object interactions via functional generalization","venue":null,"work_id":"88f0ba1e-6c1c-45eb-91ee-5e6da0fbfe80","year":null},"citing_paper":{"arxiv_id":"2507.15542","last_updated":"2025-08-04T02:28:09Z","snapshot_observed_at":"2026-08-14T18:20:35.027776Z","submitted_at":"2025-07-21T12:15:27Z","title":"HOLa: Zero-Shot HOI Detection with Low-Rank Decomposed VLM Feature Adaptation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T15:36:12.494108Z"},"links":{"citing_paper":"/paper/2507.15542"},"observation_digest":"sha256:f89a29ff6a3a2b2252db65d68a3c885666899ff3173dabae4bd81eabf7be7e85","observation_id":"5092a1e4-c999-4acc-8414-b282b00991fe","resolution":{"observed_at":"2026-08-06T15:36:20.770182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:36:20.748660Z","title":"Detecting any human-object interaction relationship: Universal hoi detector with spatial prompt learning on foundation models","venue":null,"work_id":"abeb4505-2f5f-4fe9-b035-db15648f1bec","year":2024},"citing_paper":{"arxiv_id":"2507.15542","last_updated":"2025-08-04T02:28:09Z","snapshot_observed_at":"2026-08-14T18:20:35.027776Z","submitted_at":"2025-07-21T12:15:27Z","title":"HOLa: Zero-Shot HOI Detection with Low-Rank Decomposed VLM Feature Adaptation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T15:36:12.588438Z"},"links":{"citing_paper":"/paper/2507.15542"},"observation_digest":"sha256:ba6398d9c884361eebdf086376c6679ce881cfe7520ea8aa17e8d6a272decf83","observation_id":"bdad5080-df83-4b4b-b9be-f1cb4ee34840","resolution":{"observed_at":"2026-08-06T15:36:20.754180Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:36:20.731258Z","title":"End-to- end object detection with transformers","venue":null,"work_id":"55bc732e-b85f-4283-9ef7-db6b2a5e5708","year":2020},"citing_paper":{"arxiv_id":"2507.15542","last_updated":"2025-08-04T02:28:09Z","snapshot_observed_at":"2026-08-14T18:20:35.027776Z","submitted_at":"2025-07-21T12:15:27Z","title":"HOLa: Zero-Shot HOI Detection with Low-Rank Decomposed VLM Feature Adaptation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T15:36:12.647156Z"},"links":{"citing_paper":"/paper/2507.15542"},"observation_digest":"sha256:68aabbb9a2420f3fdca8422650b57a848654651d02f22f938f20cccc2959925c","observation_id":"b07fcfc4-51cf-4a1c-9304-8d8f4ccb5afd","resolution":{"observed_at":"2026-08-06T15:36:20.736403Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:36:20.715106Z","title":"Learning to detect human-object interactions","venue":null,"work_id":"263b3af1-1a6a-4f34-afb0-7cb6b36b37e9","year":2018},"citing_paper":{"arxiv_id":"2507.15542","last_updated":"2025-08-04T02:28:09Z","snapshot_observed_at":"2026-08-14T18:20:35.027776Z","submitted_at":"2025-07-21T12:15:27Z","title":"HOLa: Zero-Shot HOI Detection with Low-Rank Decomposed VLM Feature Adaptation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T15:36:12.729363Z"},"links":{"citing_paper":"/paper/2507.15542"},"observation_digest":"sha256:01dc5756b3887de6762880d93101929902e1a28a2c77dc801923053a1bb38af8","observation_id":"e1f2b764-f143-461f-a419-73db87568b44","resolution":{"observed_at":"2026-08-06T15:36:20.719655Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.08647","last_updated":"2021-12-16T05:52:23Z","snapshot_observed_at":"2026-08-16T17:34:12.259823Z","submitted_at":"2021-12-16T05:52:23Z","title":"QAHOI: Query-Based Anchors for Human-Object Interaction Detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.08647","snapshot_observed_at":"2026-08-06T15:36:12.809446Z","title":"Qahoi: query-based an- chors for human-object interaction detection","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.15542","last_updated":"2025-08-04T02:28:09Z","snapshot_observed_at":"2026-08-14T18:20:35.027776Z","submitted_at":"2025-07-21T12:15:27Z","title":"HOLa: Zero-Shot HOI Detection with Low-Rank Decomposed VLM Feature Adaptation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T15:36:12.809446Z"},"links":{"cited_paper":"/paper/2112.08647","citing_paper":"/paper/2507.15542"},"observation_digest":"sha256:20637f365e5d792c41c37c8a35661e4b900f10ce03ad5be8fc9195ec10d7d4a9","observation_id":"969e18e2-4b8e-4ea3-9f5d-df3306453541","resolution":{"observed_at":"2026-08-06T15:36:12.809446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:36:20.698740Z","title":"Bottom-up 2d pose estimation via dual anatomical centers for small-scale persons","venue":null,"work_id":"5248218b-8df3-4d9a-b965-51431aab378e","year":2023},"citing_paper":{"arxiv_id":"2507.15542","last_updated":"2025-08-04T02:28:09Z","snapshot_observed_at":"2026-08-14T18:20:35.027776Z","submitted_at":"2025-07-21T12:15:27Z","title":"HOLa: Zero-Shot HOI Detection with Low-Rank Decomposed VLM Feature Adaptation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T15:36:12.928668Z"},"links":{"citing_paper":"/paper/2507.15542"},"observation_digest":"sha256:02fcb9c6bc9ea24a4beec23b2f703a778d981237b12cd955fc9e305876df731f","observation_id":"af11014e-afcb-4ebc-872a-e68764badd18","resolution":{"observed_at":"2026-08-06T15:36:20.703771Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:36:13.017205Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.15542","last_updated":"2025-08-04T02:28:09Z","snapshot_observed_at":"2026-08-14T18:20:35.027776Z","submitted_at":"2025-07-21T12:15:27Z","title":"HOLa: Zero-Shot HOI Detection with Low-Rank Decomposed VLM Feature Adaptation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T15:36:13.017205Z"},"links":{"citing_paper":"/paper/2507.15542"},"observation_digest":"sha256:e4f0409c2fe796fba2973893dc800263c1f7bc62673cb8ede7f506fe70d74db5","observation_id":"ff046463-31d1-482c-a950-85c33dc0f796","resolution":{"observed_at":"2026-08-06T15:36:13.017205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T15:36:13.082419Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15542","last_updated":"2025-08-04T02:28:09Z","snapshot_observed_at":"2026-08-14T18:20:35.027776Z","submitted_at":"2025-07-21T12:15:27Z","title":"HOLa: Zero-Shot HOI Detection with Low-Rank Decomposed VLM Feature Adaptation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T15:36:13.082419Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2507.15542"},"observation_digest":"sha256:16b5edc87f92f4a4ced3c29b8e39ec8f1d262407229225d05fc92f4fa5da6da7","observation_id":"c62a9350-5274-4747-89c2-57aa74c12ca1","resolution":{"observed_at":"2026-08-06T15:36:13.082419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:36:20.665976Z","title":"Clip-adapter: Better vision-language models with feature adapters","venue":null,"work_id":"ed58d03c-d5e4-42ea-a001-87d7b4ebf0c9","year":2024},"citing_paper":{"arxiv_id":"2507.15542","last_updated":"2025-08-04T02:28:09Z","snapshot_observed_at":"2026-08-14T18:20:35.027776Z","submitted_at":"2025-07-21T12:15:27Z","title":"HOLa: Zero-Shot HOI Detection with Low-Rank Decomposed VLM Feature Adaptation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T15:36:13.195046Z"},"links":{"citing_paper":"/paper/2507.15542"},"observation_digest":"sha256:fe563bd1bd3d42d545aa2b640ac21891564f5828058024c1b3e6267185a3ba4e","observation_id":"5e847c40-a42f-416b-a3c7-47dff3b19ef6","resolution":{"observed_at":"2026-08-06T15:36:20.672025Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:36:20.648398Z","title":"Detecting and recognizing human-object interactions","venue":null,"work_id":"5378229d-c96e-4621-bc26-7d5e5ab9e739","year":2018},"citing_paper":{"arxiv_id":"2507.15542","last_updated":"2025-08-04T02:28:09Z","snapshot_observed_at":"2026-08-14T18:20:35.027776Z","submitted_at":"2025-07-21T12:15:27Z","title":"HOLa: Zero-Shot HOI Detection with Low-Rank Decomposed VLM Feature Adaptation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T15:36:13.323221Z"},"links":{"citing_paper":"/paper/2507.15542"},"observation_digest":"sha256:1147cd3808a2b11089090a5a29f54f4870b479dfe3ad51f3fce0cf0db3fb7a9c","observation_id":"9d01239a-5b06-4e61-bcbc-c2557c8eca10","resolution":{"observed_at":"2026-08-06T15:36:20.653448Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.13921","last_updated":"2022-05-12T01:27:40Z","snapshot_observed_at":"2026-08-16T03:57:01.951598Z","submitted_at":"2021-04-28T17:58:57Z","title":"Open-vocabulary Object Detection via Vision and Language Knowledge Distillation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.13921","snapshot_observed_at":"2026-08-06T15:36:13.425439Z","title":"Open-vocabulary object detection via vision and language knowledge distillation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15542","last_updated":"2025-08-04T02:28:09Z","snapshot_observed_at":"2026-08-14T18:20:35.027776Z","submitted_at":"2025-07-21T12:15:27Z","title":"HOLa: Zero-Shot HOI Detection with Low-Rank Decomposed VLM Feature Adaptation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T15:36:13.425439Z"},"links":{"cited_paper":"/paper/2104.13921","citing_paper":"/paper/2507.15542"},"observation_digest":"sha256:2fdab3d7348a19880e00ad290521104faa56ae9df7b9ef261409d2ca079b664b","observation_id":"63841c17-9da0-4011-b570-3c4db2b2d0a4","resolution":{"observed_at":"2026-08-06T15:36:13.425439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:36:13.486655Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.15542","last_updated":"2025-08-04T02:28:09Z","snapshot_observed_at":"2026-08-14T18:20:35.027776Z","submitted_at":"2025-07-21T12:15:27Z","title":"HOLa: Zero-Shot HOI Detection with Low-Rank Decomposed VLM Feature Adaptation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T15:36:13.486655Z"},"links":{"citing_paper":"/paper/2507.15542"},"observation_digest":"sha256:4f19d18f0c7686727efe8ea7977d3d8959e7549df595de4f44e949a505488a96","observation_id":"9dae0258-1677-49cb-8582-792f81326794","resolution":{"observed_at":"2026-08-06T15:36:13.486655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:36:20.617318Z","title":"Vi- sual compositional learning for human-object interaction de- tection","venue":null,"work_id":"e24449f1-048e-4b9f-98e0-ddd149f7bcb0","year":2020},"citing_paper":{"arxiv_id":"2507.15542","last_updated":"2025-08-04T02:28:09Z","snapshot_observed_at":"2026-08-14T18:20:35.027776Z","submitted_at":"2025-07-21T12:15:27Z","title":"HOLa: Zero-Shot HOI Detection with Low-Rank Decomposed VLM Feature Adaptation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T15:36:13.591512Z"},"links":{"citing_paper":"/paper/2507.15542"},"observation_digest":"sha256:4cb587ece7851491d9885f5f73c615aee0956ac08f0eae741a414b4d6a8bdbef","observation_id":"488cb253-8f3a-447d-af5c-3e8056c812d8","resolution":{"observed_at":"2026-08-06T15:36:20.622642Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:36:20.597328Z","title":"Affordance transfer learning for human-object interaction detection","venue":null,"work_id":"984a9d14-c5c8-4e90-8d95-1ee86ec68e7c","year":2021},"citing_paper":{"arxiv_id":"2507.15542","last_updated":"2025-08-04T02:28:09Z","snapshot_observed_at":"2026-08-14T18:20:35.027776Z","submitted_at":"2025-07-21T12:15:27Z","title":"HOLa: Zero-Shot HOI Detection with Low-Rank Decomposed VLM Feature Adaptation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T15:36:13.657000Z"},"links":{"citing_paper":"/paper/2507.15542"},"observation_digest":"sha256:03a7bad1b22f0785637af1509aea17663fd0d0ae203832dc81e5b481e12ad717","observation_id":"6b767926-2ccf-4cd2-84fb-42328baf46b6","resolution":{"observed_at":"2026-08-06T15:36:20.602637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:36:20.576600Z","title":"Detecting human-object interaction via fab- ricated compositional learning","venue":null,"work_id":"b5bd1427-da93-40f1-a120-b31fac84ddc5","year":2021},"citing_paper":{"arxiv_id":"2507.15542","last_updated":"2025-08-04T02:28:09Z","snapshot_observed_at":"2026-08-14T18:20:35.027776Z","submitted_at":"2025-07-21T12:15:27Z","title":"HOLa: Zero-Shot HOI Detection with Low-Rank Decomposed VLM Feature Adaptation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T15:36:13.741301Z"},"links":{"citing_paper":"/paper/2507.15542"},"observation_digest":"sha256:6a1a8487cabcc38b8c7e278abcb83ae7217ce86531fd533b5d77cf22b8627936","observation_id":"5df2596f-644b-4fbd-9b64-39080798a95e","resolution":{"observed_at":"2026-08-06T15:36:20.583284Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-17T18:04:53.578114Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-06T15:36:13.846594Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.15542","last_updated":"2025-08-04T02:28:09Z","snapshot_observed_at":"2026-08-14T18:20:35.027776Z","submitted_at":"2025-07-21T12:15:27Z","title":"HOLa: Zero-Shot HOI Detection with Low-Rank Decomposed VLM Feature Adaptation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T15:36:13.846594Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2507.15542"},"observation_digest":"sha256:189f1d200f06a73f76512d454717c830021ab0b8011b63d0c8579e2ca635c98e","observation_id":"84ddf259-32f2-40fc-a9bf-6dfee93624c1","resolution":{"observed_at":"2026-08-06T15:36:13.846594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:36:13.932774Z","title":"Vi- sual prompt tuning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.15542","last_updated":"2025-08-04T02:28:09Z","snapshot_observed_at":"2026-08-14T18:20:35.027776Z","submitted_at":"2025-07-21T12:15:27Z","title":"HOLa: Zero-Shot HOI Detection with Low-Rank Decomposed VLM Feature Adaptation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T15:36:13.932774Z"},"links":{"citing_paper":"/paper/2507.15542"},"observation_digest":"sha256:541460241339a168751fa9a9970814500b73b4c8963c6ebd60e73aa830d678c6","observation_id":"4510ff64-5744-4cd3-a22b-56865c9339d0","resolution":{"observed_at":"2026-08-06T15:36:13.932774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:36:20.547171Z","title":"Maple: Multi-modal prompt learning","venue":null,"work_id":"276567af-7578-464d-bd95-b1e731d39690","year":2023},"citing_paper":{"arxiv_id":"2507.15542","last_updated":"2025-08-04T02:28:09Z","snapshot_observed_at":"2026-08-14T18:20:35.027776Z","submitted_at":"2025-07-21T12:15:27Z","title":"HOLa: Zero-Shot HOI Detection with Low-Rank Decomposed VLM Feature Adaptation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T15:36:14.015237Z"},"links":{"citing_paper":"/paper/2507.15542"},"observation_digest":"sha256:ea049abed61355cad8a5c1a90cd5cd63af904737f6bb1c350a1699a79ec5b471","observation_id":"02dab7fa-19af-44fd-8c0a-1db0ae66b172","resolution":{"observed_at":"2026-08-06T15:36:20.553880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:36:14.104612Z","title":"Relational context learning for human-object interaction detection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15542","last_updated":"2025-08-04T02:28:09Z","snapshot_observed_at":"2026-08-14T18:20:35.027776Z","submitted_at":"2025-07-21T12:15:27Z","title":"HOLa: Zero-Shot HOI Detection with Low-Rank Decomposed VLM Feature Adaptation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T15:36:14.104612Z"},"links":{"citing_paper":"/paper/2507.15542"},"observation_digest":"sha256:e1911ea8142100fb8e7ddfcbfb0d550fec11c02a381c7eda90c8b3289981e45e","observation_id":"e2cfc07b-556f-4821-bba0-b02bf6484473","resolution":{"observed_at":"2026-08-06T15:36:14.104612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:36:14.181513Z","title":"Human action recognition and predic- tion: A survey","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.15542","last_updated":"2025-08-04T02:28:09Z","snapshot_observed_at":"2026-08-14T18:20:35.027776Z","submitted_at":"2025-07-21T12:15:27Z","title":"HOLa: Zero-Shot HOI Detection with Low-Rank Decomposed VLM Feature Adaptation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T15:36:14.181513Z"},"links":{"citing_paper":"/paper/2507.15542"},"observation_digest":"sha256:983e6c3822ce6a46586523cce637afcf5eca330748c6ba6ab8ecba9b049c8d34","observation_id":"ba473696-815c-40cd-aea6-ef940287da92","resolution":{"observed_at":"2026-08-06T15:36:14.181513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:36:20.503527Z","title":null,"venue":null,"work_id":"4fe989c9-5b0a-4d87-bf22-14df75a5f574","year":2024},"citing_paper":{"arxiv_id":"2507.15542","last_updated":"2025-08-04T02:28:09Z","snapshot_observed_at":"2026-08-14T18:20:35.027776Z","submitted_at":"2025-07-21T12:15:27Z","title":"HOLa: Zero-Shot HOI Detection with Low-Rank Decomposed VLM Feature Adaptation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T15:36:14.288387Z"},"links":{"citing_paper":"/paper/2507.15542"},"observation_digest":"sha256:4fcf42ed24c9d4d9cd7d9985cb8aae55dc63b916d8d96154ab434b622912e9e1","observation_id":"1a644791-1945-4872-9720-507f17832ca1","resolution":{"observed_at":"2026-08-06T15:36:20.510604Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:36:20.472733Z","title":"Few-shot learn- ing from augmented label-uncertain queries in bongard-hoi","venue":null,"work_id":"aa633949-e123-41dd-b997-75105849a4b7","year":2024},"citing_paper":{"arxiv_id":"2507.15542","last_updated":"2025-08-04T02:28:09Z","snapshot_observed_at":"2026-08-14T18:20:35.027776Z","submitted_at":"2025-07-21T12:15:27Z","title":"HOLa: Zero-Shot HOI Detection with Low-Rank Decomposed VLM Feature Adaptation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T15:36:14.356562Z"},"links":{"citing_paper":"/paper/2507.15542"},"observation_digest":"sha256:ff3160beeef9f1ba6574d20d7a73ccd87745ddc73290bbc9c46660d474bd6994","observation_id":"216f9ce3-377d-4ac6-98f9-86866087bb4f","resolution":{"observed_at":"2026-08-06T15:36:20.483133Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:36:20.453179Z","title":"Efficient adaptive human-object interac- tion detection with concept-guided memory","venue":null,"work_id":"1b0bc0ae-4479-4a64-9f01-2a8ebfef4929","year":2023},"citing_paper":{"arxiv_id":"2507.15542","last_updated":"2025-08-04T02:28:09Z","snapshot_observed_at":"2026-08-14T18:20:35.027776Z","submitted_at":"2025-07-21T12:15:27Z","title":"HOLa: Zero-Shot HOI Detection with Low-Rank Decomposed VLM Feature Adaptation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T15:36:14.424562Z"},"links":{"citing_paper":"/paper/2507.15542"},"observation_digest":"sha256:d7cef1ea6ba6cf65df4b66c68ab682ea13588a39ff12727318611837a8c7f7d9","observation_id":"d7965822-32a2-497e-b082-2c78567015d5","resolution":{"observed_at":"2026-08-06T15:36:20.458231Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:36:20.431680Z","title":"Exploring the po- tential of large foundation models for open-vocabulary hoi 9 detection","venue":null,"work_id":"85f20eba-a1fb-4d6b-846e-38631d602b1d","year":2024},"citing_paper":{"arxiv_id":"2507.15542","last_updated":"2025-08-04T02:28:09Z","snapshot_observed_at":"2026-08-14T18:20:35.027776Z","submitted_at":"2025-07-21T12:15:27Z","title":"HOLa: Zero-Shot HOI Detection with Low-Rank Decomposed VLM Feature Adaptation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T15:36:14.506188Z"},"links":{"citing_paper":"/paper/2507.15542"},"observation_digest":"sha256:e7804384a0f18b035916fa30d7c35806599bf9e55d98a3fdbbfc9d75d7c7dde8","observation_id":"0a05668c-860d-46a8-8e95-aac1a04d68b1","resolution":{"observed_at":"2026-08-06T15:36:20.438830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:36:20.410374Z","title":"Explor- ing conditional multi-modal prompts for zero-shot hoi de- tection","venue":null,"work_id":"d7a3a66a-ecf0-41d4-8a0f-3d9af0e4f96c","year":2024},"citing_paper":{"arxiv_id":"2507.15542","last_updated":"2025-08-04T02:28:09Z","snapshot_observed_at":"2026-08-14T18:20:35.027776Z","submitted_at":"2025-07-21T12:15:27Z","title":"HOLa: Zero-Shot HOI Detection with Low-Rank Decomposed VLM Feature Adaptation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T15:36:14.577130Z"},"links":{"citing_paper":"/paper/2507.15542"},"observation_digest":"sha256:ab3bf3a80fdf4a81340f625de1c9fe1fe66911c12c4c29ecdc2cf9a438d31636","observation_id":"fb314260-ee48-4b69-9a2a-c5ff2d3b45da","resolution":{"observed_at":"2026-08-06T15:36:20.415682Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:36:20.389706Z","title":"Blip: Bootstrapping language-image pre-training for uni- fied vision-language understanding and generation","venue":null,"work_id":"16254770-0dc5-42dc-a396-1d1ab27ed645","year":2022},"citing_paper":{"arxiv_id":"2507.15542","last_updated":"2025-08-04T02:28:09Z","snapshot_observed_at":"2026-08-14T18:20:35.027776Z","submitted_at":"2025-07-21T12:15:27Z","title":"HOLa: Zero-Shot HOI Detection with Low-Rank Decomposed VLM Feature Adaptation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T15:36:14.691364Z"},"links":{"citing_paper":"/paper/2507.15542"},"observation_digest":"sha256:b4ee8a3bf6949d16d0155d91d78c5355c0bb3a021ff5ef9ae294c124cb9f10f3","observation_id":"6b0eb445-8235-4bbb-9455-a55518d12fd5","resolution":{"observed_at":"2026-08-06T15:36:20.396360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12597","last_updated":"2023-06-15T07:57:29Z","snapshot_observed_at":"2026-08-12T12:01:54.105712Z","submitted_at":"2023-01-30T00:56:51Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12597","snapshot_observed_at":"2026-08-06T15:36:14.758596Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15542","last_updated":"2025-08-04T02:28:09Z","snapshot_observed_at":"2026-08-14T18:20:35.027776Z","submitted_at":"2025-07-21T12:15:27Z","title":"HOLa: Zero-Shot HOI Detection with Low-Rank Decomposed VLM Feature Adaptation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T15:36:14.758596Z"},"links":{"cited_paper":"/paper/2301.12597","citing_paper":"/paper/2507.15542"},"observation_digest":"sha256:41e4e82d5ffbd1b84d8eba0a5ed168c8162c568df8a61f8d85d026538fdfeebe","observation_id":"6b9798f6-a4ca-4da7-bd8d-05e09ad6cb65","resolution":{"observed_at":"2026-08-06T15:36:14.758596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:36:20.371852Z","title":"Neural- logic human-object interaction detection","venue":null,"work_id":"3f69c8b0-8a51-4f00-9bc8-ae48c41ddbaf","year":2024},"citing_paper":{"arxiv_id":"2507.15542","last_updated":"2025-08-04T02:28:09Z","snapshot_observed_at":"2026-08-14T18:20:35.027776Z","submitted_at":"2025-07-21T12:15:27Z","title":"HOLa: Zero-Shot HOI Detection with Low-Rank Decomposed VLM Feature Adaptation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T15:36:14.894472Z"},"links":{"citing_paper":"/paper/2507.15542"},"observation_digest":"sha256:f4dd6260af9b40e8b7d9edc749fcca6d8c0682406f840fa308bdc82f76ac42d0","observation_id":"4a2a4472-911d-456c-a7b6-92cb2db64df1","resolution":{"observed_at":"2026-08-06T15:36:20.377258Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:36:20.352903Z","title":"Gen-vlkt: Simplify association and enhance interaction understanding for hoi detection","venue":null,"work_id":"552df7e0-59cf-42e0-b0a8-a3deedc74480","year":2022},"citing_paper":{"arxiv_id":"2507.15542","last_updated":"2025-08-04T02:28:09Z","snapshot_observed_at":"2026-08-14T18:20:35.027776Z","submitted_at":"2025-07-21T12:15:27Z","title":"HOLa: Zero-Shot HOI Detection with Low-Rank Decomposed VLM Feature Adaptation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T15:36:14.977556Z"},"links":{"citing_paper":"/paper/2507.15542"},"observation_digest":"sha256:9d5ee2fa383a5dd023037ccd4ba0e383badd2560346706e608f1d1a731f2ffa0","observation_id":"218c4877-4306-4215-8271-68b20231894d","resolution":{"observed_at":"2026-08-06T15:36:20.358954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:36:20.336979Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":"e31948c3-a129-42c6-be13-c99cbd7d0a42","year":2014},"citing_paper":{"arxiv_id":"2507.15542","last_updated":"2025-08-04T02:28:09Z","snapshot_observed_at":"2026-08-14T18:20:35.027776Z","submitted_at":"2025-07-21T12:15:27Z","title":"HOLa: Zero-Shot HOI Detection with Low-Rank Decomposed VLM Feature Adaptation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T15:36:15.058495Z"},"links":{"citing_paper":"/paper/2507.15542"},"observation_digest":"sha256:2654b74f7a60edbddf5dec19dcd84f1c0411151c7dadd935f602683352fa55a5","observation_id":"1360e76f-a665-4ff1-a1d0-a4836153b548","resolution":{"observed_at":"2026-08-06T15:36:20.342257Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:36:20.316504Z","title":"Focal loss for dense object detection","venue":null,"work_id":"6a4f8c35-f477-4fb0-8488-a6c696668cdb","year":2017},"citing_paper":{"arxiv_id":"2507.15542","last_updated":"2025-08-04T02:28:09Z","snapshot_observed_at":"2026-08-14T18:20:35.027776Z","submitted_at":"2025-07-21T12:15:27Z","title":"HOLa: Zero-Shot HOI Detection with Low-Rank Decomposed VLM Feature Adaptation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T15:36:15.138208Z"},"links":{"citing_paper":"/paper/2507.15542"},"observation_digest":"sha256:1ad9e8024dd81b30b7f247ad6253e3222a9b9d812f28beb0ffbd45f3ebacf921","observation_id":"f3e77925-9ada-497d-9cb6-431a58bc621f","resolution":{"observed_at":"2026-08-06T15:36:20.321842Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03744","last_updated":"2024-05-15T19:22:44Z","snapshot_observed_at":"2026-08-15T02:35:59.111911Z","submitted_at":"2023-10-05T17:59:56Z","title":"Improved Baselines with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03744","snapshot_observed_at":"2026-08-06T15:36:15.223472Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15542","last_updated":"2025-08-04T02:28:09Z","snapshot_observed_at":"2026-08-14T18:20:35.027776Z","submitted_at":"2025-07-21T12:15:27Z","title":"HOLa: Zero-Shot HOI Detection with Low-Rank Decomposed VLM Feature Adaptation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T15:36:15.223472Z"},"links":{"cited_paper":"/paper/2310.03744","citing_paper":"/paper/2507.15542"},"observation_digest":"sha256:848cac001e580b41abb30bade605b1f6931393533406584f2ac6bf9a73a53b08","observation_id":"c274fba1-64d7-45b3-a191-56aaedf5e9ec","resolution":{"observed_at":"2026-08-06T15:36:15.223472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:36:20.292798Z","title":"Visual instruction tuning","venue":null,"work_id":"39badb5d-e803-4cbe-a05a-d79fc3c3ce69","year":2023},"citing_paper":{"arxiv_id":"2507.15542","last_updated":"2025-08-04T02:28:09Z","snapshot_observed_at":"2026-08-14T18:20:35.027776Z","submitted_at":"2025-07-21T12:15:27Z","title":"HOLa: Zero-Shot HOI Detection with Low-Rank Decomposed VLM Feature Adaptation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T15:36:15.282448Z"},"links":{"citing_paper":"/paper/2507.15542"},"observation_digest":"sha256:88d4d73a1356fd9348b5e529e3e7aa0b397396c5eba8eb56fbfc4ed864d5db0b","observation_id":"4672011b-0cd9-47ad-96f5-70a936cf62fd","resolution":{"observed_at":"2026-08-06T15:36:20.300701Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-14T20:13:52.872565Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-06T15:36:15.342830Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.15542","last_updated":"2025-08-04T02:28:09Z","snapshot_observed_at":"2026-08-14T18:20:35.027776Z","submitted_at":"2025-07-21T12:15:27Z","title":"HOLa: Zero-Shot HOI Detection with Low-Rank Decomposed VLM Feature Adaptation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T15:36:15.342830Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2507.15542"},"observation_digest":"sha256:f5660af274098967f36fef64d13c2c78c7d916eee23817326adcc2e52797f23a","observation_id":"95272b43-8d02-4036-922f-518c13c48fe5","resolution":{"observed_at":"2026-08-06T15:36:15.342830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:36:20.274855Z","title":"Discovering syntactic interaction clues for human-object interaction detection","venue":null,"work_id":"ec28086d-66b1-4a3b-a9cd-97570f6f0051","year":2024},"citing_paper":{"arxiv_id":"2507.15542","last_updated":"2025-08-04T02:28:09Z","snapshot_observed_at":"2026-08-14T18:20:35.027776Z","submitted_at":"2025-07-21T12:15:27Z","title":"HOLa: Zero-Shot HOI Detection with Low-Rank Decomposed VLM Feature Adaptation","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T15:36:15.447196Z"},"links":{"citing_paper":"/paper/2507.15542"},"observation_digest":"sha256:cd36e010a49b9523bb0b63a719dacf778737bf7e717071c0bee14a7737779204","observation_id":"6f4045a1-86c6-44f9-9253-277573c24ddb","resolution":{"observed_at":"2026-08-06T15:36:20.280188Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:36:20.256016Z","title":"Clip4hoi: Towards adapting clip for practi- cal zero-shot hoi detection","venue":null,"work_id":"1735b7e5-f323-47d0-a6f9-088958f2f7bf","year":2024},"citing_paper":{"arxiv_id":"2507.15542","last_updated":"2025-08-04T02:28:09Z","snapshot_observed_at":"2026-08-14T18:20:35.027776Z","submitted_at":"2025-07-21T12:15:27Z","title":"HOLa: Zero-Shot HOI Detection with Low-Rank Decomposed VLM Feature Adaptation","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T15:36:15.586397Z"},"links":{"citing_paper":"/paper/2507.15542"},"observation_digest":"sha256:e15a130f7df949c9fca9ed7cefe484aeedee5de0298635b7b73f9f8b7ad69922","observation_id":"7b18c439-439a-4667-9b5d-b66f1c53be05","resolution":{"observed_at":"2026-08-06T15:36:20.262443Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:36:20.238009Z","title":"Simple open-vocabulary object detection","venue":null,"work_id":"2eb8c494-a799-40dd-b8c3-73f6b9ac70f6","year":2022},"citing_paper":{"arxiv_id":"2507.15542","last_updated":"2025-08-04T02:28:09Z","snapshot_observed_at":"2026-08-14T18:20:35.027776Z","submitted_at":"2025-07-21T12:15:27Z","title":"HOLa: Zero-Shot HOI Detection with Low-Rank Decomposed VLM Feature Adaptation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T15:36:15.684872Z"},"links":{"citing_paper":"/paper/2507.15542"},"observation_digest":"sha256:96660aff97d77503d19e114d6269115013dba5aeb6396beb48dd0b792c75ea3e","observation_id":"74811a20-622b-426c-98fd-206c5a71cbfd","resolution":{"observed_at":"2026-08-06T15:36:20.243236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:36:20.221183Z","title":"Hoiclip: Efficient knowledge transfer for hoi detection with vision-language models","venue":null,"work_id":"af98152a-2eef-4ea2-8aa1-2f4a14ec5b13","year":2023},"citing_paper":{"arxiv_id":"2507.15542","last_updated":"2025-08-04T02:28:09Z","snapshot_observed_at":"2026-08-14T18:20:35.027776Z","submitted_at":"2025-07-21T12:15:27Z","title":"HOLa: Zero-Shot HOI Detection with Low-Rank Decomposed VLM Feature Adaptation","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T15:36:15.835139Z"},"links":{"citing_paper":"/paper/2507.15542"},"observation_digest":"sha256:35f807d7cfbb5888a19313792da8d349abd2b779c20dd1a91cf77c8d1d24c714","observation_id":"896ece77-a12b-46d3-815e-4c833f018023","resolution":{"observed_at":"2026-08-06T15:36:20.226568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:36:20.204387Z","title":"Viplo: Vision transformer based pose-conditioned self-loop graph for human-object interaction detection","venue":null,"work_id":"c82b2e48-d252-42fc-b9a4-a8099fc7a806","year":2023},"citing_paper":{"arxiv_id":"2507.15542","last_updated":"2025-08-04T02:28:09Z","snapshot_observed_at":"2026-08-14T18:20:35.027776Z","submitted_at":"2025-07-21T12:15:27Z","title":"HOLa: Zero-Shot HOI Detection with Low-Rank Decomposed VLM Feature Adaptation","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T15:36:15.941606Z"},"links":{"citing_paper":"/paper/2507.15542"},"observation_digest":"sha256:828ad387e3ec05777777c40dca708d4675a96ef6d9b0dadc0698b1cca2646712","observation_id":"0e0629cf-286d-4faf-b703-97dbd418f133","resolution":{"observed_at":"2026-08-06T15:36:20.209885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:36:16.092560Z","title":"Distillation using oracle queries for transformer-based human-object interaction detection","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.15542","last_updated":"2025-08-04T02:28:09Z","snapshot_observed_at":"2026-08-14T18:20:35.027776Z","submitted_at":"2025-07-21T12:15:27Z","title":"HOLa: Zero-Shot HOI Detection with Low-Rank Decomposed VLM Feature Adaptation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T15:36:16.092560Z"},"links":{"citing_paper":"/paper/2507.15542"},"observation_digest":"sha256:78831eff29ae9917045b6f505c36e2eb24006fd3a4edbe5437d85ed62c04b5fa","observation_id":"02b26101-4398-4585-bf7c-5f9f7d83eb14","resolution":{"observed_at":"2026-08-06T15:36:16.092560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:36:16.207811Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.15542","last_updated":"2025-08-04T02:28:09Z","snapshot_observed_at":"2026-08-14T18:20:35.027776Z","submitted_at":"2025-07-21T12:15:27Z","title":"HOLa: Zero-Shot HOI Detection with Low-Rank Decomposed VLM Feature Adaptation","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T15:36:16.207811Z"},"links":{"citing_paper":"/paper/2507.15542"},"observation_digest":"sha256:24bd9b1f5bdfa6bd096cd5c9d187c49bf78c5d35c98ef99d1f2ea138d2eb5ea1","observation_id":"89708747-82d2-46bf-9656-c26e62782c93","resolution":{"observed_at":"2026-08-06T15:36:16.207811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1611.01967","last_updated":"2017-03-15T08:18:28Z","snapshot_observed_at":"2026-08-14T21:31:40.993445Z","submitted_at":"2016-11-07T10:15:40Z","title":"Regularizing CNNs with Locally Constrained Decorrelations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.01967","snapshot_observed_at":"2026-08-06T15:36:16.351117Z","title":"Regularizing cnns with locally constrained decorrelations","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.15542","last_updated":"2025-08-04T02:28:09Z","snapshot_observed_at":"2026-08-14T18:20:35.027776Z","submitted_at":"2025-07-21T12:15:27Z","title":"HOLa: Zero-Shot HOI Detection with Low-Rank Decomposed VLM Feature Adaptation","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T15:36:16.351117Z"},"links":{"cited_paper":"/paper/1611.01967","citing_paper":"/paper/2507.15542"},"observation_digest":"sha256:f0622929c451ce7b83d6d2df79cd5ae2933b6e07c1a20d3ae5da9b6585e6596f","observation_id":"fd0f92af-e0a6-4e05-a80c-722e0601ceef","resolution":{"observed_at":"2026-08-06T15:36:16.351117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:36:20.164412Z","title":"Test- time prompt tuning for zero-shot generalization in vision- language models","venue":null,"work_id":"f9aef5a5-5b41-4e56-8f5d-e36f76639d9f","year":2022},"citing_paper":{"arxiv_id":"2507.15542","last_updated":"2025-08-04T02:28:09Z","snapshot_observed_at":"2026-08-14T18:20:35.027776Z","submitted_at":"2025-07-21T12:15:27Z","title":"HOLa: Zero-Shot HOI Detection with Low-Rank Decomposed VLM Feature Adaptation","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T15:36:16.469208Z"},"links":{"citing_paper":"/paper/2507.15542"},"observation_digest":"sha256:cf8df89bf42a7197c2f741942e1edcfa56dbc4912f6654ec6a8d7e8ba85c0275","observation_id":"2cfef1bb-5136-4f46-9b36-641ff018ea1f","resolution":{"observed_at":"2026-08-06T15:36:20.169349Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:36:20.148017Z","title":"Energy-based learning for scene graph generation","venue":null,"work_id":"7aa9bcc5-8d6b-41ab-978a-f35968ef29e8","year":2021},"citing_paper":{"arxiv_id":"2507.15542","last_updated":"2025-08-04T02:28:09Z","snapshot_observed_at":"2026-08-14T18:20:35.027776Z","submitted_at":"2025-07-21T12:15:27Z","title":"HOLa: Zero-Shot HOI Detection with Low-Rank Decomposed VLM Feature Adaptation","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T15:36:16.621980Z"},"links":{"citing_paper":"/paper/2507.15542"},"observation_digest":"sha256:447339ecef51b9d525054affba7e9ad78fd6374e051f40f06af80a1486f556bf","observation_id":"6f60bc81-875b-4985-9dc0-0d834875e3f8","resolution":{"observed_at":"2026-08-06T15:36:20.153510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:36:20.130088Z","title":"Vl-adapter: Parameter-efficient transfer learning for vision-and-language tasks","venue":null,"work_id":"94020315-afc5-4f49-90b8-9cbbbea4188a","year":null},"citing_paper":{"arxiv_id":"2507.15542","last_updated":"2025-08-04T02:28:09Z","snapshot_observed_at":"2026-08-14T18:20:35.027776Z","submitted_at":"2025-07-21T12:15:27Z","title":"HOLa: Zero-Shot HOI Detection with Low-Rank Decomposed VLM Feature Adaptation","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T15:36:16.847653Z"},"links":{"citing_paper":"/paper/2507.15542"},"observation_digest":"sha256:2c8b0b4cade9994565a4ccf9f740ad55d8dd68518c7c1dd557f0c85da084c051","observation_id":"6a3f617b-0766-43ef-835e-8ae42e98b1c0","resolution":{"observed_at":"2026-08-06T15:36:20.135438Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:36:20.114940Z","title":"Qpic: Query-based pairwise human-object interaction detec- tion with image-wide contextual information","venue":null,"work_id":"262cc034-2649-4aa6-9f3d-109c42467470","year":2021},"citing_paper":{"arxiv_id":"2507.15542","last_updated":"2025-08-04T02:28:09Z","snapshot_observed_at":"2026-08-14T18:20:35.027776Z","submitted_at":"2025-07-21T12:15:27Z","title":"HOLa: Zero-Shot HOI Detection with Low-Rank Decomposed VLM Feature Adaptation","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T15:36:16.938320Z"},"links":{"citing_paper":"/paper/2507.15542"},"observation_digest":"sha256:258646633486908909ba1988311161fc6c0e1f268c9b5c0a533c17a6124b8098","observation_id":"46ec4ed0-2a5c-4ace-a069-f34ae4ef7554","resolution":{"observed_at":"2026-08-06T15:36:20.119479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:36:20.100095Z","title":"Bilateral adaptation for human-object interac- tion detection with occlusion-robustness","venue":null,"work_id":"11cd2592-9f2c-45f7-a27e-c631f8febb56","year":2024},"citing_paper":{"arxiv_id":"2507.15542","last_updated":"2025-08-04T02:28:09Z","snapshot_observed_at":"2026-08-14T18:20:35.027776Z","submitted_at":"2025-07-21T12:15:27Z","title":"HOLa: Zero-Shot HOI Detection with Low-Rank Decomposed VLM Feature Adaptation","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T15:36:17.028398Z"},"links":{"citing_paper":"/paper/2507.15542"},"observation_digest":"sha256:a8dd18ad90acf96e88a3fbd690f6241a1b218ce84d349d606ad1c57cc0c30f70","observation_id":"3a589e77-dd73-422d-8a48-90e7f5d03920","resolution":{"observed_at":"2026-08-06T15:36:20.104728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:36:20.083945Z","title":"Exploring pose-aware human-object interaction via hybrid learning","venue":null,"work_id":"8b597d70-be5d-40a9-a4fb-2a828f4f8f9e","year":2024},"citing_paper":{"arxiv_id":"2507.15542","last_updated":"2025-08-04T02:28:09Z","snapshot_observed_at":"2026-08-14T18:20:35.027776Z","submitted_at":"2025-07-21T12:15:27Z","title":"HOLa: Zero-Shot HOI Detection with Low-Rank Decomposed VLM Feature Adaptation","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T15:36:17.147387Z"},"links":{"citing_paper":"/paper/2507.15542"},"observation_digest":"sha256:32cc333b5a6106196aadb7888a72db639fee983efac7530e25cf278d7a416f19","observation_id":"95b130a0-6d53-4656-a45c-2797231cf72e","resolution":{"observed_at":"2026-08-06T15:36:20.088920Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:36:20.061561Z","title":"End-to-end zero-shot hoi detec- 10 tion via vision and language knowledge distillation","venue":null,"work_id":"4539a7ca-0c50-4b03-a2e7-8492d075279e","year":2023},"citing_paper":{"arxiv_id":"2507.15542","last_updated":"2025-08-04T02:28:09Z","snapshot_observed_at":"2026-08-14T18:20:35.027776Z","submitted_at":"2025-07-21T12:15:27Z","title":"HOLa: Zero-Shot HOI Detection with Low-Rank Decomposed VLM Feature Adaptation","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T15:36:17.260544Z"},"links":{"citing_paper":"/paper/2507.15542"},"observation_digest":"sha256:2fb4da471577e3473015978a90875eee8d574244642bb34699186de7869e4fb6","observation_id":"6da029c7-60ab-4445-bab4-8575833a3c19","resolution":{"observed_at":"2026-08-06T15:36:20.071924Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:36:20.045197Z","title":"Category query learning for human-object interaction classification","venue":null,"work_id":"9eb641cc-18a0-4cc3-9052-4668a4214878","year":2023},"citing_paper":{"arxiv_id":"2507.15542","last_updated":"2025-08-04T02:28:09Z","snapshot_observed_at":"2026-08-14T18:20:35.027776Z","submitted_at":"2025-07-21T12:15:27Z","title":"HOLa: Zero-Shot HOI Detection with Low-Rank Decomposed VLM Feature Adaptation","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T15:36:17.361189Z"},"links":{"citing_paper":"/paper/2507.15542"},"observation_digest":"sha256:0d980e6c73bbfda6cdac680524186bbeacf66ec5c4b2929c94e4a0cc778d15de","observation_id":"599e1d3b-7900-4cf3-8cda-0f4907cd6358","resolution":{"observed_at":"2026-08-06T15:36:20.050128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:36:20.027719Z","title":"Chore: Contact, human and object reconstruction from a sin- gle rgb image","venue":null,"work_id":"9b5cb8d9-7948-4da3-b151-b40214a939aa","year":2022},"citing_paper":{"arxiv_id":"2507.15542","last_updated":"2025-08-04T02:28:09Z","snapshot_observed_at":"2026-08-14T18:20:35.027776Z","submitted_at":"2025-07-21T12:15:27Z","title":"HOLa: Zero-Shot HOI Detection with Low-Rank Decomposed VLM Feature Adaptation","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T15:36:17.459479Z"},"links":{"citing_paper":"/paper/2507.15542"},"observation_digest":"sha256:7b8807f145640123241e4daa2175fb438e4ca1e0560e59632cf3ad0c8c58b3cf","observation_id":"c6b7896c-4545-481b-9be9-8afd15b41f13","resolution":{"observed_at":"2026-08-06T15:36:20.032482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:36:20.010938Z","title":"Open-world human-object interaction detection via multi-modal prompts","venue":null,"work_id":"d2722865-e65d-45b1-b19a-bfc8e797a49f","year":2024},"citing_paper":{"arxiv_id":"2507.15542","last_updated":"2025-08-04T02:28:09Z","snapshot_observed_at":"2026-08-14T18:20:35.027776Z","submitted_at":"2025-07-21T12:15:27Z","title":"HOLa: Zero-Shot HOI Detection with Low-Rank Decomposed VLM Feature Adaptation","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T15:36:17.538190Z"},"links":{"citing_paper":"/paper/2507.15542"},"observation_digest":"sha256:e42d09cef6dcd3df1ef6fb0a7c1267bc330a01258ba10cb0c90092e199d192a0","observation_id":"b7df081d-b74b-4ed6-821c-ca84cb56d8a7","resolution":{"observed_at":"2026-08-06T15:36:20.016919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:36:19.993131Z","title":"Mma: Multi-modal adapter for vision-language models","venue":null,"work_id":"01fde16b-2860-4583-a61c-224d237285d4","year":2024},"citing_paper":{"arxiv_id":"2507.15542","last_updated":"2025-08-04T02:28:09Z","snapshot_observed_at":"2026-08-14T18:20:35.027776Z","submitted_at":"2025-07-21T12:15:27Z","title":"HOLa: Zero-Shot HOI Detection with Low-Rank Decomposed VLM Feature Adaptation","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T15:36:17.669651Z"},"links":{"citing_paper":"/paper/2507.15542"},"observation_digest":"sha256:5f41d9e3a1f3df7a64a87026df6a041158f211d54f34f6e83c372aee49ea39b3","observation_id":"afd4bc2c-ed67-456c-875e-4bcfcbcba2bc","resolution":{"observed_at":"2026-08-06T15:36:19.998901Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:36:19.975946Z","title":"Rlip: Rela- tional language-image pre-training for human-object interac- tion detection","venue":null,"work_id":"5dd3a6ea-ebf9-4782-b4a6-ba8d036e9491","year":2022},"citing_paper":{"arxiv_id":"2507.15542","last_updated":"2025-08-04T02:28:09Z","snapshot_observed_at":"2026-08-14T18:20:35.027776Z","submitted_at":"2025-07-21T12:15:27Z","title":"HOLa: Zero-Shot HOI Detection with Low-Rank Decomposed VLM Feature Adaptation","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T15:36:17.735963Z"},"links":{"citing_paper":"/paper/2507.15542"},"observation_digest":"sha256:5ffb5dcc2ae3a67ed2da0e5cbe3f5a301ce77a7a63880eca6651fae9feddaf6b","observation_id":"340c1feb-e571-47ca-9cfd-44941a0a0025","resolution":{"observed_at":"2026-08-06T15:36:19.981215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07225","last_updated":"2022-10-13T17:50:24Z","snapshot_observed_at":"2026-08-18T09:28:49.447974Z","submitted_at":"2022-10-13T17:50:24Z","title":"Unified Vision and Language Prompt Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07225","snapshot_observed_at":"2026-08-06T15:36:17.773682Z","title":"Unified vision and language prompt learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.15542","last_updated":"2025-08-04T02:28:09Z","snapshot_observed_at":"2026-08-14T18:20:35.027776Z","submitted_at":"2025-07-21T12:15:27Z","title":"HOLa: Zero-Shot HOI Detection with Low-Rank Decomposed VLM Feature Adaptation","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T15:36:17.773682Z"},"links":{"cited_paper":"/paper/2210.07225","citing_paper":"/paper/2507.15542"},"observation_digest":"sha256:9c48e09881d848e42a8a4f4abc3db223cc08ef1ca47513ca759176ffeb6bcbe5","observation_id":"39cf9e76-117e-4977-ac08-f79d7f62f868","resolution":{"observed_at":"2026-08-06T15:36:17.773682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:36:19.956968Z","title":"Open-vocabulary object detection using captions","venue":null,"work_id":"1755163a-374d-43fc-8094-b76097932981","year":2021},"citing_paper":{"arxiv_id":"2507.15542","last_updated":"2025-08-04T02:28:09Z","snapshot_observed_at":"2026-08-14T18:20:35.027776Z","submitted_at":"2025-07-21T12:15:27Z","title":"HOLa: Zero-Shot HOI Detection with Low-Rank Decomposed VLM Feature Adaptation","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T15:36:17.869087Z"},"links":{"citing_paper":"/paper/2507.15542"},"observation_digest":"sha256:55395e974c5754518c3caa95255a04cde6a94837afaa10d595cdbcc743544658","observation_id":"a602d3ef-9aa7-40da-93f5-a30d5b98f5c9","resolution":{"observed_at":"2026-08-06T15:36:19.963611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:36:19.937769Z","title":"Spatially conditioned graphs for detecting human-object in- teractions","venue":null,"work_id":"881fc0f5-c318-4cdd-9917-5add9e10a1fb","year":2021},"citing_paper":{"arxiv_id":"2507.15542","last_updated":"2025-08-04T02:28:09Z","snapshot_observed_at":"2026-08-14T18:20:35.027776Z","submitted_at":"2025-07-21T12:15:27Z","title":"HOLa: Zero-Shot HOI Detection with Low-Rank Decomposed VLM Feature Adaptation","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T15:36:17.972617Z"},"links":{"citing_paper":"/paper/2507.15542"},"observation_digest":"sha256:5ded6d5b4583e21111558c1174353c1f0b645a318b95540969437bd1890fac84","observation_id":"6904d752-f23d-43ae-b9b9-9ffd3acde90f","resolution":{"observed_at":"2026-08-06T15:36:19.943609Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:36:19.921958Z","title":"Efficient two-stage detection of human-object interactions with a novel unary-pairwise transformer","venue":null,"work_id":"a9973db8-262e-4ab4-a16f-7c2e23fe1a60","year":2022},"citing_paper":{"arxiv_id":"2507.15542","last_updated":"2025-08-04T02:28:09Z","snapshot_observed_at":"2026-08-14T18:20:35.027776Z","submitted_at":"2025-07-21T12:15:27Z","title":"HOLa: Zero-Shot HOI Detection with Low-Rank Decomposed VLM Feature Adaptation","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T15:36:18.090838Z"},"links":{"citing_paper":"/paper/2507.15542"},"observation_digest":"sha256:e028856d1e257a04597188ae64dc3fc8abfb8b4a24779f41e9a8886228238d1a","observation_id":"dcab018c-2835-4a80-a207-16cf7b48dc1c","resolution":{"observed_at":"2026-08-06T15:36:19.927110Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:36:19.904409Z","title":"Exploring predicate visual con- text in detecting of human-object interactions","venue":null,"work_id":"18006a0a-ada6-46d3-a231-f57a89bb61b6","year":2023},"citing_paper":{"arxiv_id":"2507.15542","last_updated":"2025-08-04T02:28:09Z","snapshot_observed_at":"2026-08-14T18:20:35.027776Z","submitted_at":"2025-07-21T12:15:27Z","title":"HOLa: Zero-Shot HOI Detection with Low-Rank Decomposed VLM Feature Adaptation","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T15:36:18.169260Z"},"links":{"citing_paper":"/paper/2507.15542"},"observation_digest":"sha256:22a24c31b2452c9daadad18636ed7dcd9209c398e02f41443f2f4248bd738400","observation_id":"0e972724-d36a-4acf-8d5a-8ab0ad690af5","resolution":{"observed_at":"2026-08-06T15:36:19.910367Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:36:19.883392Z","title":"Perceiving 3d human-object spatial arrangements from a single image in the wild","venue":null,"work_id":"f29812a3-8108-45bc-a2ee-056e1569561a","year":2020},"citing_paper":{"arxiv_id":"2507.15542","last_updated":"2025-08-04T02:28:09Z","snapshot_observed_at":"2026-08-14T18:20:35.027776Z","submitted_at":"2025-07-21T12:15:27Z","title":"HOLa: Zero-Shot HOI Detection with Low-Rank Decomposed VLM Feature Adaptation","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T15:36:18.385779Z"},"links":{"citing_paper":"/paper/2507.15542"},"observation_digest":"sha256:68ddb677be2d60096caadd884579f1e2c6693dec693c502fcf561762ee4930a5","observation_id":"79b7c3fe-5232-428a-980b-66b74ad74011","resolution":{"observed_at":"2026-08-06T15:36:19.890965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.03930","last_updated":"2021-11-15T04:58:28Z","snapshot_observed_at":"2026-08-18T14:02:33.902650Z","submitted_at":"2021-11-06T18:09:22Z","title":"Tip-Adapter: Training-free CLIP-Adapter for Better Vision-Language Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.03930","snapshot_observed_at":"2026-08-06T15:36:18.538157Z","title":"Tip-adapter: Training-free clip-adapter for better vision- language modeling","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.15542","last_updated":"2025-08-04T02:28:09Z","snapshot_observed_at":"2026-08-14T18:20:35.027776Z","submitted_at":"2025-07-21T12:15:27Z","title":"HOLa: Zero-Shot HOI Detection with Low-Rank Decomposed VLM Feature Adaptation","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T15:36:18.538157Z"},"links":{"cited_paper":"/paper/2111.03930","citing_paper":"/paper/2507.15542"},"observation_digest":"sha256:c1a26e70aad38a88f0881aab094dbe73c8f8898532bda80f56b1e6aa31c1b172","observation_id":"6ca96122-cc10-4d83-97e1-e11c6ad5b3b1","resolution":{"observed_at":"2026-08-06T15:36:18.538157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:36:19.863981Z","title":null,"venue":null,"work_id":"4c3d0e0c-80ba-4ac1-958c-df97010c1d3e","year":2025},"citing_paper":{"arxiv_id":"2507.15542","last_updated":"2025-08-04T02:28:09Z","snapshot_observed_at":"2026-08-14T18:20:35.027776Z","submitted_at":"2025-07-21T12:15:27Z","title":"HOLa: Zero-Shot HOI Detection with Low-Rank Decomposed VLM Feature Adaptation","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T15:36:18.665662Z"},"links":{"citing_paper":"/paper/2507.15542"},"observation_digest":"sha256:26e516052e389f0ce3dfbaecae77df5de11f40beb239552c137bf32357170e19","observation_id":"5e766ba1-4c3d-40be-9829-ab2be1957bb8","resolution":{"observed_at":"2026-08-06T15:36:19.869271Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:36:18.797085Z","title":"Conditional prompt learning for vision-language mod- els","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15542","last_updated":"2025-08-04T02:28:09Z","snapshot_observed_at":"2026-08-14T18:20:35.027776Z","submitted_at":"2025-07-21T12:15:27Z","title":"HOLa: Zero-Shot HOI Detection with Low-Rank Decomposed VLM Feature Adaptation","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T15:36:18.797085Z"},"links":{"citing_paper":"/paper/2507.15542"},"observation_digest":"sha256:f907e1b956cefd3e720ce0cd9e885a22e7f7850be4a7042a97a35c3a819b8210","observation_id":"7f2bf446-807f-4afb-a178-0ba791ebc76f","resolution":{"observed_at":"2026-08-06T15:36:18.797085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:36:18.905494Z","title":"Learning to prompt for vision-language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15542","last_updated":"2025-08-04T02:28:09Z","snapshot_observed_at":"2026-08-14T18:20:35.027776Z","submitted_at":"2025-07-21T12:15:27Z","title":"HOLa: Zero-Shot HOI Detection with Low-Rank Decomposed VLM Feature Adaptation","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T15:36:18.905494Z"},"links":{"citing_paper":"/paper/2507.15542"},"observation_digest":"sha256:78c426e4245de1fee1f9eb4817d9fbed1f251b393976030f12c78f37fd249cf3","observation_id":"aa175532-adf3-400f-b3ba-44017ca453b4","resolution":{"observed_at":"2026-08-06T15:36:18.905494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:36:19.812883Z","title":"End-to-end human object interaction detection with hoi transformer","venue":null,"work_id":"f9d6fb3f-2fb5-4791-8ff6-32e474d6ad7d","year":2021},"citing_paper":{"arxiv_id":"2507.15542","last_updated":"2025-08-04T02:28:09Z","snapshot_observed_at":"2026-08-14T18:20:35.027776Z","submitted_at":"2025-07-21T12:15:27Z","title":"HOLa: Zero-Shot HOI Detection with Low-Rank Decomposed VLM Feature Adaptation","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T15:36:19.017651Z"},"links":{"citing_paper":"/paper/2507.15542"},"observation_digest":"sha256:2f1ac87e4c76a45ed0dd6c8352e221f561691dc60cf58c393138eee046a36abb","observation_id":"734135b8-2d60-4cd6-b534-52b8cfeb9136","resolution":{"observed_at":"2026-08-06T15:36:19.819026Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:36:19.791816Z","title":"- High- light the possible roles of specific body parts (e.g., hands gripping, feet pressing, or knees bending) without specify- ing actions","venue":null,"work_id":"773bc94f-bf72-4564-915b-5e5a4d6fa99e","year":null},"citing_paper":{"arxiv_id":"2507.15542","last_updated":"2025-08-04T02:28:09Z","snapshot_observed_at":"2026-08-14T18:20:35.027776Z","submitted_at":"2025-07-21T12:15:27Z","title":"HOLa: Zero-Shot HOI Detection with Low-Rank Decomposed VLM Feature Adaptation","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T15:36:19.156847Z"},"links":{"citing_paper":"/paper/2507.15542"},"observation_digest":"sha256:bd9721932e94492d75a4b079fbf667901dabbcb985aded00e64eaee7ee740ba7","observation_id":"59a0d159-ae2f-434d-a0bb-2e1c96cdd381","resolution":{"observed_at":"2026-08-06T15:36:19.797848Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:36:19.767661Z","title":"LLM input humancupFFN DETR pairing … : finetuning : frozen : features : boxes : human-object tokens Cross Attention Layer 𝑉","venue":null,"work_id":"1d617b05-2893-4f88-9261-3c84ac41d399","year":null},"citing_paper":{"arxiv_id":"2507.15542","last_updated":"2025-08-04T02:28:09Z","snapshot_observed_at":"2026-08-14T18:20:35.027776Z","submitted_at":"2025-07-21T12:15:27Z","title":"HOLa: Zero-Shot HOI Detection with Low-Rank Decomposed VLM Feature Adaptation","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T15:36:19.265377Z"},"links":{"citing_paper":"/paper/2507.15542"},"observation_digest":"sha256:f8cb469ec5aa99eb50a69360d8dd60d36683adad08c6ad38de31e1a8aad1f94d","observation_id":"2bfe0ec3-4a05-4617-9616-fdd39f77fe21","resolution":{"observed_at":"2026-08-06T15:36:19.774455Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:36:19.744464Z","title":"The head’s angle might vary, possibly tilted up or down, depending on the human’s position relative to the car’s height, such as looking over the roof or under the chassis","venue":null,"work_id":"74b2ae1b-69f5-4627-add7-21eec194a445","year":null},"citing_paper":{"arxiv_id":"2507.15542","last_updated":"2025-08-04T02:28:09Z","snapshot_observed_at":"2026-08-14T18:20:35.027776Z","submitted_at":"2025-07-21T12:15:27Z","title":"HOLa: Zero-Shot HOI Detection with Low-Rank Decomposed VLM Feature Adaptation","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T15:36:19.395490Z"},"links":{"citing_paper":"/paper/2507.15542"},"observation_digest":"sha256:25e612985e35a461d3677758f01f1a652dc795d9fc911df501c50028578fd58f","observation_id":"2b2d5640-3e17-45f0-be7d-7715d6475c1b","resolution":{"observed_at":"2026-08-06T15:36:19.752630Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:36:19.718223Z","title":"hosing a car","venue":null,"work_id":"7312668f-3631-4ed4-a023-f3bbb7d4621d","year":null},"citing_paper":{"arxiv_id":"2507.15542","last_updated":"2025-08-04T02:28:09Z","snapshot_observed_at":"2026-08-14T18:20:35.027776Z","submitted_at":"2025-07-21T12:15:27Z","title":"HOLa: Zero-Shot HOI Detection with Low-Rank Decomposed VLM Feature Adaptation","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T15:36:19.443783Z"},"links":{"citing_paper":"/paper/2507.15542"},"observation_digest":"sha256:5903b81636fda2cec44e5d8ce94db0d9231eac790b2458c51feecd891d1e91cb","observation_id":"6a08a6ed-b0e4-4d14-acd3-d7bee148cc3b","resolution":{"observed_at":"2026-08-06T15:36:19.724520Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.15542","last_updated":"2025-08-04T02:28:09Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T18:20:35.027776Z","submitted_at":"2025-07-21T12:15:27Z","title":"HOLa: Zero-Shot HOI Detection with Low-Rank Decomposed VLM Feature Adaptation"},"reference_resolution":{"displayed":70,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":22,"verified_exact":0,"verified_fuzzy":48},"total_outbound_references":70},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 70 of 70 outbound references and 0 inbound Pith citation observations for arXiv:2507.15542."}